论文标题:DocPrune: Efficient Document Question Answering via Background-, Question-, and Comprehension-aware Token Pruning
论文链接:https://arxiv.org/abs/2604.22281
发表信息:CVPR 2026 Main Conference

1 三把不同的“剪刀”
DocPrune是一个无需训练的插件,包含BTP、QTP和CTP三个模块。BTP是背景token剪枝:它利用文档页面背景相对均匀的特点,优先移除空白和低信息区域,同时保留文字、表格等前景内容。该步骤发生在页面检索和文档编码阶段,先减少进入后续网络的视觉token。
QTP是问题感知剪枝。模型把问题token与文档token计算相似度,将与问题关联较弱的区域继续剔除。它与BTP的区别在于:前者判断“页面上有没有内容”,后者判断“这些内容是否与当前问题有关”。
CTP则发生在语言模型生成过程中。作者观察到,不同层对视觉信息的需求不同:浅层建立图文对应,深层逐渐聚焦答案。CTP结合跨模态注意力和层间表征变化,动态决定何时、保留哪些token,避免从第一层到最后一层都使用同一套静态掩码。
2 一个样例如何从2508降到168

论文展示了一张问卷页面。原始输入包含2508个视觉token;经过BTP后保留1340个,占53%;加入QTP后只剩406个,占16%;再经过CTP,最终参与后续计算的token降至168个,约为原始输入的7%。图中答案区域和问题提示仍被保留,大量背景与无关段落则被遮蔽。
这组可视化也解释了为何三种剪枝不能简单合并成一个阈值。背景、问题相关性和模型理解状态分别来自页面、查询和网络内部,只有按阶段处理,才能在压缩计算量的同时尽量守住证据。
3 不只更快,分数也没有被牺牲

在M3DocRAG基准、Qwen2-VL-7B骨干上,输入4页时,原模型编码器和解码器计算量分别为59.28和86.27TFLOPs;加入DocPrune后降至16.36和25.45TFLOPs。吞吐率从0.6/0.6样本每秒提高到1.8/2.0,约为3.0倍和3.3倍。
与此同时,整体EM从31.5升至33.0,F1从36.3升至37.3。也就是说,压缩并未换来准确率下滑,反而通过去除噪声获得1.5和1.0个点的提升。与FastV、DivPrune和VTW相比,DocPrune在图中的计算量—效果曲线上更靠近左上角。
4 总结
DocPrune的价值在于把文档视觉冗余拆成三类问题:先看版式,再看查询,最后看模型是否已经完成理解。它不需要重新训练,在已有文档VQA系统中更容易作为推理加速模块接入。
不过,论文的主要评测集中在M3DocRAG、MMLongBench-Doc等设定,实际加速还会受到骨干模型、硬件与剪枝阈值影响。对手写文档、极密集表格或证据本身很小的页面,激进剪枝是否稳定也需要更多测试。其最重要的启发很清楚:文档问答的效率优化,不应只盯着模型大小,还应认真决定哪些视觉token根本不值得算。
夜雨聆风