一张年度财报,塞了十几个表格、几十行小字和一堆花花绿绿的图。你问 AI:“今年华东区的退款率是多少?”
它盯了两秒,答得斩钉截铁。你再放大原图一看:它看的根本不是退款率,而是旁边的复购率。
这类翻车,很多人会怪 OCR 不准,或者怪模型不够聪明。可 CVPR 2026 这篇论文给出了一个更扎心的解释:模型为了省算力,可能在回答之前,就把真正的证据删掉了。
论文名字很直白:Focus, Don’t Prune。聚焦,别乱剪。
作者来自高丽大学、KT、崇实大学和 Kakao Mobility。他们做的 PinPoint,不是再造一个更大的多模态模型,而是专门修理一个越来越普遍的坏习惯:面对长截图、信息图和多页文档,先按注意力分数砍掉一批视觉 Token,再让大模型拿剩下的内容作答。
这套做法省钱、提速、论文也好写。但它有个致命问题:注意力高,不等于证据重要;注意力低,也不等于可以删除。
“大模型的幻觉,有时不是它没看懂,而是系统先替它把证据撕了。证据没了,模型又不能沉默,只好拿语言能力补洞。

一、为什么一张报表,能把视觉 Token 撑爆
普通照片里,一个主体往往占据很大面积。猫就是猫,车就是车,模型把图压缩一点,通常还能认出来。
但信息密集图像不是这样。合同里的一个日期、发票角落的一行税额、柱状图上方的一个百分号,都可能决定最终答案。为了读清这些小字,视觉模型必须提高分辨率,或者把原图切成许多小块分别编码。分辨率一上去,视觉 Token 数量就跟着暴涨。
Token 多,麻烦不只是显存。它们还会进入大语言模型,参与一层又一层注意力计算。长文档里真正和问题有关的内容可能不到十分之一,但模型却要把整座仓库都搬进脑子,最后只找一张收据。
于是视觉 Token 剪枝火了。常见做法是读取 LLM 中间层的注意力权重,保留高分 Token,删除低分 Token。直觉很顺:模型越关注的地方,越值得留下。
可论文把这层窗户纸捅破了。注意力图会波动,也会被版式、颜色和全局上下文带偏;更麻烦的是,文字和图表的语义往往跨越多个 Token。你保留数字“25”,删掉后面的“%”,答案就从比例变成了一个孤零零的数。你保留柱子,删掉图例,模型就不知道蓝色代表华东还是华南。
论文在 InfographicVQA 上做了一个很直观的实验:给 LLaVA-NeXT 的视觉 Token 里逐步掺入与问题无关的区域,准确率一路下滑。无关 Token 占比从接近 0 增加到 100% 时,准确率大致从 0.34 掉到 0.26。

这里有一个非常反常识的结论:看得更多,不一定答得更准。
不是因为信息越多越坏,而是现有模型还没有能力在海量碎片里稳定区分“证据”和“干扰”。把整页都塞进去,是计算浪费;随手剪掉一半,是拿准确率赌博。真正的问题不是“留多少”,而是“凭什么留”。
二、PinPoint 的办法:先找区域,再重新看一遍
PinPoint 的结构只有两步:区域选择,区域精炼。
这两个词听着平常,但顺序很关键。它不是先把整张图的 Token 排队,然后从后往前删除;而是先根据用户的问题,判断哪些完整区域可能包含答案和推理证据,再把这些区域单独裁出来,重新高分辨率编码。

先说区域选择。
模型把视觉编码器输出的 Token 恢复成二维网格,再用一个 (W\times H) 的滑动窗口扫描整张图。每个窗口里的 Token 被拼成一个区域级表示。论文实验采用 10×10 窗口、步长 7,这意味着区域之间会重叠,避免关键文字刚好被切在窗口边缘。
接着,问题文本也被编码。这里不能简单拿一句话向量和一块图直接算相似度,因为视觉特征与文本特征不在同一个空间里,而且文本由多个子词组成,并没有一个天然可靠的总括 Token。
作者引入了 (K) 个可学习的 guidance queries,相当于一组共享的“翻译坐标”。它们分别和区域视觉特征、问题文本特征交互,把两种模态映射到可比较的共同空间。随后,模型按余弦相似度给所有区域排序。
但 PinPoint 也没有把 top-k 写死。它会从最高分区域开始逐个加入,直到这些区域的外接范围超过设定的目标比例 ®。论文里 (r=0.6)。所以简单问题可能只抓住一小块,跨图表问题则会自动扩大范围。
这一步比 Token 级剪枝稳的地方在于:它保留的是有上下文的区域,不是散落一地的像素碎片。
三、最值钱的不是“选中”,而是重新编码
很多区域聚焦方法走到“裁图”就结束了。PinPoint 还多做了一步:把选中的区域重新送进视觉编码器。
为什么要重看?
因为第一次编码整张图时,全局自注意力已经让每个视觉 Token 混入了周围信息。即使你后来挑中了一块正确区域,那块区域的表示也可能早已被页眉、广告图、别的表格和装饰元素污染。
PinPoint 把选中区域单独裁下,再次经过 ViT 和投影层。第二次编码时,模型看到的是更紧凑、更高分辨率、干扰更少的局部图。论文架构示例中,视觉 Token 从 3043 个降到 1604 个,但留下来的 Token 反而含有更多与答案有关的细节。
这像极了人读财报:第一遍扫目录和页面,找到相关表格;第二遍把表格放大,沿着行列交叉定位。没有人会在第一遍扫视时,随机抠掉半张表,然后相信自己还能算对。
“真正高效的阅读,不是少看,而是把算力花在证据上。省 Token 的最高境界,也不是删除,而是让每个留下来的 Token 都有用。
四、它怎么学会“问题对应哪块区域”
PinPoint 没有微调整个 LLM,也没有反向传播穿过巨大的视觉编码器。作者冻结了 LLM、视觉编码器和投影器,只训练 guidance queries 与两个轻量 MLP。
训练目标由两部分组成。
第一部分是跨模态对比损失。正确问题与对应区域应该靠近;同一批次里其他图片的区域,则应该远离。它负责建立“这句话通常和什么视觉区域匹配”的能力。
第二部分更关键,是图内对比损失。对同一张图,答案和支撑证据所在区域是正样本,其他窗口是负样本。模型不仅要知道“什么像答案”,还要在一堆长得很像的表格、标签和数字里,明确把错误区域推远。

公式不复杂,难点其实在标注。过去很多文档问答数据只标“最终答案框”。可现实推理经常需要多处证据:问题问“哪项增长最快”,模型既要看今年数值,也要看去年数值,还得知道两行分别属于哪个地区。只框最后一个数字,等于告诉学生答案,却没告诉他演算过程。
作者因此给 InfoVQA、SinglePageDocVQA 和 MultiPageDocVQA 补了更丰富的区域标注:答案框、支撑证据框,以及覆盖全部相关元素的统一区域。对于不同类型的数据,他们组合 OCR 判断、LLM、先进视觉语言模型和人工自标,尽量减少纯人工成本。

这一步其实比模型结构更值得产品团队抄作业。很多企业做文档 Agent,只积累“问题—答案”对,却不保存答案来自哪一页、哪张表、哪几个单元格。模型上线后答错了,团队只知道结果错,不知道是检索错、视觉定位错、OCR 错,还是推理错。
没有证据区域的训练数据,最后只能得到一个会猜答案、不会交代过程的系统。
五、主表很漂亮,但别只看“快了多少”
论文在四套基准上验证:信息图问答 InfoVQA、单页文档 SPDocVQA、多页文档 MPDocVQA,以及自然图像问答 GQA。底座包括 LLaVA-NeXT-7B 和 Qwen2-VL-7B。
先看 LLaVA-NeXT。
在 InfoVQA 上,原版模型把所有视觉 Token 都送进去,ANLS 是 0.2552,计算量 38.98 TFLOPs。PinPoint 的 ANLS 提到 0.3024,计算量降到 25.48 TFLOPs,也就是原来的 65.3%。这不是“少算一点、少掉一点分”,而是少算约三分之一,准确率反而相对提高约 18.5%。
在 MPDocVQA 上,PinPoint 从 0.3758 提到 0.3866,FLOPs 只剩 56.5%;在 GQA 上,准确率从 0.7598 小幅升到 0.7608,FLOPs 降到 59.1%。
Qwen2-VL 上也能看到同样趋势。PinPoint 在 InfoVQA 上以 55.5% 的计算量得到 0.7140,虽然没有超过完整 Token 的 0.7399,但远高于 FastV 的 0.5130 和 PDrop 的 0.4506。

| 方案 | 怎么省 Token | 最大风险 | PinPoint 的判断 |
|---|---|---|---|
| 随机采样 | 随机留一部分 | 证据随缘消失 | 只能当下限 |
| 注意力剪枝 | 保留高注意力 Token | 注意力不稳、语义被切碎 | 省算力但可能放大幻觉 |
| 反复调用 LLM 裁图 | 让模型多轮找区域 | 多次推理,成本很高 | 定位准但不经济 |
| PinPoint | 问题—区域对齐后重编码 | 依赖区域标注与窗口设计 | 准确率与效率更平衡 |
不过,延迟数据提醒我们别只看 FLOPs。LLaVA-NeXT 的 PinPoint 延迟是 381.6 毫秒,确实快于完整模型的 569.5 毫秒,但不如 ToMe 的 315.1 毫秒。Qwen2-VL 上 PinPoint 是 555.5 毫秒,也只比原版 907.4 毫秒快,并没有碾压所有剪枝方法。
原因很简单:它要先选择区域,再重新编码。PinPoint 追求的不是最快,而是别为了快把答案弄错。
六、最扎心的对比:剪枝方法真的把答案剪没了
论文的定性图比跑分更有说服力。
一个问题问“现行法律处理得好,是哪类人的主观看法”。FastV 回答“28k”,直接把图里的另一个数字捡了过来;PyramidDrop 找到了一段相关文字,却答成“主要污染者应该支付治理费用”。PinPoint 定位到正确文字区域,回答“Legislation”。
另一个表格问题问本年度本土原材料占比。两种剪枝方法都答 79.23%,PinPoint 放大对应行列后答 20.77%。第三个自然图像问题更好笑:问路上是什么车,剪枝方法回答“road”,PinPoint 才答出“truck”。

这几张图把问题说透了:剪枝失败以后,模型并不会举手说“证据不够”。它会在剩下的 Token 里找一个最像答案的东西,然后用流畅语言包装出来。
所以企业里评估文档 Agent,不能只测响应速度和平均 Token 数。至少还要加三项:证据区域召回率、答案可追溯率,以及证据缺失时的拒答率。
“一个系统如果删错证据后依然自信作答,速度越快,风险越大。它不是高效,是高效地把错误送进业务流程。
七、为什么这篇论文能进 CVPR:它没发明大词,却把证据链做完整了
PinPoint 的结构并不花哨。滑窗、对比学习、区域裁剪、二次编码,单拿出来都不是新发明。
它能站住,靠的是问题定义够准,证据链也够完整。
第一,作者没有泛泛说“视觉 Token 有冗余”,而是把现有剪枝的三个具体毛病拆出来:注意力图不可靠、语义片段被打散、全局上下文造成特征纠缠。
第二,方法设计逐条对应这些毛病。区域级比较解决语义碎片;问题—区域对齐摆脱 LLM 中间注意力;二次编码清理全局干扰。
第三,数据标注不只框答案,还框支撑证据。这让训练目标与论文主张真正一致,而不是拿一个旧数据集硬凑故事。
第四,消融做得很老实。去掉图内对比损失,区域准确率和答案指标都会下降;去掉区域精炼,InfoVQA 从 0.3024 掉到 0.2603。可训练参数只占底座的 0.86% 到 1.40%,说明提升并不是偷偷把模型重新训大了。

这也是很多论文最该学的地方:创新不一定是造一个新名词,也可以是把一个被大家默认正确的工程习惯,逼到墙角做一次完整审讯。
八、对普通用户和产品经理,真正有用的三条
如果你只是用现成 AI 读 PDF、财报或截图,别急着研究模型结构。你可以先改提问方式。
第一,要求它先指出页码、表格名、行列或截图区域,再给答案。没有证据定位,答案再顺也先打折。
第二,大文档别一股脑上传后问“总结一下”。把问题拆成“先找相关页—再提取证据—最后计算或判断”。这其实就是手工版 PinPoint。
第三,碰到数字、日期、金额、比例,要求模型把相邻表头和单位一起读出来。只抄一个数字,是文档问答里最常见的坑。
如果你在做产品,优先级则更明确:把“证据区域”当成一等公民。界面上让用户能看到答案对应的原图框;日志里保存区域坐标;评测集里加入干扰表格和相似数字;证据召回失败时,宁可让模型说不知道。
别再迷信“视觉 Token 砍了 70%”这种孤零零的数字。那和手机厂商只告诉你跑分、不告诉你续航一样。省下多少算力当然重要,但更重要的是:被省掉的,到底是垃圾,还是证据。
PinPoint 最有价值的提醒,不属于某个模型,也不只属于文档 AI。
今天的 Agent 都在学习更快地读网页、表格、合同和后台页面。它们迟早都要面对同一道选择题:是把所有东西都塞进上下文,还是聪明地只保留相关部分。
前者太贵,后者太容易自作聪明。
真正可靠的第三条路,是先知道自己要找什么,再决定哪里值得看第二眼。
AI 的效率,不该建立在遗失证据上。一个会聚焦的模型,永远比一个会乱删的模型更值得信任。
以上。如果这篇文章帮你重新理解了“省 Token”这件事,欢迎转给正在做文档 Agent、RAG 或多模态产品的朋友。也别忘了点个赞、在看,给真正把问题讲清楚的研究留一点流量。
夜雨聆风