在视觉文档问答中,模型给出正确答案并不代表推理过程可信。面对论文、报告、网页截图和多页文档,用户不仅需要知道“答案是什么”,还需要知道模型依据了哪一页、哪张表,以及每一步推理是否得到原始文档的支持。针对这一问题,中国科学技术大学提出了 Chain-of-Evidence(CoE) 推理范式和 Look As You Think(LAT) 强化学习框架,让视觉语言模型在生成推理步骤的同时,持续定位相应的视觉证据。
• 论文:Look as You Think: Unifying Reasoning and Visual Evidence Attribution for Verifiable Document RAG via Reinforcement Learning • 论文地址:https://arxiv.org/abs/2511.12003 • 代码仓库:https://github.com/MINE-USTC/LAT
一、文档RAG的问题,不只是答错,更是无法验证
现有视觉文档检索增强生成系统通常包括两个环节。
系统首先从文档库中检索相关页面,再由视觉语言模型阅读页面并生成答案。为了提高可信度,部分方法还会在最终答案后提供页码或边界框,指出答案可能来自哪个区域。
但这种“答案加最终证据”的方式仍然存在明显缺陷。
模型只展示了最终结果,却没有说明自己如何逐步找到答案。用户无法判断模型是否先定位到了正确章节,是否准确读取了对应表格,也无法确定中间推理是否引用了错误内容。
例如,面对“研究中共有多少名患者”这一问题,模型可能正确回答“231”,但用户仍然不知道:
模型是否找到了描述研究对象的部分,是否正确读取了男性患者204人和女性患者27人,以及最终答案是否真的由这两个数字相加得到。
人类阅读复杂文档时,通常不会直接跳到答案,而是按照“章节、段落、具体元素”的顺序逐步缩小范围。论文认为,可靠的文档RAG也应该呈现类似的渐进式证据搜索过程。

Figure 1清晰展示了传统回答方式与CoE的区别。模型不再只框出最终答案,而是在寻找章节、读取句子、检查表格和完成计算的过程中,持续标记当前使用的视觉区域。
二、Chain-of-Evidence:每一步推理都有据可查
传统的 Chain-of-Thought 让模型输出一连串文本推理,例如:“先查找临床特征部分,再阅读表格,男性患者为204人,女性患者为27人,因此患者总数为231人。”
这些文字看起来逻辑完整,但用户无法确定模型是否真的看到了对应内容。模型也可能根据语言模式生成一段听起来合理、实际上没有文档支撑的解释。
CoE在此基础上增加了一个关键要求:
每当推理步骤引用文档中的事实、图表或文字时,模型都要同时输出对应的页码和边界框。
以论文第一页展示的案例为例。模型需要回答“研究中共有多少名患者”。CoE推理过程会依次完成:
找到文档中“Clinical characteristics”部分。定位介绍队列特征的句子。转向表格进行确认。找到男性患者204人、女性患者27人的具体区域。计算得到总人数为231人,并再次标出支持最终答案的表格区域。
这样一来,模型输出的不再只是一条文本推理链,而是一条由“文字推理、页码、视觉区域”共同组成的证据链。
从形式上看,CoE需要模型同时生成三类结果:
• 文本推理步骤 • 每个步骤对应的页面索引与边界框 • 最终答案及其核心支持区域
因此,CoE的价值并不只是让输出“看起来更详细”,而是把文档问答拆解为一系列可以逐步检查的证据单元。用户不仅能够核查最终答案,也可以核查推理过程中的每一次信息引用。
三、LAT框架:用少量标注和强化学习教模型“边想边看”
要让模型生成CoE,一个直接方案是人工标注大量逐步推理过程,并为每一步框选证据区域。
但这种方法成本极高。标注者不仅要回答问题,还需要编写完整推理过程,定位页面,并为多个中间步骤绘制边界框。
为减少对人工标注的依赖,论文提出了两阶段训练框架 Look As You Think。

第一阶段是冷启动监督微调
研究团队从每个训练数据集中抽取1000个样本,利用Gemini 2.5 Pro生成带有推理步骤、页码和边界框的CoE轨迹。生成结果先根据答案召回率进行过滤,再由人工检查和修正错误的边界框及输出格式。
经过筛选后,大约30%的高质量样本被保留下来,用于对Qwen2.5-VL-7B-Instruct进行LoRA监督微调。
这一阶段的主要目标不是获得最终性能,而是让模型先学会CoE的基本输出方式。
第二阶段采用GRPO强化学习
LAT从原始数据中抽取5%的问答样本,让模型自主生成多条CoE轨迹,再通过四类规则奖励判断哪些轨迹值得强化。
答案准确性奖励
LAT结合软精确匹配与词语召回率评估答案。完全匹配的答案可以获得较高奖励,表达略有差异但包含关键信息的答案也可以获得部分奖励。
逐步证据归因奖励
对于每个带边界框的推理步骤,系统会从原始文档中裁剪对应区域,再使用ColQwen2计算该区域与推理文本之间的语义相似度。
只有当推理内容与框选证据相匹配时,模型才能获得奖励。
LAT还计算不同步骤边界框之间的重叠程度,防止模型在每一步都框选同一个大区域。该约束鼓励模型从较大的相关区域逐渐定位到更具体的内容。
最终证据定位奖励
模型不仅需要给出正确答案,还需要正确选择答案所在的页面。预测边界框与真实证据区域的IoU超过0.5时,模型才能获得最终定位奖励。
格式奖励
模型需要按照规定格式分别输出推理过程和最终答案。格式错误会得到负奖励,从而提升生成结果的稳定性和可解析性。
四种奖励分别约束答案、过程、最终证据和输出形式。更重要的是,逐步证据奖励受到答案正确性的限制。
也就是说,只有最终答案足够准确时,证据一致的中间推理才会得到强化。这一设计避免模型只学会“框选与文字看起来相关的区域”,却无法生成正确答案。
四、实验结果
论文在Wiki-VISA和Paper-VISA上进行实验,分别评估单图像与多图像场景。
单图像场景直接向模型提供包含答案的页面。多图像场景则向模型提供三个候选页面,模型需要先判断哪个页面包含答案,再完成推理和证据定位。
实验使用三个主要指标:
EM 衡量最终答案是否正确。
IoU@0.5 衡量最终证据区域是否定位准确。
SA 衡量每个中间推理步骤与对应视觉证据是否一致。

与原始Qwen2.5-VL-7B相比,LAT在四个实验设置中的软EM平均提升 8.23个百分点,IoU@0.5平均提升 47个百分点。
证据定位能力的提升尤其明显。
在Wiki-VISA单图像场景中,LAT-Ind.的IoU@0.5达到53.7,而原始模型只有2.2。
在Paper-VISA单图像场景中,IoU@0.5由3.8提升至49.9。
在Wiki-VISA多图像场景中,EM由54.9提升至64.5,IoU@0.5由11.0提升至38.0。
在Paper-VISA多图像场景中,EM由39.6提升至51.2,IoU@0.5由16.2提升至46.9。
这些结果说明,原始模型虽然具备一定的文档问答能力,却很难精确指出答案所在区域。LAT在保持和提升答案准确性的同时,显著改善了视觉证据定位。
论文还单独评估了完整CoE推理过程。

仅在提示词中加入一个CoE示例,只能有限地改善模型表现。经过LAT训练后,模型不仅能遵循CoE格式,还能准确地将不同推理步骤绑定到相关证据区域。
论文报告LAT生成的CoE轨迹平均SA达到57.1%,表明模型已经能够在较大比例的推理步骤中实现文本内容与视觉证据的一致。

五、过程与结果共同优化
论文的消融实验揭示了LAT性能提升的核心原因。

第一阶段监督微调得到的Mdist已经明显优于原始模型,说明少量经过验证的CoE数据能够帮助模型掌握证据链格式,并初步改善视觉定位。
但从Mdist进入LAT强化学习阶段后,IoU@0.5和SA仍然获得了大幅提升。这表明,仅仅模仿人工生成的CoE轨迹还不够,模型还需要通过强化学习不断探索和筛选更可靠的推理路径。
移除逐步证据奖励后,模型的SA平均下降约15.5个百分点,最终证据定位性能也随之降低。
这一结果说明,中间步骤的证据质量会直接影响模型最终能否找到正确答案区域。
另一方面,如果仅优化推理文本与视觉区域之间的相似度,却取消答案准确性对过程奖励的约束,模型可能生成“局部合理但整体错误”的证据链。
因此,LAT最重要的设计并不是某一个独立奖励,而是将两类目标连接起来:
过程层面要求每一步推理都能找到对应证据,结果层面要求整条证据链最终导向正确答案。
这一思路也体现了论文的核心价值。
传统文档RAG更关注模型有没有答对,LAT则进一步追问:
六、总结
LAT的核心价值,不只是提升文档问答的答案准确率,更在于把推理过程与视觉证据统一起来。通过Chain-of-Evidence,模型需要在生成每一步推理时同步指出对应的页面和文档区域,使用户能够沿着证据链逐步核查答案的来源。
当然,LAT仍有一定局限。图文语义相似度只能衡量推理文本与局部区域是否相关,尚不能完全证明二者具有严格的逻辑支持关系。边界框形式也更适合单一区域定位,在跨页面、多区域信息整合等复杂任务中仍显不足。
尽管如此,这项工作推动文档RAG从“给出答案”进一步走向“展示依据”。未来更可靠的文档智能系统,不仅需要回答正确,还需要说明答案来自哪里、经过了怎样的推理,以及每一步是否能够回到原始文档中验证。
当模型能够在思考过程中同步展示自己正在查看的证据,文档RAG才真正从黑箱生成迈向可追溯、可核查的推理。
夜雨聆风