乐于分享
好东西不私藏

ACL 2026|Doc-V*:把百页文档问答变成一场主动阅读

ACL 2026|Doc-V*:把百页文档问答变成一场主动阅读
面对一份上百页的财报、论文或操作手册,模型真的需要把所有页面一次性塞进上下文吗?Doc-V*给出的答案是:先看全局缩略图,再像人一样边读、边找、边验证。

论文标题:Doc-V*: Coarse-to-Fine Interactive Visual Reasoning for Multi-Page Document VQA

论文链接:https://arxiv.org/abs/2604.13731

发表信息:ACL 2026 Main Conference Long Paper

多页文档视觉问答一直存在两难。端到端方法保留全部页面,信息完整但视觉token、显存和注意力开销随页数迅速上升;视觉RAG只取固定top-k页面,成本低,却可能在第一轮检索失误后永远看不到关键证据。两类方法都缺少一个能力:根据已经读到的内容决定下一步看哪里。

1 从“输入文档”改成“探索文档”

Doc-V*把问答建模为连续的证据聚合过程。系统先把文档页面排成低分辨率缩略图,让模型获得章节分布、页面类型和显著视觉区域等全局线索。随后,智能体可以执行语义检索或按页码抓取高清页面;每次观察后,它都会更新工作记忆,再决定继续寻找、核对已有证据,还是输出答案。

这种设计尤其适合跨页问题。比如需要统计多处签名时,智能体先从缩略图定位疑似页面,读取高清内容后发现实例可能不完整,再检索包含签名的其他页面。它不要求一次检索命中全部证据,而是允许推理过程反过来修正阅读路径。

100页文档若逐页按1024×768输入,会产生超过10万个视觉token;论文的缩略图方案约需8000个,实现约10—12倍压缩。缩略图负责导航,高清页负责确认细节,两种分辨率各司其职。

2 两阶段训练让智能体学会停下来

训练首先从MP-DocVQA和DUDE构造交互轨迹。作者用教师模型在真实工具环境中完成检索、翻页与回答,并按格式、答案正确性和证据页合理性过滤,得到9019条高质量轨迹用于监督微调。第二阶段从2048个不重叠样本出发,使用GRPO优化策略。

奖励不只看最终答案,还同时评价证据页质量和输出格式。这样,模型既不能为了省步骤草率作答,也不能无限翻页。论文的效率图显示,Doc-V*通常只读取少量高清页,却能维持更高的答案分数和证据页F1,收益来自更有效的选择,而不是更多输入。

3 五个基准上的结果

在同为Qwen2.5-VL-7B骨干的对比中,GRPO版Doc-V*在DUDE、MP-DocVQA、SlideVQA、MMLongBench-Doc和LongDocURL上分别取得64.5、86.2、77.2、42.1和56.3。相比固定检索5页的RAG基线,DUDE提升12.3个点,LongDocURL提升18.5个点;相比直接输入的基础模型,LongDocURL提升23.4个点

更值得注意的是迁移能力。训练数据来自两个文档问答集合,但模型在幻灯片和超长文档上仍有明显增益,说明“先定位、再取证、最后回答”的策略比某个固定检索器更容易跨场景复用。

4 总结

Doc-V*的核心贡献不是给模型增加更多上下文,而是把上下文变成可按需访问的环境。缩略图保留全局结构,检索和高清取页补充细节,工作记忆把分散证据串起来,GRPO则让阅读路径兼顾正确率与成本。

目前实验主要围绕单文档、多页问答,并基于Qwen2.5-VL-7B训练;跨文档搜索、更多骨干模型以及真实系统中的工具延迟仍需进一步验证。但对于长财报、档案和技术手册,这条路线提供了一个明确方向:真正困难的不是模型能看多少页,而是它是否知道下一页该看哪里。