乐于分享
好东西不私藏

CVPR 2026|VinQA:文档问答不只要答对,还要把图表嵌进答案

CVPR 2026|VinQA:文档问答不只要答对,还要把图表嵌进答案
当用户询问一份设备手册或财报时,只返回一句短答案往往不够。理想结果应当解释步骤、引用对应页面,并把关键图表直接放在相关段落中。VinQA为这种“可视证据交错的长答案”建立了数据集与评测体系。

论文标题:VinQA: Visual Elements Interleaved Long-form Answer Generation for Real-World Multimodal Documents

论文链接:https://arxiv.org/abs/2606.16092

发表信息:CVPR 2026 Main Conference

传统DocVQA通常用ANLS或准确率评估一个短字符串,但真实文档助手需要回答“如何操作”“为什么变化”或“这些图表说明什么”。此时答案既要完整、忠实,还要把引用放在正确位置。仅给出页码无法指出具体图表,只生成文字又丢失了最有说服力的视觉证据。

1 一个专门面向真实文档长答案的数据集

VinQA覆盖指南、财务报告、学术论文、政府报告和信息图等文档。训练集包含131906页、42700组问答,测试集包含9373页、1605组问答。测试问题中1206个可回答,399个不可回答,避免模型总是假设文档里一定存在答案。

每条回答可以同时引用页面和视觉元素。图表、表格或示意图以标识符插入到相关句子附近,读者不必在文档中来回翻找。数据构建流程包含视觉元素检测、OCR、问题与答案生成、文本验证和视觉验证,目标不是批量生成流畅文字,而是确认引用内容确实支撑对应陈述。

2 两种方式把视觉证据交给模型

Page Encoding直接输入带视觉元素标注的完整页面,保留版式与上下文关系,流程简单但视觉token较多。Modality Encoding先提取OCR文本,再把裁剪出的图表和图片作为独立视觉输入,压缩成本并强化局部细节,但会削弱原始页面布局。

两种方式最终都要求模型生成带引用标记的长答案。除了训练模型,作者还提出M-GroSE,从相关性、完整性、忠实度和不可回答识别等方面评估文字内容;Visual Source F1检查视觉引用是否选对;Visual G-Eval进一步判断图片插入位置与表达是否合理。

3 训练后,7B模型明显缩小差距

在Page Encoding设置中,Qwen2.5-VL-7B经过VinQA微调后,M-GroSE平均分达到3.34,Visual Source F1为0.55;在Modality Encoding下分别为3.33和0.58。商业模型仍占优势:Claude 3.5 Sonnet在页面编码下达到3.53/0.65,GPT-4.1在模态编码下达到3.63/0.72。

样例显示,模型可以先解释喷油系统或扩展坞步骤,再在相关段落插入对应图片,而不是把所有图片统一堆在答案末尾。这样的输出更接近技术支持、研究报告和产品知识库真正需要的阅读体验。

附录中的长度分析也提示了瓶颈:微调模型在0—2500token区间的综合指标为3.42,超过10000token时降至3.03。训练改善了视觉引用,却没有消除超长上下文中的信息衰减。

4 总结

VinQA把文档问答的目标从“找到一个答案字符串”推进到“生成有视觉证据的完整说明”。它同时提供数据、两种编码方式和覆盖文本与图片引用的评测指标,使视觉元素是否被正确选择、放置和解释都可以量化。

局限同样需要正视:训练使用16张A100、持续3轮,数据构建依赖多阶段自动生成和验证;Visual G-Eval还需要强模型担任裁判,长上下文性能依然下降。即便如此,VinQA提出了更贴近产品的问题定义:一个可靠的文档助手,不只要告诉用户结论,还应把支持结论的那张图放在眼前。

关于我们

我们是一群来自 985、211 高校的在读研究生,关注文档视觉问答、文档解析、多模态文档理解与 RAG 等方向。     

    这里持续追踪 ACL、EMNLP、CVPR、ICLR、ICML、NeurIPS 等顶会前沿工作,分享值得关注的论文、科研思考与潜在 Research Idea。

     希望和更多科研同学一起,读懂前沿 · 发现问题 · 验证想法,让每一次论文阅读,都离下一个 Idea 更近一步。     

Doc问视界DOC VISION

文档智能 · 顶会论文 · Research Idea

论文分享|科研交流|合作联系

docwsj@163.com