论文标题:VinQA: Visual Elements Interleaved Long-form Answer Generation for Real-World Multimodal Documents
论文链接:https://arxiv.org/abs/2606.16092
发表信息:CVPR 2026 Main Conference

1 一个专门面向真实文档长答案的数据集
VinQA覆盖指南、财务报告、学术论文、政府报告和信息图等文档。训练集包含131906页、42700组问答,测试集包含9373页、1605组问答。测试问题中1206个可回答,399个不可回答,避免模型总是假设文档里一定存在答案。
每条回答可以同时引用页面和视觉元素。图表、表格或示意图以标识符插入到相关句子附近,读者不必在文档中来回翻找。数据构建流程包含视觉元素检测、OCR、问题与答案生成、文本验证和视觉验证,目标不是批量生成流畅文字,而是确认引用内容确实支撑对应陈述。
2 两种方式把视觉证据交给模型

Page Encoding直接输入带视觉元素标注的完整页面,保留版式与上下文关系,流程简单但视觉token较多。Modality Encoding先提取OCR文本,再把裁剪出的图表和图片作为独立视觉输入,压缩成本并强化局部细节,但会削弱原始页面布局。
两种方式最终都要求模型生成带引用标记的长答案。除了训练模型,作者还提出M-GroSE,从相关性、完整性、忠实度和不可回答识别等方面评估文字内容;Visual Source F1检查视觉引用是否选对;Visual G-Eval进一步判断图片插入位置与表达是否合理。
3 训练后,7B模型明显缩小差距
在Page Encoding设置中,Qwen2.5-VL-7B经过VinQA微调后,M-GroSE平均分达到3.34,Visual Source F1为0.55;在Modality Encoding下分别为3.33和0.58。商业模型仍占优势:Claude 3.5 Sonnet在页面编码下达到3.53/0.65,GPT-4.1在模态编码下达到3.63/0.72。

样例显示,模型可以先解释喷油系统或扩展坞步骤,再在相关段落插入对应图片,而不是把所有图片统一堆在答案末尾。这样的输出更接近技术支持、研究报告和产品知识库真正需要的阅读体验。
附录中的长度分析也提示了瓶颈:微调模型在0—2500token区间的综合指标为3.42,超过10000token时降至3.03。训练改善了视觉引用,却没有消除超长上下文中的信息衰减。
4 总结
VinQA把文档问答的目标从“找到一个答案字符串”推进到“生成有视觉证据的完整说明”。它同时提供数据、两种编码方式和覆盖文本与图片引用的评测指标,使视觉元素是否被正确选择、放置和解释都可以量化。
局限同样需要正视:训练使用16张A100、持续3轮,数据构建依赖多阶段自动生成和验证;Visual G-Eval还需要强模型担任裁判,长上下文性能依然下降。即便如此,VinQA提出了更贴近产品的问题定义:一个可靠的文档助手,不只要告诉用户结论,还应把支持结论的那张图放在眼前。
我们是一群来自 985、211 高校的在读研究生,关注文档视觉问答、文档解析、多模态文档理解与 RAG 等方向。
这里持续追踪 ACL、EMNLP、CVPR、ICLR、ICML、NeurIPS 等顶会前沿工作,分享值得关注的论文、科研思考与潜在 Research Idea。
希望和更多科研同学一起,读懂前沿 · 发现问题 · 验证想法,让每一次论文阅读,都离下一个 Idea 更近一步。
文档智能 · 顶会论文 · Research Idea
论文分享|科研交流|合作联系
docwsj@163.com
夜雨聆风