
✨导读:真实文档检索既要读正文,也要理解表格、图片、版式和跨页关系。DocRetriever 不把 OCR 当成必经入口,而是从视觉语言模型中同时提取稠密语义与稀疏词项,再用带推理示例的视觉上下文学习完成重排。作者还构建了覆盖 313 份长文档、2581 个问题的 MultiDocR。实验显示,混合检索提升跨域召回,视觉示例选择则让重排 nDCG@10 达到 87.8。
• 作者: Ruofan Hu、Menghui Zhu、Jieming Zhu、Bo Chen、Shengyang Xu、Minjie Hong、Xiaoda Yang、Sashuai Zhou、Li Tang、Tao Jin、Zhou Zhao
• 单位: 浙江大学、华为技术有限公司
• 论文标题: DocRetriever: A Plug-and-Play Framework for Multimodal Document Retrieval with Comprehensive Benchmark
• 论文链接: https://arxiv.org/abs/2605.30027
• 发表信息: KDD 2026
问题背景:一页文档不是一段纯文本
多模态文档检索的难点,是相关性往往藏在文字之外。 一份报告可能把结论写在表格单元格里,把流程放在示意图中,把限定条件分散在前后两页。传统 OCR 检索会把页面压平为文本,版式、视觉对应关系和图表语义随之减弱;纯视觉稠密向量虽然能够保留整体语义,却不容易显式表达专有名词、数字和关键词匹配。
已有系统通常再训练一个监督式 reranker 来弥补召回不足,但领域迁移成为新的问题。财报、新闻、产品手册和技术论文的视觉布局差异很大,一个在固定数据上学习相关性边界的模型,换到新领域后容易失去稳定性。与此同时,现有评测多以单页、单模态问题为主,无法反映跨页证据与复杂视觉元素带来的真实难度。
DocRetriever 因此把问题拆成两层:第一层在不依赖 OCR 的前提下,同时获得语义召回和词项匹配;第二层不微调新的重排模型,而是让通用视觉语言模型通过高质量示例学会判断相关性。这一设计把可迁移性放在了系统中心。
混合检索:同一个视觉模型同时产生稠密与稀疏表示
DocRetriever 的离线阶段只需把文档页面送入视觉语言模型一次。模型的视觉表征形成稠密向量,用于匹配查询与页面的整体语义;语言模型头产生词表上的概率分布,经过筛选后形成稀疏表示,用于捕捉明确词项。在线查询到来时,两路分数按权重融合,再返回候选页面。
稀疏表示并不是 OCR 文本的替代包装。对于使用页面级最终隐藏状态的模型,作者用“Represent this document in one word:”提示模型概括页面;对于采用 late interaction 的模型,则分别计算页面局部块的词表 logits,再在空间维度取最大值。随后执行词形还原、停用词与无效词过滤、ReLU 和对数饱和,保留权重最高的 256 个词项并做整数化压缩。
混合分数的系数设为 0.8,即以视觉稠密语义为主体,同时让稀疏词项修正专名、术语和数字检索。它不需要额外 OCR 引擎,也不要求为每个新领域重新训练检索器,因而可以直接接到已有视觉文档编码模型之后。

图注:原文 Figure 1。DocRetriever 先从视觉语言模型中提取稠密页面向量与稀疏词项,混合召回候选页面,再通过带视觉示例的通用 VLM 完成相关性重排。
视觉 ICL 重排:给模型看“为什么相关”的示例
召回之后,DocRetriever 使用 pointwise 方式逐页判断相关性。关键不只是把查询和候选页面交给 VLM,而是为它提供带推理过程的正例与难负例,让模型从上下文中理解当前任务的判别尺度。示例离线生成,不需要更新重排模型参数。
作者先通过对比式流程构造候选示例,再让多个模型投票筛选。人工抽查 3000 个样本后,保留下来的示例精度达到 98.3%。真正查询时,系统同时考虑查询语义相似度与候选文档的视觉相似度,从示例库选择最接近当前场景的演示,而不是随机拼接几个问答。
这种“双相似度”选择很重要。仅按查询文本找示例,可能得到主题相近却布局完全不同的页面;仅按视觉布局选择,又可能忽视相关性判断所需的语义关系。DocRetriever 把两者结合,使模型既看到相似问题,也看到相似页面结构。
MultiDocR:把跨页、跨模态检索纳入同一基准
作者从 313 份长篇多模态文档出发构建 MultiDocR,最终得到 2581 个问题,其中 1535 个由已有内容衍生,1046 个为新创建问题。43.8% 的问题需要跨页证据,53.2% 涉及跨模态信息,并覆盖 7 类问法。
证据类型也并非以正文一项独大:文本占 60.4%,图片占 18.8%,表格占 16.7%。每个查询与页面之间采用五级相关性标注,使评测能够区分“包含直接答案”“提供部分支撑”和“只在主题上相近”,而不是把检索简化为二元命中。
构建流程先生成 3121 个候选问题,再过滤为 2581 个。对每个查询,系统用 ColQwen 召回前 50 页、Jina reranker 缩小到前 30 页,最后由 Gemini 2.5 Pro给出五级相关性标注。这样的设计让基准同时覆盖规模、难负例和细粒度排序质量。
五级标签也改变了系统优化方向。只看 Recall@K 时,一张主题相同却没有答案的页面也可能被计为成功;nDCG 则要求直接证据排在部分证据和背景页面之前。对于需要跨页整合的问题,多个中等相关页面的相对次序同样会影响后续回答,因此 MultiDocR 更接近真实 RAG 的证据入口,而不是单纯页面分类。
从问题构成看,跨页与跨模态并非两个孤立标签。一些查询需要先从图中识别对象,再到另一页表格查数值;另一些需要把流程图节点与正文定义对应。这样的组合让检索器必须保留页面整体视觉语义,也解释了为什么 OCR 词项无法独立完成任务。

表注:原文 Table 2。MultiDocR 汇总 313 份长文档和 2581 个问题,跨页问题占 43.8%,跨模态问题占 53.2%,证据分布覆盖正文、图片和表格。
主结果:混合召回先补齐证据,视觉示例再拉开重排差距
在多个文档领域上,ColQwen 的纯稠密检索平均 nDCG@10 为 72.9,加入稀疏视觉词项后达到 75.7,平均提升约 3 个点。新闻领域的平均增益达到 5.9%,说明显式词项在实体密集、名称频繁变化的页面上尤其有效。
重排阶段的提升更明显。随机选择 ICL 示例时,平均 nDCG@10 为 80.5;根据查询与页面共同选择相似示例后达到 87.8,高于监督式 Jina-reranker-m0 的 86.7。新闻子集上,相似示例策略取得 74.8,说明示例选择不是锦上添花,而是决定跨域重排质量的核心环节。
代价方面,相似示例策略对前 30 个候选完成重排需要 33.4 秒;Qwen3 reranker 为 43.6 秒,MM-R5 为 49.5 秒,Jina-reranker-m0 为 14.6 秒。ICL 示例检索本身约 2 毫秒,主要时延仍来自 VLM 对页面逐项判断。DocRetriever 用更高推理成本换取了无需任务微调的泛化能力。

表注:原文 Table 3 与 Table 4。混合表示将平均 nDCG@10 从 72.9 提升到 75.7;结合查询语义和页面视觉选择 ICL 示例后,重排结果达到 87.8。
消融分析:视觉信息、双侧上下文和提示压缩各有作用
视觉示例不能被文本描述简单替代。 将 ICL 中的页面替换为纯文本后,平均 nDCG@10 从 87.8 降到 74.2。页面中的表格结构、标题层级和图文对应关系,为相关性判断提供了普通描述难以完整保留的证据。
上下文放置也有清晰递进。直接零样本使用 Qwen2.5-VL 得分为 68.4;只加入查询侧示例后为 75.7;只加入文档侧上下文后为 78.1;双侧信息共同使用时达到 87.8。这说明重排既要理解“用户在找什么”,也要学习“怎样的页面才算支持答案”。
提示压缩实验进一步展示了表达方式的影响。模型式压缩得分为 0.687,高于关键词 0.654、页面描述 0.631 和摘要 0.625。融合权重在 0.8 时达到最佳,过度依赖任一路表示都会损害排序。面对改写查询,混合检索下降约 4%,而词法检索下降约 8%,也证明稠密语义与稀疏词项具有互补性。
这些消融共同排除了“只是换了一个更强 VLM”的解释。 同一模型下,视觉示例相对文本示例、双侧上下文相对单侧上下文、混合表示相对单一路径都有独立增益。系统效果来自检索表示、示例内容和示例选择三个环节协同,而不是某一个提示模板偶然命中测试集。

表注:原文 Table 7。零样本、单侧上下文和双侧上下文形成逐级提升,完整 DocRetriever 达到 87.8,验证视觉示例与查询信息必须协同使用。
局限与应用边界:效果之外仍有在线成本
DocRetriever 的稀疏词项来自 VLM 的语言头,能够避免独立 OCR 流水线,但它仍受基础模型视觉识别能力影响。极小字号、低清扫描、复杂公式或非主流语言都可能让词表分布偏离真实内容。五级相关性由强模型完成标注,也意味着基准质量依赖自动标注器对长文档证据的理解。
视觉 ICL 重排逐页调用大模型,延迟明显高于专用 reranker。它更适合高价值、候选规模已经被压缩的检索场景,而不是直接面对百万页面做全量判断。实际系统可以让混合召回负责速度,用缓存、批处理或轻量模型处理常见查询,再把最困难的候选交给视觉 ICL。
MultiDocR 强化了跨页与跨模态问题,但数据仍来自有限文档集合。面向合同、病历、工程图纸等高风险领域,还需要验证术语覆盖、隐私处理与证据可追溯性,不能把公开文档上的排序增益直接等同于生产环境可靠性。
另一个实际边界是索引更新。稀疏词项和稠密向量都由特定版本的 VLM 生成,替换模型或提示后可能需要重建索引;若新旧向量混用,排序分布会发生漂移。对持续增长的文档库,应记录编码器版本,并把小规模回归集作为每次更新的质量闸门。
全文总结
DocRetriever 的价值,是把文档检索从“先转成文本再搜索”推进到“直接从页面视觉中构建混合索引”。 稠密向量负责整体语义,稀疏词项负责精确匹配,带推理示例的视觉 ICL 则在不微调重排器的情况下学习新的相关性边界。
MultiDocR 进一步证明,真正困难的文档问题往往跨页、跨模态、带细粒度相关性。混合召回的约 3 点 nDCG@10 增益和视觉 ICL 的 87.8 最终成绩,共同说明一个可靠系统需要同时处理“把证据找全”和“判断证据是否真正回答问题”。
夜雨聆风