乐于分享
好东西不私藏

CVPR 2026|ORCA:让九类文档专家先协作,再用辩论校验答案

CVPR 2026|ORCA:让九类文档专家先协作,再用辩论校验答案
面对表格、表单、图表、手写文字和复杂版式,单个视觉语言模型往往需要同时完成定位、识别、推理和自检。ORCA把这些职责拆给不同智能体,并在答案不稳定时启动压力测试与正反辩论。

论文标题:ORCA: Orchestrated Reasoning with Collaborative Agents for Document Visual Question Answering

论文链接:https://arxiv.org/abs/2603.02438

发表信息:CVPR 2026 Main Conference

DocVQA错误并不都来自OCR。模型可能读对文字,却选错字段;也可能找到局部证据,却没有意识到问题需要比较多个区域。普通单模型推理缺少明确的分工和验证机制,而简单多数投票又容易让多个相似错误相互加强。ORCA希望解决的是:怎样把多智能体组织成一条可检查、按需加深的推理流程。

1 从问题理解到专家路由

第一阶段由Thinker分析问题与文档,生成显式推理路径。第二阶段的Router据此激活专业智能体,候选角色覆盖General、Form、Free Text、OCR、Image/Photo、Layout、Table/List、Yes/No和Figure/Diagram九种类型。Orchestrator负责汇总各专家结果,生成初步答案。

关键在于并非九个智能体每次全部出场。表格比较题可路由到表格、OCR与版式专家,图片内容题则采用另一组组合。这样既让不同证据类型有针对性的处理方式,也保留了可追踪的任务分解过程。

2 答案不稳时才增加计算

ORCA的第三阶段是Stress Testing。评估智能体与被激活的专家对初步答案提出质疑,检查它是否遗漏视觉细节、错误对齐字段或使用了不充分证据。如果发现矛盾,系统进入第四阶段:Thesis Agent支持当前答案,Antithesis Agent寻找反例,Judge Agent比较双方依据后给出裁决。

最后,Sanity Checker执行一致性检查和答案精炼。这种设计不是让模型无条件“想得更久”,而是将额外计算集中在有争议的样本上。论文统计中,压力测试阶段在23.4%的问题上被激活,真正进入辩论的比例为8.3%

案例中,多个模型对档案记录里的出版信息给出不同答案。ORCA先定位对应行,再由专家分别核对手写内容、版式关系和字段语义,最终将错误候选逐一排除。它的优势不仅是答对,还能看到错误在哪个阶段被纠正。

3 8B模型带来的实际增益

以Qwen3-VL-8B为骨干时,直接推理在DocVQA和InfoVQA上分别得到96.1和83.1,加入ORCA后提升到97.2和88.0,分别增加1.1和4.9个点;多个文档VQA基准的平均分从89.6提高到92.6。OCRBench也从65.4升至67.1。

作者还分析了100个错误样本:43%属于推理错误,27%来自路由,18%来自智能体协调,12%属于过度精炼。这说明多智能体并没有消除错误,只是把问题从一个黑盒答案拆成了更具体的故障点。特别是路由错误,一旦最合适的专家没有被激活,后续辩论也可能围绕错误证据展开。

4 总结

ORCA给DocVQA提供了一种“按风险分配推理预算”的思路:简单问题走短路径,复杂问题调用专长,冲突答案再进入压力测试和辩论。相比固定长度的思维链,它更强调组织方式和验证闭环。

代价也很明确。多轮智能体调用会增加延迟和token开销,最终效果依赖路由质量,而且实验主要针对单页文档视觉问答,尚不能直接等同于百页级检索。对于需要审计过程的表单、票据和档案场景,ORCA最值得借鉴的部分或许不是“智能体越多越好”,而是每次额外推理都应有清楚的触发条件与否决机制。