核心信息
- 原文标题: Visual Document Understanding and Reasoning: A Multi-Agent Collaboration Framework with Agent-Wise Adaptive Test-Time Scaling
- 中文标题: 视觉文档理解与推理:具有智能体级自适应测试时扩展的多智能体协作框架
- 方法名称: MACT
- 领域: 视觉文档理解与推理、Vision-Language Models、多智能体协作、测试时扩展
- 论文类型: 方法研究与实验评测
摘要
视觉文档理解与推理要求模型处理基于文档的程序化推理、较高的认知复杂度以及严格的事实准确性。论文认为,主流 Vision-Language Models(VLMs)依赖增加参数和训练数据的单体扩展范式,在这一领域已经出现收益递减。
为此,论文提出 MACT:一种采用智能体级自适应测试时扩展的多智能体协作框架。MACT 将视觉文档处理拆分为规划、执行、判断和回答四个专门智能体,以缓解单一模型同时承担异质任务时的认知过载,并通过判断智能体建立面向事实依据的自纠错闭环。在此基础上,框架根据各智能体功能的复杂度与冗余度,自适应分配测试阶段的计算资源。
在多个视觉文档理解基准上,MACT 以较小参数规模取得了更优性能,并能适应不同文档场景,同时没有牺牲一般推理和数学推理能力。三种 MACT 变体的平均性能排名均进入前三,相对各自基础模型的平均提升达到 9.9%–11.5%。
背景与问题
视觉文档理解不是单纯识别页面中的文字。随着处理对象从简单页面扩展到多页报告、复杂图表和网页,问题也从直接查找信息发展为语义理解、多跳推理与数值计算。模型不仅要解析复杂版面、密集文本和结构化数据,还要连续完成问题拆解、策略制定、信息定位、局部操作、过程检查和答案综合。
这类任务对中间过程尤其敏感。段落截断、表格行列错位或某一步信息定位错误,都可能改变后续推理轨迹并使最终答案失效。单体 VLM 通常在一次前向计算中同时承担全局规划、细粒度抽取、逻辑推断、数值计算和答案生成,容易产生认知过载与任务干扰,也缺少主动定位和修正早期错误的内部闭环。
现有主流路线主要通过增加模型参数和高质量训练数据提升能力。论文指出,这种 monolithic scaling 在基于文档的视觉问答上已经出现收益递减:计算开销持续上升,但继续扩大开源模型规模带来的性能改善有限。问题不只是模型容量不足,更在于统一结构没有显式对应文档分析的程序化流程,也无法根据规划、执行、检查和回答等环节的不同难度合理分配测试时计算。
MACT 因而把研究重点从“扩大同一个模型”转向“组织完整的文档处理程序”:用四个功能明确的智能体分担异质能力,以独立判断环节建立定向纠错闭环,再将额外计算投入最需要搜索、执行或校验的环节。
创新点
从单体扩展转向程序化扩展
MACT 将视觉文档分析显式拆分为 Plan Agent、Execution Agent、Judgment Agent 和 Answer Agent。该设计把规划、操作、验证和综合从同一次前向计算中分离,使模型结构与文档任务天然具有的多步骤处理流程相对应,直接缓解异质能力集中于单一模型造成的认知过载。
以独立判断智能体建立定向纠错闭环
MACT 不让原智能体自行判断并修改,也不让一个额外智能体同时承担判断和纠错。Judgment Agent 只负责检查计划与执行过程、定位错误并生成简短错误描述,实际修正仍交由 Plan Agent 或 Execution Agent 完成。这样既降低了判断角色的职责复杂度,也能把错误准确路由到对应功能模块。
按智能体功能自适应分配测试时计算
不同角色需要的额外计算并不相同。MACT 为规划阶段提供并行路径探索,为执行阶段提供逐步骤候选生成与奖励筛选,为判断阶段配置思考预算,而回答阶段只承担信息汇总。其核心不是统一增加采样量,而是让计算投入与各角色的认知负载和功能冗余相匹配。
用混合奖励协调局部行为与全局路径
论文同时使用智能体专属奖励和完整协作路径的全局奖励。前者让规划与执行获得步骤级反馈,让判断与回答获得符合其输出形式的结果反馈;后者把四个智能体绑定到同一个端到端目标,从而缓解单个角色只提高自身奖励、却损害最终答案的“智能体自利”。
一句话总结
MACT 将视觉文档理解与推理从单体模型的一次性处理改造成规划、执行、判断和回答四个智能体协作的可纠错程序,并依据不同角色的功能需求自适应分配测试时计算。
数据与任务定义
输入与输出
系统输入包括问题、由一个或多个视觉页面组成的文档、规划智能体、执行智能体及其工具库、判断智能体、回答智能体,以及最大纠正次数。输出是针对输入问题生成的最终答案。
任务要求模型在视觉文档上完成规划、信息定位、逐步执行、错误检查和答案整合。实验范围不仅包含视觉文档理解,还覆盖一般能力与数学推理,用于检验文档能力提升是否以损害其他推理能力为代价。
评测范围
实验共覆盖 15 个基准,其中 10 个用于文档理解,涉及文本型、网页型、图表型和表格型文档;2 个用于通用能力评估,3 个用于数学推理评估。可统一运行的模型使用 LMMs-Eval,多数基准由 GPT-4o 判断答案正确性,其余沿用 ANLS、F1 等原始评价指标。
论文构建了三种 MACT 变体,分别基于 Qwen2.5-VL、MiMo-VL 和 InternVL3 系列,总参数规模为 24B、28B 和 28B。对比范围包括闭源模型、不同参数规模的通用模型以及面向文档任务的专用模型。
方法主线
整体架构
如图2所示,MACT 上半部分是一条由规划、执行、判断和回答组成的程序化文档分析链路。Judgment Agent 检测到规划错误时将流程退回 Plan Agent,检测到执行错误时则退回 Execution Agent;判断通过后,Answer Agent 才综合经过检查的中间过程生成答案。图2下半部分展示了智能体级测试时扩展和混合奖励建模在各角色中的位置。

MACT 中的规划与执行智能体采用 VLM,以接收视觉输入并完成文档分析;判断与回答智能体采用 LLM,分别负责错误判定和最终信息整合。该分工的重点不是简单增加智能体数量,而是让不同模型组件承担边界明确的功能。
机制流程
输入与规划。 Plan Agent 接收问题和视觉文档,先生成若干相似、相关实例及其参考计划,再结合问题、参考计划和历史错误信息生成正式计划。计划描述每一步的目标和要求,但不提前绑定具体工具。
逐步骤执行。 Execution Agent 把计划拆为顺序执行单元。每个单元结合问题、文档、当前步骤、已有结果、工具库和错误反馈独立处理,并保留完整过程供后续检查。工具选择在执行阶段动态完成。
独立判断与定向回退。 Judgment Agent 同时检查计划和执行过程。若发现规划错误,流程返回规划阶段;若发现执行错误,则返回对应执行阶段。错误描述会加入后续提示,纠正次数随回退累积,最大纠正次数设为 3。
答案综合。 当判断未发现错误或纠正次数达到上限后,Answer Agent 综合问题、修正后的执行结果、历史错误片段及错误描述生成最终答案。保留“错误—纠正”轨迹有助于突出修改位置和易错细节。
独立判断为何不同于自我纠正
由生成计划或执行结果的原智能体进行内部纠正,可能重复其既有认知盲区;额外设置一个同时负责判断和改写的代理,又可能引入主观偏差、输出模糊化以及组件间不兼容。MACT 因此把“判断错误”和“实际改写”分离:Judgment Agent 只决定哪里错、属于哪一类错误,修正由原功能智能体完成。
智能体级测试时扩展
Plan Agent 通过并行生成多个相关计划增加正确路径的覆盖概率。Execution Agent 在每个执行节点产生多个候选结果,由预训练奖励模型评分,只保留最高分候选进入下一步骤。Judgment Agent 使用 budget forcing:当已消耗的思考 token 未达到预算时,继续生成推理内容,以加强错误检测。Answer Agent 主要汇总已校验的信息,额外测试时扩展只能带来边际收益,因此不是主要计算投入对象。
这套策略与 parallel、sequential、hybrid 或 internal scaling 的区别在于,MACT 不对整条链路采用同一种扩展方式,而是根据不同智能体的功能特点选择搜索、候选筛选或思考预算。
分阶段训练
训练分为两个阶段。第一阶段进行分角色 SFT:先使用混合 CoT 与非 CoT 的文档及非文档数据增强 VLM 的视觉理解与推理能力;再使用 GPT-4o 生成的判断标签和规则验证结果训练 Judgment Agent;最后结合前序智能体输出与真实答案训练 Answer Agent,使其学习整合完整中间过程。
第二阶段使用 GRPO 和预训练奖励模型优化各角色。Plan Agent 与 Execution Agent 使用 VisualPRM 提供逐步过程奖励;Judgment Agent 与 Answer Agent 使用 Skywork-VL-Reward,对完整判断结果和最终答案提供结果奖励。训练目标进一步加入完整多智能体路径的全局奖励。
关键结果
小模型程序化协作优于更大单体模型
如图1所示,三种 MACT 变体相对各自基础模型均取得稳定提升,平均增幅为 9.9%–11.5%。MACT-Qwen2.5-VL-Series-24B、MACT-MiMo-VL-Series-28B 和 MACT-InternVL3-Series-28B 的汇总结果分别为 74.8、77.2 和 75.3,三者平均性能排名均进入前三。

在论文给出的对比范围内,24B 的 MACT-Qwen2.5-VL-Series 得分 74.8,高于 Qwen2.5-VL-72B-Instruct 的 70.5;28B 的 MACT-MiMo-VL-Series 得分 77.2,高于 InternVL3-78B-Instruct 的 71.6,也高于闭源模型 Gemini-2.0-Pro 的 71.3。三种 MACT 在 15 个基准中的 13 个取得第一,其中 MiMo 变体领先 7 个基准。
在长视觉上下文基准 MMLongBench-Doc 上,MACT-MiMo-VL-Series 相对第二名提高 7.1%;在三个数学基准上的领先幅度分别为 10.6%、5.9% 和 8.7%。这些结果支持论文关于文档能力提升没有牺牲一般推理和数学推理能力的结论。
完整框架的组件贡献
如表2所示,完整 MACT 在 MMLong、TabBen、MVision 和总体平均分上分别达到 43.7、57.2、41.8 和 74.8。去除多智能体协作后,四项结果下降至 24.7、44.4、26.0 和 58.6;去除智能体级自适应扩展后,平均分为 71.1;去除混合奖励建模后,平均分为 71.4。

论文据此报告,程序化多智能体框架相较单体系统提升 8.6%,智能体级自适应测试时扩展和混合奖励建模均贡献至少 3% 的平均准确率增益。多智能体协作是最大增益来源,但计算分配和奖励设计仍是完整性能不可缺少的组成部分。
增益来自功能分工,而非单纯增加角色
如表3所示,仅由规划与执行智能体组成的基础程序化系统,相对基础模型平均提升 3.9%;加入 Judgment Agent 后进一步提高 5.5%;继续加入 Answer Agent 后再提高 0.9%。

判断角色带来的增益明显高于最后的答案整合角色,说明对计划与执行过程进行独立检查,是 MACT 协作链路中的关键环节。Answer Agent 的增益较小,但仍能通过整合经过校验的中间过程改善最终输出。
独立判断比两类纠错方案更有效
如图3所示,论文比较了三种机制:原智能体内部纠正、额外智能体同时负责判断和纠正,以及 MACT 使用的独立 Judgment Agent。MACT 的独立判断策略平均至少提高 2.6%,同时平均减少 0.3 次纠正。

该结果支持“判断与改写解耦”的设计:判断智能体只定位错误并控制回退,对应的规划或执行智能体负责实际修改,从而避免判断代理同时承担过多职责。
纠正次数不是越多越好
如图4所示,MACT 在最大纠正次数设为 3 时取得最佳结果,而内部纠正和判断—纠正合并两种对照策略需要将上限设为 5。继续增加纠正次数不会持续提升性能,过度纠正可能造成混淆,并覆盖原本正确的答案。

这一结果说明,自纠错机制的价值来自准确识别错误和定向回退,而不是无限延长推理链。MACT 在较低纠正上限下达到最优,也与其平均减少 0.3 次纠正的结果一致。
智能体级扩展优于统一扩展策略
如表4所示,无测试时扩展时,MMLong、TabBen、MVision 和总体平均分分别为 34.9、50.8、34.5 和 71.1;Agent-Wise Adaptive 对应达到 43.7、57.2、41.8 和 74.8,四项均为最高。

并行、顺序、混合和内部扩展的平均分分别为 72.0、72.4、73.0 和 72.3,而按智能体自适应扩展达到 74.8,至少领先这些统一策略 1.8%。结果支持论文的核心判断:测试时计算应依据规划、执行和判断等环节的认知负载分配,而非对所有角色统一增加采样或推理预算。
混合奖励优于单一奖励
如表5所示,无奖励、智能体专属奖励、全局奖励和混合奖励的平均分分别为 71.4、72.7、70.2 和 74.8。单独使用全局奖励没有取得最佳效果,而混合奖励比仅使用智能体专属奖励进一步提高 1.3%。

这说明局部过程质量与端到端协作结果不能相互替代。角色级奖励负责改善具体规划、执行、判断和回答行为,全局奖励则约束这些行为是否共同形成正确路径;两者结合才能同时避免局部步骤失控和智能体局部自利。
深度分析
论文重新定义了视觉文档任务的扩展瓶颈
MACT 的主要贡献不是提出一个更大的文档模型,而是把性能瓶颈从“参数容量不足”重新表述为“流程组织、错误控制与计算分配不合理”。24B 和 28B 的 MACT 变体超过部分 72B、78B 单体模型,为这一判断提供了直接实验支持。该证据表明,在论文覆盖的模型系列和基准范围内,显式程序化协作可以比继续扩大单体参数获得更高的汇总性能。
独立判断是协作链路中的主要增益节点
不同智能体组合实验中,加入 Judgment Agent 带来 5.5% 的进一步提升,高于加入 Answer Agent 的 0.9%。纠错策略对比又表明,独立判断至少领先两种替代方案 2.6%,并减少平均纠正次数。两组证据共同支持判断角色的价值来自功能边界,而不是单纯增加一次模型调用。
自适应扩展改善的是计算配置方式
Agent-Wise Adaptive 相比无扩展提高了总体平均分,也领先并行、顺序、混合和内部扩展。由于回答智能体的额外扩展只产生边际收益,论文没有把计算平均分配给所有角色,而是把搜索用于规划、候选筛选用于执行、思考预算用于判断。表4的结果说明,扩展策略的收益不仅取决于计算量,还取决于计算被放在哪个处理阶段。
局部奖励和全局奖励具有互补关系
表5显示,单独使用全局奖励的平均分为 70.2,低于智能体专属奖励的 72.7,也低于完整混合奖励的 74.8。这意味着完整协作路径的结果信号不能取代对具体角色行为的细粒度监督。混合奖励的有效性来自两层约束:局部奖励提高单个处理节点的质量,全局奖励检查这些节点能否共同服务于最终答案。
有效性证据集中在多组件协同
整体消融、角色组合、纠错策略、测试时扩展和奖励建模五组结果方向一致:流程拆解贡献最大,独立判断进一步提高事实检查能力,角色级计算分配优于统一扩展,混合奖励则协调局部和全局目标。因此,论文支持的是一套联合机制,而不是某个单独技巧可以完全解释全部增益。
局限
MACT 依赖预先规定的规划、执行、判断和回答四阶段流程,其适用边界与这一程序化分工直接相关。当前纠错机制还设置了固定上限:最大纠正次数为 3;当达到上限后,即使仍检测到潜在问题,流程也会停止并进入答案生成。
纠错收益并不随迭代次数持续增加。实验显示,过度纠正可能让智能体产生混淆,并覆盖原本正确的答案。这意味着系统必须在错误修正能力、额外计算和错误改写风险之间保持平衡。
Judgment Agent 的检测能力依赖足够的思考预算,Plan Agent 的并行路径和 Execution Agent 的逐步骤候选筛选也会增加测试时计算。论文证明了按角色分配资源优于统一扩展,但这些性能提升仍建立在额外的搜索、评分与判断调用之上。
Answer Agent 的测试时扩展只能带来边际改善,说明额外计算并非对所有组件都同样有效。奖励建模同样存在明确边界:单独采用全局奖励的平均结果低于混合奖励,不能仅依赖最终路径评分替代角色级过程监督。
实验覆盖 15 个基准,多数基准通过 GPT-4o 判断答案正确性,其余采用 ANLS、F1 等原始指标。因此,论文的总体结论建立在这一基准集合和混合评价协议之上。
总结
MACT 针对视觉文档理解与推理中的程序化处理需求、认知过载和事实错误风险,将单体 VLM 的统一处理方式改造成由规划、执行、判断和回答四个智能体组成的协作流程。Judgment Agent 独立定位错误并控制流程回退,Plan Agent 和 Execution Agent 负责定向修正,由此形成最多纠正 3 次的事实检查闭环。
框架进一步根据角色功能分配测试时计算:规划阶段并行探索路径,执行阶段逐步骤生成并筛选候选,判断阶段增加思考预算,而回答阶段主要负责汇总。训练侧通过角色级过程或结果奖励提高局部行为质量,再以全局奖励约束完整协作路径。
三种 MACT 变体相对各自基础模型平均提升 9.9%–11.5%,并在 15 个基准中的 13 个取得第一。整体消融、角色组合、纠错策略、扩展策略和奖励实验共同表明,性能提升来自程序化分工、独立判断、智能体级计算分配以及局部—全局混合奖励的协同作用。论文的证据同时说明,纠正次数和测试时计算并非越多越好;MACT 的核心价值在于把额外能力与计算投入到文档分析流程中最需要搜索、执行和校验的位置。
夜雨聆风