ARTICLE · 1157654
AI Agent 写对了新功能,却差点改错测试:人大高瓴提出 AEWM,让世界模型直接纠正下一步

> 本文来自社区投稿

摘要
在一次软件工程任务中,Agent 需要修改 OpenLibrary 的匹配逻辑,让程序支持未经预处理的原始记录,同时保留对旧格式数据的兼容。
新功能写出来了,但三个已有测试突然报错。Agent 开始怀疑测试本身过时,准备继续检查测试文件。
真正的问题却是:新增功能不能以破坏旧接口为代价。
中国人民大学高瓴人工智能学院提出的 Agent-Editing World Model(AEWM),在这一节点识别出错误方向,直接修订 Agent 的推理与代码修改动作,让程序兼容两种输入。重新运行测试后,原先三个失败项转为通过。

论文链接:https://arxiv.org/abs/2609.28416
项目主页:https://github.com/RUCAIBox/Agent-Editing-World-Model
Hugging Face:https://huggingface.co/collections/RUC-AIBOX/agent-editing-world-model
背景:Agent 为什么会越做越偏?
长程任务中的失误,往往不是单次工具调用失败,而是错误理解被写入历史,影响此后的每一步。
比如把猜测当作事实、把局部成功当作任务完成,或者在已有证据否定某个方向后继续重复探索。论文将这种现象称为 task-state contamination(任务状态污染)。
不少语言世界模型尝试预测下一次搜索、终端或测试会返回什么。但这些结果由网页变化、文件系统和实际执行状态决定,不仅难以准确模拟,而且真实工具通常能直接提供反馈。
AEWM 因此提出不同的思路:与其模拟环境,不如判断 Agent 当前的决策是否真正有助于推进任务。
创新点:在行动执行前给 Agent 一次改道机会
AEWM 不是传统意义上的工具返回模拟器,而是一个能够判断并编辑 Agent 当前状态的模型。
它由两项能力组成:
Action Judge:先判断。 在真实执行前,把候选推理和行动分成三类:Critical(关键推进)、Exploratory(有效探索)、Noisy(重复、偏题或错误方向)。其中,必要的试错不会被简单当成无效操作。
State Revision:再修订。 只有决策被判定为 Noisy 时,才根据已有历史重新生成推理与行动,替换原本准备执行的下一步。
这套流程被称为 EditAct:Agent 提出决策 → AEWM 判断 → 必要时修订 → 真实工具执行 → 将实际反馈写回历史。
区别在于:AEWM 不只是说“这里可能错了”,而是让更合理的下一步真正进入执行轨迹。

实验:不只会挑错,还能在六项任务上提升表现
研究团队先构建了包含 3,000 条决策的 Action Judge Benchmark,覆盖 Search、Terminal、SWE 三个领域。
AEWM 的整体 Macro-F1 达到 **70.5%**,比最强对照模型高 10.6 个百分点。

更关键的是,判断能力能否真正帮助 Agent 完成任务?
在 BrowseComp、DeepSearchQA、Terminal-Bench 2.0、Doc2Repo、NL2Repo 和 SWE-Bench Pro 六项基准、三个 Qwen3.5 基座上,EditAct 均优于 ReAct 和两种 Best@3 基线;六项平均分较各自最强基线提升 3.2–6.7 个百分点。
例如,在 Qwen3.5-35B-A3B 上,Terminal-Bench 2.0 从 **37.1% 升至 48.3%**,DeepSearchQA 从 69.4 升至 78.6。

消融实验还发现,单纯让 Agent 再生成一次,或给出修改提示,都不如直接修订推理与行动。这说明提升并非仅仅来自“多想一轮”。
长期效果:一次纠偏能否变成长期能力?
AEWM 并不止于在线干预。研究团队利用 EditAct 产生、经过验证的高质量轨迹,进一步微调 Agent,提出 AEWM-RFT。
在后续评测中,即使完全不再调用 AEWM,训练后的 Agent 仍比使用自身轨迹训练的 Self-RFT 高 2.2–2.6 个百分点。在 BrowseComp 上,平均交互轮数也从原始模型的 56.2 轮下降至 39.3 轮。

写在最后
AEWM 将世界模型的关注点从“环境将返回什么”,移到了“Agent 的下一步是否值得执行”。它不仅能及时改写低价值决策,也能把真实纠偏轨迹转化为训练监督。
长程 Agent 需要的不只是更多行动,而是在关键时刻能够修正自己的行动方向。
-- 完 --

机智流推荐阅读:
2. 刚刚,2026 诺贝尔化学奖揭晓:法国和日本化学家获奖,发现分子「左右手」能自己放大
3. 活动报名:OpenAI 和 Thinking Machines 都押注的实时交互模型,下一步往哪走?丨iRTE 2026
4. 微软开源 NVX:给Agent用的超轻量SandBox,Windows 和 Linux 都能跑
cc | 大模型技术交流群 hf | HuggingFace 高赞论文分享群 lc|LangChain 技术交流群 code | AI Coding 交流群 具身 | 具身智能交流群 硬件 | AI 硬件交流群 推理 | AI 推理框架交流群 智能体 | Agent 技术交流群