乐于分享
好东西不私藏

为什么顶级AI做不了真实网购?从评测、底座到自演进的5篇论文解析

为什么顶级AI做不了真实网购?从评测、底座到自演进的5篇论文解析
在大语言模型向高自主性智能体(Autonomous Entities)演进的过程中,学术界与工业界面临着一个共同的挑战:模型在传统静态测试集中的表现日益饱和,但在面对真实生产环境、长程任务和状态改变型操作时,其可靠性依然不足。近期发表的五篇论文从不同维度对这一困境给出了解决方案。

本文聚焦近期五篇具有代表性的前沿论文——ClawBenchALE(Agents' Last Exam)Code as Agent HarnessAutoResearchClaw 与 AREX,按“现实基准评测—系统运行底座—自主演进闭环”三个层次,对它们的核心机制、实验发现与系统设计进行逐一解析。

一、评测重构:直面生产环境与专业工作流

1. ClawBench:144个真实生产网站上的“写重”检验

  • 论文标题ClawBench: Can AI Agents Complete Everyday Online Tasks? (arXiv:2604.08523, 2026.04)
  • 主要团队:英属哥伦比亚大学 (UBC)、Vector 研究所、滑铁卢大学、卡内基梅隆大学 (CMU) 等

核心机制与设计

传统 Web 评测(如 WebArena)多局限于静态 HTML 快照或只读查询,忽略了真实网络中广泛存在的动态 JavaScript 渲染、Cookie 弹窗、身份验证及反爬机制。ClawBench 对此进行了两项关键设计:

  • 真实场景覆盖:在 144 个完全真实的生产环境网站上设计了 153 个写重(Write-heavy)日常任务,覆盖金融、求职、教育、旅游等 15 个细分领域,要求模型执行实质性改变服务器状态的操作(如预约挂号、提交申请)。
  • 终端请求拦截(Final-Request Interception):在受控 Chromium 容器中,利用 Chrome DevTools Protocol (CDP) 实时监测网络流量。当检测到可能产生现实副作用的 POST/PUT/DELETE 请求时,系统在浏览器底层精准阻断并捕获完整的 Payload(含 Header、Body 及 Cookies),实现“100% 真实交互、0% 现实副作用”。
  • 五层轨迹证据比对:通过录屏视频、动作截图、浏览器原生指令日志、智能体推理流(CoT)以及捕获的 HTTP 数据包,与人类参考路径进行字段级对齐评分。

核心发现与问题诊断

在静态基准中得分达 70%~88% 的模型,在 ClawBench 上表现出明显的成功率下滑:Claude Sonnet 4.6 取得 33.3% 的成功率,Qwen 3.5 为 26.1%,GLM-5 为 24.2%,GPT-5.4 仅为 6.5%。

  1. 努力的悖论(The Effort Paradox):失败的任务往往消耗了更多的交互动作与工具调用,智能体容易在反爬盾(如 DataDome)或无限滚动的前端框架中陷入死循环。
  2. 最后一公里的犹豫(Last-Mile Hesitation):模型在完成前期搜索与表单填写后,面对最终的“提交/确认”按钮时频繁出现提前退出或反复刷新。其深层原因在于模型内置的安全对齐机制与不可逆操作要求之间的策略冲突。

2. Agents’ Last Exam (ALE):专业级数字工作流与能力拆解

  • 论文标题Agents’ Last Exam (arXiv:2606.05405, 2026.06)
  • 主要团队:加州大学伯克利分校 (UC Berkeley) Dawn Song 团队

架构体系与实验结论

ALE 针对专业领域的数字工作流进行评估,基于美国劳工部 O*NET/SOC 2018 职业标准与 250 多位行业专家经验,构建了涵盖 55 个核心职业领域的 1000 多个长程任务。

  • GCUA 五层架构模型:将通用计算机使用智能体(Generalist Computer Use Agent)系统性拆解为:

  • Brain(大脑):负责全局规划、多步推理与调度决策。

  • Eyes(眼睛):解析复杂渲染与多模态 DOM 树。

  • Body(身体):提供隔离且状态一致的运行环境。

  • Hands(双手):模拟精确的人类交互动作(如拖拽、点击)。

  • Feet(双脚):负责 URL 路由与页面深层跳转。

  • “认知胜过工程”:消融实验(Harness Sweeps)表明,提高截图分辨率或优化 DOM 提取等工程手段虽有提升,但底层模型推理能力(Brain)的升级对成功率的拉动效果是单纯工程优化的 3 倍以上

二、系统底座:运行容器(Harness)的代码化与事务性

3. Code as Agent Harness:可执行、可验证的有状态系统

  • 论文标题Code as Agent Harness: Toward Executable, Verifiable, and Stateful Agent Systems (arXiv:2605.18747, 2026.05)
  • 主要团队:伊利诺伊大学香槟分校 (UIUC)、Meta、斯坦福大学

范式转变:代码作为统一运行基质

传统的自然语言 ReAct 对话框架在长程任务中容易因语义模糊而发生“状态漂移(State Drift)”。该研究系统阐述了将代码(Python)作为智能体感知、推理与行动的统一基质:

  • 接口层(Interface):将工具调用封装为具备异常捕获(try-catch)与断言机制的动态脚本,使单步动作具备自我排错与容错能力。
  • 机制层(Mechanisms):建立底层遥测(Telemetry)系统,实时采集 stderr/stdout 及系统资源指标。当检测到逻辑偏离预定时,支持智能体回滚至上一个“已知稳健状态(Known Good State)”。
  • 扩展层(Scaling):在多智能体系统(MAS)中提出 Transactional Shared Program State(事务性共享程序状态),引入类似数据库的并发锁与状态原子性机制,避免多个智能体同时修改代码基底时产生竞态冲突(Race Condition)。

三、自主演进:科研闭环与上下文动态垃圾回收

4. AutoResearchClaw:多角色对抗与负反馈驱动的自主科研

  • 论文标题AutoResearchClaw: Self-Reinforcing Autonomous Research with Human-AI Collaboration (arXiv:2605.20025, 2026.05)
  • 主要团队:北卡罗来纳大学教堂山分校 (UNC-Chapel Hill)、加州大学圣克鲁兹分校 (UC Santa Cruz)、CMU、NUS、UC Berkeley 等

核心机制与系统组成

AutoResearchClaw 针对开放域科学研究构建了包含 23 个阶段的闭环系统,在 ARC-Bench 评测中相比前代 AI Scientist v2 实现了 54.7% 的性能提升

  1. 结构化多智能体辩论(Multi-Agent Debate):在假说生成、实验执行与结果分析阶段动态激活对立角色(如 创新者 vs. 唱反调者编码者 vs. 审计员),利用角色约束减少单模型偏见。
  2. 自愈执行器(Self-Healing Executor):当实验报错或输出异常时,执行器通过 Pivot(路径转向)与 Refine(局部细化)逻辑自动解析 Traceback 并重构代码。
  3. 数值注册表(Numerical Registry):所有实验产出的关键数值指标强制与底层原始计算日志哈希绑定,防止数据幻觉。
  4. 跨运行经验沉淀(Lesson Store):将失败与纠错记录提炼为结构化教训存入数据库,在后续新任务启动前动态索引注入,实现跨会话能力积累。
  5. 智能挂起(SmartPause):在检测到不确定性过高或涉及高价值资源开销时主动暂停循环,请求人类专家介入(HITL CoPilot 模式)。

5. AREX:发现-验证不对称性与自主上下文垃圾回收

  • 论文标题AREX: A recursively self-improving agent for deep research (arXiv:2607.21461, 2026.07)
  • 主要团队:北京智源人工智能研究院 (BAAI)

破局长程任务中的信噪比失衡

在长链条深度调研中,大量网页内容和临时报错会迅速挤占上下文窗口,导致逻辑漂移。AREX 提出了针对性的解决方案:

  • 双环验证架构:基于“验证的计算复杂度远低于发现”的不对称性,内环负责信息检索与路径生成,外环由独立的审计智能体进行逻辑重放,找出隐蔽矛盾并驱动内环修正。
  • 自主上下文更新(ACU: update_context:赋予智能体主动清理上下文的能力。模型可自主剔除已验证无效的探索分支,仅保留核心证据快照并置顶当前的关键阻碍因子。消融实验显示,ACU 机制直接带来了 11.8% 的准确率净提升
  • 智能体中期训练(Agentic Mid-training):引入“关键步骤关注机制”,重点训练智能体在路径选择、错误回溯与约束冲突等关键节点上的纠错与恢复能力(Path Correction)。

四、五项论文核心维度对比

ClawBench
Agents' Last Exam (ALE)
Code as Agent Harness
AutoResearchClaw
AREX
技术层级
真实生活场景评测
专业数字工作流基准
系统容器与运行底座
科学研究自演进管线
深度研究自演进架构
测试/运行环境
144个真实生产网站 (153项任务)
55个职业领域 (1000+工作流)
动态 Python 代码环境
23阶段端到端科研闭环
双环检索-审计环境
核心机制
CDP 终端请求拦截 + 5层轨迹证据
GCUA 五层解构体系
事务性共享状态 + 遥测回滚
对抗辩论 + Lesson Store + 挂起机制
双环重放 + ACU 上下文垃圾回收
解决的关键问题
真实写操作风险与反爬死循环
专业复杂技能评估标准缺失
自然语言状态漂移与并发竞态
科研探索单模型偏见与数值幻觉
长程探索上下文膨胀与信噪比崩溃

五、总结

综合上述五项前沿工作,大模型智能体系统的发展正在呈现出三个清晰的技术趋势:

  1. 评测信号直接赋能训练闭环:ClawBench 提出的真实 Payload 拦截反馈与 ALE 的专业环境约束,正逐步作为强化学习(RL)的奖励信号,与 AREX 类的中期纠错训练直接打通。
  2. 以代码为核心的事务性基础设施:自然语言不再承担全部的状态传递职责,基于 Python 代码、具备异常处理与事务一致性保障的 Harness 正在成为工业级智能体系统的基础组件。
  3. 主动上下文管理取代被动窗口扩展:面对长程任务,依赖硬件上下文窗口扩容已显不足,通过 AREX 的 update_context 进行动态垃圾回收,结合 AutoResearchClaw 的 Lesson Store 进行跨任务经验沉淀,正在成为提升长程任务成功率的关键手段。

更多交流,可加本人微信

(请附中文姓名/公司/关注领域)