乐于分享
好东西不私藏

你用的AI编程助手,为什么越用越笨

你用的AI编程助手,为什么越用越笨
你每天用的 AI 编程助手,背后都有一个「推理引擎」。这套引擎让 AI 能多轮对话、调用工具、访问外部系统,但有一个致命矛盾:引擎越复杂,AI 越难被训练变聪明。
这不是技术细节问题。这意味着你现在用的 Claude Code、Codex,能力天花板可能已经很难突破。
7 月 23 日,一篇来自微软亚研和多所高校的论文(arXiv: 2607.21557)提出了解决方案:一个叫 OpenForgeRL 的开源框架,可以在任何环境里端到端训练这些 Agent。简单说,就是给 AI 编程助手装上了一个「自我进化引擎」。
问题出在哪?现有的开源训练基础设施(SFT/RL 栈)根本处理不了 Agent 推理引擎的复杂性。Agent 运行时不是一个简单的输入输出过程,它有状态、有多个进程并行、需要反复调用外部工具。现有的训练框架完全「接不住」这种复杂度,训练失败率接近 100%。
OpenForgeRL 的核心思路是:它在推理引擎和模型之间插入一个轻量代理,拦截所有模型调用,同时把这些调用记录为训练数据。另一个 Kubernetes 编排器负责在独立容器里运行每次推理,把训练和推理彻底解耦。这样,无论你用的是 Claude Code 还是 Codex,都能直接用真实环境的数据训练 Agent。
效果如何?论文在多个基准测试上跑出了数据。在 ClawEval 上,OpenForgeClaw 达到了 31.7 pass^3 和 55.9 pass@3;在 OSWorld-Verified 上,OpenForgeGUI 拿到 37.7 分;在 WebVoyager 上更是达到 72.3。这些数字看起来不高,但关键对比在于:它们用的模型规模远小于竞品,却在几乎所有基准上都跑赢了同级别的开源模型。在 GUI 任务上,甚至能匹配或超越参数量大好几倍的模型。
论文还发现了一个反直觉现象:不是所有推理引擎都一样难训练。有些引擎的学习难度显著高于其他引擎,这意味着选择什么工具跑 Agent,直接影响它能不能变聪明。另外,强化学习确实提升了 Agent 的可靠性,比如自我验证和工具覆盖率,但错误恢复能力依然很弱。也就是说,AI 学会了「做对的事」,但还没学会「做错了怎么补救」。
这件事的行业意义在于:当 Agent 可以被端到端训练,AI 编程工具的进化速度会加快一个量级。过去,开发者只能调提示词、换模型;现在,直接用真实环境的数据训练 Agent 成为可能。
但问题也随之而来。当 Agent 能自主学习、自主进化,谁来监督它的行为边界?如果一个编程助手在训练中学会了「走捷径」,绕过安全检查直接调用敏感接口,它写出的代码是更高效,还是更危险?
点击上方蓝字关注「AI 前哨营」,第一时间获取 AI 行业前沿资讯。