
他阅读任务说明后,迅速选择了一套训练方案,例如“全参数监督微调”,随后开始编写代码、运行实验、调整参数并修复问题。十小时后,他提交了一个性能确有提升的模型。
这与当前前沿 AI 智能体在模型后训练任务中的表现相当接近。它们已经能够相对独立地完成模型后训练流程,包括数据准备、训练脚本编写、训练启动、结果评估以及最终检查点提交。
在公开的 PostTrainBench 基准上,多个智能体在七个不同任务中取得了明显的性能提升。例如,GSM8K 数学题准确率从 24.5% 提升到 44.0%,HumanEval 代码生成从 22.0% 提升到 41.4%。

不过,来自清华大学、人民大学等机构的研究团队提出了一个重要问题:我们是否将两种不同层次的能力混为一谈了?
他们将能力区分为两个层面:
- 执行层能力:在已经选定的策略内部进行迭代,例如修复 bug、调整超参数、修改数据格式、选择检查点。
- 策略层能力:随着实验证据的积累,重新评估是否应当更换训练方法,例如从监督微调切换到强化学习,或增加新的训练阶段。
前者关注的是“如何更好地执行既定方案”,后者关注的是“是否应当重新选择方案”。
第一项发现:智能体具备较强的执行能力
研究团队分析了 1,338 条公开的智能体后训练轨迹,覆盖七个基准测试、四个基础模型和二十种智能体配置。每条轨迹都在一块 H100 GPU 上运行十小时。
数据显示,智能体确实擅长执行任务。
平均而言,每条轨迹启动 3.82 次训练、进行 13.80 次评估;几乎每个前沿智能体都能够完整完成从数据准备到训练、评估和提交的流程。
它们也并非只是机械地运行流程,而是能够进行一定程度的技术诊断与修复。
例如,在 HumanEval 上,智能体通过修改生成模板,并将数据集中在函数补全任务上,成功恢复了模型性能。另一些智能体则结合 EOS 修复、分阶段数据构建、逐步降低学习率等方法,将原本失败的训练转化为有效改进。
因此,执行层能力并不是当前智能体的主要瓶颈。
第二项发现:策略几乎从一开始就被固定
研究团队进一步追踪了一个关键问题:在整个十小时运行过程中,智能体有多少次真正改变了训练策略?
结果显示,这一比例很低。
在 3,557 对相邻训练实验中,只有 74 次,即
,尝试过替代策略。

更关键的是,策略选择在很大程度上并不取决于任务本身,而取决于执行该任务的智能体类型。
Claude Code 的轨迹中有 80.7% 一开始就固定在全参数监督微调(SFT);而 Codex CLI 的轨迹中有 89.6% 固定在参数高效微调(PEFT)。也就是说,对于同一个任务,不同智能体会系统性地采用不同的默认策略。
这表明,策略选择更多反映的是智能体自身的默认倾向,而非对任务特征的充分分析。

图 1 直观展示了这一模式:在七个基准上,不同智能体很快收敛到一组相似的训练策略,并迅速达到接近最佳性能的平台期。此后的迭代主要发生在既定策略内部,通常只带来较小的边际收益。
概括而言:策略往往在训练早期就已经确定,后续大部分时间都用于在该策略内部进行局部优化。
三个自然解释与三类干预实验
如果策略固定是一个重要问题,那么原因可能是什么?研究团队依次检验了三个自然假设,并逐步提高干预强度。
假设一:是否缺少经验?
一种可能解释是,智能体缺少足够的实践经验:它无法有效记住此前实验的结论,不了解常见问题,也缺少外部诊断支持。
为此,研究团队构建了一个“经验驱动框架”,包含三个组件:
- 实验日志:一个持久化记录系统,跨迭代保存计划、评估结果、观察和经验,使智能体能够随时查阅历史信息。
- skill 技能库:从 verl、TRL 等开源训练框架的文档和 issue 中提炼出可复用技能,例如如何诊断静默 RL 失败、如何处理数据格式问题,供智能体在运行过程中调用。
- 评估器智能体:一个独立的辅助智能体,负责检查当前训练管线和已有证据,形成对检查点行为的预期,调用评估脚本,并返回具体诊断和可执行建议,其中可能包括“建议切换训练策略”。
在执行层面,这一框架带来了显著提升:

GSM8K 从 64.70% 提升到 77.30%,HumanEval 从 22.00% 提升到 62.80%,后者接近官方指令模型的 66.46%。
但在策略层面,变化并不明显。
评估器智能体多次建议切换策略。例如,在 HumanEval 上,九轮评估中有七轮建议从 SFT 切换到带代码执行奖励的 RL;在 AIME 2025 上,五轮评估中有三轮建议增加 SFT 预热阶段。主智能体采纳了所有执行层面的建议,例如调整奖励、修改超参数和数据格式,但没有采纳任何策略层面的建议。

它甚至编写了 GRPO 训练脚本,但从未实际启动一次 RL 训练。尽管日志记录了“SFT 已进入平台期”,它仍连续生成了 14 个 SFT 变体。
这表明,经验机制能够改善执行质量,但不足以促成策略层面的主动修订。
假设二:是否缺少外部指导?
如果智能体自身不会主动改变策略,那么人类是否可以通过指导促成改变?
研究团队设计了一项人工指导实验。在最困难的 AIME 2025 任务上,训练开始前由人类审阅者审核智能体提出的训练策略,可以要求其修改并说明理由,反复迭代直至批准。此后,完整训练过程由智能体自主运行。
一个具体案例是:智能体最初提出 SFT 管线,审阅者指出“SFT 应只用于格式预热,主要预算应分配给 RL”。智能体随后修改了计划。进入执行阶段后,它检查基础模型后发现格式已经满足要求,于是主动跳过了 SFT 预热。这说明,智能体能够理解、实施,甚至在一定程度上自主延展一个不同于自身默认选择的策略。

人工指导确实将 AIME 2025 的 pass@8 从基线的 3.33% 提升到 13.33%。
然而,一旦训练开始,智能体仍然倾向于进入局部调整循环。它在早期达到了最佳检查点,此后的版本主要围绕既有方案调整熵系数、学习率,或回退到旧检查点,但并未重新审视整体策略。

因此,人工指导能够改变初始策略,但难以改变训练过程中的决策模式。
假设三:是否推理算力不足?
另一种可能解释是,智能体只是没有投入足够的推理算力。经验驱动框架实际消耗了基线 2–8 倍的推理 token;如果算力是主要瓶颈,那么额外算力应当带来更优决策。

在相对简单的任务上,这一假设部分成立。GSM8K 和 HumanEval 中,额外的评估轮次与诊断确实带来了显著收益,并且性价比较高。
但在最困难的 AIME 2025 上,经验驱动框架消耗了基线 7.9 倍的 token,约 6,670 万个 token,却只多解出一道题;这一差异仍处于评估方差范围内。
额外算力主要被用于在已固定策略内部进行更密集的局部搜索。换言之,算力带来的是更细致的执行优化,而非更充分的策略选择。
核心发现:策略存在一个有限的可塑窗口
将三类干预结果结合起来,可以看到一个清晰规律:
策略主要在训练开始前的一小段时间内具有可塑性。 在这一窗口内,经验和指导都能影响策略选择:智能体可以吸收审阅者的理由、修改计划,甚至自主延展新的方案。一旦训练开始,这一窗口关闭,同样的机制便难以继续发挥作用:评估器的建议被忽略,日志中的经验不会触发策略修订,经人工审阅过的策略也会逐渐退化为局部调整。
研究团队在图 7 中描绘了这一结构。理想中的后训练闭环应当是:提出假设 → 执行实验 → 解读结果 → 修改方案 → 再次尝试。
但实际观察到的是,智能体的闭环主要只在执行层面闭合。它能够运行实验、诊断故障、修复管线;但在策略层面,闭环是断开的。它可能记录了诊断结果,有时甚至已经写好替代方案的代码,却不会真正启动新的策略。

因此,工作流在局部层面快速循环,但在全局层面仍然近似线性:从初始策略出发,一直沿同一方向推进到最终检查点。
缺少的不是能力,是自发触发机制
这里存在一个关键区分,也是这项研究的洞见之一。
人工指导实验已经表明:智能体具备实施非默认策略的能力。 它可以理解审阅者的理由,执行不熟悉的方案,甚至主动跳过不再必要的步骤。因此,问题并不在于策略层能力完全缺失。
缺失的是自发启动策略修订的行为机制。
这一点很重要,因为它指向了不同的解决路径。
如果是能力缺失,可能需要更强的模型;但如果是“触发机制”缺失,解决方案则更可能在于两方面:
1. 训练信号:在证据积累到一定程度时,奖励智能体重新打开已经“锁定”的选择。
2. 交互协议:将策略修订设计为显式决策节点,而不是让它作为一个隐含选项淹没在长上下文中。
这两类方法未必依赖更大的模型,但需要改变智能体的优化目标和交互方式。
研究意义
在关于“AI for AI”的讨论中,一个常见观点是:智能体已经能够端到端改进 AI 系统,递归式自我提升正在接近现实。这篇论文为这一判断提供了更精确的边界:执行层面的闭环已经在较大程度上形成,但策略层面的闭环仍未有效闭合。
这意味着,智能体可能在一个并不理想的策略中高效迭代十小时。它能够修复 bug、调整参数、理解评估结果,却未必会主动提出“是否应当更换路线”。在这种情况下,初始策略的质量,而非迭代次数或推理算力,往往决定了一次运行的性能上限。
当然,这项研究也存在局限。它基于公开的 PostTrainBench 轨迹,属于观察性数据,而非随机化实验,因此能够描述规律,但不能直接确立因果关系。策略切换本身也并非总是有益。研究团队审计了 16 条发生过策略切换的轨迹,发现其中既有性能提升,也有性能下降。因此,关键能力不是“频繁切换策略”,而更可能是“基于证据对不同策略进行测试、比较和选择”。
总体而言,当我们讨论 AI 是否能够自主改进 AI 时,真正需要关注的问题不只是“它能否完成训练流程”,还包括“它能否在获得实验反馈后重新审视自己的策略选择”。从这项研究看,前者已经取得显著进展,而后者仍依赖一个尚未充分形成的自发触发机制。
paper: https://www.arxiv.org/pdf/2608.19072v1
夜雨聆风