夜雨聆风学习资料网

ARTICLE · 1125180

AI 自我改进(RSI)走到哪一步了:8 条 take away

AI 自我改进(RSI)走到哪一步了:8 条 take away

让 AI 改进自己,再用改进后的自己继续改进,这个叫递归自我改进(Recursive Self-Improvement,RSI)的想法已经提出了几十年,眼下正在快速发展和应用。

10 月 3 日,NICE 的线上 workshop「AI 自我改进的机制、证据与边界」邀请了四位这个方向的研究者:黄呈松(圣路易斯华盛顿大学博士生)、刘世隆(普林斯顿大学博士后,2027 年秋将任哥伦比亚大学助理教授)、殷达(NeoCognition)和钱成(UIUC 博士生),一起讨论 RSI 的主流路线、当前瓶颈、评测方法,以及它对学术界和工业界的影响。我们把这场讨论总结成了下面 8 条 take away。

1. RSI 改的是整个系统,不只是模型

今天说“自我改进”,改的对象已经是一整套 agent 系统,能动的地方至少有三处。

  • 权重。通过训练改模型本身。
  • Harness。包在模型外面的工具、记忆和执行流程,改它不用重训模型。
  • 环境和数据。黄呈松的看法是,不管用什么算法优化 agent,都需要更难、更贴近下游任务的训练数据,在 agent 场景里这就是环境。模型变强后能合成更好的环境,更好的环境再训出更强的模型。

这三处会交替推进。钱成的说法是“螺旋上升”:harness 里的部件会被训进模型自己的能力,模型变强之后又需要新的 harness。刘世隆的组走过的路线也是这个顺序:先让模型自己造工具,再到环境里探索,最后用探索得到的弱监督数据训模型。

既然都能改,就该一起改。黄呈松认为,协同优化的结果一定不差于单独优化,代价只是优化过程更难。

殷达打了个比方:斯诺克里很难说哪根球杆最好,成绩来自球员和自己那根杆的长期磨合,换一根杆,顶尖球员也可能再打不出原来的成绩。模型和 harness 同理:各家公司的基础设施和数据分布都不一样,A 公司的训练配方搬到 B 公司的 harness 上未必好用。

还有一个问题是谁来改。钱成把自我改进分成三层:修改当前答案,跨任务积累经验,提升“产生和筛选改进方案”的能力。他们做的 AI for AI 主要在第三层。过去是人设计一套 harness 或 skill 去提升执行者的能力;现在让一个 builder AI 给 target AI 搭 harness、写环境、做 debug,两者的关系像导师和博士生。

2. 现在RSI哪些能做,哪些还暂时不能做?

RSI 这一轮能做起来,是因为模型已经能自己跑完整个改进循环,而且每改一次,都能又快又便宜地知道改对了没有。做不到这一点的任务,比如要靠人来评判的写作、要到物理世界里做实验的科学问题,就是它现在的能力边界。

为什么现在能做起来?钱成总结了三个原因:

  1. none !important
    none !important基础模型能独立承担闭环里的每个环节:读代码、提修改意见、跑实验、分析反馈、记录经验,中间不再需要人来衔接。none !important
    none !important
  2. none !important
    none !importantHarness 让“改进”变便宜了。不用重训模型,改一下工具包装、记忆策略或执行流程,就能直接在现有模型上验证。none !important
    none !important
  3. none !important
    none !important可执行的环境多了。强化学习里有各种 gym,很多新的 benchmark 也不再只是“一个输入、一个输出”,而是 agent 可以在里面自由执行的沙盒。系统在这样的环境里能拿到更直接的反馈。none !important
    none !important

刘世隆认为:人加电脑本来就是一个 RSI 系统,只是人的带宽太窄,没法一周七天、一天二十四小时地转。LLM 接手了人的一部分环节,循环才快起来。

黄呈松点出了其中最关键的一条:reward 要便宜。他们用 AI 优化 test-time scaling 算法时,卡住的地方是每拿一次 reward 都要等很久。后来把结果提前跑好、改成静态模拟,reward 能很快拿到,优化算法就“变成了一个非常简单的事情”。再把问题改写成写代码或写文本(code as policy),语言模型就能接手。

那哪些还暂时不能做?刘世隆的判断是,环境可验证时,给模型一些时间它就能做好;难的是不容易验证、或者验证成本很高的场景,比如真实物理世界里的科学和工程问题。黄呈松举的例子是写作:一版改得好不好,目前还得靠人做 A/B test,每轮反馈隔得很久,循环自然慢。在他看来,一个问题只要能写成代码、又容易拿到 reward,RSI 就没什么问题;瓶颈在于很多真实场景没法建模成这样。

刘世隆认为,RSI 最核心的问题,是怎么从真实世界里拿到好的 reward。现在的 AI 系统和真实的生产、生活问题之间,还缺一个把两边接起来的连接层。他觉得这件事最重要,也最难,不过“只要连接上了,它自己就可以发展得很好”。

他还补充,真实世界的问题本来也没有完美的 reward,人们同样是靠大量 proxy 任务一层层筛掉错的答案。所以不必一步做到 100%,每次比之前好一点就够了。

3. 环境是被忽视的那个旋钮

Agent 靠它和环境交互出来的轨迹学习,可是大家一直只优化 agent 这一侧,环境那一侧又贵又不会变。这是黄呈松在 Google 实习期间的论文 EnvHarness 的出发点。

先说贵。Terminal-Bench 2.0 的 89 个环境,平均每个要花一位专家 15.9 小时,合计约 1,400 小时。APEX-Agents 的 33 个环境更重,每个约 485 小时,合计约 16,000 小时,按每小时 100 美元算是 160 万美元。训练要的是成千上万个环境,靠人造不出来。

再说不会变。一个环境造好之后只有一个固定难度:对弱模型永远做不对,对强模型又太简单,两头都学不到东西。即使一开始难度合适,模型训几轮变强之后,这个环境也就失效了。

EnvHarness 的做法是不新建环境,给现成的环境套一层 harness,思路和 agent harness 包在冻结的模型外面一样。任务本身和判定任务是否完成的 verifier 都不动,只调初始状态、动作、观测和状态转移这四样。它有三个组件:

  • Stage 改初始状态。任务是“把洗干净的马克杯放到桌上”:把杯子先藏进抽屉,任务变难;提前替 agent 把杯子拿好,任务变简单。
  • Contract 改规则。禁掉“直接走到某处”的快捷动作,agent 就必须学会导航。
  • Chain 把几个短任务串成一个长任务,前一个做完不结束,接着做下一个。

写这层 harness 的是另一个 agent,叫 EnvRigger。它读策略跑出来的轨迹,找出系统性的弱点,写一段 harness 代码,再让策略在改过的环境里重新跑一批轨迹来验证。如果任务变得无解,或者毫无挑战,这次修改就被拒绝。

报告里举了一个 SWE-bench 上的例子。策略总是不跑那个失败的测试就提交补丁,EnvRigger 于是写了一个假的 pre-commit hook,把这类提交拦下来。策略由此学到一条技能:改之前和改之后都跑一遍测试。这个实验里 EnvRigger 和被训练的策略用的是同一个模型,所以提升不是从更强的模型蒸馏来的。

4. 最大的技术卡点是归因

自我改进的中间一步是诊断:看到失败,找到原因,再提出一个可以验证的修改。钱成认为这是眼下最主要的卡点。

难处在于,同一种表面现象可能有完全不同的原因。一次失败可能来自推理,来自工具接口,来自信息缺失或记忆模块的干扰,甚至来自对训练目标的理解有偏差,每种都需要不同的干预。过去这一步靠的是人的经验。

模型现在的毛病是自下而上。它会 case by case 地看错在哪,再反过来打补丁。人会先自上而下地判断整体思路哪里有问题,再去验证。逐例打补丁式的归因很容易过拟合。

钱成给了两个方向。

  • 诊断要有证据。看中间状态,看预期结果和实际反馈之间的差距,看实际的资源消耗,再从这些去推原因,不能把系统当黑盒。
  • 归因要做对照实验。像论文里做消融实验那样,把模型、工具、记忆、执行流程里的某一样替换掉或去掉,或者 replay 一遍,看结果怎么变。这些事现在主要是人在做。

他的结论是,要教给系统的不是某个 benchmark 上的技巧,而是“怎么做假设检验”这种更抽象的思考方式。

前面提到的 EnvRigger 可以看成这个思路的一个小规模实现。它从多条轨迹里找系统性的弱点,而不是只针对于单个 case。

5. 自我迭代的收益饱和得很快,而且分数涨了不等于能力涨了

钱成讲了他们实验里的一个现象。他们让模型反复改进自己的 harness,每改一轮就测一次效果。结果在隐藏集上,分数前几轮在涨,到第四五轮就不再涨了。所以并不是迭代得越多,效果就越好。但是模型判断不了什么时候该停,钱成说,成本控制这件事“可能根本就不在它的脑子里”:效果上不去,它还会继续加轮数。抠细节式的优化越做越过拟合,最后甚至会掉点。

人的做法不一样。先在一小部分数据上试,确认有效再投入大规模资源。这一小部分还要挑得尽量多样,能暴露的问题越多越好。钱成认为,系统要学会的正是这种分阶段的资源分配。

黄呈松补充道,RSI 很容易过拟合到手上的任务,找到的可能是捷径,甚至是直接 hack 了这个任务。所以要分清,agent 是真的变强了,还是只是更会做这一类题。

有观众问:不能无限循环的自我提升,还算不算 RSI?黄呈松回答说,模型的参数量有限,能力一定有上限,“希望 RSI 可以无限提升是个不现实的事情”。值得关心的是多快能接近上限,以及能不能感知离饱和还有多远,好提前停下来。

钱成补充,迭代次数不该成为定义的门槛。预算用完、边际收益递减都会让循环停下,要看的是大方向是不是在往上走。

6. 评测 RSI,train/test 切分不够用

一个会自己找捷径的系统,靠“划一个测试集”防不住数据泄露和 reward hacking。那该怎么评测?四位嘉宾各给了一个思路。

用一次性的、和时间绑定的评测。 这是黄呈松的主张。一类是预测:把新旧两版模型同时放进真实市场,或者让它们预测未来的事件,答案事先谁都不知道,也就没有泄露。另一类是让人做 A/B test。代价是成本高、出结果慢,没法在线地衡量一个 RSI 算法。

或者退一步,用完全可控的合成环境。 刘世隆提到的折中办法是自己构造环境,放进模型从没见过的合成数据。但他认为最终还是要落到金融、法律、医疗这些真实的工作流里,那里有大量人们已经定义好的指标。

环境要做到真实、可控、动态。 这是钱成的三个标准。可控首先是可复现:环境越大,同一个模型由不同的人测出来的结果越不稳定。RSI 要迭代很多轮,可控指的是,能分别衡量每一轮迭代带来了多少提升。动态指环境会逐步揭示约束或用户意图,考的是模型发现结果和预想不一样时怎么适应。但是,真实和可控互相矛盾:真实世界的信号是乱的,很难做成结构化的环境;全靠人工或 LLM 构造,又会显得很假。

先想清楚要考的学习难点是什么。 殷达认为一个 RSI benchmark 不能只是旧 benchmark 的子集,得有自己要考的 learning challenge,效率和成本也应该算进指标。他们做 ApprenticeBench 时,防 reward hacking 靠的还是大量人力去看 agent 的轨迹。怎么可扩展地发现这类行为,他觉得本身就可以做成一个 benchmark。

主持人李大卫补了一个观察:这些问题和当年评测大模型推理能力时遇到的很像,都是死记硬背、数据泄露、在一个领域上过拟合。实时更新的评测和合成数据等经验,是可以在这里借鉴的。

7. 效率是被低估的指标

殷达反复强调, 现在的 RSI 研究大多盯着前沿能力,落地时发现agent 不会越做越熟。

他把 RSI 放进企业部署的场景里看。新人入职要读文档、学软件、上手操练、拿上级的反馈,最后成为熟手。AI 要进入企业的工作流,也得走一遍这个过程。他所在的 NeoCognition 最近发布的 ApprenticeBench 考的就是这件事,选的岗位是 construction finance accounting,一个普通的会计类白领岗位,并不需要多聪明的模型。

人刚上手时也生疏,但同一类事反复做上几十上百回,一定越来越快,从需要想的 System 2 变成不用想的 System 1。在他们的评测里,模型完全没有表现出这种转变。他评论道:“你没有道理说这个 agent 做了 100 个 task,它花的时间和 cost 还是跟之前差不多,甚至比一开始还要更高一些。”

他提了三个可做的方向:

  • 更好地索引和组织学过的经验,遇到类似情况能快速取回来。
  • 把工作里重复的流程沉淀成可以反复使用的 skill 或工具。
  • 先用前沿模型把事情学会,再把学到的工作流知识压缩进更小、更专的模型。

这不只是企业的问题。殷达说,从一代模型训到下一代,同样希望把前几轮迭代里可复用的知识总结下来,后面少做些实验。这类效率和成本的问题,恰好是学界做得起、又足够前沿的方向。

8. 人的位置上移一层

AI 接手“解决已经定义好的问题”之后,人的价值在于找到问题,并把它定义清楚。

刘世隆认为,人一直在一层层往上抽象:从汇编到 C++、Python,再到神经网络框架,早年大家还要手写梯度下降。底层仍然重要,但大多数人可以把精力放到离应用更近、更能产生价值的地方。这未必是坏的变化。

黄呈松参与过一个全自动科研系统所写论文的审稿。他的感受是,纯 AI 生成的论文最大的特点是“用实验证明了一个不一定是很重要的问题”。AI 很擅长在定义完善的问题上做增量改进,比如把一个 benchmark 的分数再推高一点。

真正的研究更多是发现一个问题,再把它定义清楚:输入是什么,输出是什么,指标是什么。后面的事可以交给 AI。“我们从一个 PhD 变成了一个 PI,从一个写 code 的人变成了 project manager,从解决问题的人变成了一个找问题的人。”

钱成说:人的 insight 应该注入到 meta 层。以前讨论的是怎么做一个好的博士生,现在该想的是怎么做一个好的导师,也就是怎么给下游的 agent 提供更稳的 harness、环境和反馈机制,让它的自我迭代能稳定地跑下去。

延伸阅读

  • EnvHarness 论文:https://arxiv.org/abs/2608.19880
  • ApprenticeBench:https://apprenticebench.com
  • 刘世隆的博客[A Taxonomy of Self-evolving Agents]:http://lsl.zone/blog/2026/a-taxonomy-of-self-evolving-agents

相关学习资料