夜雨聆风学习资料网

ARTICLE · 1094880

AI 开始改自己的代码,RSI 能让它持续变强吗?

AI 开始改自己的代码,RSI 能让它持续变强吗?
连续运行8天,给自己留下7轮有效改进。
这是 Weco AI 团队在9月22日提交的 AIDE² 研究里报告的结果。系统要做研究,还要修改自己的工作程序。修改通过评估,新版本接着干,随后又参与下一轮改进。
这份工作安排挺狠。活儿归它,改进干活的方法也归它。
我把论文的方法和后面的讨论对着看了一遍,觉得 RSI 最有意思的地方就在这里。让 AI 写一段代码,我们已经比较熟悉。现在,它开始参与修改自己用来做事的那套程序。再往前一步,人们想知道,它会不会越改越擅长改?
论文还没证明最后这一步。研究者没有替实验提前庆功,这点挺好。
先看看它给自己修了什么
RSI,递归自我改进。名字读起来有点绕,顺着一次工作过程看就容易了。
旧系统提出修改,评估之后留下更好的版本,再由新版本参与下一轮。前一次改动带来的好处,要有机会进入后一次改动的过程。
AIDE² 这次动的是模型外面的代理程序。怎样搜索方案,如何管理上下文,用什么步骤检查结果,都属于它可以调整的部分。底层模型的权重没有因此自动重练一遍。把工作程序改顺和重新训练一个模型,工程量差得很远。
研究团队还给它规定了任务和预算,用没有参与修改过程的保留数据检验结果。得让新版本碰一碰没提前准备过的题,才能看出改动有没有用。
否则,一边改程序,一边只挑自己擅长的题做,成绩当然容易进步。连考试范围都归自己管,自信很难不膨胀。
这类改进也有相当朴素的一面。2025年5月,Sakana AI 与合作研究者介绍的 Darwin Gödel Machine,就让编程代理修改自身代码,保存不同版本,再从这些版本继续探索。它找到过的改法包括改善文件查看方式、增加补丁检查。
文件看不全,先把查看工具修好。补丁容易出错,就加一道检查。把这些具体动作摊开,多少能让人松口气。AI 已经开始琢磨怎么改自己,手头也照样有工具不好用这种烦恼。
我们平时让聊天机器人“再想想”,通常只是在改眼前这份答案。要把它算成系统能力的进步,修改得存下来,换一道题还能发挥作用。聊到半夜,回答越来越长,并不能替代这项检验。聊天记录长胖了,能力有没有增长,得另外称。
一次修改要进入下一轮,需要先通过评估并保存有效版本。
快了23%,为什么最后只省了1%?
Google DeepMind 在2025年公布 AlphaEvolve 时,给过一组很适合一起读的数字。团队用它优化 Gemini 训练中的一项计算内核,该内核加速23%,对应整体训练时间减少约1%。
23%挺醒目。1%负责把人拉回整项工作。
一项训练还有其他步骤,优化的那一段只占其中一部分。把局部加速直接贴到总用时上,计算器可能同意,实际运行不会同意。这个例子也说明,AI 帮助改进研发,已经能落到具体计算任务上;改进能传到多大范围,要接着往下算。
9月22日,阿里在云栖大会材料里也报告,Qwen3.8-Max 在一个月内完成了33轮迭代。这是公司的公开自述,值得跟踪它究竟改了什么,以及同等条件下结果能否复现。迭代次数像工作记录,有多少轮,和每轮解决了多少问题,最好放在一起看。
再回到 AIDE²。研究者没有止步于“新版做任务更好了”,还做了一项更难的比较,把改进后的代理放到负责改进其他代理的位置上。
这次,现有实验不足以证明它比强基线更擅长这项工作。要进一步确认,又需要花很高的实验成本。
结果挺耐人寻味。系统可以把一些工作做得更好,却还没有拿到足够证据,证明自己因此更会推动下一轮改进。一个程序修得不错,距离以后每次都修得更快、更有效,中间还有实验要做。
这也正是 RSI 最值得继续盯住的问题。省略它,故事很快就能写到 AI 自己造出下一代 AI。保留它,就得老老实实等下一组结果。
代理做任务更好,是否也更会改进自己,需要分别检验。
AI 负责改,谁来判卷?
我觉得普通团队现在就能学的一件事,是把“改了”和“改好了”分开记录。
9月更新的一篇 RSI 综述,也把自主执行改进、自主制定策略等能力拆开讨论。自动化可以一点点增加。暂时没能力训练大模型的团队,可以先看自己已有的代理程序,哪一步老是出错,能不能让它提出一个可测试的改法。
这里需要的是固定的测试材料和旧版本。改前跑一次,改后按同样条件再跑,费用与失败情况一起记。新程序如果多用了十倍算力,结果只好了一点,就得讨论这笔交换值不值。
失败记录尤其别删。只留下最后一次成功,下次系统可能又满怀信心地把旧错误试一遍。它没有不好意思,我们倒得再付一次钱。
评估标准也得有人维护。代码通过了测试,说明它通过了这批测试。测试没有覆盖的行为,仍然需要检查。涉及真实账户和生产系统的修改,可以先在隔离环境里跑,别让一个研究实验顺便参与公司当天的经营。
所以下一篇 RSI 论文出来,我会先翻实验部分。用了什么条件,换题以后还能不能进步,尤其是把改好的系统放回改进过程,它有没有做得更有效。
至于“AI 已经学会自己进化”这种大结论,先让它交作业。作业里最好也附上电费。
主要资料
AIDE² 研究论文与实验 · DGM 项目说明 · AlphaEvolve 研究介绍 · 阿里云栖大会材料 · RSI 综述
事实依据截至2026年9月28日核对的材料,较早研究用于解释技术背景。

相关学习资料