夜雨聆风学习资料网

ARTICLE · 1127786

对AI 的RSI 技术综述

对AI 的RSI 技术综述

26年9月来自清华、港中文、CMU 、北大、新加坡国立、上海AI实验室、加州伯克利分校、华中科技、中科院自动化所、复旦、南洋理工、威斯康星大学、西湖大学、伊利诺伊大学芝加哥分校、香港理工大学和几个创业公司的论文“Recursive Self-Improvement in AI: A Survey”,由 H Wu 等人撰写。

这篇综述的核心观点:AI 已经能够利用自身经验改进模型、记忆、工具和程序,但“系统表现变好”不等于“系统改进自己的能力变强”,更不等于“能够持续加速地自我改进”。 全文最有价值的贡献,是建立了一套区分这些主张、检查实验依据的分析框架。


一、论文研究什么:从“自我改进”到“递归自我改进”

RSI 是 Recursive Self-Improvement,即“递归自我改进”。论文关注的问题是:

一次改进所获得的能力,能否反过来提升系统产生下一次改进的能力?

理解这一定义,需要区分三个层面。

层面
具体例子
能说明什么
当前答案改进
模型检查并修改一次错误回答
当前任务的输出变好
持久的系统改进
保存有效经验、增加工具、更新模型参数
后续任务可以继承改进
改进过程本身改进
修改负责诊断错误、提出修改、选择候选的程序
有可能更有效地产生后续改进

第三种最接近本文关心的 RSI,但修改“改进器”,仍需要证明修改后的改进器更有效。

例如,编程智能体修复用户仓库中的一个错误,属于任务完成;修改自己的修复流程,并使其在新仓库中更有效地修复错误,才提供了改进能力增强的证据。

作者还区分:

  • 结构上的递归
    :系统存在作用于自身或后续改进过程的反馈路径。
  • 实证上的递归改进
    :实验表明,这条反馈路径确实提高了后续改进的效果。

这一界限贯穿全文。它也解释为什么论文收录自训练、记忆和自动化设计等研究,却不认为这些工作都已经实现 RSI。

如图 1 所示这是关于递归自我改进(RSI)的机制层面视角。经验为候选变更提供依据,而验证过程则决定了哪些变更得以保留:上层循环将任务系统的状态传递给后续任务;下层虚线循环则将变更传递给负责生成后续改进的流程。外部锚点用于界定更新范围之外的条件。该图示描绘潜在的依赖关系,而非对性能提升的保证。

二、全文的论述结构与详细内容

如图 3 所示展示与递归自我改进(RSI)相关机制的概览图。该图将内圈的更新目标、中圈的改进机制以及外圈的代表性研究联系起来。图中的六个扇区涵盖了权重、任务、记忆、程序、反馈及改进过程。单项研究可能涉及多个目标,但在图中的布局仅突出展示了其中一种关联。该图囊括了历史基础、赋能方法以及面向 RSI 的系统。图中的标识代表了入选研究的作者或所属机构,而非基础模型;其他合作机构可能未予列出。

如图 4 所示探索实现递归自我改进的路径。45篇具有代表性的方法论论文被归纳为六条研究路径,并单独标示了三个历史性里程碑。时间段划分基于所查证资料中的首次公开日期;各时间段内的间距已针对可读性进行了调整。分支线条表示相关的研究系列。关于技术传承、跨路径迁移以及持续性递归收益的认定,需依据单独的证据。本选集涵盖了截至2026年9月12日的文献检索结果。标识(Logo)标示了每项研究中选定的一位作者或其所属机构;“Ind.”代表独立研究人员。机构信息及标识来源均有单独记录。

全文主线可以概括为:

定义与历史 → 两类工程目标 → 更新机制 → 代表方法 → 证据评估 → 失败机制与研究方向。

1.研究范围与文献方法:这是一篇叙述性综述

第 2 节说明,文献主要通过初始论文集合、引文追踪和针对性检索获得,主要检索截止日期为 2026 年 9 月 12 日。

作者报告:从初始的 125 项工作出发,筛查 442 篇不同 arXiv 论文的书目与摘要,增加 275 项工作,再补充 4 项历史研究,形成 404 项不同工作的文献集合。

这里有两个重要限定:

  • 并非所有收录论文都经过同等深度的全文审阅。
  • 文章不是穷尽性的系统综述,也没有进行元分析。

其分析单位不是笼统的“某篇论文”,而是具体实验配置:什么组件被更新、使用什么反馈、保留什么状态,以及哪些条件由外部固定。

这是合理的,因为同一个基础模型在不同配置中,可以分别充当回答者、评价者和改进器。

2.历史定位:RSI 与 AutoML、元学习和程序搜索有连续性

第 3 节把 RSI 放回既有研究脉络:

研究传统
已经能够做什么
本文进一步追问什么
AutoML、架构搜索
自动选择算法、超参数和网络结构
搜索成果能否提高以后设计系统的效率?
元学习、学习型优化器
学习初始化或更新规则
产生、调整这些学习规则的过程能否进一步改进?
程序搜索、开放式进化
搜索算法、保留候选、演化任务与求解器
本次发现能否提高下一次发现的能力?
自修改系统
修改自己的代码或运行逻辑
修改后是否有可验证、可复用的收益?

作者特别指出:外层算法固定,不代表内部搜索状态不变;外层程序可修改,也不代表改进一定更好。

Gödel Machine 提供了形式化自修改的历史参照,但其保证依赖公理、效用和证明条件,不能直接套用于靠实验结果接受修改的大模型智能体。

3.两类工程目标:设计新系统与修复现有系统

这是文章组织方法综述的主要轴线。

工程目标
典型内容
成功标准
自动设计 AI 基础设施
数据管线、课程、学习算法、智能体架构、工作流、评价器
设计在独立任务上有效,并具有可接受的开发和使用成本
修复与优化现有系统
修复代码、调整提示词、维护记忆、更新参数、修改改进器
解决目标问题,同时尽量保留既有能力

两类目标可以重叠。例如,智能体因失败而重新设计工作流,既是修复,也是设计。

对修复而言,论文强调一种约束意识:提高目标任务表现时,不能忽视其他任务的退化、修改成本和资源限制。

4.统一模型:任务系统与改进器如何形成闭环

论文把第 t 轮保留下来的状态写成:

X_t=(S_t,I_t)

其中:

  • S_t:执行任务的系统,包括参数、提示词、记忆、技能和代码。
  • I_t:产生或选择改进的过程,包括诊断策略、修改程序、选择机制和持久上下文。

运行过程是:

执行任务 → 收集经验与反馈 → 生成候选修改 → 验证与选择 → 保留新状态 → 进入下一轮。

验证不必接受每次修改,也可以保留原状态,或将候选放入档案供后续探索。

这里的“任务系统”和“改进器”是功能划分,不一定是两个独立模型。它们可能共享参数或代码,这也是后续因果归因困难的重要来源。

5.方法分类:不同系统究竟改了什么

第 4—6 节围绕六类更新对象展开。下面按便于理解的方式整理:

更新对象
机制与代表工作
需要特别辨别的边界
参数
STaR 等将筛选后的生成内容用于训练
模型变强,不代表训练方法本身变强
数据与任务课程
Absolute Zero、POET 等调整任务供给
任务更难或更多,不代表更有学习价值
记忆与技能
Reflexion、ExpeL、Voyager 等保存反思、经验和可执行技能
内容积累与管理机制改善是两件事
提示词、程序与工作流
ADAS、GEPA、SICA、DGM 等修改智能体行为结构
更好的产物与更好的设计者需要分别测试
反馈与评价器
Self-Rewarding和Meta-Rewarding 等学习奖励或判断力
自评变高可能来自评价标准漂移
改进过程
Promptbreeder、STOP、Hyperagents,以及递归上下文方法 Metan
存在递归路径不等于产生持续收益

如图 6 所示在经历一轮改进过程后,哪些内容得以保留?根据所延续的状态,可区分出四种模式:(a) 局部检查与修订仅改变答案,而不保留对求解器(solver)的改动;(b) 保留记忆 M,同时保持模型参数和选定的更新程序不变;(c) 在固定的训练程序下更新参数 θ;(d) 保留对改进器(improver)I 的一项已采纳的改动,该改动进而主导后续的任务系统更新 ΔS_t+1。水平灰色虚线将当前任务或当前轮次的处理过程与后续的复用阶段区分开来;黑色虚线框用于将各组件归组。彩色箭头表示保留的更新,带端点横线的连线则表示未延续的改动。网络、记忆栈和程序图均为示意性表示。求解器和改进器是功能性角色,可能共用同一实现。这些分析模式可能并存,且并不构成能力高低的排名;仅凭持久性改动或元层面的改动,并不能实现持续的递归增益。

其中有几组值得重点理解。

自训练与课程生成。关键不是合成数据的数量,而是数据是否正确、多样、可学习,以及验证成本。文中特别指出,STaR 的某些配置每轮从原始预训练模型重新微调,连续性部分存在于不断变化的数据池中,不能简单理解为参数逐轮继承。

记忆与技能。记忆可以保存具体经历,经验总结可以抽象规律,技能则直接规定可执行行为。文章强调,要分别检查“存了什么”和“如何写入、检索、更新、删除”。记忆库变大可能增加有效知识,也可能积累过时假设。

自修改与改进器演化。STOP 让程序改进器修改自己的实现;DGM 让编程智能体修改自身代码并维护候选档案;Hyperagents 将任务智能体与元智能体代码纳入可编辑范围。它们改变的层级不同,仍有模型、父代选择或外部驱动程序保持固定。

递归上下文。Metan 的特殊性在于:固定的元操作不断处理之前的代码、轨迹和上下文。递归发生在输入与继承状态中,而不一定发生在操作程序自身。这说明“必须修改自己的源代码”不是本文判断递归性的唯一标准。

自动化科研。文章把提出假设、实现实验、分析结果和保留研究经验视为基础设施设计的一部分。但实验跑通、报告写完、得到较高评审分数,都不能独立证明科学发现成立。可靠继承的对象应包含结果、证据、适用条件和失败记录。

6.评价框架:文章最有分量的部分

第 7 节区分三类证据。

要证明的主张
应观察什么
任务能力增强
更新系统在独立测试上的表现是否超过初始系统
改进能够保留和迁移
后续轮次是否遗忘旧能力;新任务上是否仍有收益
改进器能力增强
从相同起点、获得相同反馈、使用相同预算时,新改进器能否产生更好的后继系统

第三项是本文的关键。

把新旧改进器分别记为 I_t 和 I_0,核心比较可以直观写为:

改进器增益 = 新改进器产生的后继收益 - 旧改进器产生的后继收益

这个比较必须尽量控制起始系统、任务、反馈和预算;培养新改进器的前期成本也要另外计入总体比较。

论文提出的评价要求包括:

  • 开发、选择、封闭测试分离
    :最终测试反馈不能返回更新或检查点选择过程。
  • 完整成本核算
    :计入生成、训练、验证、执行、失败候选与重试。
  • 设置有效对照
    :比较完整系统、冻结改进器的系统,以及不保留更新的推理搜索。
  • 观察完整轨迹
    :同时报告进步、退化、接受率、恢复成本与旧能力保留。
  • 区分不同评价对象
    :档案中的最佳结果、实际部署的智能体和最后一轮状态不能混为一谈。

如图 7 所示针对 RSI 的一项拟议评估方案。(a) 在第 t 轮,状态 X_t = (S_t, I_t) 生成一个候选方案。预先设定的验证规则决定是采纳该方案还是恢复至上一状态;保留下来的状态将驱动下一轮的运行。(b) 所有运行结束后,独立评估者利用密封的测试任务和标签,对搜索前已确定调度计划所选定的归档检查点进行审计。测试反馈不得用于指导更新、采纳决策或检查点选择。应报告任务增益、迁移效果、累计成本、多次运行间的变异性以及性能回退情况,而不应预设进展呈单调上升趋势。(c) 在总预算上限 B、初始化条件及数据访问权限均相同的情况下,将完整的 RSI 与“冻结改进器(frozen improver)”及“无更新搜索基线”进行比较。成本核算应涵盖提案生成、训练、验证、推理及被拒尝试;需匹配审计调用与推理限制,并报告实际发生的成本。(d) 为单独评估改进器的质量,可将 It 和 I0 应用于相同的预留求解器状态,并在成本相当的前提下比较其在新任务上的下游增益。这两个角色可能共用同一实现;仅在两者可分离的情况下采用这种成对干预的评估方式。该示意图展示的是一种实验设计方案,而非实测结果或通用标准;其设计理念借鉴了 ADAS 中的验证/测试分离原则以及 DGM [5,80] 中的固定改进器对照方法。

如图 8 所示更新机制及用于评估它们的证据。(a) 涵盖二十项精选研究的六种更新对象,基于摘要及相关方法论述进行编码 [1–7, 46, 72, 75, 77, 79, 80, 82, 84, 86, 87, 142, 189, 282]。实心圆点表示更新;半实心圆点表示发挥共同作用但已发生变更的制品(artifacts)。Ω 代表 Metan 提出的、随上下文扩展而变化的固定算子;其中“数据”包含课程,“记忆”包含可复用技能,“策略”包含提示词(prompts)与代码;仅有归档(archive)或使用判别器(judge)并不意味着形成了习得记忆或更新了判别器。Logo 标识了所选的一项所属机构。(b) 针对表 7 中八项研究的定向协议编码。时间跨度(Horizons)采用各论文自身的度量单位。勾号表示已报告的测试;三角形符号用于标注混合了“留出集(held-out)/未划分集(unsplit)”的评分,或涉及改变任务-智能体状态的迁移(transfer)过程。预算标签标示了特定比较所用的资源单位,而非总支出相等;Token 等价性(token parity)仅适用于特定设置。NR 表示在所查阅的文本段落中未报告该特定协议。其余十二项研究未在此进行协议编码。空白单元格或 NR 并不代表普遍缺失,且这些样本既不支持对普遍性的估算,也不支持对持续递归改进能力的排名。

三、综述认为什么已经得到证据支持

文章的判断比较谨慎:局部系统改进已有大量研究,改进能力本身增强已有有限证据,而持续、普遍、加速的 RSI 尚未确立。

第 7.6 节的几个案例尤其能体现这种判断。

案例
综述报告的结果
不能忽略的限制
DGM
80 次迭代后,200 题 SWE-bench Verified 子集得分从 20% 升至 50%
该评价包含搜索任务,并非完全独立的测试集
STOP
演化后的改进器在未见实例及额外任务上接受测试
部分较弱模型配置出现退化,改进并非普遍成立
Hyperagents
向数学评分任务迁移后,报告测试分数由 0 提升到 0.630
同时迁移任务智能体与元智能体,且初始系统存在输出格式问题,难以纯粹归因于改进器增强
Meta-Rewarding
四轮后,长度控制胜率为 39.44%,对照为 35.49%
评价器与人类排序的一致性收益,并未在所有后续轮次中保持
Metan
部分任务的等 token 对照支持递归上下文的贡献
不能推广为所有配置总成本相同,也不能把档案最佳当成单个智能体能力

因此,文章并不支持把这些结果直接解释为“AI 已实现自主无限进化”。它们支持的是特定配置、任务、反馈条件和预算下的有限改进。

四、这篇综述最值得抓住的六个要点

  1. 重复迭代不自动构成 RSI。
     必须追踪改进成果如何影响下一次改进。
  2. 持久化边界很关键。
     当前上下文中的反思、跨任务记忆和永久参数更新不是同一种继承。
  3. 好结果不等于好改进器。
     发现优秀算法,与更善于发现算法,需要不同实验。
  4. 外部反馈属于机制的一部分。
     执行器、真实数据和人类判断带来的信息不能被“自主”这个标签掩盖。
  5. 成本必须与收益共同评价。
     更多搜索和验证可能制造能力上升的表象,却未提高改进效率。
  6. 递归结构不保证稳定。
     错误反馈、遗忘、组件冲突和评价漏洞都可能随循环积累。

五、RSI 领域本身有哪些问题

以下是作者讨论的研究难题:

问题
为什么会阻碍 RSI
反馈失真
系统可能越来越擅长满足内部奖励,而真实能力没有提高
经验覆盖不足
合成数据和记忆可能反复强化已有模式,遗漏稀有情况
更新互相干扰
新提示词、工具、参数或记忆可能破坏其他组件的依赖
评价完整性受损
自修改系统可能利用测试漏洞,或间接接触测试信息
搜索与验证争夺预算
多探索与严验证之间存在资源冲突
改进能力难迁移
在编程中有效的改进流程未必适用于规划、科研或其他模型
风险也会被持久化
有害行为、记忆污染和权限问题可能随更新传递
科研证据不充分
自动完成实验与报告,不等于实验真正检验了科学假设

作者没有把模型坍塌视为所有自训练过程的必然结局,也没有把外部反馈等同于必须持续人工监督。这两处限定值得保留。

如图 9所示关于递归改进的开放性问题。每个板块都关联了一个瓶颈、一个研究问题以及一项拟议的探究方案。(a) 评判偏差促使人们研究校准反馈与外部核查机制 [79,353]。(b) 数据的积累与经验的复用促使人们研究测试的选择、更新及重放;在各种数据机制下,系统崩溃并非不可避免 [77,357]。(c) 递归层级间的相互干扰促使人们研究长期记忆保持与回滚机制 [7]。(d) 目标操纵(objective hacking)与基准测试污染促使人们关注系统演变过程中的评估完整性 [5,349]。(e) 搜索与验证成本促使人们研究预算分配问题 [5,82]。(f) 迁移已发现的求解器与迁移改进器有所不同;在每个新领域内进行成对探究时,应保持初始求解器状态与预算不变 [6,80]。这些问题与拟议测试均源于现有文献,而非已测得的结果、既定的保证或预期的进展顺序。示意图仅为概念性展示;其中的机制与失效模式可能会相互作用。

六、这篇综述本身有哪些问题

以下是基于附件内容的评价,与作者总结的领域问题分开。

1.文献覆盖广,但筛选和审阅过程的可复现性不足。

第 2.2 节给出了检索路径和数量,也承认不同论文的审阅深度不同;但正文没有提供足够完整的检索式、逐篇排除理由、审阅分工与一致性信息。

因此,它适合作为研究地图,较难作为“完整覆盖该领域”的依据。作者已经主动声明这是叙述性综述,这降低了过度宣称的问题,但不能消除选样偏差。

2.“什么算 RSI”仍有较大的解释空间。

文章纳入代码自修改、学习型更新规则和固定操作下的递归上下文,这使框架具有包容性,却也使边界判断依赖具体实现。

尤其是:不断增长的搜索历史或上下文,什么时候只是普通自适应搜索,什么时候形成实质性的递归改进?文中给出了判断方向,但尚未形成容易由不同研究者一致执行的判定流程。

可改进之处是:明确每类主张的最低实验条件,并用反例展示哪些系统不满足。

3.分类维度存在交叉,统一性仍可加强。

“参数、记忆、代码”是状态载体;“评价器、改进器”是功能角色;“设计、修复”是工程目的。三种维度不在同一层级。

作者承认类别可以重叠,因此这不构成直接逻辑错误,但读者仍可能困惑:一个用参数实现的记忆管理器究竟该归到哪类?

若提供统一的“目标 × 载体 × 角色 × 反馈 × 保留边界”编码表,跨论文比较会更清晰。

4.最强的贡献是评价原则,而非经过验证的统一评测方案。

图 7 的封闭审计、冻结改进器对照和配对测试很有价值,但属于作者提出的实验设计;文章没有用同一套协议重新运行代表系统。

因此,它能够指出已有研究哪里证据不足,却不能据此给出经过统一验证的方法排名,也未证明这套协议在所有耦合系统中都容易实施。

对共享权重、共享记忆或接口不断变化的系统,如何公平交换新旧改进器,仍是未解决的操作问题。

5.文献规模与深入证据比较之间存在落差。

广泛文献集合包含约四百项工作,但表 5 详细比较 16 个配置,表 7 深入比较 8 个实验协议。核心实证判断主要依赖这个较小样本。

作者明确说这些样本不能推断领域实践的普遍程度,这是优点;但为何优先选择这些配置、是否遗漏重要负结果,仍可以解释得更充分。

尤其不宜从这些表推断“某类方法整体优于另一类”或“多数 RSI 系统都具有某种缺陷”。

6.形式化框架清楚,但对长期动力学解释有限。

任务收益、保留和改进器收益的公式有助于澄清测量对象,却主要是定义与分析模板。

文章没有进一步建立足以回答以下问题的统一理论:什么条件下改进会饱和、何时出现净退化、反馈误差如何跨轮积累、改进收益怎样随累计资源变化。对“加速”的讨论也更多是提出证据要求,而非给出成熟的可操作统计检验。

这意味着它更擅长回答“如何避免错误宣称”,对“怎样构造能长期有效的 RSI”给出的机制性答案相对有限。

7.对其他综述的比较具有主观性,且存在编辑层面的瑕疵。

表 1 中本文在全部比较维度上获得完整覆盖标记,而表 2 说明部分其他综述仅检查摘要或选定全文段落。这样的比较可以说明作者自定框架下的侧重点,却不足以证明本文全面优于其他综述。

此外,表 2 仍保留“Current draft”“coding ongoing”等表述;表 7 存在文字挤压、列间重叠,影响关键证据的阅读。这些属于稿件完成度问题,不直接推翻结论,但提示仍需编辑与核校。


总体评价是:这篇论文最适合被当作一份“RSI 概念辨析与证据审查指南”。它有效地区分了能力提升、持久适应和改进器增强;其主要不足,是框架与要求比统一实证更充分,文献筛选透明度、分类操作性和长期机制解释仍有提升空间。

相关学习资料