ARTICLE · 1091562
AI的RSI:定义、现状、分歧
AI的RSI:定义、现状、分歧
01. RSI到底是什么,又不是什么 递归自我改进——Recursive Self-Improvement,缩写RSI——的核心逻辑并不复杂:AI不再只是被动执行人类指令的工具,而是成为自身进化的推动者。它可以自主发现模型缺陷、编写优化代码、设计新架构,每一次迭代升级后的版本都比上一代更强,进而以更高的效率完成下一轮自我优化,形成滚雪球式的能力正反馈循环。 但“AI改过一次代码”和真正的RSI之间,隔着一条远比想象中宽的鸿沟。不列颠哥伦比亚大学研究者张宇轩在一篇广泛传播的博文中给出了一个相当克制的定义:RSI不是“AI自我修改过就算达成”的里程碑,而是一条条件很强的主张——系统改进了执行下一轮改进的机制,并且后续世代在未参与选择的评测上仍然更擅长继续改进。换句话说,真正的RSI需要证明的是一种可跨代传递、且在独立评测中依然成立的改进能力,而不是在同一个评测器上把分数刷上去。 姚顺宇在AGI House的讨论中进一步厘清了这条边界。在他看来,让模型用自己生成的数据训练自己,只是强化学习最基本的形态,还算不上RSI。“如果模型能自己设计整套训练流程,这就已经超出RL的范畴了。”传统RL中,训练方案由人定好,模型只负责产出数据;而RSI要求系统不仅产出结果,还要改写下一次产生结果的方式。这意味着RSI从一开始就是一个系统工程问题:调度层、上下文管理层、硬件优化层需要全部打通,模型单方面的能力提升远远不够。 02. 验证比实现更难 一个容易被忽略的事实是,RSI最棘手的地方不在于让AI改自己,而在于证明“改完之后确实变强了”。张宇轩在博文中将自我改进按层级拆解:输出级迭代只是同一模型对答案的自我修订,提示词与工作流优化属于受限的脚手架调整,策略优化在固定环境下是有效的RL;再往上一层,是由人类设定验证器与资源预算、系统迭代优化某个程序或训练脚本;只有到“改善下一代的模型、训练流程、工具链或评估过程”这一层,才触及强RSI的门槛。当前大多数实验结果支持的只是较低层级——在固定目标函数和验证器下对某个提示词、程序或工作流做迭代优化,而不是强RSI。 这就引出了一个更隐蔽的风险:评测过拟合。张宇轩引用Dwork等人的研究指出,反复在同一套评测集上选择和调参会产生“自适应过拟合”,这是严格的统计问题。AGI House的那场讨论里也有嘉宾直言,公开基准常被刷榜,能存活三五个月已属不易。张宇轩提出的三道验证门槛——修改对象是否触及产生下一代的系统、选择后代的开发评测与报告能力的封闭评测是否分开、在同等资源、未见任务且改变过测试框架的条件下是否仍呈现 v2 > v1 > v0 的可靠改进——正是针对这一问题的诊断框架。 03. 从代码比例看真实进度 抛开概念之争,产业数据提供了一条更直观的观察线。Anthropic在2026年9月披露的内部统计显示,截至2026年8月,Claude已经主导了公司26%的AI研发任务,而这一数字在2月还不足1%;截至2026年5月,合并入库的代码中超过80%由Claude生成。微软(MSFT.O)2025年披露的比例是20%至30%,New Relic在2026年7月发布的调查则显示,67%的技术负责人估计其组织每周产出的代码中51%至75%来自AI。 这些数字说明的是同一件事:AI在研发流程中的角色正在从“辅助工具”滑向“主要执行者”。Anthropic把这一进程画成一条时间线:2021年至2023年由人写代码,2023年至2025年聊天机器人打下手,2025年至2026年编码智能体开始自己写、自己改,今天自主智能体已经能自行运行代码,并把数小时的工作分给其他智能体,再往前一步就是“闭环”——智能体自己构建并训练模型。就目前而言,核心决策权仍在人类手中,但人类从“全权设计者”变成“监督者”的速度,比大多数人预想的要快。 04. 分歧不在技术,在节奏 RSI引发的真正争论,不是它能不能实现,而是它应该以什么速度实现。OpenAI在2026年9月21日发布政策提案,呼吁由美国牵头制定面向前沿AI的全球技术标准,并把RSI纳入讨论范围,提出需要衡量AI公司内部自动化研究的程度、定义哪些自动化研究流程应触发人类审核,并建立统一的事件分类和报告阈值;提案同时明确,这些标准不构成许可证,也不是强制性的发布前审查。与此同时,Anthropic联合创始人兼CEO达里奥·阿莫代伊在2026年9月12日发表《我们必须把控前沿的步伐》(We Must Pace the Frontier),主张主动放慢模型能力的提升速度,为对齐、可解释性与安全验证争取时间。2026年2月发布的《国际人工智能安全报告》由一百多位独立专家撰写,把“失控”单列为风险类别,同时指出专家对其可能性分歧很大、当前系统尚不具备引发此类风险的能力。 但并非所有人都认同这种紧迫感。一些研究者指出,当前所谓RSI的实证证据仍然薄弱,大多数成果更准确的名称是“受限的自动化优化”,而非真正意义上的递归自我改进。将受限优化包装成RSI,不仅会误导公众认知,还可能催生不必要的监管过度反应。 这场争论的实质,是两种时间感的冲突。一种认为能力曲线正在陡峭化,留给验证和治理的窗口在收窄;另一种认为验证本身才是瓶颈,在无法可靠证明“下一代确实更强”之前,讨论失控为时过早。而无论站在哪一边,有一件事是确定的:当AI开始参与设计自己的下一代时,人类需要回答的问题不再是“它能做什么”,而是“我们还能不能看懂它在做什么”。

今年6月,Anthropic旗下的Anthropic Institute发布长文《当AI建造自身》(When AI builds itself),让整个AI行业神经紧绷。
文章的核心判断很直白:如果算力充足,AI系统有可能完全自主地设计并开发出自己的后继模型,也就是“递归自我改进”;这种前景“可能比多数机构所准备的时间更早”到来,并将大幅提升人类失去技术控制权的风险。
这不是某位末日论者的私人预言,而是一家顶级AI实验室对自己所在赛道发出的公开警告。
- End -