夜雨聆风学习资料网

ARTICLE · 1036899

AI已接管26%研发,RSI闭环了吗

AI已接管26%研发,RSI闭环了吗

这周有件事我觉得比任何一个新模型发布都值得聊。

9月17日,Anthropic在官网挂了一篇文章,标题很平淡,叫《Measuring the pace of AI development》。内容却是头一回:一家前沿实验室把自己内部的三个运营数字摊开给外人看——AI在它自己的研发里干了多少活,那些自己跑的Agent有没有人盯着,算力有多少分给了安全。

这三个数背后其实只有一个问题:递归自我改进(Recursive Self-Improvement,下面简称RSI)到底走到哪了,这个话题从今年开始就非常火爆,智谱最近也声明他们在Infra开发上实现了基本的RSI。这篇文章我想把报告和这个问题放在一起讲。先讲报告说了什么,再讲RSI这个概念从哪来、现在有哪些硬证据、哪些是反证,最后用RSI的框架回头看这三个数,你会发现它们的意义和媒体标题写的不太一样。

一、报告说了什么

先把三个数交代清楚,后面要反复用。

26%。今年7月,Anthropic每周随机抽20%的员工,问你这周具体干了什么,攒下来大概一万五千个小任务,归成一棵542个节点的树,每个任务按花的时间加权。然后让一个Claude当裁判,按Epoch AI的自动化等级打分:0级AI没参与,3级“协作”(人盯着,AI干大块),4级“主导”(给个大方向,AI自己从头做到尾),5级完全自主。结果是到8月份,Claude“主导”了26%的模型研发任务,2月份还不到1%;九成以上到了“协作”以上;没有任何一块是完全自主的。裁判靠谱程度:模型和人打分完全一致59%,差一级以内97%,而人和人之间完全一致只有35%。

三万个Agent。内部主平台上约三万个Agent在干研究和工程,累计超过十亿次决策。在线监控100%覆盖,实时拦截率0.002%,约每四万七千次拦一次;离线监控100%覆盖,每千份记录标一两份,每周约五十起升级到人。每个Agent有独立身份,所有产出记名,Agent之间用共享消息系统沟通。

6%。7月13到20日一周的算力快照,研发算力里6%用于安全,“AI驱动的研发”里12%。报告自己说这是刻意保守的估计,也说算力是安全投入的糟糕代理——安全研究耗人时不耗算力。

报告为什么这时候发?同月Dario Amodei写了《We Must Pace the Frontier》,核心主张是前沿实验室要主动放慢能力提升的节奏,理由就是RSI:AI开始参与造下一代AI,这个环一旦闭合,速度就不由人决定了。三指标是他三步走方案(第三方进驻、盟友协调、再谈中国)的第一步配套。所以这不是一份中立的技术报告,是一份带议程的透明度文件。知道这点,再看数字会冷静一些。

二、RSI是什么:从1965年到现在

这个词现在被用得很滥,先把它说清楚。

起点。1965年,I.J. Good写了篇《关于第一台超智能机器的推测》,定义超智能机器是“在包括设计机器在内的一切智力活动上都超过任何人的机器”。他的推论很简单:既然设计机器也是智力活动,那第一台超智能机器就能设计出更好的机器,更好的机器再设计更好的,于是“智能爆炸”。这个逻辑六十年没变过,变的是它从思想实验变成了工程问题。

现代定义。Anthropic今年5月发过一篇《When AI builds itself》,把RSI定义为“一个AI系统能完全自主地设计和开发自己的继任者”。注意“完全自主”和“继任者”这两个词——不是AI帮人写代码,是AI自己决定下一代模型长什么样、怎么训、训出来好不好。Anthropic的原话是“我们还没到那一步,而且RSI不是必然的”。

分层。今年7月arXiv上有篇综述,梳理了2024到2026年一千两百五十篇相关论文,把这个领域的混乱术语理了一遍。它的核心区分是两个维度:一是“改进的是什么”——是部署时的行为、训练策略、评估器、还是研究过程本身;二是“环闭合到什么程度”——从人在环里到完全闭环。按这两个维度,它把现有工作分成两类:“有界自我精炼”(self-refine、self-reward、self-play这些,收敛、可评估、已经在工业界用了)和“开放式RSI”(受制于接地要求、坍缩动力学和算力)。

综述里最有价值的一句话是:每一个自我改进的环路,本质上都是“某个信号可以替代人类判断”的一个断言。它按信号强弱排了一个层级:形式化验证器最强,单元测试次之,往下是基准分数、模型评判,最弱的是模型自评。违反这个层级的后果是两种失败:自我确认的死循环,和模型多样性坍缩。

这句话我后面要反复用。RSI能不能闭环,本质上就是问:在研发的每一环,有没有一个足够强的信号能替代人的判断。

软件爆炸还是硬件爆炸。还有一个区分要交代。RSI的加速可以来自两个方向:算法和软件的自我改进(不需要新芯片,只需要更聪明地用现有算力),或者硬件和算力的扩张(需要建厂、建电站)。前者可以很快,后者受物理约束。现在讨论的“智能爆炸”基本都是指前者——所谓软件智能爆炸。这也是为什么算力分配能成为一个刹车:软件爆炸的上限是现有算力,算力分配是唯一能被外人核实的物理量。

三、RSI的进展:正面证据

正面证据主要来自实验室自己,其中Anthropic 5月那篇最详细。

代码。Anthropic内部合并的生产代码,超过80%是Claude写的,2025年2月之前是个位数。每个工程师每季度的代码量,从2024年二季度到2026年二季度涨了8倍。他们自己的评估是:2025年底Claude写的代码比人略差,现在持平,一年内会明显更好。

任务长度。METR的“时间跨度”指标是这个领域最常引用的:一个模型能以50%成功率完成的任务,换算成人类专家需要花多长时间。Anthropic给的内部数据是:2024年3月的Opus 3能做4分钟的任务,2025年3月的Sonnet 3.7能做90分钟,2026年3月的Opus 4.6能做12小时,预计2027年到一周。METR自己的数据显示,这个跨度长期是每7个月翻一倍,但2024到2025年加速到了每3.5个月翻一倍——也就是一年10倍。METR同时说,16小时以上的测量在现有任务集上已经不可靠了,也就是说尺子快到头了。

实验优化。Anthropic给了一个我觉得最硬的数:给模型一个代码优化任务,2025年5月的Opus 4能做到3倍加速,2026年4月的Mythos Preview做到52倍,而熟练的人花4到8小时能做到4倍。这是执行环上超越人类的直接证据。

研究复现。一个叫W2S的内部项目,AI Agent一周内恢复了97%的性能差距,两个人类研究员同期只恢复了23%,Agent用了800个累计小时和大约1.8万美元算力。负责的研究员评价是:“如果一个初级同事在同样时间交出这样的结果,我会略感惊讶。”注意措辞,是“略感”。

判断力。这是最值得盯的一项。Anthropic测了模型在研究会话中选择下一步的判断是否优于人:2025年11月是51%(等于抛硬币),2026年4月是64%。这个数从“和人一样”到“比人好一点”只用了五个月。

产出倍数。3月对130名员工的调查,中位数估计是有了Mythos Preview之后产出是原来的4倍。

把这些放在一起,Anthropic自己的判断是:Claude在执行明确定义的实验上已经超过人;在把一个没说清楚的问题搞清楚并解决上已经很强;差距主要在“选择目标”——工程上和研究上都是。他们的原话是,这个差距“就是今天的AI和一个能自主设计继任者的未来系统之间的距离”。

四、RSI的进展:反面证据

反面证据主要来自实验室外面,而且是最近才有的。

普林斯顿的实验。今年8月,Sayash Kapoor团队做了一个很直接的测试:给Claude Opus 4.8两篇还没发表的NeurIPS 2026论文的问题,3000美元预算,六天时间,让它独立做研究。两篇AI生成的论文都被原作者打回了。Kapoor的评价很不客气:“Agent在真正做研究这件事上,毫不含糊地差。”具体差在哪:不会探索多样的假设,一条路走不通不会换,不会有效吸收反馈,不会管理资源(算力、token、时间怎么分配)。他的解释是,模型在强化学习里反复练过的任务上很强,但开放式的工作没练过。

Jack Clark的表态。这一条分量很重,因为他是Anthropic的联合创始人。他说观察到的是“缺乏有价值的、直觉性的创造力”和“死板、公式化的思考”,并明确说这是“对短期RSI时间线的看空信号”。一家实验室的创始人,在自己公司发26%的同一个季度,说这话,说明内部对RSI的判断并不像外面传的那么一致。

综述的结构性判断。前面那篇arXiv综述的结论是:开放式RSI受三个东西限制——接地(改进的信号最终要落到真实世界的验证上)、坍缩(自我评判的环路会趋同)、算力。而且它指出人的角色不只是“验证”,还有“决定什么值得被验证”,这一层验证层级本身管不了。它认为“治理级别的自我改进度量”是整个领域最空的一块——而这恰恰是Anthropic这次三指标想填的。

Amdahl定律。Anthropic 5月的报告自己也承认了这个:一个环节加速之后,瓶颈就转移到没加速的环节。他们现在的瓶颈已经变成了人的代码审核跟不上Claude的产出,以及“新想法的爆发超过了组织追踪它们的能力”。这意味着执行环的加速不能线性传导为整体加速——执行快了十倍,如果判断环没动,整体只快一点点。

把正反两面放一起,我的读法是:执行环和验证环已经大半自动化了,而且是超人类水平的自动化;提问环和判断环还在人手里,而且外部实验显示AI在这两环上不只是弱,是差。这不是一个“还差一点”的状态,是一个结构性的分层状态。

五、用RSI的框架回头看三指标

现在把报告的三个数放回这个框架。

26%说的是哪一环。报告列的例子——评估平台的bug修复、RL沙箱的网络策略、线上事故复盘——全是执行环和验证环的活。它没有给分类别的自动化比例,这是报告最大的缺失,但从5月那篇的信息可以推:Anthropic自己说“定方向的工作占个位数比例”,这个比例“仍然由人控制”。所以26%大概率是执行环里的比例在涨,不是判断环在被替代。

换个说法:26%证明的是Good的逻辑里“设计机器也是智力活动”这句话的前半截——机器确实在做智力活动了;但没证明后半截——机器在“设计”。

4级和5级之间隔着什么。报告说没有任何子集到完全自主,这句话比26%重要。4级“主导”的定义是“给个高层提示,AI端到端完成”——提示还是人给的。从4级到5级,隔的不是工程量,是那64%。判断力从51%到64%用了五个月,如果这条线继续走,明年这个时候可能到80%。但普林斯顿的实验说的是另一件事:在真正开放的研究问题上,AI不是“判断稍差”,是不会探索、不会回头、不会分配资源。这两个信号打架。我倾向于认为Anthropic的64%测的是“在人已经框定的会话里选下一步”,普林斯顿测的是“没人框定时自己开一条路”,前者是局部判断,后者是全局判断。局部判断在快速追平,全局判断还没起步。

三万个Agent是RSI的组织形态。我看研发组织一直用一个框架:组织迭代效率等于决策速度乘以信息带宽乘以资源集中度,再除以组织摩擦。人的组织里四项都有硬上限。三万个Agent,每个有身份、有记录、共享消息系统——这是一个信息带宽和决策速度都不在人类尺度上的组织。Anthropic做的事,本质上是先把组织的迭代速度从人的尺度拉到机器的尺度,这是RSI的前置条件。但注意,这个组织的“决策速度”目前指的是执行层的决策,方向层的决策速度还是人的速度。所以它是半台机器:底盘换了,方向盘还在人手里。

监督指标是RSI的许可条件。放回RSI语境,那三个子指标(覆盖率、审查延迟、升级率)就不是安全部门的KPI了。Amodei担心的是“能力更强但对齐没跟上的Agent群”,这就是那三万个Agent的下一代。RSI的风险不在于某一个模型突然变聪明,而在于一个自我改进的Agent组织目标漂移了没人发现。综述说的“自我确认的死循环”,放在组织层面就是这个。覆盖率掉下100%的那天,就是该踩刹车的那天。而0.002%的拦截率是好是坏,取决于监控器的召回率——这个内部数据永远给不出来,只能靠第三方。

6%是为软件爆炸预留的刹车。如果RSI真的开始加速,人时会失去意义(AI不睡觉),能力评估会滞后(模型进步快过评估集更新,METR的尺子已经快到16小时的顶了),最后唯一还能卡住节奏的物理量就是算力。Anthropic现在把算力拿出来当指标,是在给未来的自己留一个刹车踏板。6%本身没有信息量,但“把算力列为指标”这个动作有。

六、真正的瓶颈在哪

综合下来,我认为RSI闭环前面有三道坎,而且它们的性质不一样。

第一道是验证。综述那个层级说得很清楚:执行环之所以能先自动化,是因为代码有单元测试、实验有基准分数,信号够强。研究判断之所以难自动化,是因为“这个方向值不值得做”没有强信号,只有人的品味。RSI要闭环,要么找到替代品味的强信号,要么让模型的品味好到可以自评。前者目前没有,后者就是普林斯顿实验测的东西,结果是差。

第二道是墙钟时间。就算AI把研发人时全包了,一个想法要验证,还是得跑训练,训练要GPU、要时间。AI再快,也快不过一次预训练的墙钟时间。52倍的优化加速很惊人,但它加速的是“优化一段代码”,不是“跑一次实验”。我一直的看法是,学习层的算力已经进入边际递减,瓶颈在往表征和预测那一层挪,而那一层的突破靠的是新范式,不是更多的执行力。26%的执行自动化对突破新范式的帮助有限。

第三道是Amdahl。执行加速十倍,如果判断环没动,整体只快一点点,而且瓶颈会转移到人的审核和组织的消化能力上。Anthropic自己已经撞上这堵墙了。这意味着RSI不会是一条平滑的指数曲线,而是一段一段的:每自动化一环,加速一阵,然后卡在下一环,直到那一环也被自动化。

所以我对RSI的总体判断是:不要把它想成一个开关。它是一个逐环替换的过程,先替执行,再替验证,最后才轮到判断。26%告诉我们前两环替得很快,对第三环没有提供信息;外部实验告诉我们第三环还差得远。

真正该盯的信号不是“主导比例涨到多少”,而是两个:一,有没有任何实验室拿出证据,说AI独立提出的研究问题产生了人没想到的非平凡结果;二,Anthropic那个“下一步判断优于人”的比例,明年测的时候是在开放问题上还是在框定问题上。前者出现,或者后者换了测法还能过70%,我会全面修正判断。

七、对中国和对投资人

关于中国。Amodei的三步走,第二步是美国和盟友先协调,第三步才轮到中国,而且他自己说很难验证。真要发生协调放缓,大概率先在美国公司之间发生。对国内头部团队,这在时间上是窗口,在舆论上是压力——“你们为什么不参与”会被反复问。我建议头部团队提前想清楚:自己的透明度指标是什么,什么时候公布,公布什么。另外,国内实验室的研发自动化程度到底在哪一档,目前没有任何公开数据。这个信息差本身就值得关注——不是说国内一定落后,而是没人知道。

关于投资。我觉得主要有三点影响。

一是研发效率的定义变了。以前问创始人“你们团队里AI干多少活”是软问题,现在有了可借的尺子:按Epoch的等级,你的执行环、验证环、判断环各在几级。我会开始要求被投和拟投的公司按这个口径自评。不是为了追26%,是为了知道自己在哪条曲线上——一个百人团队如果执行环到了4级,它对标的是过去的千人团队。

二是验证是个赛道。综述说得对,RSI每一环能不能闭合取决于有没有强信号替代人的判断。谁能把某个领域的“品味”变成可计算的验证信号,谁就在那个领域拿到了RSI的钥匙。这在机器人和具身智能上尤其明显:物理世界的验证信号天然比代码弱,仿真到真实的差距就是验证层级里的断层。谁把这个断层补上,谁的数据飞轮才转得起来。

三是监督是个产品。当每家做Agent的公司都要回答“你的覆盖率、延迟、升级率是多少”,监督工具会变成独立市场。而且这个市场有政策推力——Amodei的第一步就是第三方进驻,进驻之后总得有工具看。

结语

这份报告最好的地方,是把三个以前只能定性吵的事变成了可以定量追踪的数,而且老老实实列了每一个的缺陷。最要警惕的地方,是它目前还是一份单方面的、没人核过的、带着明确目的的文件。

26%这个数接下来会被引用无数次,多半会被当成“RSI已经开始”的证据。我建议每次引用都把限定词带上:Anthropic内部、按时间加权、Claude打的分、“主导”这一级、2026年8月。

至于RSI本身,Good在1965年说的那句话,现在可以拆成两半来看:机器确实在做设计机器的智力活动了,这一半成立;机器在“设计”,这一半还没有。26%是前一半的证据,Jack Clark的看空和普林斯顿的两篇退稿是后一半的证据。环路的下半截转起来了,上半截还没有。什么时候上半截也转起来,才是真正该紧张的时候——而到那时,报告里那三个数,就是我们唯一能看的仪表盘。

参考资料

Anthropic,《Measuring the pace of AI development》,2026年9月
Anthropic,《When AI builds itself》,2026年5月
Dario Amodei,《We Must Pace the Frontier》,2026年9月
MIT Technology Review,《AI's recursive self-improvement might not come so quickly after all》,2026年8月
arXiv 2607.07663,《Recursive Self-Improvement in AI: From Bounded Self-Refinement to Autonomous Research Loops》,2026年7月
METR,《Time Horizons》,2026年5月

相关学习资料