ARTICLE · 1074244
AI会成为自己的工程师吗?读懂递归自我改进:从“会改答案”到“会改造改进方法”
AI会成为自己的工程师吗?读懂递归自我改进:从“会改答案”到“会改造改进方法”原论文:The Last AI Built by Humans: Toward Genuine Recursive Self-Improvement,75页。AI会成为自己的工程师吗? 读懂递归自我改进:从“会改答案”到“会改造改进方法” 先说结论:还没有一台AI能脱离人类,稳定地制造出一代比一代更强的继任者。论文真正有价值的地方,不是预言“最后一个由人类制造的AI”即将出现,而是给“自我改进”划了一条清楚的边界:一次任务里反复改答案,不算;改动必须经过验证、跨任务保留下来,并影响下一轮如何继续改进,才开始接近递归自我改进。 一、为什么今天又开始谈RSI? 大模型越来越强,研发它们的流水线却越来越重。数据清洗、训练、评测、部署、故障诊断,每一环都要大量人力和算力。论文列举的例子很直观:NVIDIA AIMO-2曾生成320万条长推理答案、170万条工具答案,并整理54万道题。模型能力往上走,配套工程也在膨胀。 作者还设计了一个“剩余提升空间关闭指数”(HCI),把不同基准的进步放到同一尺度上。其统计显示,高等数学和研究生科学任务已关闭约86%的测评空间,而工具型Agent只有约40%。这说明模型在单题推理上进步很快,但在长期规划、调用工具、记住状态和连续纠错上仍有明显短板。要继续扩张,AI可能不得不参与改进自己的研发流程。 但这里有一个重要限定:HCI是作者的二次统计工具,论文中2026年之后的延伸曲线只是示意,不是预测。 二、什么才算“递归自我改进”? 普通Agent也会反思、重写和重试。区别在于,这些经验是否活过当前任务。假设一个编程Agent修好了Bug,但下次仍从头摸索,这只是一次性迭代;如果它把失败原因整理成可检索的技能,经回归测试后写入长期工具库,下一次会主动调用,才出现“持续改进”。 真正的“递归”还要再多一步:本轮改动不只让系统会做更多事,还改变它以后如何发现问题、选择实验、判断结果。可以把它想成一座工厂。修好一件次品不算RSI;升级生产线算持续改进;连“如何设计和调试下一代生产线的机床”都能被改造并继承,才接近最高层。 三、从B0到L5,AI一步步接过什么权力? 层级 AI接过的权力 一句话理解 当前证据 B0 只改当前输出 这次改好,下次忘掉 常见,但不算RSI L1 执行既定改进流程 人写章程,AI照办并保存成果 证据较广 L2 选择改进策略 人出题判卷,AI自己设计实验 软件等领域较活跃 L3 选择下一步经验 根据短板给自己安排练习 依赖可验证环境 L4 从部署中持续适应 把现场教训写进长期手册和工具 原型与局部实践 L5 修改改进机制本身 改造制造下一代工具的机床 受限原型,长期有效性未证实 这套分级衡量的是“谁在掌握改进闭环中的决策权”,不是智力排行榜。等级更高,也可能更容易把错误、偏见或评测漏洞写进未来版本。 四、哪些案例说明这条路已经起步? 第一类证据来自软件和数据工程,因为这里的反馈最清楚:代码能否运行、测试是否通过、速度是否提升,都可以机器验证。Humanlaya把数据质检中的重复故障转成新规则和技能,经过四轮版本更新后,在600个留出任务包上,自动修复后仍含关键缺陷的比例从9.0%降至3.7%,人工处理时间从每项48分钟降至27分钟。关键不在于“多试几次”,而在于失败被正确归因、经留出验证后进入下一版。 第二类证据提醒我们,AI表现不只取决于模型。Theseus在30项工作区任务中发现,同样的模型和Agent框架,干净环境比噪声环境高21.7至51.6个百分点。把资料、状态和操作记录重新组织后,部分组合又提高18.65至39.67个百分点。这更像是在给AI整理工作台,而不是让“大脑”突然变聪明。 第三类是更接近元改进的原型。STOP允许改进器修改自己的程序,A-Evolve-Training让元Agent在四轮中持续调整后训练策略。不过,论文也记录了退步和评测漏洞:Gödel Agent的100次优化中有14次最终不如初始策略。能改自己,不等于越改越好。 五、为什么“会自我改进”不等于“即将失控”? 因为今天的大多数系统仍被装在明确边界里。人类规定总目标、预算、可访问资源、验收标准和发布权限;AI主要是在边界内扩大自主权。论文梳理的491篇相关工作中,L1和L2合计占75.4%,L5只有29篇,占5.9%,而其中不少只能证明“改进机制被改过并用于下一轮”,不能证明它长期、稳定、低成本地产生更好的后代。 真正难的不是生成候选方案,而是可靠地判定哪一次修改值得继承。同一个模型既出题又判卷,可能共同放大盲点;评价器如果也能被改,分数上涨可能只是尺子变松;技能库越积越大,还可能让检索变差。到了机器人和医疗场景,软件回滚更无法撤销现实中的物理或临床伤害。 六、这篇论文最该怎样读? 把它当成一张路线图,而不是一份“强RSI已经实现”的实验报告。论文汇总了学术论文、技术报告、企业博客、开源仓库和公司自报结果,证据强度并不一致;B0到L5也是作者提出的分类法,不是行业统一标准。 标题《The Last AI Built by Humans》很抓人,但正文并没有证明“最后一个由人类制造的AI”已经或即将出现。更准确的说法是:AI研发链条里,一些零部件已经开始自动化,少数系统开始修改会影响下一轮改进的机制;距离跨多代、可归因、可迁移、成本受控的有效递归,还有一段很长的路。 结语:真正该盯住的,不是科幻式倒计时 未来几年,最重要的问题可能不是“AI何时突然接管一切”,而是它在逐步接手数据、实验、工具、评测和部署时,我们能否同步建立独立验收、版本记录、回归测试、成本核算、权限边界和人工叫停机制。 如果某个系统宣称实现了RSI,可以追问四件事:改了什么?改动是否被下一代继承?在相同预算和独立测试下是否持续更好?失败时能否追溯和回滚?这四个问题,比一个耸动标题更接近论文真正留下的判断框架。