一条提示词,一台云服务器,一个通宵当工程师第二天醒来,AI已经把运行自己的那套代码翻了个底朝天,跑分从77.5%飙到88.8%,每次测试的账单反而从79美元降到不足50美元。
这段情节颇像科幻小说的开头2026年7月底,开源编码代理Cline公布了一场精心设计的实验:让AI代理连续自主运行约17小时,诊断、修复、迭代运行AI自身的底层框架代码,并在斯坦福参与推动的Terminal-Bench 2.1基准测试上反复验证。整场实验花费约680美元,产出约10亿个token。
消息公布后,社交媒体上出现了两种截然不同的评价。有人高呼"递归自我改进的早期形态已经出现",也有人冷冷回应:"所谓递归自我改进,就是在Cline里跑了个Kimi然后让它改Cline。"


▲ Cline官方发布的前后对比:灰色柱77.5%/$79,蓝色柱88.8%/$49.8,绿色标注"+11.3分"与"便宜37%"
一条提示词,发动一场17小时的“自我手术”
先把角色关系理清楚,这件事里其实有两个AI在协同工作。
主刀医生是OpenAI的GPT-5.6-Sol,它负责读失败日志、提假设、写补丁、调度实验,是整场17小时马拉松的"大脑"。被手术的对象是Cline这套开源编码代理的CLI运行框架(业内叫harness),你可以把它理解成AI和真实世界之间的"神经接口":怎么发请求、怎么重试、怎么判断自己是否陷入死循环、怎么避免把自己的进程误杀。最终上场考试的选手,则是Moonshot的Kimi K3。
一个AI改框架,另一个AI跑考试框架改得好不好,用考试成绩说话
这条发动一切的提示词,由团队先请GPT-5.6根据过往经验起草,人类再收紧边界,最终以公开gist的形式挂在GitHub上。它围绕一个核心研究问题展开:Kimi K3能否通过检查和改进运行自己的Cline框架,在Terminal-Bench 2.1上取得真实、可复现的提升,同时严禁作弊?
四刀下去,把五类"幽灵故障"逐个斩杀
基线成绩是69/89题通过,77.5%20道失败题里,17次带有异常退出痕迹。AI没有急着刷分,而是像一个经验丰富的SRE工程师一样,先做故障归因。
故障一:限流即死 Kimi K3当时供应紧张,OpenRouter频繁返回429错误("太多请求"),旧框架收到拒绝就直接放弃。修复很朴素:把重试次数从2提到5,加指数退避。5道因此失败的题,全部翻盘
故障二:假死循环 有两道题需要AI轮询后台长任务,输出一直在变化、任务确实在推进,但旧的循环检测器只看"是否在重复调用同一个工具",于是把正常工作误判成死循环并强行终止。改成"输出感知型"检测后,两题翻盘
故障三:7.6秒幽灵退出 一道题在7.6秒内退出,零token、无会话记录,模型甚至还没被调用就死了。根因被追溯到一个极其隐蔽的bug:提示词中出现类似@a的token触发了文件查找功能,而一个异步worker的超时逻辑让进程在模型响应之前就合法退出了。一行代码修复,确定性翻盘
故障四:任务自杀 两道题里,AI为了清理后台进程使用了pkill -f命令,这个命令会匹配所有含特定字符串的进程,结果把运行自己的父进程也一起杀了。修复方式是在工具说明里加入警告:追踪精确PID,不要用宽匹配。


▲ 社区热传的"680美元commit":右侧是新增的pkill -f警告代码,被戏称为"史上最贵的几行注释"
成绩单:更强,同时更便宜
四轮修复组合完毕后,进入全量确认阶段。三次独立确认跑的成绩分别是:
| 确认跑1 | 79/89 | 88.8% | $49.8 |
三次均值约87.3%,异常率从基线的19.1%降到约9.8%。另一个亮点是成本下降约37%评论者Sandeep Alluru算了一笔账,同样的钱买到的分数涨了约1.8倍,"变好的同时还变便宜,这几乎从不发生"。

▲ "变好的同时变便宜",这组数据让不少人感到意外
而对比其他模型跑同一基准的成本就更刺激了:博客显示,GPT-5.6 Terra一次跑分约400美元,Claude Fable 5约552美元,而优化后的Kimi K3+Cline只要不到50美元,不到前者的十分之一。

▲ 博客中的成本对比:Kimi K3蓝色矮柱 vs GPT-5.6和Fable 5的灰色高柱,标注"不到1/10的成本"
"递归自我改进"还是"一次性自动调参"?社区吵翻了
Cline官方和工程师Ara Khan都用了一个极具冲击力的标签:Recursive Self Improvement(递归自我改进)。科技账号SciTech Era的引用转发更是直接写成"实用的递归AI自我改进",Dr Singularity等账号则宣称"这就是递归自我改进的早期阶段"。

▲ "这就是递归自我改进早期阶段的样子",乐观观点的典型代表
但质疑声同样尖锐
研究者Louis Mullie的反驳很简短,却像一把手术刀:一轮带提升的自我修改,不等于递归自我改进。

▲ "一轮修改有提升 ≠ 递归自我改进",定义之争的核心一击
账号Unobserved追问得更狠:完整的递归自我改进,应该是装上新harness之后还能继续改进自己。你觉得现在这个新harness能把分推过88.8%吗?看起来不能,否则你们早做了

▲ "改进后的版本能否继续自我改进?",这是检验RSI的试金石问题
而chiefofautism给出了一种简洁的拆解:所谓"递归自我改进"="我在Cline里跑了个Kimi K3,然后让它改Cline"。
这场争论的实质是:经典AI安全文献中的RSI,指的是系统改进自身认知能力,且改进后的版本能更快地继续改进,形成加速飞轮。 Cline展示的可视为一次出色的自动化hill climbing:代理改了框架、分数上去了、成本下来了,但没有证据表明这个过程可以无限递归下去。博客自己也用了"a version of RSI"这样留有余地的措辞,到了多次转述中,限定词逐渐消失,结论却变得越来越确定。
还有一个方法论层面的硬问题:研究者Ari Heljakka指出,Terminal-Bench的分数本身就在优化循环内部。即使提示词明令禁止写题专解、改判分器,但以榜单为反馈信号做17小时迭代,选择压力本身就可能造成对特定评测集的过度适配,学术界管这叫benchmax。
680美元买到了什么?
整场实验的总账单约680美元,拆开看:
- GPT-5.6-Sol控制线程
:约2.77亿token,~337美元 - Terminal-Bench评测跑分
:约3.91亿token,~344美元
合计约10亿token有人把最终PR里那几行"不要用pkill -f"的代码截图贴出来,戏称这是"史上最贵的commit"。这句玩笑遮蔽了真实的价值分布:680美元覆盖了完整的失败诊断→假设生成→代码修改→子集验证→全量确认→无效跑排除科学循环,最终几行注释只是其中一小部分。
更有意思的对比是时间成本2026年2月,Cline团队用人工方式做类似的hill climbing,四个工程师花了数周,才把另一个模型从47%推到57%。六个月后,同样的方法论流程,一个工程师发一条提示词,AI跑17小时,把分数推了11个百分点。
这场实验为什么重要?
剥开"递归自我改进"这个闪亮的外壳,这场实验展示的工程能力可能比标签本身更有价值:
工程闭环已经贯通 AI完成了"读故障日志→提假设→改代码→验证→保留或回滚"的完整流程,工作发生在真实终端环境中,对着89道涵盖Linux内核编译、OpenSSL证书、数据分片的任务做系统级可靠性工程。
评测基础设施、可执行协议和长时agent同时成熟了。 89道题并行跑完压到几十分钟,反作弊规则写死在提示词里,全部traces和代码包公开可下载。这些条件共同让"自动爬山"成为680美元账单上可核对的工程实践。
控制AI与执行AI的双模型编排,可能成为常态。 用贵的前沿模型做大脑、用便宜的开源模型跑考试,这种分工在成本上极具吸引力。Cline文末透露,他们已计划把类似流程做成新模型发布后的标准动作:先基线,再用AI自动榨取harness红利。
眼下还没到宣布奇点降临、把每一次"AI改了自己的代码"都说成觉醒的时候。有一件事正在安静地发生:AI把改进自身运行环境的工程周期,从"数周数人"压缩到了"一夜一提示词"。 这条曲线的斜率,已经值得持续观察
夜雨聆风