一条提示词一个云端虚拟机17个小时无人值守
当工程师第二天早上打开终端时,屏幕上跳动着一个他们没敢想过的数字,88.8%。前一天还是 77.5%同时,跑一次的费用从 79 美元直接砍到了 49.8 美元。又好又便宜,这在AI行业几乎是违反物理定律的事。
这段场景发生在2026年7月底开源编码代理 Cline 公布了一场真实实验:他们让AI花了17个小时,改进“运行AI自己”的那套软件,随后测得更高的成绩。
消息传开后,硅谷很快出现两派声音有人高呼*“奇点已至”,有人冷笑“680美元买了几行注释”*,还有人抛出了一个让所有人沉默的追问:它能不能继续改进自己?


▲ Cline官方帖:灰色柱是改进前(77.5%/$79),蓝色柱是改进后(88.8%/$49.8),绿色标注"+11.3分"和"便宜37%"
一场精心设计的“自我手术”
先搞清楚一件事:这场改造动的是AI的身体,模型本身没有改变。
这个比喻很关键AI模型的“大脑”是它的神经网络权重,那是训练阶段锁死的东西。而“身体”,在这个实验里叫 harness(运行框架),是把大脑接到真实世界的那一层皮肤和肌肉:怎么发请求、遇到服务器忙怎么办、怎么判断自己是否陷入死循环、怎么执行命令行操作而不把自己杀死。
同一个大脑,换一副身体,表现可以天差地别。
这次实验的分工是这样的:被测试、出成绩的“考生”是 Moonshot 的 Kimi K3;而主导整个17小时改造循环的“总指挥”是 GPT-5.6-Sol。总指挥读失败报告、写修复补丁、调度评测、决定保留还是回滚,所有这些,都在一条结构化提示词的驱动下自动完成。
考场是 Terminal-Bench 2.1,由斯坦福参与推动的终端环境AI基准测试,89道硬核任务,从编译Linux内核到用OpenSSL签证书,每一道都要在真实终端里动手干活,单纯写代码片段过不了关。

▲ 官方数据图:Kimi K3以$49.8拿到88.8%,对比GPT-5.6 Terra的$400和Fable 5的$552
17小时里到底发生了什么
故事要从基线说起Kimi K3用原版Cline跑Terminal-Bench 2.1,69题通过,89题里挂了20题,异常率高达19.1%。工程师把失败轨迹喂给GPT-5.6-Sol,然后按下了那个按钮。
接下来的17个小时,AI像一个不知疲倦的急诊医生,逐一解剖每一种死法:
先处理的是限流猝死有5道题的失败模式完全一样,服务器返回429(太忙了),Cline直接放弃了。修复很朴素:把重试次数从2提到5,加上指数退避。5题全部起死回生
接着出现的是假性脑死亡两道题被循环检测器误杀AI其实在轮询一个长时后台任务,每次输出都在变化,明明是有进展的,但旧检测器只看到“重复调用”就直接拔管。改成输出感知后,两题翻盘
还有一个7.6秒幽灵一道题启动后7.6秒就退出了,零token、无session。根因被追溯到一个荒诞的bug:提示词里出现了类似@a的字符,触发了文件查找功能,而某个异步线程和超时逻辑配合失误,在模型还没被调用之前,进程就已经合法退出了。一行代码修复,确定性翻盘
最后还碰到了自杀式清理两道题里,AI在做完任务后执行pkill -f清理后台进程,结果匹配模式太宽,把运行自己的父进程也杀死了。这就像一个外科医生做完手术后清理手术室,不小心把自己也消毒进去了。


▲ Can Bölük的“680美元commit”配图:diff里新增的内容包括"记录精确PID"、"避免pkill -f宽匹配"等工具说明
680美元买了什么
四刀下去,三次确认跑的成绩分别是 79/89(88.8%)、76/89(85.4%)、78/89(87.6%)。异常率从19.1%降到9.8%均值约77.67题,相对基线提升约8.5题。
整场实验的账单被完整公开:GPT-5.6-Sol控制线程消耗约2.77亿token,花费约337美元;Terminal-Bench评测跑消耗约3.91亿token,花费约344美元。合计 680美元,近10亿token。
社区立刻炸出了经典梗图有人把最终PR的diff截图贴出来,几行工具说明、一个重试参数、几处进程处理逻辑,配文:“这就是680美元买来的代码。”

▲ PR #12465:标题"Improve CLI resilience for long-running agent workflows",+774/-58行变更
但这种嘲讽忽略了一个关键事实:680美元买下的是找到这几行代码的过程,代码量只是结果。 就像你不会说爱迪生只是“花了几千美元买了一根钨丝”。10亿token覆盖的是数百次失败分析、假设生成、修复验证、全量评测的完整科学循环。而同样的工作,Cline团队2026年2月用人工方式做过一次,四个工程师花了数周时间,才把成绩从47%推到57%。
Sandeep Alluru在评论区算了一笔精妙的账:性价比提升了1.8倍,花更少的钱拿到了更高分数。这在AI行业确实“almost never happens”。

▲ "变好的同时还变便宜,这种事几乎不会发生"
争议焦点落在“递归自我改进”的定义上
代码改动之外,围绕概念的争论更激烈。
Cline官方博客把这次实验称为“a version of recursive self-improvement”,措辞已经相当保守。但后续讨论不断加码
科技账号 SciTech Era 写的是*“practical recursive AI self-improvement”。Dr Singularity 说“这就是早期RSI形态”*。而David Patterson则一口气把说法推到了终点,
“AI现在比人类AI开发者更聪明。当AI改进下一个AI模型时,这叫递归自我改进。RSI来自人工超级智能。奇点已至。”


▲ 将实验直接等同于"奇点"的观点性推文
但冷水来得同样迅猛医学与AI研究者 Louis Mullie 直接指出:一轮带来提升的自我修改,尚不能算递归自我改进。
化名 Unobserved 的用户追问更狠:“按照严格的RSI定义,装上新harness之后,它还要能继续改进自己。你觉得现在这套新harness能把分数推过88.8%吗?如果能,你为什么不继续做?”

▲ 改进后的系统能否继续自我改进,是判断RSI的关键
这个追问之所以致命,是因为它指向了RSI定义的核心:系统改进后仍能继续迭代,而且改进速度还会加快。 一个能自己修轮胎的赛车手很厉害,但如果他修完轮胎之后就再也没什么可修的了,你不会说他开启了“递归自我改进的无限循环”。
还有一个更隐蔽的方法论问题芬兰研究者 Ari Heljakka 指出:Terminal-Bench的分数始终在优化循环的反馈回路里。即使提示词明文禁止了题面特判、禁止改评判器、禁止只报最好成绩,但“以榜为信号做选择”这件事本身就是一种选择压力。AI没有针对某道题作弊,但它的每一个修复决定都受到了榜单分数的引导,这到底算不算 benchmax(围绕基准过度优化)?
分数之外,更重要的变化
跳出定义之争,这场实验提供了三点信息:
“自动爬山”从demo变成了可审计的工程实践。 Cline公开了4.52GB的轨迹包、SHA-256校验、实验账本、被测CLI包的精确哈希。你可以自己下载、自己跑、自己验证如今除了博客和图表,团队还把traces直接公开,任何人都能自行查看。
双模型编排正在成为新范式 一个贵的前沿模型当总指挥(GPT-5.6-Sol,负责思考),一个便宜或开源的模型当执行者(Kimi K3,负责干活)。博客还透露,他们本来想用 Fable 5 当总指挥,但Fable的安全过滤机制在这种自我修改场景里反复触发降级,最终只能放弃。这暗示了一个被低估的维度:能不能当“总指挥”,不仅取决于能力,还取决于产品策略允不允许AI长时间自己改自己。
更深层的变化来自评测基础设施、可写清的实验协议和长时agent能力的同时成熟。 它们让这件事从口号变成了账单上可核对的680美元。Cline文末透露,他们已经准备把类似流程变成新模型发布后的标准动作:先跑基线,再让AI自动榨取harness红利。
这释放出一个更有价值的信号:“AI改进AI运行环境”正在从实验室奇观进入发版流水线。

▲ Grok的长回复:逐步解释了"递归"在此语境下的含义,harness被升级后,后续循环跑在改进版上
写在最后
回到那个让所有人沉默的追问:它能不能继续改进自己?
答案是,目前不知道 Cline没有展示第二轮三次确认跑的成绩是88.8%、85.4%、87.6%,波动本身就暗示:这可能已经接近当前架构的天花板了。五道题在所有优化跑中始终失败,被归类为“真实模型能力上限”。
因此,目前看到的是一次成功的“自我手术”,离“自我进化”仍有距离。
一次手术和持续进化之间的距离,可能是几个月,可能是几年,也可能永远跨不过去。但680美元和17个小时之后,那条线确实比昨天更近了一点。
夜雨聆风