一条提示词一台云服务器17个小时
当工程师第二天早上打开屏幕的时候,AI已经把运行自己的那套软件翻新了一遍,成绩从77.5%飙到88.8%,跑一次的花费反而从79美元砍到了49.8美元。
更好,还更便宜
这一幕发生在真实实验中2026年7月底,开源编码代理Cline公布了一场精心设计的实验:让AI在一条结构化指令的驱动下,连续17小时审视、诊断、修改“运行自己的底层框架”,然后在业界公认的硬核基准Terminal-Bench 2.1上反复考试,直到把分数拉满。
整场实验的账单?约680美元 换算成人民币,不到五千块
消息一出,科技圈争论四起有人高呼"递归自我改进的黎明",有人冷笑"不过是在Cline里跑了个Kimi然后让它改Cline",还有人盯着最终合并的代码截图,发出灵魂一问,
"这就是那个680美元的commit?"


▲ 社区热传的"680美元commit":最终合并的代码改动里,有一条是告诉AI"别用pkill -f把自己杀了"
一、先搞清楚:谁改了谁?
这件事常被简化成"AI改进了自己",实际分工却精密得多。
想象一个考场考生是月之暗面的Kimi K3模型,题目来自斯坦福参与推动的Terminal-Bench 2.1,89道硬核终端操作任务,从编译Linux内核到用OpenSSL签证书,每一道都要在真实终端环境里完成,单靠写几段代码无法过关。
考生还坐在一把椅子上,这把椅子就是Cline的CLI运行框架(harness)。框架决定了模型怎么调用工具、怎么处理报错、怎么识别死循环、遇到服务器限流该重试几次或直接放弃。
同一个考生,换一把椅子,分数可以差出十万八千里。
这场实验的核心操作是:让一个更强的"监考官"模型,OpenAI的GPT-5.6-Sol,花17个小时去调整这把椅子。它遵守反作弊约束,不碰试卷答案,专门改善框架体验和运行稳定性。
二、17小时里到底发生了什么?
故事要从基线说起
Cline团队拿原始框架跑了一遍89道题,Kimi K3考了69/89,77.5%。失败的20道题里,有17次带着明显的异常退出;不少题尚未检验出模型能力,框架便先崩了。
于是GPT-5.6-Sol开始了它的"诊断-修复-验证"循环。博客按实验编号记录了每一步,读起来像一份极其冷静的手术报告:
实验0:推理强度被静默降级 Kimi K3支持max级推理,但Cline的框架悄悄把它塌缩成了high。模型发现了这个bug,修了底层抽象。不一定立刻加分,但解除了一道隐形的紧箍咒。
实验1:429限流直接放弃 五道题失败的模式完全一样,OpenRouter返回"请求太多"的429状态码后,框架直接躺平不试了。修复方案是提高重试次数并加入指数退避。五道题全部翻盘
实验2:假死循环误杀 有些任务需要长时间轮询后台进程,输出一直在变化,模型其实在正常工作。但旧的循环检测器看到"重复调用"就判死刑,直接杀进程。修复后检测器会看输出是否有变化,有变化就说明有进展,别急着下刀。两道题翻盘
实验3:7.6秒的幽灵 一道题在7.6秒内退出,零token消耗,没有任何会话记录。根因令人哭笑不得:提示词里出现了类似@a的文本,触发了一个文件提及查找功能;一个异步worker和超时逻辑配合失误,模型还没来得及被调用,进程就合法退出了。一行代码修复,确定性翻盘
实验4:AI把自己杀了 两道题失败的原因堪称黑色幽默,代理在清理后台任务时使用pkill -f加上一个宽泛的模式串,结果匹配到了自己父进程的命令行,把自己干掉了。修复方式是在工具说明里加一条警告:追踪精确的PID,别用宽匹配。
这就是那个"680美元commit"里最被嘲笑的一行改动。但你仔细想想,一个AI系统在连续运行中发现自己会意外自杀,然后教会自己不要这么做,这件事本身就够赛博朋克的了。


▲ 官方前后对比:灰色柱77.5%/$79,蓝色柱88.8%/$49.8,绿色标注+11.3分、便宜37%
三、最佳成绩88.8%,但故事没那么简单
Cline选择公布的那个88.8%,是三次确认跑中最好的一次。另外两次分别是85.4%和87.6%三次平均下来,约87.3%
这个诚实的数据披露,反而成了社区争论的火药桶。

▲ 医学与AI研究者Louis Mullie的判断:"一轮自我修改带来提升,仍不足以称为递归自我改进"
芬兰AI研究者Ari Heljakka追问:Terminal-Bench的分数是否处在优化循环内部? 如果优化器连续17小时都能看到成绩反馈,即使没有任何"针对特定题目的修改",围绕榜单指标的过度优化(benchmax)也可能悄然发生。

▲ "如果优化器盯着分数看了17个小时,它可以在没有任何显式benchmark-specific fixes的情况下benchmax"
这就好比,你说你没有针对高考押题,但你连续做了十七个小时的高考真题模拟卷然后调整答题策略,这算不算针对高考优化?
Cline的启动提示词里确实写死了一大堆反作弊规则:不许改判分器、不许写题目特判、不许靠加时间加内存刷分、不许只报最好成绩。但"以榜单为反馈信号"这件事本身带来的选择压力,是提示词里的禁令无法从逻辑上消除的。
四、680美元买到了什么?

▲ 博客中的成本对比:Kimi K3+优化后Cline仅$49.8,而GPT-5.6 Terra约$400,Fable 5约$552
Cline公开的traces把账单拆得清清楚楚:
- GPT-5.6-Sol控制线程
:约2.77亿token,花费约337美元 - Terminal-Bench评测消耗
:约3.91亿token,花费约344美元 - 总计
:近10亿token,约680美元
博客把这个数字和"工程师团队花数周时间做同样的事"做对比。2026年2月,Cline团队用人工方式做过一轮完全相同性质的hill climbing,四个人,几周时间,把成绩从47%推到57%。六个月后,同样的工作,一条提示词,17小时,680美元。
社区有人算了另一笔账:88.8%的最佳跑只花了49.8美元,而号称更强的Fable 5跑一次就要552美元。性价比差了十倍不止 这可能是整件事里最具商业冲击力的数字,在agent赛道上,"更强"和"更贵"正在被解耦。
五、"递归自我改进"还是"花式调参"?
这是整场争论最核心的问题
Cline官方用了一个谨慎的措辞:"a version of RSI",递归自我改进的一种版本。随后不少转述丢掉了这个限定词

▲ chiefofautism的简化说法:"递归自我改进" = "我在Cline里跑了Kimi K3然后让它改Cline"
经典意义上的递归自我改进(RSI)是这样的:系统改进自身→改进后的系统更擅长改进自身→继续改进→形成加速循环→直到触及物理极限。这是从冯·诺伊曼到Bostrom一脉相承的智能爆炸理论中的核心机制。
Cline这次做的是什么?一个强模型改了一个框架,被改的框架让另一个模型跑分更高了。但被改过的框架尚未被证明"更擅长改自己"。 社区里有人直接追问:如果新harness这么好,为什么不接着跑第二轮、第三轮?能不能从88.8%继续往上推?若后续无法继续提升,这次实验更接近一次性的自动化调优,距离递归闭环还有一步。


▲ Cline工程师Ara的个人宣告:"我们已经为编码代理实现了RSI"
但话说回来,即便它"只是"自动化hill climbing,这件事本身也足够震撼。
想想看:六个月前还需要一个团队花几周才能完成的优化循环,现在一个agent用一条提示词就能在17小时内跑完。Anthropic自己的研究文章When AI builds itself里也承认:AI已经能在明确目标下超强执行实验与写代码,只是在"选择下一个研究问题"上仍有人类优势。
Cline的实验恰好卡在这条分界线上:研究问题由人类定义,执行过程由AI完成,审核合并由人类把关。 它尚未抵达奇点,也远比普通调参复杂,是人机协作进入新阶段的一份收据,上面写着680美元。
六、该关注的信号
剥开所有噪音,这件事显示出三件基础设施的同时成熟,比"RSI来了"的口号更有分量:
第一,评测基础设施已经足够标准化,89道题可以在Modal上并行跑完,单次全量评测压到几十分钟级别。第二,长时agent的可靠性过了某个临界点,17小时不间断运行、自主做checkpoint、遇到中断能恢复。第三,结构化协议可以把"读失败日志→提假设→改一处→验证"这个工程师的核心循环完整编码成一条提示词。
Cline在博客末尾轻描淡写地提了一句:他们已经把类似流程准备成"新模型发布后的标准动作"。 以后每出一个新模型,先跑基线,再自动榨取harness红利。
如果这成为行业惯例,那680美元的实验或许会成为一种新范式的第一张发票。
而我们所有人,无论是欢呼还是质疑,都已经站在了收银台前。
夜雨聆风