一条提示词,17小时,680美元 人类工程师无需熬夜改代码,团队也省去了头脑风暴;一个AI代理独自坐在云端虚拟机里,拆解自己的失败轨迹、给自己打补丁、再测试、再改进,循环往复,直到把自己的考试成绩从77.5%拉到了88.8%,顺手还把每次考试的花费砍掉了37%。
这段情节听着像科幻小说,却来自2026年7月底开源编码代理Cline公开披露的一场实验。它瞬间点燃了整个AI社区,有人高呼“奇点已至”,有人冷笑“一轮优化也敢叫递归”,还有人默默截了张代码diff图,配文:“这就是680美元买来的commit。”


▲ Cline官方发布的前后对比:灰色柱是"改造前",蓝色柱是"改造后",成绩涨了11.3个百分点,成本却降了37%
一场精心设计的“AI自我手术”
先把故事拆干净
被改进的对象,是Moonshot旗下的Kimi K3模型,通过OpenRouter接入Cline框架运行。主刀操刀的外科医生,是OpenAI的GPT-5.6-Sol,它作为“领导模型”驱动整个长达17小时的控制线程。手术台,是Cline的CLI运行框架(harness),你可以理解为模型与真实世界之间的那层“神经接口”:怎么发请求、怎么处理报错、怎么识别死循环、怎么避免把自己的进程杀掉。
关键概念来了:harness相当于大脑用来操控手脚的“脊髓和运动神经”。 同一个大脑,换一套运动神经系统,表现天差地别。Cline这次改的就是这套神经系统。
考试场地叫Terminal-Bench 2.1,由斯坦福参与推动的终端环境AI基准测试,89道硬核任务,从编译Linux内核到处理视频,代理必须在真实终端里动手干活,单纯写段代码无法交卷。

▲ Terminal-Bench官网:专门考察AI代理在真实终端环境中的动手能力
四刀下去,成绩飙升
GPT-5.6-Sol拿到启动提示词后,开始了一场极其系统化的“失败考古”。它翻看Kimi K3的每一份考试失败记录,像老刑警一样还原现场,然后精准下刀。
先治“一碰就放弃”症 基线测试中有5道题,失败原因完全一样,OpenRouter返回了429限流错误,Cline直接躺平放弃。修复方案很朴素:提高重试次数,加上指数退避。5题全部翻盘
接着治“误杀勤劳者”症 有2道题,代理其实在老老实实轮询一个长时间运行的后台任务,输出一直在变化,明明是在干活。但Cline的循环检测器只看到“这家伙又调用了同一个工具”,二话不说判定死循环,直接击杀。修复后检测器改用产出变化判断进度,2题翻盘。
再治“7.6秒猝死”症 最诡异的一题:进程启动7.6秒后退出,零token输出,连session都没建立。根因被追踪到一个荒诞的bug,提示词里出现了类似@a的字符,触发了文件提及查找功能,而某个异步worker与超时逻辑的配合失误,导致模型还没被叫醒,进程就已经合法退出了。一行代码修复,确定性翻盘
第四刀:治“自杀式清理”症 2道题里,代理在做后台清理时使用了pkill -f这种大杀器,问题是,匹配模式太宽,把自己的父进程也干掉了。修复方式是在工具说明里加入警告:记住精确PID,不要用宽匹配。


▲ Can Bölük截取的代码改动,有人戏称“这就是680美元的commit”:新增的是关于记录PID、避免pkill -f的测试断言和工具说明
四刀下去,基线的69/89(77.5%)被推到了最佳确认跑的79/89(88.8%)。三次独立确认跑成绩分别是79、76、78题通过,异常率从19.1%降到9.8%。与此同时,成绩在涨,成本在降,单次完整测试的花费从约79美元降到了约49.8美元。
10亿token燃烧的17小时
把钱掰开看,更有意思
整场实验消耗了约10亿token,总成本约680美元。其中GPT-5.6-Sol控制线程吃掉约2.77亿token(大量缓存命中),花费约337美元;Terminal-Bench评测跑了多轮,消耗约3.91亿token,花费约344美元。
Cline博客把这笔账与“工程师团队花数周时间做同样的事”做了对比,2026年2月,他们的人类团队曾用类似的方法论,花了数周、约四人的投入,才把某个模型组合的成绩从47%推到57%。六个月后,一条提示词、一名工程师偶尔瞄一眼、17小时,就把另一个模型组合推高了11.3个百分点。

▲ 博客中的成本对比图:Kimi K3 + 优化后Cline仅需49.8美元即可完成一次完整评测,而GPT-5.6 Terra需400美元,Fable 5需552美元
人类工程师在这17小时里做了什么?几乎什么都没做 官方描述是“每隔几小时照看一下,代理意外停下时按continue”。代理跑在云端虚拟机上,人类只需像ICU值班护士那样,偶尔按一下呼吸机静音键。
“递归自我改进”:定义之战
成绩提升有公开的traces、PR和SHA-256校验包可供审计,争议集中在:这到底算不算“递归自我改进”(RSI)。
Cline官方用了一个谨慎的措辞:a version of RSI。理由是:代理修改了运行自己的harness,后续循环跑在改进版上,形成了自我指涉的改进闭环。


▲ 乐观派代表:有人直接将此事延伸到ASI与奇点想象
但医学与AI研究者Louis Mullie直截了当地泼来冷水:
“一轮带来提升的自我修改,还称不上递归自我改进。”

▲ Louis Mullie的引用评论:简洁、精准、致命
另一位用户Unobserved追问得更狠:完整的RSI应该在装上新harness后继续改进自己。 那么,现在这套新harness能不能再把分推过88.8%?如果能,为什么不继续做? 如果不能,这次实验至多算一次性的自动优化,尚未形成递归闭环。
芬兰研究者Ari Heljakka则抛出了一个更深的方法论质疑:Terminal-Bench的分数在不在优化环内部? 如果优化器连续17小时都看得见这个分数作为反馈信号,那即使没有显式的“针对特定题目的作弊”,围绕榜单指标过度优化(benchmax)的选择压力本身就已经存在了。

▲ Ari Heljakka的提问直指要害:分数若在优化环内,17小时的benchmax无需任何显式作弊
奇点之外,还有哪些信号
让我们从定义之争中退后一步,看看这件事透露出了什么。
第一,“评测基础设施 + 可机器执行的研究协议 + 长时代理”三件套的同时成熟。 自动爬山能从口号变成一张680美元的账单,靠的是整条流水线终于可以被写成一条提示词。Harbor评测框架、Modal并行化、OpenRouter路由、反作弊宪法级约束,每一块积木单看都不惊人,拼在一起就构成了可审计的自动化研究能力。
第二,双模型编排正在成为常态 一个贵的前沿模型(GPT-5.6-Sol)负责读trace、想策略、写补丁;一个便宜或开源的目标模型(Kimi K3)在固定协议下被反复测量。这种“贵脑袋指挥便宜手脚”的架构,可能很快会成为每个代理团队发版前的标准动作。Cline文末已经明说了:他们准备把类似RSI风格的流程变成新模型上线后的常规操作,先跑基线,再自动榨取harness红利。
第三,也最容易被忽略:还有5道题始终没修好。 build-pov-ray、extract-moves-from-video、filter-js-from-html、make-doom-for-mips、video-processing,这些任务在四次优化跑中全部失败。由此可见,harness优化存在天花板,再往上走会撞上模型能力本身的硬约束。若要抵达更完整的递归自我改进,还得实现认知能力的递归提升,其难度远高于调整重试逻辑和循环检测。

▲ 对应的GitHub PR:标题强调“CLI韧性”和“长时代理工作流”,+774/-58行代码变更
680美元,买到了什么?
Tino Wening在评论中点出了一个工程视角的好问题:如何避免局部最优? 他自己用过种群引导的演化算法,追踪候选家族、变异有前途的想法、淘汰死胡同、在停滞时注入新奇性。Cline这次的实验采用纯粹的贪心爬山,省去了种群、变异与回溯搜索。它之所以有效,很可能是因为低垂的果实太多了,429不重试、假阳性循环检测、7.6秒猝死、自杀式pkill,这些都是常规工程bug,只需一个不知疲倦的诊断者。
680美元买到的是一种更诚实也更实际的能力:机器可以接管“读失败日志→提假设→改代码→重新测试”这条工程链的全程,而且做得又快又省。它距离奇点、超级智能和递归自我改进的无限闭环仍然很远。
粉丝与批评者都给出了各自的极端解读。这项实验是一张快照,拍下了2026年夏天AI工程能力的真实水位线。 水位还在涨,但离“海啸”还有距离那段距离究竟有多远,要看下一轮、再下一轮的实验结果。
那个问题依然悬在那里,等着被回答:新的harness,能不能继续改进自己?
夜雨聆风