

一个令人窒息的反直觉事实正砸向AI圈:同一个模型,同一套权重,同一批编程任务,只是换了一套"外壳"来驱动它,分数就能从57.3%暴涨到68.5%。差距高达11个百分点模型没变过一行代码,变的只是外围那层"harness"。
2026年6月29日,开源编程代理Cline推出ClinePass,每月9.9美元,把GLM-5.2、DeepSeek、Kimi、MiniMax、Qwen等一众开源权重模型打包接入自家harness,宣称提供2到5倍的用量额度。同一天,技术博主Akshay发长帖,给出自己的行业判断:
The harness is what matters now. The model is just a commodity.眼下关键在于外壳,模型本身只是商品。

▲ Akshay长帖核心卡片:模型可替换,harness决定落地率
模型是"会想字的大脑",harness是"能干活的身体"
要理解这场地震,先搞懂一个概念
大语言模型(LLM)的接口本质极其朴素:输入上下文,输出文本。它不会自己开仓库、不会点浏览器、失败后不会重试。这些动作必须由外围程序完成
Agent Harness,就是除模型权重以外、让整个系统运转起来的软件与配置:系统提示、工具权限、上下文管理、状态记忆、循环编排、验证护栏、可观测评测。LangChain给过一个粗暴的公式:
Agent = Model + Harness模型之外,皆为外壳。
模型提供"会想字"的智能;harness决定这些智能能否变成可交付的活儿。 过去一年,一个残酷的共识正在形成,当模型的"聪明"越过够用门槛,价格的雪崩让智能本身迅速沦为大宗商品。约15美元/百万token的顶级模型与约1.5美元/百万token的开源模型,在大量编码任务上的表现开始收敛。差异去了哪?去了模型之外的那层运行时
同一个Kimi K3,成本差出9倍:数字不会说谎
如果说Akshay的11个百分点还只是"一家的对照实验",那么2026年7月下旬Composio的跨harness测试,直接给出了让财务人员坐不住的数据。
同一个模型Kimi K3,分别在Claude Code、Hermes、Kimi Code三个harness上跑相同的28个任务。结果令人瞠目:
- 成功率几乎贴在一起
:约20到22个任务通过; - 中位token消耗
:从约6.1万飙升到34万,差距近6倍; - 单任务成本
:从约0.22美元到约2.00美元,差距约9倍。

▲ Composio实测:同模型跨harness,成本可差约9倍
Composio的结论句锋利得像刀:想降agent成本,先审视harness,再换模型。
而LangChain的自述更夸张:仅改动harness,其coding agent在Terminal Bench 2.0上的排名从榜单后段飙升至前五,约52.8%到约66.5%。Vercel的案例同样被收录:删掉约80%的冗余工具后,成功率从约80%升到100%,token减半,时延从724秒暴跌到141秒。
Harness,正在成为新的主战场。
OpenAI与Anthropic的转身:护城河迁移的顶级样本
如果你觉得这只是开源社区的自嗨,请看看OpenAI自己做了什么。
OpenAI工程博客记录了一场内部实验:团队给自己立下铁律,人类不手写业务代码,一切都由Codex生成。约五个月后,仓库量级突破百万行代码,累计约1500个PR,小团队人均日均多个PR,且吞吐量随人员增加不降反升。他们总结出的角色重写振聋发聩:
Humans steer. Agents execute.人类掌舵,智能体执行。
人类的时间与注意力成了最稀缺的资源。工作重心转向清晰规定环境、让反馈可被agent读取、让架构边界可被机械执行。AGENTS.md被压到约百行当目录,细节藏在结构化docs/里;自定义lint把架构不变量写进可执行规则,仓库之外的知识对agent不可见。
Anthropic的答案则像一场接力赛。他们发布Effective harnesses for long-running agents,直面一个致命的工程难题:跨会话失忆。每个新会话像换班工程师,对上一班毫无记忆。他们的处方是两段式,Initializer agent第一次会话专门搭环境、写进度文件、展开数百条功能清单;而后Coding agent每个会话只做增量,结束留下干净状态交棒。端到端验收逼着模型像真人一样点浏览器走查,仅有curl通过并不足以验收。

▲ Chelsea Finn转发:harness本身也可以被agent端到端优化
51.2万行TypeScript的真相
2015年,Google研究者Sculley等人发表了一篇被MLOps领域奉为圭臬的论文,配图至今仍在流传:在真实生产机器学习系统中,"模型代码"只是中心一个极小的黑盒,周围环绕着数据采集、验证、服务编排、监控、资源配置等一整圈基础设施。那篇文章的核心教训,模型往往是系统里相对容易的部分。
今天的agent系统正在以更快的节奏重复同一结构。
一个极具冲击力的细节:Claude Code源码外泄时被统计为约51.2万行TypeScript、约1900个文件,其中与"直接调用模型"相关的部分只占很小比例,其余全是harness。用户在聊天框里看到的"聪明",底下是大量与智能无关、却决定可用性的工程。
这不禁让人想起云计算的历史:当虚拟机规格趋同,竞争往往转移到编排、网络策略、权限与可观测。信息结构何其相似,当中心能力商品化,竞争外移到约束、交付与治理层。
别急着下跪:harness也有边界
诚实的读法必须承认:harness的增益取决于具体条件。
Scale AI的SWE-Atlas发现,对部分模型家族而言,harness选择的差异落在误差带内;METR等基准显示Claude Code与Codex并不总是稳定压过朴素scaffold。一位实践者在Chelsea Finn帖子下描述了自己的日常:每天跑十几个agent,超过60%的工作量花在harness工程上,prompt只占次要部分。

▲ 一线实践者:harness工程占据日常工作的大头
增益强烈依赖任务类型与模型能力区间。 工具密集、长程、依靠外部验证闭环的软件工程,能体现Cline与Composio展示的情况;短问答或模型已极强且任务近乎单步时,换外壳可能几乎不动针。
NVIDIA Labs在7月27日发布的NOOA研究预览,则从模型侧接口给出了更激进的答案:把agent写成单个Python类,方法即能力、字段即状态、文档字符串即提示。在SWE-bench Verified上,用同一模型、通用253行agent、无基准特供提示,达到约82.2%,而调用次数与token约为对比harness的一半量级。同模型下的分数,成本帕累托,才是新的竞技场。
9.9美元的本质:可替换内核上的不可替换外围
回到9.9美元这个价格
ClinePass把选模型,管密钥,扛限速,适配harness这套脏活累活,打包成一条可订阅的默认路径。它的深层假设是市场已然接受的判断:模型是slot,环绕它的loop是产品。
当模型可以热切换,可能形成锁定的资产包括:吸收失败模式的轨迹与评测集、绑定企业身份与审计的工具权限模型、订阅与分发渠道、以及被仓库化、可被agent读取的组织知识。下一轮开源权重发布,也很难一夜抹平这些积累。
但反面风险同样锋利:harness与某一模型后训练工具格式的过拟合,是"多模型slot"产品必须持续支付的适配税。LangChain文提到,只是改一下apply_patch的工具逻辑就可能导致表现下滑。模型与harness的协同进化,是一场没有终点的军备。
仍开放的问题是残酷的:harness增益何时真的大于换模型?当模型原生规划与自验证变强,哪些外壳部件会被"吸回模型",哪些永远留在外围?谁来自评自优化的harness,防止评测契约被"优化掉"?
一个9.9美元的SKU,撕开的是一场关于AI价值链重心转移的宏大辩论。 下一次有人问你"AI的护城河在哪",请记住那组分数:
同一套权重,57.3%与68.5%之间,隔着的是整整一个工程宇宙。

夜雨聆风