乐于分享
好东西不私藏

AI最大谎言被揭穿:模型只是白菜!同一权重分差11%,9.9美元撕开护城河遮羞布

AI最大谎言被揭穿:模型只是白菜!同一权重分差11%,9.9美元撕开护城河遮羞布

一个令人窒息的反直觉事实正砸向AI圈:同一个模型,同一套权重,同一批编程任务,只是换了一套"外壳"来驱动它,分数就能从57.3%暴涨到68.5%差距高达11个百分点模型没变过一行代码,变的只是外围那层"harness"

2026年6月29日,开源编程代理Cline推出ClinePass,每月9.9美元,把GLM-5.2、DeepSeek、Kimi、MiniMax、Qwen等一众开源权重模型打包接入自家harness,宣称提供2到5倍的用量额度。同一天,技术博主Akshay发长帖,给出自己的行业判断:

The harness is what matters now. The model is just a commodity.眼下关键在于外壳,模型本身只是商品。

▲ Akshay长帖核心卡片:模型可替换,harness决定落地率

模型是"会想字的大脑",harness是"能干活的身体"

要理解这场地震,先搞懂一个概念

大语言模型(LLM)的接口本质极其朴素:输入上下文,输出文本不会自己开仓库、不会点浏览器、失败后不会重试这些动作必须由外围程序完成

Agent Harness,就是除模型权重以外、让整个系统运转起来的软件与配置:系统提示、工具权限、上下文管理、状态记忆、循环编排、验证护栏、可观测评测。LangChain给过一个粗暴的公式:

Agent = Model + Harness模型之外,皆为外壳。

模型提供"会想字"的智能;harness决定这些智能能否变成可交付的活儿。 过去一年,一个残酷的共识正在形成,当模型的"聪明"越过够用门槛,价格的雪崩让智能本身迅速沦为大宗商品约15美元/百万token的顶级模型与约1.5美元/百万token的开源模型,在大量编码任务上的表现开始收敛差异去了哪?去了模型之外的那层运行时

同一个Kimi K3,成本差出9倍:数字不会说谎

如果说Akshay的11个百分点还只是"一家的对照实验",那么2026年7月下旬Composio的跨harness测试,直接给出了让财务人员坐不住的数据

同一个模型Kimi K3,分别在Claude Code、Hermes、Kimi Code三个harness上跑相同的28个任务结果令人瞠目:

  • 成功率几乎贴在一起
    :约20到22个任务通过;
  • 中位token消耗
    :从约6.1万飙升到34万,差距近6倍;
  • 单任务成本
    :从约0.22美元到约2.00美元,差距约9倍

▲ Composio实测:同模型跨harness,成本可差约9倍

Composio的结论句锋利得像刀:想降agent成本,先审视harness,再换模型。

而LangChain的自述更夸张:仅改动harness,其coding agent在Terminal Bench 2.0上的排名从榜单后段飙升至前五,约52.8%到约66.5%。Vercel的案例同样被收录:删掉约80%的冗余工具后,成功率从约80%升到100%,token减半,时延从724秒暴跌到141秒

Harness,正在成为新的主战场。

OpenAI与Anthropic的转身:护城河迁移的顶级样本

如果你觉得这只是开源社区的自嗨,请看看OpenAI自己做了什么

OpenAI工程博客记录了一场内部实验:团队给自己立下铁律,人类不手写业务代码,一切都由Codex生成约五个月后,仓库量级突破百万行代码,累计约1500个PR,小团队人均日均多个PR,且吞吐量随人员增加不降反升。他们总结出的角色重写振聋发聩:

Humans steer. Agents execute.人类掌舵,智能体执行。

人类的时间与注意力成了最稀缺的资源。工作重心转向清晰规定环境、让反馈可被agent读取、让架构边界可被机械执行AGENTS.md被压到约百行当目录,细节藏在结构化docs/里;自定义lint把架构不变量写进可执行规则仓库之外的知识对agent不可见

Anthropic的答案则像一场接力赛他们发布Effective harnesses for long-running agents,直面一个致命的工程难题:跨会话失忆每个新会话像换班工程师,对上一班毫无记忆。他们的处方是两段式,Initializer agent第一次会话专门搭环境、写进度文件、展开数百条功能清单;而后Coding agent每个会话只做增量,结束留下干净状态交棒。端到端验收逼着模型像真人一样点浏览器走查,仅有curl通过并不足以验收。

▲ Chelsea Finn转发:harness本身也可以被agent端到端优化

51.2万行TypeScript的真相

2015年,Google研究者Sculley等人发表了一篇被MLOps领域奉为圭臬的论文,配图至今仍在流传:在真实生产机器学习系统中,"模型代码"只是中心一个极小的黑盒,周围环绕着数据采集、验证、服务编排、监控、资源配置等一整圈基础设施那篇文章的核心教训,模型往往是系统里相对容易的部分

今天的agent系统正在以更快的节奏重复同一结构

一个极具冲击力的细节:Claude Code源码外泄时被统计为约51.2万行TypeScript、约1900个文件其中与"直接调用模型"相关的部分只占很小比例,其余全是harness用户在聊天框里看到的"聪明",底下是大量与智能无关、却决定可用性的工程。

这不禁让人想起云计算的历史:当虚拟机规格趋同,竞争往往转移到编排、网络策略、权限与可观测信息结构何其相似,当中心能力商品化,竞争外移到约束、交付与治理层。

别急着下跪:harness也有边界

诚实的读法必须承认:harness的增益取决于具体条件。

Scale AI的SWE-Atlas发现,对部分模型家族而言,harness选择的差异落在误差带内METR等基准显示Claude Code与Codex并不总是稳定压过朴素scaffold。一位实践者在Chelsea Finn帖子下描述了自己的日常:每天跑十几个agent,超过60%的工作量花在harness工程上,prompt只占次要部分

▲ 一线实践者:harness工程占据日常工作的大头

增益强烈依赖任务类型与模型能力区间。 工具密集、长程、依靠外部验证闭环的软件工程,能体现Cline与Composio展示的情况;短问答或模型已极强且任务近乎单步时,换外壳可能几乎不动针

NVIDIA Labs在7月27日发布的NOOA研究预览,则从模型侧接口给出了更激进的答案:把agent写成单个Python类,方法即能力、字段即状态、文档字符串即提示。在SWE-bench Verified上,用同一模型、通用253行agent、无基准特供提示,达到约82.2%,而调用次数与token约为对比harness的一半量级同模型下的分数,成本帕累托,才是新的竞技场。

9.9美元的本质:可替换内核上的不可替换外围

回到9.9美元这个价格

ClinePass把选模型,管密钥,扛限速,适配harness这套脏活累活,打包成一条可订阅的默认路径它的深层假设是市场已然接受的判断:模型是slot,环绕它的loop是产品

当模型可以热切换,可能形成锁定的资产包括:吸收失败模式的轨迹与评测集、绑定企业身份与审计的工具权限模型、订阅与分发渠道、以及被仓库化、可被agent读取的组织知识下一轮开源权重发布,也很难一夜抹平这些积累。

但反面风险同样锋利:harness与某一模型后训练工具格式的过拟合,是"多模型slot"产品必须持续支付的适配税。LangChain文提到,只是改一下apply_patch的工具逻辑就可能导致表现下滑。模型与harness的协同进化,是一场没有终点的军备。

仍开放的问题是残酷的:harness增益何时真的大于换模型?当模型原生规划与自验证变强,哪些外壳部件会被"吸回模型",哪些永远留在外围?谁来自评自优化的harness,防止评测契约被"优化掉"?

一个9.9美元的SKU,撕开的是一场关于AI价值链重心转移的宏大辩论。 下一次有人问你"AI的护城河在哪",请记住那组分数:

同一套权重,57.3%与68.5%之间,隔着的是整整一个工程宇宙。