同一个模型,换个外壳,排行榜名次就能跳一整档,这个事实,终于把整个行业逼到了悬崖边
2026年7月21日深夜,AI工程博主Mark Kretschmann洗完澡,湿着头发敲下一条推文他说:今天所有的AI Agent,本质上是"一个极其聪明的大脑,被关在一个极其愚蠢的笼子里"
这个笼子,行业术语叫harness,你可以把它理解为缰绳、外壳、脚手架它来自模型周围那一整圈人类写死的代码:路由怎么走、工具怎么调、上下文怎么裁剪、失败了重试几次、权限卡在哪一层Claude Code、Codex和Cursor Agent都属于harness
Mark把判断压缩成了一个大胆的提议:
这个笼子本身,也应该是另一个AI。

▲ Mark Kretschmann的"淋浴间灵光",掀起了一场关于AI架构范式的激烈讨论
"聪明的大脑 + 愚蠢的外壳",到底有多荒谬?
先说一个让工程师们集体沉默的事实
OpenAI在2026年2月发了一篇内部实验复盘:五个月,从空仓库起步,所有产品代码、测试、CI、文档,全部由Codex编写,人类一行业务代码都不碰百万行代码量级,小团队以惊人的PR吞吐推进
但文章反复强调,工程师的工作已经完全上移到设计harness:写清意图、组织仓库知识地图、用自定义lint钉死架构约束、搭反馈回路

▲ Anthropic工程团队明确指出:harness设计是前沿Agent性能的关键变量
Anthropic也不藏着。他们的工程文直接写道:从早期的initializer + coding agent两段式,到generator/evaluator的"类GAN"对抗,再扩展为planner–generator–evaluator三agent结构,多次性能跳跃都来自外层harness的改造,模型权重保持不变
Addy Osmani的解剖长文更是用公开数据点捅破了窗户纸:同一个模型,换一套harness,排行榜名次可以跃迁一整个档位

▲ "Coding Agent = 模型 + 你在它周围建造的一切",这个定义正在重塑整个行业的认知
今天的AI助手好不好用,可能只有一半取决于模型本身,另一半取决于那层你根本看不见的外壳代码
三条疯狂的技术路线,已经在"拆笼子"
Mark的想法并不孤立。当他发出那条推文时,至少三支团队已经在用截然不同的方式,把"死外壳"变成"活系统"
路线一:自然语言直接当代码跑。 清华深圳国际研究生院的Pan等人提出了一个叫NLAH(Natural-Language Agent Harness)的框架核心思路极其大胆:既然harness本质上是一套操作规程(SOP),那为什么不直接用自然语言写,然后让一个智能运行时去解释执行?

▲ 清华团队的论文开篇第一句就点明:Agent的表现,被周围的harness强烈塑造
Trajectory联合创始人Ronak Malde在X上转述这篇论文时写道:"一开始觉得脑子转不过来,但一旦理解了就觉得是天才"


▲ "如果由AI自己来运行harness,会发生什么?"
路线二:让Agent自己进化出更好的笼子 斯坦福的Yoonho Lee、Chelsea Finn等人推出Meta-Harness,思路更"套娃",用一个coding agent(比如Claude Code),阅读所有历史harness的源码、分数和执行轨迹,然后提出新的harness代码,在hold-out任务上评估,循环进化

▲ 斯坦福Meta-Harness:横轴是迭代轮次,纵轴是通过率,外壳在"自我进化"
在TerminalBench-2上,自动演化出的harness跑出了约76.4%的pass rate,超越了多个人类精心手工打造的强基线

▲ 论文明确指出:LLM系统性能不仅取决于权重,也取决于决定存取与呈现哪些信息的harness代码
路线三:训练一个小模型当"总指挥"。 NVIDIA推出ToolOrchestra,训练一个仅8B参数的小型编排器,用强化学习在效果、效率和用户偏好之间做权衡,去调度更大的模型与各类工具

▲ NVIDIA的口号简洁有力:Train Small Orchestration Agents to Solve Big Problems
8B参数的"司令"指挥数百B参数的"士兵",成本账已经让这幅科幻画面落进了工程现实
反对的声音:两个黑箱,你信哪个?
也有人对此保持警惕。
评论区里最尖锐的声音来自开发者Burhan:
"蠢外壳有一个好处,它可预测。一旦模型在编排另一个模型,出了bug你就得盯着两个黑箱,猜到底是哪个在骗你。"

▲ 可预测性 vs 智能化,这是整场辩论中最尖锐的张力
另一位回复者Irushi则从另一个角度泼冷水:"靠堆更多LLM调用来提升准确率,本质上不过是用更贵的方式重建规则系统"

▲ 当"AI套AI"退化成另一种if-else,革命就成了笑话
还有人主张继续强化基座模型。模型足够强时,外壳自然可以越做越薄Anthropic也沿着这条路径前进:每当新版模型能内化某种能力,他们就会从Claude Code的harness里删掉对应的规划步骤
Mark的终极答案:递归语言模型
争论还在燃烧时,Mark自己在评论区亮出了底牌
有人追问"那到底怎么实现",他回了六个字:"Recursive Language Models are the answer."

▲ 作者点名了一个来自Zhang、Kraska、Khattab等人的激进方案
这指向一篇2025年底的论文(arXiv:2512.24601):让模型把超长提示当作外部环境,以编程方式检查、切片,并递归调用自身处理片段模型由此可以自己决定怎么"吃"上下文
如果这个范式成真,harness中最头疼的问题之一,上下文管理,就会被模型自身吸收外壳随之变薄,其中一部分甚至会消失进模型里
分歧落在策略决策权上
连Grok都下场做了总结:Meta-Harness在搜索更好的代码外壳,NVIDIA在训练专用编排器,LangGraph和CrewAI在向模型驱动路由迁移混合路线,学得动的编排 + 钉得死的安全边界,是当前共识最大公约数

▲ 连AI自己都在给这场辩论做文献综述了


▲ LangChain Labs的Viv列出八条"强观点":评测是护城河,通用harness本质是权衡
共识之下仍有一条断裂带。大家都认可harness的必要性,却无法在最高层策略权的归属上达成一致:
最高层的策略决策权,到底放在人的手里、代码的逻辑里,还是模型的推理里?
从BPM工作流引擎到Kubernetes控制面,从服务网格到特征开关平台,软件史上每一次"把变化的决策从业务逻辑里抽出来",都伴随着巨大的生产力释放和同样巨大的可观测性焦虑
AI Agent的harness,就是这个时代的控制面
而Mark的淋浴间灵光,不过是把所有人已经闻到但还没说出口的那句话,大声喊了出来:
笼子本身,也该有智慧。
剩下的问题只有一个,当笼子也变成黑箱,谁来看守看守者?
夜雨聆风