上一篇我说 Agent 竞争争的是控制面。现在我改了主意:控制面只是中间站。真正的问题是,谁在为模型建实验室。
上一篇文章,我把 DeepSeek Harness 官方 0.1.0-rc.5 固定到 commit 47f943859b,完整拉进工作区,装依赖、跑测试、拆 Host / Client / Web 和核心包,最后给了一个判断:Claude Code 赢在产品,DSH 赢在底座,下一场竞争争的是控制面——会话真源、权限边界、异构执行。
那个判断我依然认。但它不完整。
因为我一直在用工程师的视角问一个问题:这套可拔插的底座,让我这个搭 Agent 的人多了什么能力?
上周六听完小马智行 CTO 楼天成的一场分享,我发现这个问题问反了。
Everything is a Plugin 最大的受益者,从来不是我。
一、我们把「可拔插」读成了工具箱
先回顾 DSH 拔到了什么程度。
它的 Cordis 不是插件市场,是一棵运行时插件树。Agent Loop、LLM Adapter、Session Store、Tool Registry、System Prompt、Sandbox、Approval、Compaction、Subagent Provider、Web UI,全部可加载、可替换、可卸载。连 Agent Loop 都不是特权内核。 默认循环刻意做得很薄,只干五件事:领输入、组请求、调模型、执行工具、判断继续还是结束。能力还被切成三层——能力定义、能力实现、工具消费者,把本地执行换成远端沙箱只需换 Provider。
主流解读是:工程师终于能按需组装自己的 Harness 了。
这个解读没错,但停在了工具箱层面。工具箱的隐含前提是「有个人拿着它去装东西」。 而 DSH 最有意思的地方,恰恰是它把「装东西的人」这个角色也一起解构了。
一棵插件树 + 一层能力 seam + 一条可回放的事件日志凑在一起,意味着这套系统的形态可以在运行时被改写,而且每次改写都留下完整证据。 谁改写不重要。人可以改,模型也可以改。
我用它跑自己的工作流后反应过来:我加的每个插件、每条权限规则、每个自定义工具,本质上都是我在用手工方式替模型完成一次「工序选择」。
那为什么这件事要我来做?
二、read 的天花板,是人类认知的总和
楼天成的核心观点,大意是:AI 现在的能力来自 read——读已有资料、代码、信息,从人类既有知识里习得。往后会转向 practice——与环境持续互动,自己做实验、拿反馈、总结规律,更接近人类探求自然界的科学过程。
他举了围棋。这个例子我回来把代号对了一遍:
2016 年 AlphaGo 打败李世石 4:1,李世石还赢了一局,因为那一代的能力起点是人类棋谱,本质是 read。2017 年 10 月的 AlphaGo Zero 完全不看棋谱,从随机权重纯自我博弈,对战赢下李世石的那个版本(AlphaGo Lee)是 100:0;后来更通用的 AlphaZero 对 AlphaGo Zero 是 60:40。
比分不是重点。重点是柯洁等一批职业棋手反复复盘、反设之后确认的那件事:它下出了人类千年棋史里从未出现过的定式。
这句话值得停一下。read 能到的最高处,是人类已有认知的总和。哪怕把互联网所有文本、代码、论文榨干,天花板还在那儿,因为那些东西全是人写的。practice 没有这个天花板——它的上限由环境丰富度和反馈信号质量决定,跟人类知道多少无关。
三、这两条线是同一件事的两个投影
DeepSeek 用工程范式表达它,楼天成用能力范式表达它。放在一起看,说的是同一句话:AI 未来必然是自进化的。
顺着这个共识回头看 DSH,很多细节的动机就变了。
事件溯源那条「模型可见,当且仅当已经记录」,我上一篇是从企业合规角度理解的——出错要能重建现场。但如果模型要自己做实验,可回放的完整现场就不是审计需求,是训练信号。 一次失败,日志里存着当时的 Prompt、工具 Schema、策略、上下文和历史,这套东西合起来才叫实验记录。没有它,practice 只是瞎撞。
崩溃恢复时写 TOOL_OUTCOME_UNKNOWN 而不擅自假定成功失败,同理。实验的诚实性比结果的完整性重要。 一个会为填满日志而猜结果的系统,产不出可靠规律。
followup / steer / inject 三种输入语义,我一开始觉得是过度设计。现在看它是把外部反馈做了分类:哪些该唤醒模型重新规划,哪些只补充上下文不打断推理。这是给反馈通道分层。
所以 Harness 这个词该重新定义:它不是人类搭 Agent 的脚手架,而是支持大模型自进化的技术框架——一个让模型自己选工序、自己组工具、自己生成插件的容器。
这条路走通后的产物不是「一个会写代码的 Agent」,而是你身边那个用了两年、知道你所有习惯和忌讳的个人化 AI 员工。工程师长出来的插件树,和财务、运营、法务长出来的,会完全不一样。这才是插件化的意义:它不预设岗位。
四、一个做机器人的人才会给的冷判断
practice 要成立需要两个东西:能互动的环境,和能拿到的反馈信号。 这两件事在虚拟世界和物理世界的成本,差好几个数量级。
代码的 practice 有多便宜?一次实验是一次进程启动,反馈是编译报错、测试红绿、diff 是否被接受。成本近乎为零,可并行上万次,失败没代价,回滚一条命令。
我做了十年机器人,太清楚另一边什么样。创业时,搭具身实验室做「烤面包」那个 demo 时——语义地图导航 → 开冰箱 → 取面包 → 放空气炸锅 → 烤好放盘子——最终做到 90% 以上成功率。那 10% 的失败每一次都是真实物理代价:面包掉地上,夹爪打滑。一次实验分钟级,反馈信号要人标,硬件会磨损,采数据要付人力。
所以我的冷判断是:编码 Agent 先跑出来,不是因为写代码更简单,而是因为写代码的 practice 成本足够低,低到能支撑自进化所需的实验次数。
具身智能卡在爬坡期,卡的不是模型能力,是实验成本。仿真能补一部分,但 sim-to-real 那道缝还在,我们自研 GROS 就是想把仿真的性能和真实度往上顶。
反过来说,如果 practice 是唯一出口,具身智能真正的胜负手就不在 VLA 参数量上,而在谁能把物理世界的实验成本打下一个数量级。这跟我在扫地机行业十年反复验证的那件事一样:极致成本不等于减配,是用更聪明的架构拿同样的结果。
一个可以在 2027 年 12 月 31 日打脸我的预测
到 2027-12-31 之前,至少一款主流 Agent Harness 会把「模型自主注册插件/工具」做成一等能力——不是靠 prompt 让模型写段代码再由人去装,而是模型能在运行时提交插件、进入受控审批、通过后立即生效,且这个动作在事件日志里留下和 tool/call 同级的正式坐标。
如果到那天所有主流 Harness 的插件注册依然只有人类入口,那这篇就是错的:插件化确实只是给工程师的工具箱,我把它想大了。
最后,接住两个最常见的反驳
「模型自己装插件,安全怎么办?」 这恰好是 DSH 已经打好地基的地方。单调 Guard 保证前面策略拒绝后,后面插件只能继续拒绝或沉默,不能把 deny 翻成 allow;权限审批在工具流水线里是独立一段;Scope 让子 Agent 只看见该看见的工具和 Credential。模型自主注册的前提是这套约束已在协议层生效——不是加个开关,这套底座本来就是为「不可信的调用方」设计的。
「这不就是 AutoML 的老故事?」 不一样。那些是在固定框架内调参数,上限被框架锁死。这里说的是框架形态本身可被改写:能力实现能换,Agent Loop 能换,工具集能长出来。形态搜索没有那把锁。
夜雨聆风