乐于分享
好东西不私藏

万物皆插件:DeepSeek 开源 Harness,把 Claude Code 和 Codex 变成了可调用的「零件」

万物皆插件:DeepSeek 开源 Harness,把 Claude Code 和 Codex 变成了可调用的「零件」

📍 泰姬陵 · 印度 — 白色大理石写就的永恒爱情诗

大家都盯着模型跑分、比参数的时候,DeepSeek 干了件更狠的事。

8 月 13 日,DeepSeek 一口气放出两样东西:一个是主打智能体的旗舰模型 V4-Pro,另一个是很多人没太当回事、但可能影响更深远的——DeepSeek Harness v0.1,一个 MIT 协议、完全开源的智能体框架(GitHub 上现在就能下)。

先说个反直觉的事实:同一个模型,配一套好的 harness 和一套差的 harness,在真实编程任务上的差距,可能比你换一代模型还大。这不是修辞,是很多一线开发者的共识。有测试者用它搭了个实时追踪国际空间站的小应用,两轮对话、35 分钟、烧掉大约 2000 万 token,跑到最后缓存命中率 100%。这些以前藏在黑箱里的数字,Harness 直接摊在你眼前。

问题来了:模型我们都熟,可这个「harness」到底是什么?为什么 DeepSeek 要把它开源,还专门做成「什么都能拆」的样子?为什么它能把 Claude Code、Codex 这些竞品反过来当「零件」使唤?这篇我们就掰开揉碎讲清楚。

先搞懂:harness 到底是什么?

「harness」这个词,本意是套在马身上的挽具——缰绳、马鞍、嚼子那一整套。马是动力,但没有挽具,你没法让它往你要去的方向跑。汽车里也有个词叫 wiring harness(线束),是把发动机和全车电器连起来的那套线路。

放到 AI 里,这个比喻精准得吓人。业界现在有个很干净的心智模型:

模型(比如 V4-Flash、Claude Opus、GPT-5.6)是大脑——一堆预测下一个 token 的权重。Harness 是除了大脑以外的所有东西:工具的定义、对文件系统和 shell 的访问、记忆与上下文管理、子智能体的调度、循环控制,以及最关键的一点——什么时候该停下来

换句话说,模型负责「想」,harness 负责「把想法变成动作」。一个模型再聪明,如果不能读文件、不能跑命令、不知道任务做完了没、不知道该不该找你确认——它就只是个会聊天的自动补全,成不了能干活的 Agent。

这里面最难、也最容易被忽略的,恰恰是那句「什么时候该停下来」。你可以把 Agent 的工作想象成一个循环:模型输出一步→ harness 去执行(读文件/跑命令/搜索)→ 把结果塞回给模型→ 模型再决定下一步……如此循环。听起来简单,但魔鬼全在细节里:每一轮都要把之前的上下文重新喲给模型,上下文会越滞越长;什么时候该把早期的内容压缩掉、什么时候该停下来问人、什么时候该判定「任务完成」而不是无限空转——这些判断全部是 harness 的活。同一个模型,上下文管理做得好不好、循环何时终止判得准不准,直接决定了它是「能把一个需求从头做到尾」还是「跑两步就迷路。」这也是为什么我说,换一套好 而 harness 的差距,可能比换一代模型还大。

💬 大白话版:模型是引擎,harness 是整台车。变速箱、方向盘、刹车、导航、安全气囊——这些才决定你能不能安全开到目的地。以前大家买车只看引擎马力(模型跑分),DeepSeek 现在把整台车的图纸开源了,还告诉你:每个零件都能拆下来换。

这就是为什么 Harness 值得单独写一篇。过去一年,AI 编程工具的竞争,早就从「模型多聪明」悄悄挪到了「围着模型的这套系统做得多好」——Anthropic 的 Claude Code、OpenAI 的 Codex,卖的其实主要是 harness。你付费订阅的,不是那个模型(模型谁都能调),而是那套把模型包裹起来、让它能真正接管你代码仓的工程。而 DeepSeek 这次,把这一层直接掀了桌子。

「万物皆插件」:Cordis 与可组合架构

DeepSeek 给 Harness(命令行里叫 dsh)定的核心哲学只有一句话:Everything is a plugin(万物皆插件)

这句话不是口号。它建立在一个叫 Cordis 的框架之上——一个专门为「可组合插件」设计的运行时。在传统的编程 Agent 里,工具、循环、权限这些都是厂商焊死在产品里的固定部件,你只能用、不能改。Harness 反过来:模型、工具、技能、会话、沙箱、文件系统、循环、编排、用户界面——全部都是可以插拔、替换、扩展的插件。

🌰 举个栗子:在 Claude Code 里,「Agent 每跑一轮要不要停下来问你」这套逻辑是固定的,你改不了。在 Harness 里,这个「循环控制」本身就是一个插件——你嫌它太啰嗦,可以换一个;你想让它在特定条件下自动停,可以自己写一个塞进去。连「Agent 主循环」这种最核心的东西,都是零件。

DeepSeek 把这套思路追溯到自己的一篇论文,讲的是所谓「时空可组合性的编程范式」——听着玄,说白了就是:别把 Agent 的能力做成一根焊死的流水线,做成一堆可以自由拼装的乐高。 这套哲学背后是个很现实的赌注:没人知道一年后最好用的工具、模型、循环策略长什么样,那不如把每一块都做成可替换的,让未来自己去填。

这带来一个很实际的好处:配置全在一个 YAML 文件里。你想加个新的模型提供商、想让它指向本地部署的模型、想开关某个工具、想把权限从「只读」调到「危险操作全部放行」——改配置就行,不用碰源码。启动也简单,一条 npx @deepseek-ai/dsh web 就能在本地拉起一个网页界面。

那这套插件到底能拆成哪几类?落到实处,大致是四层:

工具(Tools):shell 访问、文件编辑、网页搜索这些,都是一个个可单独开关的插件,而不是焊死的能力。你想给它加个连公司内部数据库的工具?写个插件插上去。

模式(Modes):前面说的 Standard / Code / Minimal / Creator,本质上就是不同插件的不同组合。

模型(Models):有 DeepSeek API key 时,Flash 和 Pro 可以在一个会话里随时切,每个模型的推理强度(reasoning effort)还能单独调。

提供商(Providers):因为是 MIT 开源,你可以接入 DeepSeek 以外的任何提供商,甚至把箭头指向你本地跑的开源模型。

这种设计的真正价值,不在于「极客玩具」四个字。对企业而言,它意味着你不再被某一家厂商的工作流绑死:数据敏感的片段用本地模型跑,对成本敏感的批量任务用便宜模型跑,对质量要求高的关键环节再换最强的模型——同一套 harness,全部搬定。对个人开发者而言,它意味着你终于能把商业编程 Agent 的黑盒掉头看个仔细,甚至把它拆开重新拼成你自己的样子。

它到底能干什么?

别被「插件框架」这个词吓到,以为它只是个空壳子。Harness 开箱就是一个完整的编程 Agent。

它默认能做这些事:读懂整个代码仓库、编辑文件、执行 shell 命令、搜索本地文件和网页、维护任务计划、调用技能(skills)、把活儿拆给子智能体、并且强制执行审批策略。 这些正是把 Claude Code、Codex 从「自动补全」拉升到「能自主干活的 Agent」的那几样核心能力,一个不少。

Harness 内置了几种工作模式,对应不同的胆子大小:

Standard(标准模式):满血编程 Agent,文件编辑、shell、搜索、规划、子智能体、工作流全都有;本地网页界面里你可以选工作目录、对敏感操作逐一点头确认。

Code(精简模式):更轻量,砍掉一些花哨功能,专注写代码。

Minimal(最小模式):只留一个带持久化 bash 和 str_replace_editor 的两工具 Agent,极简。

Creator(创作者模式):给你留了个后门——在标准能力之上,加了运行时检查、插件实验、以及自定义 Agent 预设的能力。想自己攒一个专属 Agent,从这儿进。

这四个模式不是四套独立的产品,而是同一套插件在不同开关下的不同面貌。你完全可以从 Minimal 起步,边用边把需要的工具一个个加回来,最后长成一个只属于你的定制 Agent——这种「从最小可用开始逐步搭建」的自由度,恰恰是闭源产品给不了的。

权限也是连续可调的:从「只读」一路开到 dangerous-skip-permissions(危险操作全部放行)——熟悉 Claude Code 的人会觉得亲切,因为思路几乎一样。

更有意思的是它的透明度。大多数 Agent 工具把成本和性能藏得死死的,你只知道「它在转圈」。Harness 的界面直接把这些实时数字甩在你脸上:每秒多少 token、缓存命中率多少、跑到第几轮、已经花了多长时间。

还记得开头那个国际空间站追踪器吗?两轮、35 分钟、2000 万 token、最后缓存命中率 100%——正是因为这套仪表盘全程可见,你才能一眼看出:长任务的成本,绝大部分不是花在「想」上,而是花在反复读取上下文上。 谁能把缓存命中率做到 100%,谁的 Agent 就便宜。这也解释了为什么 DeepSeek 拼命压低推理成本——对高频调用的 Agent 来说,这才是真正的护城河。

跟 Claude Code、Codex 比,到底差在哪儿?

光说「能干活」还不够,得看和已经成名的两大编程 Agent 摆在一起是什么位置。直接上表:

维度DeepSeek HarnessClaude CodeOpenAI Codex
读写/测试代码仓
Shell 与开发工具
规划与子智能体
权限/沙箱可通过插件配置成熟的内置体系细粒度沙箱与审批
主要界面本地网页 UI + 无头命令 + Python SDK终端/VS Code/JetBrains/桌面/浏览器/手机/SlackCLI/IDE/桌面/云端
托管后台 Agent未提供
GitHub 原生 PR 工作流未提供
模型选择DeepSeek/Anthropic/OpenAI/自定义主要 Claude(含 Bedrock 等)主要 OpenAI
可扩展性极高:几乎每个部件都可替换强:技能/钩子/MCP强:插件/MCP

看表就明白了:Harness 在核心编程能力上已经追平,但在产品化的周边(多端界面、托管后台、GitHub 深度集成)还明显落后。但它换来了一个别人都没有的东西:极致的可扩展性——几乎每个部件都能拆。这是开源 + 插件化架构天然的红利。

至于配套的模型本身,V4 系列的数据也硬。以主打智能体推理的 V4-Flash 0731 版为例,在多个真实工程基准上提升惊人:Cybergym 提升 38.0 分,DSBench-Hard 提升 33.8 分,DSBench-FullStack 提升 31.7 分。 这些基准考的不是聊天,而是多步骤的真实开发与安全任务——也就是 Agent 真正干活的场景。难怪有人说,V4-Flash 不像个普通的「快模型」,更像编程 Agent 的默认首选:便宜、长上下文、对工具友好。有意思的是,不少早期上手的开发者反而更偏爱 Flash 而不是 Pro,因为在编程任务上它的性价比更好——尽管 Pro 在纯能力上是个实打实的大台阶。

一个容易被忽略的胜负手:缓存命中率

回到开头那个国际空间站追踪器的例子,有个数字值得单拎出来说:跑到最后,缓存命中率是 100%。为什么这个数字重要?

前面说过,Agent 是个循环:每转一圈,都要把之前所有的对话历史、读过的文件、跑过的命令结果,重新喲给模型看一遍。一个长任务跑下来,这部分重复的上下文可能占到总 token 消耗的大半。如果每次都重新计算,那就是在为同一段内容反复付钱。

提示缓存(prompt caching) 干的就是这件事:把上一轮已经算过的上下文缓存下来,下一轮直接复用,只为新增的那一小段付费。命中率越高,长任务的成本就压得越低。命中率能做到 100%,意味着到任务后期,重复那部分几乎不再产生新的贵价 token 开销。

这也解释了一件很多人没想明白的事:为什么 DeepSeek 敢拼命把推理成本压到地板。对高频调用、长上下文的 Agent 工作负载来说,单次对话便宜不便宜是一回事,整个任务跑下来累积花多少才是真成本。而这正是 harness 的主战场:上下文管理、缓存策略、何时压缩早期历史——这些都不是模型的事,是 harness 的事。把 harness 开源 + 把缓存做到极致,两手一握,DeepSeek 就把「便宜的长任务 Agent」这个故事讲圆了。

最狠的一招:模型无关,还能把 Claude Code 当小弟

如果说前面都是「做得不错的开源 Claude Code 平替」,那下面这一点,才是 Harness 真正的杀招。

它跟 DeepSeek 的模型没有任何绑定关系。

翻开它的提供商目录:Anthropic、OpenAI、AWS Bedrock、微软 Azure、谷歌的 Gemini 企业级平台,当然还有 DeepSeek 自己的接口——你甚至可以接任意兼容 OpenAI 格式的自定义网关。名字叫 DeepSeek Harness,骨子里却是个谁的模型都能跑的通用运行时。

更绝的是:它明确支持把 Claude Code 和 Codex 当作子智能体来调用。

品一下这句话的分量。这意味着你可以搭一条多智能体流水线:让 DeepSeek Harness 做总指挥(负责编排、拆任务),然后把每个子任务派给最合适的那个——某一步用自家的 V4-Flash(便宜),某一步甩给 Codex,某一步交给 Claude Code。Harness 不再是 Claude Code 的竞争对手,而是坐在它头上的那一层。

💬 大白话版:以前 Claude Code 和 Codex 是各自为战的「全能选手」,你只能二选一。现在 DeepSeek 说:你们俩都别争了,都来我手下当专家,我来当项目经理,谁擅长什么我派谁上。

有个耐人寻味的细节:早期测试者说,Harness 的交互界面和风格「像极了 Codex」。坊间甚至有说法,DeepSeek 编程工具的不少提交和 PR,是从一个 Codex 的工作树里长出来的。真假难辨,但这种「你中有我」的气质,恰恰是开源时代的常态。

DeepSeek 这步棋的深意

把这两件事连起来看,DeepSeek 的算盘就清楚了。

第一,它在给 harness 层「祛魅」。 Claude Code 和 Codex 之所以值钱,很大程度上是因为围着模型的这套系统是闭源的、有护城河的。DeepSeek 用一个 MIT 协议的开源框架,等于对全行业喊话:这一层,不该收智商税,拿去随便用。当 harness 变成人人可得的公共品,竞争就被迫重新回到模型本身和推理成本上——而这两样,恰好是 DeepSeek 的主场。

更长远地看,「万物皆插件」 + MIT 开源还埋了一笔:它有机会长出一个插件生态。想想 VS Code——微软当年能赢,不是因为编辑器本身多强,而是因为它把扩展能力开放给了社区,最后长出了几万个插件。Harness 把 tools、modes、providers 都做成插件,就是在下同一盘棋:如果社区愿意围着它写插件,那么真正的护城河就不再是某个具体功能,而是生态本身。当然,这只是可能性——能不能成,要看有多少开发者真愿意下场。

第二,一个反直觉的定价悖论。 就在开源 Harness 的同时,DeepSeek 却在给 V4 的 API 涨价:从 8 月 16 日起放弃原来的统一定价,改成高峰/低谷分时计价,连打了折的低谷价都比现在贵不少。一边免费送框架,一边给模型涨价——看似矛盾,其实是同一个逻辑:把框架做成免费的「毛」,把模型调用做成计费的「皮」。 框架用得越爽,模型调得越多,钱自然从 token 里赚回来。

第三,也得泼盆冷水。 Harness 目前是 v0.1 开发者预览版,官方仓库白纸黑字写着「THERE WILL BE COMPATIBILITY-BREAKING CHANGES(一定会有破坏性变更)」。它还没有 Claude Code 那样成熟的托管后台 Agent、GitHub 原生的 PR 工作流,也不是能直接塞进生产环境的稳定平台,多端的 IDE、桌面、手机体验也还没跟上。对企业来说,现在是「值得玩、值得学」,还没到「可以押注」的阶段。换句话说,把它当成一面镜子去照、去学习一个顶级 Agent 到底怎么搭,价值可能比直接拿去用还大。

但方向已经很清楚了。当模型能力逐渐拉平,真正决定 Agent 好不好用的,是围着它的那套系统——是 harness。DeepSeek 把这台「车」的图纸摊开在所有人面前,还告诉你每个零件都能换。

下一次你再看到某个模型的编程跑分创了新高,不妨多问一句:这分数,有多少是模型本身的功劳,又有多少是那套你看不见的 harness 撑起来的? 想清楚这个问题的人,才算真正看懂了这一轮 Agent 竞赛的下半场。

对普通开发者来说,现在最值得做的,不是急着把它搬进生产,而是拉下来跑一遍,看看一个真正的编程 Agent 内部到底是怎么运转的——循环怎么转、上下文怎么管、权限怎么卡。看懂了 harness,你才能看懂手里那些收费工具到底在为什么收费;也才能判断,哪一天你真需要自己搭一套时,该从哪里下手。

模型的军备竞赛远未结束,但真正决定你手里那个 AI 好不好用的,已经您您地移到了那层很多人看不见的 harness 上。以前这一层是少数厂商的私房菜,现在 DeepSeek 把图纸摊开了,接下来就看谁能拼出最好的那台车。

📚 扩展阅读

实习生打草稿,老板只盖章:DeepSeek 新作 DSpark,把大模型推理榨快 85% 的两记狠招

强化学习的第三次春天:从 AlphaGo 到 DeepSeek-R1,那个一直没站 C 位的引擎

MoE 路由算法演进:从 Switch 到 DeepSeek-V4,那个决定一切的「分诊护士」是怎么炼成的?

长上下文工程:窗口冲到千万 Token,工程师到底在跟什么死磕?

Claude Opus 4.8 深度拆解:AI 史上最大数学跨越,竟靠「承认不确定」实现

AI 视频生成 2026:从 Sora 到 Veo 3,AI 是怎么学会「脑补」一个会动的世界的?