模型厂商亲自下场,把包裹模型的那层壳开源了。DeepSeek 在2026年8月13日放出 Harness v0.1 开发者预览,用 MIT 协议把模型、工具、循环和界面全部变成可插拔的插件。命令行工具叫 dsh,一条 npx @deepseek-ai/dsh web就能在本地 127.0.0.1:3080 起一个 Web 界面。发布后12到24小时,GitHub 星标突破5万。重点不在多了一个 Agent 工具,而在模型厂商把护城河挖到了运行时这一层。
但最反常识的是,撑起这个本周最热仓库的底座,是一个已经公开四年的小众框架。
内核是四年前的老框架
Harness 的底层是 Cordis,一套 DeepSeek 之外的成熟框架。 这套插件框架在2022年就已经公开,采用 MIT 协议,用 TypeScript 写成,GitHub 星标在 Harness 发布前长期不到2000。它早前支撑过 Koishi 聊天机器人生态,还和北京大学合著过论文,给出了数学层面的基础。
DeepSeek 看中的,是它那套把一切抽象成 service 的机制,框架名气倒在其次。 一个长期冷清的框架,一夜之间成了本周最热仓库的地基。
Harness 里的每一个组件,模型、工具、技能、会话、沙箱、存储、循环、调度、UI,都是 Cordis 的一个 service,通过稳定的 context key 对外暴露。 消费者不直接 import 具体的 provider,只认这个稳定的接口。默认部署下,整套系统带着159个插件启动。
结构上的好处,在于换掉某个能力时不需要 fork 整个项目: 把 filesystem provider 换成远程实现,Bash、PTY、LSP 就一起被推到远程沙箱。单一 provider 的替换,能在全局生效。每一步操作还走 append-only 的事件流日志,事后可以逐步回溯每一行的来龙去脉。
Minimal 模式,其实是一把实验室尺子
Harness 给开发者准备了四种模式。Standard 是完整的编码 Agent,Code 用 TypeScript 组合多步操作,Creator 做运行时检视和预设编写。最容易被误读的,是 Minimal。
它只保留持久化的 bash 和 str_replace_editor,看起来像个极简编辑器。这个模式本身就是 DeepSeek 内部做模型评测的脚手架。DeepSeek 把自己的实验室尺子随产品一起开源,等于把评测口径交到社区手里。 DeepSeek-V4 系列代码 Agent 评测所用的运行时,正是这一套。
DeepSeek 交付的重点是一种度量方式,而不只是一个工具。 把评测脚手架原样放进开发者产品,就是要让社区用同一套标准来跑模型,别各做各的基准。
模型适配器也是插件,连 Claude 都能跑
Harness 的跨模型能力,落地方式同样是插件。provider 目录里内置了 Anthropic、OpenAI、Bedrock、Vertex、Azure,以及走 OAuth 的 Codex。模型适配器本身就是一个插件,想换成 Claude、GPT,或者本地模型,都是换插件的事。
把模型做成可替换的零件,意味着围绕 Harness 搭建的工作流,不会绑定在某一家模型厂商身上。
MIT 协议去掉了法律层面的壁垒,但接口还在剧烈变动,直接上生产的工程成本不低。 真要放到生产环境,先看接口稳定性。README 用大写警告了破坏性变更。开发者预览这个定位本身就在提醒:现在先别把它搬进关键链路。
一夜追平,靠的是开源整层而非单点
把时间线拉到同一刻度,竞争格局就清楚了。 Anthropic 的 Claude Code 仓库有14.1万星(截至发布时),但没有许可证,只放 tracker 和 docs。OpenAI 的 Codex 是 Apache 2.0,用 Rust 写成,累计10.5万星(截至发布时),沉淀了16个月。OpenClaw 作为此前最热的 Agent 项目,花了数月才走到 DeepSeek 一夜之间触碰的数字。
DeepSeek 一天之内追平的量级,靠的是把整层运行时都摊开,而非某一个惊艳的功能。 星标数破5万的同时,仓库的 open issues 数量是零,反馈统一走 GitHub Discussions。一个刚发布的项目没有已积压的缺陷清单,更像在说发布节奏快过了问题暴露的速度。
更巧的是开源的边界。可替换的接口反而成了留住人的地方。代码和运行时全部放出,许可证毫无门槛,开发者把工作流建在上面,迁移成本就悄悄长出来了。
Harness 层是比模型更深的护城河
真正的战略信号在最后这层。模型厂商愿意把让自家产品可被替换的那层开源,这件事本身就值得琢磨。Agent 运行时决定两件事,一是 token 怎么消耗,二是数据归谁所有。把这一层做成开放生态,开发者越往里投入,迁移成本越高。
说到底,开源模型是让对手能复现能力,开源运行时是让对手无法轻易抢走已经沉淀的工作流。 为 V4-Pro 和 V4-Flash 找分发渠道,是另一个平行的动机。模型再强,也得有人把它接进真实的工作流里,Harness 就是那条分发管道。
DeepSeek-V4-Pro-0813 在8月13日 GA,总参数 1.6T,激活 49B,Terminal Bench 2.1 拿到 87.9。8月16日起,计费改为峰谷分时,非高峰时段下调。模型能力和分发入口凑在同一周,这时间点撞得这么齐,不会只是巧合。
回到开头那个判断。当模型厂商开始把运行时摊在桌面上,行业竞争的焦点就从参数和榜单,悄悄转到了谁定义了工作流。 Harness 这步棋,下得比表面看到的要深。
互动与延伸
你会在自己的 Agent 项目里用 Harness 吗?欢迎留言聊聊你的取舍。
夜雨聆风