
8 月 13 日晚,DeepSeek 一口气放了三个消息:V4-Pro 正式版上线,API 全面调价,还有最受关注的 DeepSeek Harness(DSH)开发者预览版 v0.1,同步以 MIT 协议开源。前两件事更像是铺垫,Harness 才是这次真正值得拆开看的东西。这家靠“极致性价比模型”出名的公司,过去几乎不碰应用层,现在第一次把手伸到了模型输出之后的执行层。
它是什么:不是新模型,是给模型装上的「身体」
先厘清一个容易混淆的点:DeepSeek Harness 不是新的 DeepSeek 模型,也不是单纯的 API 客户端。官方给的公式是 Model + Harness = Agent。模型是大脑,负责思考和推理;Harness 是身体,负责把模型接进文件系统、终端、网页、代码工具和其他 Agent,组织上下文,执行工具调用,调度子任务,管理长任务。
“Harness” 原意是马具、线束,作用是把力量接到能工作的机构上,同时不让这股力量脱缰。DeepSeek 的用法一致:它是一套 Agent 运行框架,既是 SDK 也是应用,默认连 DeepSeek 模型,也方便接其他模型。模型可以读项目、改文件、跑命令、定计划、分配子 Agent,再通过 Web UI、TUI、Headless、ACP、JSON-RPC 或 Python SDK 这些形态,跟人或自动化流程打交道。
上手门槛不高。装好 Node.js,一行 npx @deepseek-ai/dsh web 就能在本地把 Web UI 拉起来,默认地址是 http://127.0.0.1:3080。
这件事其实早有预兆。7 月 31 日 V4-Flash 正式版发布时,更新日志里夹着一行容易被忽略的话:公开 Code Agent benchmark 用的是“即将发布的 DeepSeek Harness 极简模式”作测试框架。在正式亮相之前,Harness 已经在参与 DeepSeek 对自家模型的 Agent 能力评估。
亮点与架构:一切皆插件,连 Agent Loop 都能换
1. 一切皆插件
DSH 最醒目的主张是 Everything is a plugin。模型适配器、工具注册、会话、沙箱、存储、调度,甚至 Agent Loop 本身,也就是决定 Agent 怎么循环、怎么重试、怎么调度子 Agent 的那套机制,都被设计成可替换的插件。开发者不用改源码,在配置层就能选、换、扩任何一项能力。
底座是 Cordis 插件系统,设计源头是北京大学与 DeepSeek 联合署名的一篇论文《A Programming Paradigm for Spatiotemporal Composability》。运行中的 DSH 本质上是一个 Cordis Context,不同包往里注册服务、事件和能力,最后由 cordis.yml 配置组合成一套能跑的 Agent。仓库是 pnpm monorepo,200 多个 npm 包,内置 100 多个插件,主力语言 TypeScript,另有 Python 和 Rust。
机器之心打了个比方:普通的 Agent 项目像一台装好的电脑,DSH 更像一块尺寸惊人的洞洞板,模型、工具、界面、存储、安全策略、上下文管理,都能插上去,也都能拔下来重新排。

2. 四种 Agent 预设
DSH 内置四种运行模式,对应不同的工具和能力组合。
run_code 里编排多步操作,省掉模型和工具之间反复往返的开销。这套预设是“一切皆插件”最直观的产品化表达。同一套宿主、同一个 Web UI,可以从双工具的极简 Agent 切到能编排子 Agent 的标准模式,再进一步变成能改装自身的创造模式。爱范儿实测时就用创造模式让 Agent 自己建了一个官方没有的「写作工作台」预设。
3. 可重建的会话日志:模型所见皆可回放
DSH 设计了仅追加(append-only)的 Session Log。凡是模型真正看到的内容,系统提示词、思维链、工具调用与结果、上下文压缩事件、权限切换、取消原因,都必须能从日志里重建。恢复、分叉、检索、回放、审计共用同一份事件流,界面不是各自维护一份“差不多正确”的状态,而是从同一个权威事件源派生。
这套设计的价值比“日志”两个字大得多。任务出错时,我们能确切知道模型当时看到了什么。更关键的是,它让“同一个模型在不同 Harness 下表现不同”这件事变得可测量、可复现。锁定工具、沙箱、循环策略,只换模型插件,跑同一份会话,对比轨迹。这正是 Agent 评测走向工程化的基础。
4. 把安全当成系统约束
编程 Agent 一旦拿到文件系统和 Shell 权限,就能改代码、装依赖、起进程。DSH 默认用 workspace-write 模式,把命令执行和文件修改限制在工作区和允许的临时目录里,遇到要扩大权限的操作再走 ask 审批;更宽松的 danger-full-access 模式必须由部署方自己显式选择。工具调用要过前置策略、单调安全守卫、执行包装和后置处理,被守卫拒绝的操作,后续插件不能重新放行。更重要的是“失败关闭”(fail-closed)原则:系统无法确认隔离生效时宁可拒绝执行,也不会悄悄退化成无保护运行。文件系统、Bash、子进程共用同一套沙箱策略(内置基于 Linux Landlock 的 landlock-run),避免“命令受限、文件工具却能绕过”这种割裂。权限切换、审批请求、执行结果都会进 Session Log,事后审计有据可查。
5. 多形态入口与多 Agent 协作
同一套 Harness 能组装出完全不同的产品。DeepSeek LLM 适配器加文件系统、Bash、TUI,就是终端里的编程 Agent;把交互界面换成 Web 插件,就是浏览器应用;Headless 入口接任务、跑完、输出结果后退出去;ACP、JSON-RPC、Python SDK 则让 Harness 变成别的程序能驱动的自动化服务。
它也内置了子 Agent 和工作流。主 Agent 可以把任务拆给多个子 Agent,负责搜索的、改代码的、跑测试的,每个子 Agent 有独立的上下文层和工具权限,注册在 Agent 作用域里的能力随生命周期自动清理,不用靠全局命名约定维持隔离。再进一步,DSH 提供了自指 Cordis 工具,模型可以检查当前运行时的插件树,动态挂载、卸载临时插件,也就是自己写一个插件、自己装上。不少观察者认为这是“AI 自进化”目前最可落地的实现之一;官方也明确它只在创造模式下开放,属于高信任场景。
为什么这么设计:一场从模型到执行层的竞争升维
1. 模型趋同之后,Harness 决定体验
过去两年 AI 竞争围绕模型参数和 benchmark 展开。等模型能力趋于同质,同一个模型放进不同 Agent 系统,最终表现可能差出很多,社区引述的数据说能差 53 个百分点(未经交叉核验)。OpenAI 自己就用 harness 这个词描述 Codex 里组织模型、工具和用户交互的那一层。谁控制执行层,谁就控制了模型能力怎么变成真实产出。DeepSeek 下场做 Harness,等于把竞争从“卖大脑”推进到“卖能干活的完整系统”。
2. 性价比叙事的延续:便宜模型打出豪华战绩
DeepSeek 的护城河一直是极致性价比,而 Agent 恰恰是 token 消耗大户,一次长任务往往几十上百次工具调用。只要 Harness 足够可靠,让中等强度模型以极低价格完成大部分标准化任务,“便宜模型加好 Harness”就成了一种组合优势。机器之心的实测,用 V4-Flash 在 30 多分钟里做出一款能玩的 3D 丧尸射击游戏,3 个 turn、127 步、5 个并行子 Agent;爱范儿的对照实验,同一 V4-Flash 在 DSH、Reasonix、Codex 里完成同一个 Three.js 滑沙游戏,交付质量肉眼可见地不同。两个例子都在说明,Harness 本身就能显著改变最终产物。
同一天 DeepSeek 还宣布 API 采用峰谷定价,V4-Pro 峰值时段的输出价格比此前涨了约 350%,最低涨幅也有 50%。Agent 场景把 token 消耗放大了好几个量级,更聪明的模型配上更强的执行层,撑起了更高的定价。这也是它从“烧钱换份额”转向“能力兑现价值”的信号。
3. 开源与「安卓时刻」:用开放对抗闭源生态
DSH 用 MIT 协议开源,和 Anthropic、OpenAI 相对封闭的 Coding Agent 生态放在一起,是一次明确的站位。社区里传播最广的比喻是「Agent 时代的安卓」:任何人遇到 Bug 或想要新功能,都可以动手实现再开源,其他人像装《我的世界》模组一样装插件,围绕模型适配、记忆、UI、工作流、沙箱,插件生态慢慢长起来。OpenClaw 俱乐部把这件事叫作「AI 的安卓时刻」:DeepSeek 押的是“全球开发者共同定义的开放生态”,而不是“闭源巨头定义的 iPhone 式黑盒”。
4. 用执行轨迹反哺模型:Harness 是数据飞轮
DeepSeek Harness 团队独立于模型团队运营,单独注册公众号,以独立业务形态推进,生态合作的灵活性更强。对一家模型公司来说,Harness 还有一重别人不一定看得见的价值:它能拿到高质量的执行轨迹数据,也就是模型在真实任务里怎么规划、怎么调工具、在哪里失败。这些轨迹反过来正是训练和评测 Agent 能力最好的语料。Session Log 那句“模型所见皆可重建”,从模型工程的角度看,就是让 Agent 的执行过程变得可以系统化记录和分析。X 上王小丑把这总结得很到位:谁先把 Harness 做好,谁就掌握了从能聊天到能交付的完整闭环,也能拿到高质量的执行轨迹数据,反过来继续喂模型。
5. 崔添翼与量化工程基因
项目负责人崔添翼是 90 后,浙大计算机系毕业,在华尔街量化机构 Jane Street 干了 9 年,2026 年 3 月加入 DeepSeek,5 月 Harness 团队立项。量化交易对低延迟、数据一致性、异常自动恢复的要求,恰好映射到 Agent 工程的痛点:长任务可靠执行、失败恢复、可回放可审计。媒体评价他是“DeepSeek 工程化能力的重要补强”,也有人保留意见,量化背景能不能在 AI 应用层复制交易系统的成功,还得看实际结果。
用户的反应:狂热与冷静并存
发布当晚 GitHub 仓库半小时破万星,一天内涨到数万星,围观热情可见一斑。但中文 AI 圈的声音并不一边倒。
看好的一派,核心论点是竞争维度变了。王小丑在 X 上把 Harness 叫作 DeepSeek 的下一个杀手锏:模型是大脑,Harness 是让大脑真正动手干活的整套系统。他还引用梁文锋在投资人会议上的表态,说现阶段最重要的还是 Coding Agent,最合理的做法是全力做通用的 Agent。在他看来,DeepSeek 从“卖大脑”转向“卖能干活的完整系统”,做成了,意义远不止一个新产品,而是整个竞争维度的切换。
冷静的一派,指向产品和生态的现实。宝玉从普通用户角度试用后指出另一面:启动还要 Node 环境,快速输出会闪烁,产物缺顺手的预览、diff 和多标签工作区。他的判断很直接:“插件化适合开发者改造,默认配置决定普通用户能不能留下来。”他还提了个值得琢磨的观点:作为模型厂商,DeepSeek 最有价值的肯定是做 Agent Harness Product 而不是 SDK,因为 SDK 拿不到用户行为数据。做产品就要追用户量,追用户量就要先做好用户体验,其次才是插件可定制化。
中立的梳理派,比如柠檬头.sol 的 AI Radar,把这件事放进更大的图景:DeepSeek 把 Harness 全部插件化,是把竞争从模型 API 推进到“Agent 怎样运行”这一层。这类变化和 Cursor 的预构建环境、Claude Code 的自动续跑放在同一窗口里看,说明 Agent 产品的竞争正在从“模型能回答什么”移到“系统能否持续工作”。
至于开发者的实测,机器之心和爱范儿都给了相当正面的初体验,但也都标注了:数据要么是官方自测,要么是媒体单次实测,到发稿还没有第三方大规模独立复现。
正式版预期:v0.1 之后看什么
官方明确这是开发者预览版,仓库里写着 THERE WILL BE COMPATIBILITY-BREAKING CHANGES,核心插件和基础 API 还会快速迭代,不适合当生产环境依赖。关于正式版,讨论基本集中在四个问题。
第一,稳定性与兼容性什么时候落地。从 5 月立项到 8 月出开发者预览,五个月完成,迭代速度极快;但破坏性变更意味着生态要跟着适配。正式版的关键不是功能更多,而是把插件契约和基础 API 稳定下来。
第二,插件生态能不能真正长起来。DSH 的价值高度依赖 dsh-plugin 生态和第三方界面、Skill、MCP 的丰富度。官方已预留 Plugin Store,内测期社区就自发做出了约 300 个插件,从改整个工作界面的皮肤,到用纯插件实现跨会话长期记忆加后台自我进化。内测的热情能不能变成长期生态,决定它能否撼动 Claude Code 已经占住的开发者习惯。
第三,和 V4-Pro 组合起来的真实业务表现。官方公布的 V4-Pro-0813 Agent 基准,Terminal Bench 2.1 得 87.9,DeepSWE 62.7,Toolathlon-Verified 74.1,DSBench-FullStack 71.1,都是公司自测,而且部分结果依赖 Harness 配置。要在真实生产环境里被第三方独立复现,才能验证“便宜模型打出豪华战绩”到底成不成立。DeepSWE 从预览版 12.8 涨到 62.7 尤其值得注意,它衡量的是模型加执行层的组合能力,不只是模型本身。
第四,会不会有托管形态。目前 DSH 是本地运行的框架,官方没有提供 DeepSeek 托管的云端 Agent 服务,也没有成熟的 GitHub 原生 PR 工作流;而 Codex Cloud、Claude Cowork 都已经能做云端长任务。这很可能是下一阶段要补的方向。
结语

从 V4 Pro 到 Harness,DeepSeek 正在从“造一个更强的模型”走向“让这个模型真正开始工作”。模型仍然决定智能的上限,但当模型开始真正进入代码库、终端和长期任务后,怎么把智能接进真实环境,成了另一半问题。DSH 给的答案是“一切皆插件”:一个模型中立、可重组、可审计、可回放的运行时底座,用 MIT 协议交给全球开发者。
它未必是 DeepSeek 版 Claude Code,更像一套组装 Agent 的方式。能不能成为 Agent 领域的「安卓时刻」,要看正式版的速度、插件生态的厚度,还有最朴素的一条:普通用户第一次打开它的时候,是不是还得先研究框架本身。
夜雨聆风