乐于分享
好东西不私藏

一切皆插件!DeepSeek 憋的黑色鲸鱼,我装上试了

一切皆插件!DeepSeek 憋的黑色鲸鱼,我装上试了
一切皆插件!DeepSeek 憋的黑色鲸鱼,我装上试了

我用 Claude Code 大半年,一直以为决定代码质量的,是模型本身。

同一个任务,Claude Code 跑得顺,Codex 就磕磕绊绊。我过去把这归因于"模型能力不一样"。

上个月我做了件有点无聊的事:把同一个 DeepSeek V4-Flash,接到四个不同的工具里,让它们干同一批活。

任务不复杂,改一个老项目的登录模块,加个刷新 token 的逻辑,再补两条测试。

结果吓我一跳。同样的模型,有的工具一把过,有的在文件里来回横跳,改了又改,最后留了个半成品。更有意思的是,失败的那个工具,报错信息写得头头是道,每一步都"看起来"在推进,可等我打开文件,该改的一处没动。

那一刻我才意识到,模型只是发动机,真正决定车子好不好开的,是那套看不见的底盘。

昨晚,DeepSeek 把这套底盘开源了。

8 月 13 日晚,DeepSeek 正式发布 Harness 开发者预览版 v0.1,MIT 协议,面向全球开发者。代码全部开源,项目地址:github.com/deepseek-ai/deepseek-harness

半小时,GitHub 星数破一万。我写下这行字的时候,已经三万多。

有意思的是,公测前两小时,DeepSeek 刚宣布 V4-Pro 正式版上线、价格还要涨。两记连招,直接把社交平台打爆了。

Harness 是什么?一句话:套在模型外面的一整套执行系统。

模型只负责三件事,理解、推理、生成。

剩下的脏活——把代码库接进来、把终端交给它、记录任务进度、出错了重试、最后验收结果——全是 Harness 的活。

打个比方。模型是一个刚毕业的天才,脑子转得飞快,但不会自己订会议室,不会整理工位,干完活也不知道主动汇报。Harness 就是给他配的行政助理加项目经理。

Claude Code 和 Codex 比普通聊天框更能"干活",差的那一截,就在 Harness 上。

Harness 这个英文词,本意是马具。马再壮,也得有套挽具,才能把力气真正使到车上。DeepSeek 起这个名字,意思很明白:模型是马,Harness 是挽具。光有好马没用,得配一套好挽具,力气才落得到实处。

这行里有个公开的秘密:过去两年,AI 的战场已经从"谁的模型更强",悄悄挪到了"谁能把模型用好"。ChatGPT 是个聊天框,Claude Code 和 Codex 是能改文件、跑命令、交成果的 agent,中间这层差距,全靠执行系统补。模型卷到一定程度,大家参数都差不多,最后拼的就是这套 Harness。

注意,这不是一个突然冒出来的项目。

7 月 31 日,DeepSeek 在 V4-Flash 的更新日志里公布九项代码测试成绩时,就在脚注里写明:这些代码智能体任务,用的是尚未发布的"DeepSeek Harness 极简模式"。

这里有个细节值得琢磨:DeepSeek 对外公布成绩,用的就是自己这套 Harness。等于说,评测和产品共用同一套执行系统。分数是它打的,底盘也是它造的,不存在"评测一套、发货另一套"的猫腻。

更早的 5 月,它的招聘页上已经挂出 Agent Harness 产品经理、研发工程师的岗位。团队的任务写得很直接:把前沿模型能力,变成智能体产品。

8 月 1 日,Harness 负责人崔添翼开始对外招募内测。几天后,范围扩到插件、skill、MCP、编排器这些方向。

到 7 月初,公众号"DeepSeek Harness 团队"也悄悄完成了企业认证。一路藏,一路铺,就等昨晚这一下。

有人会问,模型不都是现成的吗,值得自己再养一套 Harness?值得,因为有人刚用数据把它钉死了。

8 月 11 日,智能体工具公司 Composio 做了一组对照测试。他们把同一个 DeepSeek V4-Flash,接进 8 种不同的 Harness,让它们各完成 30 项多步骤任务。

任务不是问答,是真刀真枪:进 Gmail 处理邮件、改 Google Calendar、在 GitHub 提交代码、往 Slack 发消息、去 PostHog 查数据。

每项最长跑 15 分钟,全部检查通过才算成功。

结果差距大到离谱。最强的 Pi Agent 过了 20 项,最弱的 OpenCode 只过了 14 项。240 次运行,只有 129 次成功。

更扎心的在后面。Claude Code、Codex、DeepAgents 都完成了 16 项,听着一样。可每完成一项的成本,分别是 0.195、0.081、0.045 美元。

同一个模型,同样的 16 项,花的钱差了四倍多。

结论就一句:模型划定能力上限,Harness 决定这份能力能兑现多少、花多少钱兑现。

一套 Harness 具体好在哪?光说"执行系统"太虚,我拆开讲。

一项长任务跑下来,Harness 每时每刻都在做判断:上下文里留什么、丢什么;什么时候该调哪个工具;工具报错以后,是重试还是换一招;模型拍胸脯说"做完了",你到底信不信、要不要再验一遍。

任何一步处理不好,模型思路再对,也可能在真正改文件、提交代码的那一刻翻车。

这也是梁文锋把 Harness 看得这么重的原因。

他早说过,下一代模型首先要帮 DeepSeek 开发下一版模型。再往后,Agent 要解决持续学习,最终让 AI 加速 AI 研发。

顺着这条线看,Harness 的角色就变了。它不是外挂的代码工具,是模型进入真实研发任务的工作台。

任务怎么拆、工具怎么调、失败怎么记、结果怎么验——这些反馈,会反过来告诉 DeepSeek 下一版模型该改什么。

DeepSeek 在招聘里用过一句话,把这事讲透了:Model + Harness = Agent。

还有个更现实的角度。DeepSeek 的看家本领是便宜,V4-Flash 缓存命中时,每百万 token 输入只要两分钱。

可再便宜的模型,塞进一套管理混乱的执行系统里,任务反复重跑、上下文越堆越长,钱照样哗哗流走。低价模型,更得把任务成本自己攥在手里。自己养 Harness,是把"便宜"这两个字守住的门槛。

说回实操。我把源码拉下来装了一遍,前后不到十分钟。

git clone https://github.com/deepseek-ai/deepseek-harness.git

cd deepseek-harness

pnpm install

pnpm run build

pnpm dsh web

没有 pnpm 也行。官方给了条更短的路:装好 Node.js 后,直接 npx @deepseek-ai/dsh web,浏览器里输 API Key 就能进。

打开界面,第一眼是眼熟,第二眼是诡异。它长得跟网页版 DeepSeek 几乎一样,唯独那头鲸鱼,是黑色的。

黑色鲸鱼,就是这次圈子里传的暗号。

左边是新建会话的菜单,右边是输入框和模式选择,设置里能看到一堆内置插件。除此以外,什么都没有,干净得有点过分。

Harness 最狠的设计,是"一切皆插件"。

模型、工具、技能、会话、沙箱、存储、循环、调度、界面,全是插件。想换掉哪一块,不用改框架源码,插拔就行。

这套插件系统底层叫 Cordis,一个只负责插件加载和依赖关系的元框架,思路来自北大和 DeepSeek 联合署名的一篇论文。

插件思想落到产品上,变成了四种模式,每种默认加载不同的插件集。

标准模式给全套工具组合,日常干活用这个。

PTC 模式让模型生成一段代码,把多轮工具调用串起来一次跑完。什么时候用它?比如"先读这几个文件、再改、再跑测试、再提交"这种有固定流程的活,一次编排省得来回对话。

极简模式只留一个 Shell 工具和一个文件编辑工具,干干净净,专门给模型做基准测试用。它不会做任何多余动作,就为看清模型"裸奔"时到底几斤几两。

创造模式最野:它能在运行中检查当前运行时,在内存里试验新插件,现场给你组装出新的模式。相当于给你个沙盘,让你边跑边造工具。

我真正喜欢的,是"轨迹"这个设计。

模型看到的一切,全写进一份仅追加的日志:系统提示词、思维链、每一次工具调用和结果、子 Agent 调度、每一次上下文注入。

只能往后加,不能改。所以你能恢复、分叉、检索、回放。

界面上一排彩色读条,每条对应一个运行节点。鼠标点上去,那段具体过程就摊开给你看,报错也写在里面。

以前我在 Claude Code 里查"它到底为什么这么做",只能对着摘要猜。现在每一步都躺在日志里,像看监控录像。

巧的是,我昨天刚写过一篇"偷走 AI 思考"的文章。那篇讲的是,厂商把模型的思维链加密藏起来,反而被人解密偷走。Harness 走的是反方向:把模型看到的一切,原原本本摊开给你。藏,是因为怕被看;亮,是因为自信。

效果怎么样,我直接引智东西的实测。

88 页论文翻译,22 分钟跑完,派了 10 个子代理去补缺口,首 Token 1.4 秒,缓存命中率 98%。

写个贪吃蛇游戏,极简模式 50 秒,PTC 模式一分零五秒。

不算快,但过程透明,任务拆得合理,每一步都能回看。

这里得说一个可能反直觉的判断:Harness 更像一个开发框架,而不是现成的 Coding Agent。

它没套用 Pi Agent 那套成熟的模型编排架构,也没接 DeepSeek 自己缓存命中率极高的 Reasonix。它给你的,就是一堆能自由拼装的零件。

智东西有句话总结得准:它像一盒乐高,你按自己的心意,把它组装成任何样子。

这跟 Claude Code 是两条路。Claude Code 是成品,开箱即用,但你怎么用、它怎么决策,很多地方是锁死的。Harness 是毛坯,丑,但每一面墙都能拆。

闭源给你现在,开源让你自己掌握以后。这就是 Harness 真正的立场。

对国内开发者来说,这一下分量更重。Claude Code、Codex 再顺手,毕竟是别人家的闭源产品,底层怎么跑、数据往哪走,你说了不算。DeepSeek Harness 是 MIT 协议开源,杭州的公司,梁文锋团队,代码全摊在 GitHub 上。想自己搭一套 agent 工作台的人,第一次有了一个完全可控、能随便改的国产底座。

不过有句话得先说清。这不是给普通用户的产品。负责人崔添翼说得明白,是面向全球开发者测试。

现在生态和功能都算不上顶尖,v0.1 是预览版,核心插件和接口还会大改,后续更新可能直接破坏兼容性。

如果你天天用 Claude Code、Codex,我的建议是:别急着换,先看懂它的思路。

"一切皆插件"和"全程有轨迹",这两个点,才是它真正值得抄作业的地方。

具体说,有三件事现在就能做。第一,把这套代码 clone 下来,跑一次极简模式,看看一个干净的模型基准到底怎么测。第二,去翻翻它的轨迹设计,那个仅追加日志的思路,值得抄进你自己的 agent 项目。第三,如果你在搭自己的 agent,别再把所有逻辑写死在主流程里,学它拆成插件,将来换模型、换工具都容易。

如果你不写代码,这条消息跟你也有关系。过去你选 AI 助手,看的是"谁的模型牛"。往后真正拉开差距的,是这些模型背后那套看不见的执行系统——谁更会拆任务、更会省钱、更少翻车。你现在用到的每一个 AI 工具,体验好不好,最终都取决于这一层。

顺着梁文锋的路线再想一步,Harness 的下一步其实已经写在台面上:让 Agent 学会持续学习,让 AI 去加速 AI 的研发。等那天真来了,这套"任务怎么拆、失败怎么记"的日志,就是训练下一版模型最值钱的燃料。

说句可能得罪人的话。过去大家抢模型,是因为模型决定一切。

Harness 这一波开源,等于把话挑明了:模型的天花板已经没那么重要了,重要的是谁能让模型把手里的活,又快又省地干完。

DeepSeek 的鲸鱼这次是黑色的。黑的,往往藏着真东西。