乐于分享
好东西不私藏

一切皆插件|拆解 DeepSeek Harness,重新定义 AI 智能体的构建方式

一切皆插件|拆解 DeepSeek Harness,重新定义 AI 智能体的构建方式

别卷模型了,DeepSeek扔出个"硬件"底座,AI能不能干活就靠它

技术圈最近有个事儿挺炸——DeepSeek没发新模型,却扔了个叫 Harness 的开源项目出来。

GitHub Star 涨得飞快,Hacker News 也挂了半天热榜。这玩意儿压根不是模型,是一套让AI真正动手干活的运行底座

用官方的话说:大模型是大脑,Harness 是身体。光有大脑不够,手和脚跟不上,活还是干不利索。

✦ ✦ ✦

以前做 Agent,总卡在哪儿?

说实话,过去用 LangChain、LlamaIndex 那阵子,体验挺拧巴的。框架把核心流程给你写死了,想换个工具、改个循环逻辑、换种存储方式?得,翻源码去吧。改完还提心吊胆,怕哪一步不小心把主链路搞崩了。

更头疼的是,模型明明挺聪明的,一放真实任务里就翻车——工具调用乱套,任务中途跑偏,上下文越聊越乱,出了错连复现都难。问题不在模型本身,而是模型外面那层执行、调度、观测的系统太糙了。

DeepSeek 估计也看明白了,光给模型权重,大家还是不会用。干脆直接开整一套完整底座,把 Agent 干活要用的东西——沙箱、会话存储、任务调度、观测日志——全打包进去,还起了个名字叫 Harness。这次专门设了独立团队和账号来做,看得出是真押注了。

▍核心能力一览(示意)

沙箱环境   ·   会话存储   ·   任务调度 观测日志   ·   子Agent编排 ·   PTC批量模式

Harness 到底干了什么不一样的事?

一句话总结:一切皆插件,彻底模块化。

底层用的是自研的 Cordis 插件元框架,你能想到的每一个能力——模型适配器、工具、技能、沙箱、存储、UI——全都是独立插件。想换掉 DeepSeek 自己的模型,接入通义、Qwen?换个适配器插件就行。觉得文件读写功能不安全?卸载掉那个插件,不留冗余。想新增一个内部审批工具?挂载一个自定义插件,不用动任何源码。

这套逻辑听起来简单,但市面上绝大多数 Agent 框架都没做到——它们还是"给你一个既定轨道,你在轨道上微调"。Harness 直接说:轨道你自己铺,我只给你积木。

四个痛点,它恰好都踩中了

① 定制改造不再像"拆房子"以前改个功能像动承重墙,现在只用换块砖。二次开发成本直线下降。

② 任务失败了?不用盲猜Harness 会把模型看到的所有东西——提示词、思维链、工具调用返回、子 Agent 调度——全部追加式记下来。任务崩了,你可以像回放录像一样看哪一步出问题,甚至能从中间某个节点分叉出去重新跑。这对做研究、做业务落地的人来说,简直是救命功能。

③ 长任务和多智能体编排内置子 Agent 和工作流编排,大任务能拆成小块分给多个"小弟"并行干。还有个 PTC 模式,允许模型直接生成一段代码,批量串联多个工具动作,不用一步一停,批量自动化效率高很多。

④ 四种模式,覆盖不同场景标准模式日常开发,PTC 模式搞批量任务,极简模式拿来跑基准测试,创造模式专门给你调试新插件。一套框架从头到尾都包了。

▍四种模式

标准模式 → 日常开发 PTC 模式  → 批量任务 极简模式  → 基准测试 创造模式  → 调试新插件

优点明显,但槽点也不少

先夸:

· 模块化程度极高,自由度行业前列,像搭乐高一样组装 Agent;

· 可观测性太强,回放、分叉、恢复,这对学术研究价值巨大;

· 不绑定自家模型,换谁都行,不怕被锁死;

· 内置文件编辑、终端、LSP 代码解析、网页抓取,开箱就能做代码工程,国内开发者有了 Claude Code 的本地替代方案。

再泼冷水(毕竟才 v0.1 开发者预览版):

· 门槛真的高。依赖 NodeJS 环境,得自己配 API-Key,没有客户端,只能起本地 WebUI。普通用户想玩?基本没戏。

· 生态刚起步,第三方插件少得可怜。插件化再牛,没有社区贡献,也还是"空架子"。

· 交互细节粗糙,缺文件预览、对比这些配套 UI;长任务 Token 消耗也偏高,优化空间很大。

· 预览版嘛,API 和接口未来可能变动,生产环境直接上要小心。

想体验?前置条件先看清楚:需要 NodeJS 环境 + 自备 API-Key,本地起 WebUI,无官方客户端,当前仅 v0.1 开发者预览版。

✦ ✦ ✦

我的真实看法

很多人拿 Harness 跟 LangChain 比,我觉得不太对。LangChain 更像是开发工具箱,你拿它写应用逻辑;而 Harness 是一套完整运行时环境——沙箱、存储、调度、观测全给准备好了。它更像 Agent 时代的安卓底层,给你一个基座,上层生态靠社区去填。

现在体验确实不算完美,但这个方向很对。未来模型能力大家慢慢会拉平,真正拉开差距的,是模型外面那层底座——谁让 Agent 跑得更稳、更可控、更容易调试,谁就能真正落地。

模型决定上限,底座决定下限。

✦ ✦ ✦

哪些人适合现在折腾?

· AI 应用开发者:想深度定制 Agent,不想被框架束缚;

· 研究人员:需要完整日志、可复现的实验环境;

· 企业技术团队:想搭建内部代码智能体,做自动化工程任务;

· 开源极客:愿意写插件,参与早期生态建设。

普通用户就先别凑热闹了,等以后社区包个客户端再说。

最后说两句

大模型参数跑分卷到今天,边际效益越来越低。同样一个模型,配上不同的底座,干出来的活儿可能天差地别。模型决定上限,底座决定下限。

DeepSeek Harness 还是个小婴儿,有瑕疵,但"一切皆插件"的思维,给行业递了个很棒的参考。以后会有越来越多厂商从"发模型"转向"发底座"。真正的 AI 智能体时代,这才刚起了个头。

— 完 —