乐于分享
好东西不私藏

「一切皆插件」DeepSeek 开源首个Agent 框架 Harness

「一切皆插件」DeepSeek 开源首个Agent 框架 Harness

AI 前沿观察--DeepSeek Harness:以插件化架构重新定义 AI 代码智能体

导语8月13日晚,DeepSeek 在公布 API 调价后不久,扔出两枚重磅炸弹:首款 Agent 框架 DeepSeek Harness(v0.1)正式开源,几乎同步发布V4 Pro 正式版。一个负责「想」,一个负责「干」,DeepSeek 正在用一句公式重新定义 AI 编程工具的竞争规则。

01.

Harness 到底是什么?

过去两年,大模型负责推理——它知道代码该怎么改、任务该怎么排,但这些「想法」要变成真实结果,中间还隔着文件系统、终端、网页、代码工具这些真实环境。Claude Code 解决了这个问题,Codex 解决了这个问题,但国内一直没有一个成熟稳定的开源代码智能体底座。

DeepSeek Harness 要做的,就是填补这个空白。用 DeepSeek 自己的话说,Harness 承担的是「模型以外所有工程化的活儿」。它把模型接进真实环境,再把工具调用、任务规划、执行调度、上下文管理这些杂活一件件接管过来。

从能力清单看,Harness 覆盖得相当完整:项目管理、长任务协作、多 Agent 编排、上下文管理、联网搜索,还有 Skill 机制——一个能长期干活的 Agent 该有的,基本都齐了。

02.

「一切皆插件」:把模型变成可替换的螺丝

Harness 设计上最值得拆解的一点,是核心理念「一切皆插件」。它把模型、工具、技能、会话、沙箱、存储、循环、调度、UI 这些 Agent 能力各自打包,再用一份 cordis.yml 配置文件把它们组装起来。

Model + Harness = Agent

同一套代码,四种预设模式:仅保留 Shell 和文件编辑工具的极简模式(适合基准测试);完整编程助手标准模式,能编排子 Agent;支持用 TypeScript 编写自动化流程的PTC 模式(程序化工具调用);以及允许检查运行时、试验新插件的创造模式。所谓多 Agent 编排,就是主 Agent 把任务拆给好几个子 Agent——一个搜资料、一个改代码、一个跑测试,最后由主 Agent 汇总、决定下一步。

Model + Harness = Agent:模型负责推理,Harness 负责执行与编排

这套框架思维背后是一个清醒的判断:Harness 想做一个让不同部署方自己动手的底座。换模型、换存储、换安全策略、加工具,甚至换掉整个智能体循环,都留给使用者决定。模型只是整条技术栈里一个可替换的部件——这对开发者来说意义非凡。

有开发者评价:「一切皆插件」让模型仅仅成为代理技术栈中一个可替换的部分,同时采用 MIT 这一相对宽松的开源协议,是一个激进的举措——「非常酷也非常早期」。

03.

V4 Pro 同步上线:DeepSWE 从 12.8 飙到 62.7

Harness 的发布不是孤立事件。几乎同步,DeepSeek 还发布了V4 Pro 正式版,Agent 能力出现大幅跃升。

指标
数值
DeepSWE 基准(V4 Pro)
62.7
此前成绩
12.8
提升幅度
390%

DeepSWE 是衡量大模型软件工程能力的关键基准。从 12.8 到 62.7,这不是渐进式改进,而是一次量级跳跃。更重要的是,API 同时兼容 OpenAI 和 Anthropic 两套格式——这意味着原本跑在 Claude Code 或 Codex 上的工作流,改一下 base_url 和 api_key 就能直接接进来测试

而这份亮眼的基准成绩,正是用 Harness 极简模式跑出来的。模型负责推理,Harness 负责执行,两下一凑,就成了一个完整的闭环。

不过需要指出的是,也有开发者反馈 V4 Pro 实测接入 Codex 的表现不及预期,基准成绩与实际体验之间仍存在差距,实际效果有待更多场景验证。

04.

对标 Claude Code / Codex:开源底座的降维打击

Harness 从第一天就压准了代码智能体这条赛道,直接对标 OpenAI 的 Codex 和 Anthropic 的 Claude Code。这个选择不难理解:软件研发是目前 AI 场景里刚需最强、标准化程度最高、落地效果最直观的一块。

但真正让这件事有杀伤力的,是三个字的组合:MIT + 开源

AI 编程工具赛道进入开源 vs 闭源的新一轮博弈

对开发者意味着什么?

    1. 换掉 base_url 就能切换:不用重写工作流,从 Claude Code 迁移到 Harness 的门槛极低。

    2. 数据与隐私自主:开源底座可自部署,敏感代码不必经过第三方云端。

    3. 插件生态可扩展:一切皆插件意味着社区可以贡献工具、技能,生态有望快速繁荣。

    4. 价格优势:即便近期 API 上调定价,使用成本仍显著低于海外闭源方案(约为 Claude Fable 5 的 1/57)。

    已经有用户在社交媒体上喊出那句颇具情绪的话:「这是向 Claude Code 说再见的一天。」也有用户期待用 DeepSeek Harness 和海外的 Opencode 做正面比较。

    「DeepSeek 将一切开源,这样我们就不必生活在 Anthropic 的统治之下了。」——开发者社区评论

    05.

    团队底色与行业判断:系统工程才是硬功夫

    一些背景信息同样值得注意。DeepSeek 在今年五月就内部组建了专门的 Harness 团队,负责人崔添翼曾在量化机构Jane Street 工作九年,是做高频交易系统出身。

    把这种系统工程背景的人放到智能体项目上,本身就是一个信号:DeepSeek 的判断是,Agent 要真正落地,系统工程能力才是关键。把模型稳稳当当接进真实环境、让异常有兜底、让过程可追溯——这些才是硬功夫,而不是单纯把模型跑分刷高就够了。

    七月底 V4 Flash 发布正式版时,更新日志里写过一句不太起眼的话:公开的代码智能体基准测试用的是某个即将发布的框架。那个框架,正是 Harness 的极简模式。半个月不到,它正式亮相。代码在 GitHub 开源,装好 Node.js 后跑一条 npx deepseek-ai/dsh web,就能在本地浏览器打开界面。圈子里习惯叫它dsh

    06.

    结语:从「卖模型」到「卖工作流」

    落到更大的层面,Harness 的发布标志着 DeepSeek 开始从单纯卖模型,往提供一整套能干活的工作流方向走。

    「Model + Harness = Agent」这个公式正在成为行业共识。当模型能力的差距被逐渐抹平,决定一个 Agent 上限的,往往就是它背后那套工程系统。谁能把模型更好地接进真实环境、谁能提供更稳定的执行与编排、谁能用更低成本交付——谁就拿到了下一轮竞争的入场券。

    Harness 能不能撑起国内第一款工业化代码智能体底座?接下来的快速迭代会给出答案。但至少现在,开源社区多了一个值得认真对待的选择,而 Claude Code 和 Codex 的开发者,第一次有了一个「换掉 base_url 就能用」的国产平替。

    这场 AI 编程工具的战争,才刚刚开始。


    —END—
    我是王得金,17年军龄退役老兵,ENTJ科技创业者,AI咨询机构(蘑菇云MGClouds.net)创始人,链接千位 AI 超级个体,懂AI,更懂创业~
    👇扫码加我:happyxtn,送你「蘑菇云AI学苑」出品的《FDE工程师的自我修养》学习手册,包含圈内首份「FDE工程师技能树@2026」,帮助你成长为一名优秀FDE工程师~
    FDE6大能力框架+30个业务场景+93个技能点+5个真实案例,小白也能成为FDE工程师~