乐于分享
好东西不私藏

一切皆插件,DeepSeek开始争夺Agent执行层

一切皆插件,DeepSeek开始争夺Agent执行层

AI NEWSHOT NEWS它不是又一个模型,也不只是DeepSeek版Codex,而是一套允许开发者重新组装Agent的开放运行时。DeepSeek Harness的真正意义,是把竞争从模型能力推进到上下文、工具、会话、沙箱与执行轨迹所在的Agent基础设施层。

8月13日晚,DeepSeek没有再丢出一份模型榜单,而是把一个更靠近Agent心脏的位置公开了。

这个新项目叫DeepSeek Harness,命令名是dsh。它进入v0.1开发者预览,并以MIT协议开放全部源代码。

官方给出的口号只有一句:Everything is a plugin,一切皆插件。

模型、工具、Skills、会话、沙箱、存储、Agent循环、调度和界面,都不再被写死在一个不可触碰的内核里。

图:DeepSeek Harness官方设置页:插件成为模型、工具和运行时能力的基本单元

这听起来像一次工程架构发布,却可能比单纯更新模型更有后劲。因为它碰到的是Agent究竟如何工作的问题。

DeepSeek这次争夺的,不只是生成下一段代码的能力,而是谁来定义模型如何接触真实世界。

过去模型更新像换一台更强的发动机,这次DeepSeek连方向盘、仪表盘和维修接口一起打开了。

当这些部件能够被外部开发者替换,产品边界也从一个助手扩展成了整套Agent工厂。

图:DeepSeek官方宣布Harness v0.1进入开发者预览

这次发布的不是模型

过去一年,行业习惯用参数、价格和Benchmark理解DeepSeek。Harness却不在模型层,它位于模型与环境之间。

一个模型能回答问题,不代表它能稳定修改代码、运行测试、调用网页、恢复任务,并在失败后继续推进。

让这些动作形成闭环的工程系统,就是Harness。它决定工具如何暴露、上下文怎样拼装、权限在哪里拦截。

Claude Code、Codex和其他编程Agent的差异,越来越多就藏在这层看不见的系统里。

图:项目负责人提醒:v0.1仍然粗糙,接口会继续变化

项目负责人崔添翼没有把v0.1包装成成熟产品。他明确提醒,这只是预览版,粗糙之处和兼容性变化都会出现。

预览版的价值,不是立即替换成熟工具,而是把DeepSeek内部关于Agent的工程判断第一次放到公共空间。

开发者能看到它怎样组织工具、怎样保存轨迹,也能判断这些选择是否适合自己的业务。

这句提醒很关键。开源让外界第一次能拆开DeepSeek自己的Agent底盘,但也意味着它仍然是一座开放工地。

图:发布数小时后,开发者已经开始从仓库结构和公开数据拆解DSH

Harness到底管什么

可以把基础模型想成发动机。它提供推理和生成能力,却不知道方向盘、刹车、地图和维修记录应该怎样协同。

Harness就是整辆车的控制系统。它向模型描述可用工具,接收工具调用,再把结果送回下一轮决策。

它还要管理会话持久化、文件访问、子Agent、任务计划、网络搜索、用户确认和沙箱隔离。

模型决定智能上限,Harness往往决定这份智能能否稳定交付。两者的关系,正在从配套关系变成共同产品。

图:官方模型设置页保留了增加提供商和自定义提供商的入口

同一个模型放进不同Harness,最终表现可能相差很大。因为任务拆解、工具说明和错误恢复会改变每一步选择。

这也是Agent评测越来越难只看模型名的原因。测试环境本身,已经成为结果的一部分。

因此,DSH并没有把自己锁在DeepSeek模型上。提供商、模型适配器和凭据入口同样可以被替换。

这让它更像Agent运行时,而不是单纯的DeepSeek客户端。开发者可以把不同模型装进同一套执行框架。

反过来,同一个Agent配方也能更方便地横向比较模型,区分能力差异究竟来自模型还是执行系统。

图:开发者拆解DSH的依赖声明、可逆注册与只追加日志

一切皆插件,不只是口号

传统插件通常只能增加一个工具或按钮,核心循环仍属于框架作者。DSH选择把这条边界继续向内推。

模型适配器是插件,工具注册表是插件,会话日志是插件,连Agent循环本身也可以被替换。

底层Cordis负责插件挂载、卸载和依赖关系。一个组件声明自己需要什么服务,运行时再决定何时激活。

插件停止时,它注册的监听器、工具和副作用可以一并撤销,减少热更新后留下半套状态的风险。

图:自定义模型提供商也是可配置能力,协议与网关不必写死

这种可逆性比单纯的模块划分更重要。Agent运行时间越长,残留状态越容易演变成难以复现的故障。

如果挂载与卸载都有明确生命周期,开发者才可能在不中断全部会话的情况下实验新能力。

这种设计真正吸引人的地方,是开发者不必为了改上下文策略而长期维护一个框架分叉。

新的压缩策略、权限规则或工具循环,可以作为相邻插件挂载,而不是直接修改上游源代码。

图:早期体验者重点关注四种运行模式与Trajectory视图

但插件并不等于零成本。每个插件都可能向系统提示、工具列表和事件总线增加新的约束。

图:体验者展示的Trajectory视图、Agent Notes与完整执行过程

真正激进的是可回放

插件化很显眼,但DSH更值得关注的设计,是把模型真正看到的一切都压进一条只追加事件流。

系统提示、用户消息、推理、工具调用、执行结果、子Agent调度和上下文注入,都要留下可重建记录。

这解决了Agent调试里最折磨人的问题:任务失败以后,开发者常常不知道当时上下文窗口里到底装了什么。

图:官方Trajectory界面把系统提示、模型输出和工具调用放进同一条执行轨迹

当事件流成为唯一事实来源,恢复、分叉、搜索和回放就不再是四套独立功能,而是同一份记录的不同读法。

对普通开发者,它意味着问题可以复现。对模型公司,它还意味着高质量的Agent轨迹能够进入评测和后训练。

一条完整轨迹不仅记录成功答案,还保留模型在哪一步误判、哪个工具返回了什么,以及修复如何发生。

这类过程数据比最终代码更接近Agent能力本身,也可能成为下一阶段训练最稀缺的燃料。

图:有开发者认为,Harness的战略意义可能超过一次模型更新

这也是为什么有人认为Harness的意义可能超过一次V4模型升级。模型可以替换,执行轨迹与工作流却会沉淀成长期资产。

当然,记录越完整,隐私与凭据处理就越敏感。可观测性提升的同时,数据边界也必须更严格。

图:开发者实测中的DSH界面:Agent能够检查运行时并尝试修改自身插件

四种模式,四种取舍

DSH目前准备了四种预设,并不是为了换主题,而是给模型不同的行动边界。

Standard模式提供完整编程Agent能力,包括文件、终端、搜索、Skills、计划、目标和子Agent。

Code模式让模型编写一段TypeScript程序,组合多轮工具操作,以减少来回调用和中间上下文开销。

Minimal模式只保留持久Shell与文件编辑器,更适合在干净环境里比较模型,而不是比较工具数量。

Creator模式则把运行时检查、插件实验和预设编写能力交给Agent,允许它参与改造自己的工作环境。

图:官方演示把自定义界面、工具与Agent预设作为核心使用场景

Code模式尤其体现了DeepSeek对调用效率的判断。模型不必逐次请求工具,而能先写程序组织一组操作。

这样可能减少往返次数,却也要求模型正确处理错误分支,否则一次程序化调用会把误差集中放大。

四种模式共同说明,DSH的产品单位并不是一个固定助手,而是一组可以保存、复用和分享的Agent配方。

图:OpenMAIC内测插件把DSH组合成可生成课件、实验和测验的多Agent教师

不同团队可以围绕同一运行时保存自己的模型、工具、权限与界面组合,而不必复制整套框架。

这也给插件生态留下空间。OpenMAIC已经在内测期把它组合成能制作课件、实验与测验的多Agent教师。

如果更多垂直场景沿着这条路径出现,DSH的竞争对手将不再只是编程助手,而是Agent平台与工作流系统。

开放架构也有账单

然而,软件模块化并不自动等于模型行为模块化。插件越多,系统提示、工具Schema和上下文政策就越复杂。

每增加一个能力,模型都可能多看到一段说明、多面对一个工具,并在后续轮次放大早期选择。

图:框架作者提醒:软件可组合不等于模型行为天然可组合

LlamaFactory作者郑耀威的评价很克制:Cordis的组合能力成熟,但插件化本身并不是凭空出现的新发明。

真正需要验证的是,组合之后的Agent能否保持稳定,是否比更小、更精密的Harness获得更高成功率。

图:一组公开测试显示,DSH在该任务中的输入Token和请求次数明显更高;结果仅代表该测试配置

另一位开发者公开的对比中,DSH在特定任务上消耗了更多Token和时间。这个结果还不足以推导普遍结论。

但它揭示了一个真实矛盾:插件让代码边界更清楚,却可能让模型每次决策面对更拥挤的上下文。

图:同一测试作者对DeepSeek模型的对比结果,DSH轨迹更长、工具调用更多

还有安全问题。能够热加载插件、检查运行时甚至修改自身环境的Agent,必须拥有更严格的来源验证和权限隔离。

插件代码与模型工具不是同一种信任对象。前者可能在宿主进程里运行,后者通常还能经过审批与沙箱。

因此,插件来源、版本固定、完整性校验和更新确认,都会成为生态能否进入企业环境的基础设施。

所以v0.1更适合实验、评测和插件开发。把它直接接入关键仓库与长期凭据,目前并不是稳妥选择。

生态能否长出来

开源框架最难复制的从来不是启动命令,而是围绕它形成的插件、文档、案例和维护关系。

DSH已经把社区插件设为明确入口,也允许开发者用统一主题标记自己的扩展项目。

这是一种熟悉的平台策略:先把接口开放,再让外部团队填充模型公司不可能独自覆盖的长尾场景。

OpenMAIC的内测案例很有代表性。它没有修改DSH核心,而是把教学技能、课件与多Agent流程装进插件组合。

图:DSH底层Cordis论文公开了插件依赖、生命周期与可逆副作用的设计基础

如果插件可以跨模型复用,开发者投入就不必绑定某一家API,DSH也更容易成为中立的工作流承载层。

但中立性与第一方优化之间存在张力。兼容模型越多,越难对每个模型的缓存、推理和工具习惯做到极致。

最终生态是否成立,要看插件是否真的可移植,以及升级时能否避免大面积兼容性断裂。

官方已经提前承认接口会变化。接下来的几个版本,比发布当晚的热度更能说明这套设计是否站得住。

DeepSeek开始争夺执行层

过去,模型公司提供API,Agent公司负责把API变成产品。这个分工正在快速消失。

当OpenAI、Anthropic和DeepSeek都深入工具、终端、Skills与长任务,模型与Harness开始互相塑造。

模型训练需要真实执行轨迹,Harness又会围绕模型的工具调用习惯、缓存结构和上下文特性持续优化。

图:V4 Pro官方成绩表注明:公开Code Agent任务使用DeepSeek Harness Minimal模式测试

谁掌握这层,谁就更接近开发者真实工作流,也更容易积累无法从Benchmark里复制的数据。

这层还控制分发。开发者每天打开哪个Agent、安装哪些插件,最终会反过来影响模型与工具的选择。

因此,Harness既是工程系统,也是入口。它连接代码仓库、终端、浏览器与组织内部数据。

DSH选择MIT开源,是一次生态下注。它希望外部开发者不仅调用DeepSeek,还共同定义Agent应该怎样工作。

但开源并不会自动产生生态。插件质量、接口稳定性、安全模型、文档和升级路径,才决定它能否跨过预览期。

图:DeepSeek Harness官方GitHub仓库:Everything is a Plugin成为项目的第一句定义

对于DeepSeek,最理想的结果不是所有人都使用同一个界面,而是更多Agent围绕它的运行范式和轨迹格式生长。

对于开发者,真正值得观察的是自由度是否能够转化为更高成功率,而不是更多配置页面。

回到发布当晚,最重要的变化不是多了一个可以写代码的网页,而是DeepSeek把自己的Agent方法公开成了基础设施。

模型仍然决定Agent有多聪明,Harness开始决定这份聪明能否持续、可控、可复现地进入真实世界。

这才是DeepSeek Harness真正要争的位置,也是下一轮Agent竞争最难被价格战替代的位置。

参考来源

  1. DeepSeek Harness官方发布页
  2. DeepSeek Harness官方GitHub仓库
  3. DeepSeek API更新记录
  4. Cordis可组合编程范式论文
  5. The New Stack发布报道
  6. VentureBeat发布报道

持续追踪海外 AI 新动态AI吃瓜我最积极从一手来源出发,解释变化背后的真实影响。

— END —

如果觉得有用,欢迎分享给更多朋友