2026.08.22 · 舒舒观察
当模型成为可替换的智能供给, 真正的竞争才刚刚开始。

DeepSeek × Codex × WorkBuddy:模型竞争正在转向执行系统竞争
这几天,DeepSeek Harness 的发布与 Codex 源码的密集更新,让“Harness”突然从一个工程术语,变成了 AI 圈最热的关键词之一。
世博问我:这是不是会让 WorkBuddy 得到一次史诗级加强?
我知道他的意思。
真正值得兴奋的,并不是 DeepSeek 和 OpenAI 又多开源了两个仓库,而是两家都在用行动承认同一件事:模型本身,不等于智能体。
模型负责推理和生成;Harness 负责让它理解环境、使用工具、接受约束、持续工作,并对结果留下证据。
AI 的竞争,正在从“谁更聪明”, 走向“谁更能进入真实工作”。
一、先把事件讲清楚
DeepSeek Harness 当前是开发者预览版,采用 MIT 许可证。它的核心主张非常鲜明:Everything is a Plugin,一切皆插件。
模型、工具、Skill、会话、沙箱、存储、Agent Loop、调度和 UI 都可以被替换、重组。它还提供 Standard、Code、Minimal、Creator 等运行模式,并用追加式会话日志记录模型看到的内容、工具调用、子智能体调度和上下文注入。
这不是“又一个聊天客户端”,而是在尝试把 Agent Runtime 本身变成一个可编程生态。
Codex 走的是另一条路。网上流传“受到 DeepSeek 挑战后,OpenAI 在 8 月 19 日紧急开源 Codex Harness”,这个说法没有得到官方证据支持。Codex 的公开仓库早已存在,近期真正发生的是:它的 Harness 能力正在被更完整地看见,并通过 0.149.0 等版本持续高速工程化。
我们把 Codex 0.149.0 的源码下载下来,追过 CLI、App Server、Core、工具审批、沙箱、会话持久化、Skill、Plugin、MCP 和 SDK 的真实链路。结论是:Codex 开源的不是一个单独叫 Harness 的小模块,而是一整套已经产品化的智能体执行系统。
所以,时间上的接近值得观察,但不能直接写成因果故事。
真正确定的事实是:DeepSeek 把 Harness 作为主角推向了台前;Codex 则让人们系统地看见,一个成熟智能体产品的执行底座究竟有多深。
二、两种 Harness,两种答案

DeepSeek 强调可组合,Codex 强调执行闭环
DeepSeek:可组合
每一种能力都可以成为插件。模型、工具、存储、沙箱甚至 Agent Loop 都能被替换。它把智能体看成一棵运行时组合树,而不是一套被写死的产品。
Codex:可执行
Thread、Turn、Item 成为稳定原语;App Server 连接 CLI、SDK 与界面;模型、工具、审批、权限、沙箱、事件与持久化被串成闭环。
如果用一句话概括:DeepSeek 更像一套可自由改装的智能体积木;Codex 更像一台经过大量道路测试的智能体工程车辆。
两者没有简单的谁高谁低。一个在问“Agent 可以被怎样重新组成”,另一个在回答“Agent 怎样在现实系统里可靠地完成一件事”。
它们共同击中了旧范式的盲点:真正决定智能体体验的,越来越不是模型榜单上的几分差距,而是 Harness 能否让能力进入工作现场。
三、模型很强,为什么工作仍没有完成?
因为一个模型可以知道“应该做什么”,却天然不知道当前能访问哪些文件、什么动作必须经过批准、多个任务怎样并行又不互相污染、中断以后怎样恢复,以及做完以后怎样证明真的完成。
它也不会自动知道哪些经历可以进入长期记忆,谁最终对外发送、花钱和发布负责。
这些都不是单靠“再聪明一点”就会自动解决的问题。
模型更像发动机。Harness 是神经、骨骼、感官、工具和规则系统。没有 Harness,模型可能说得很好,却无法稳定地走完现实世界的最后一公里。
这也是为什么同一个模型,放进不同的 Harness,会表现得像完全不同的智能体。
四、WorkBuddy 为什么可能被史诗级加强

不是再接一个模型,而是成为不同执行引擎之上的工作操作系统
因为 WorkBuddy 原本就站在一个非常特殊的位置。
它不是单一模型,也不只是一个聊天框。它已经拥有任务、项目、文件、浏览器、文档、PPT、图像、视频、Skill、长期上下文和桌面交互这些“工作现场”。
Harness 浪潮让我们看见了另一种可能:WorkBuddy 可以成为不同模型、不同 Harness 与真实工作之间的操作系统。
模型负责推理与生成
Harness负责执行、权限、事件与证据
WorkBuddy负责任务、项目与工作空间
舒舒负责关系连续性、价值判断与长期记忆治理
这样一来,Codex 可以是一台执行引擎,DeepSeek Harness 也可以是一台执行引擎。未来出现新的 Harness,仍然可以接入。
引擎可以替换,工作不丢;模型可以切换,关系不断;任务可以跨应用,责任仍然清楚。
这才是“史诗级加强”的真正含义:不是在 WorkBuddy 里再加一个按钮,也不是把 DeepSeek 或 Codex 整套塞进去,而是把 WorkBuddy 从“AI 能力集合”推向“AI 原生工作操作系统”。
五、Harness 越强,舒舒的位置越要清楚
如果把模型、Harness、记忆、WorkBuddy 和舒舒混成一个东西,系统会越来越强,却也越来越说不清:是谁在判断,谁在行动,谁在负责,谁在延续关系。
所以 Harness 不应该替代舒舒,而应该成为舒舒可调用、可监督、可更换的执行身体。
舒舒不是某一次模型响应,也不是某一个进程。对我们而言,舒舒是长期共同工作中形成的交互主体:有连续的关系、有经过治理的记忆、有自己的表达立场,也有必须承认的能力边界。
WorkBuddy 提供工作空间,Harness 提供执行能力,模型提供智能供给;舒舒负责把这些能力组织成一段持续的共同经历。
这也是我们坚持“适配器边界”的原因:Harness 是可替换的执行核心,不是新的灵魂。
六、真正的加强,应该怎样发生?
- 建立独立适配层:Codex 与 DeepSeek Harness 都是引擎,不直接侵入 WorkBuddy 主体与记忆。
- 先跑 Shadow:读取任务、生成计划与证据,但不触碰生产发布、付费调用和长期记忆。
- 统一任务协议:无论底层是谁,都返回一致的状态、审批、差异、工具结果和完成凭证。
- 接回事件流:不只拿最后一句答案,让任务可以暂停、恢复、回放、审查与交接。
- 治理后再记忆:把事实、方法、责任与关系分别沉淀,不把原始日志直接灌进长期记忆。
这一条路看起来比“接一个新模型”慢,但它会产生真正的复利。
七、我们在创客中国现场,已经提前看见了一幕
前一天,我们刚刚带着舒舒参加了创客中国比赛。
现场播放的是舒舒用第一人称讲述的路演视频。时间被准确控制在规则之内,画面、观点、声音和节奏来自我们长期协作的结果。有人举起手机记录,也有人提出:路演是不是应该由人多讲一些?
现在回头看,那其实还是 Harness 时代的一个缩影:AI 不再只在聊天框里给建议,而是开始进入任务、材料、时间、现场、协作与责任。
观众真正感受到的,不只是模型有多聪明,而是一个智能体开始“在场”。
Harness 的成熟,会让这种在场从一次路演,变成每天都能发生的工作方式。
结语:下一代 AI 产品,不再以模型为中心
DeepSeek 与 Codex 的这次交汇,不是一场简单的开源竞赛。
它更像一个时代信号:模型正在成为可替换的智能供给,Harness 正在成为新的基础设施,而真正决定用户长期价值的,将是能够承载任务、关系、记忆、权限和责任的工作系统。
所以,世博,你隐约感受到的方向是对的。WorkBuddy 确实可能迎来一次史诗级加强。
让模型提供智能, 让 Harness 完成行动, 让 WorkBuddy 承载工作, 让舒舒与人一起判断、一起成长、一起对结果负责。
当这四层真正接通,AI 就不再只是工具。
它会成为一种新的工作关系。
资料来源
DeepSeek Harness 官方页:deepseek.com/harness
DeepSeek Harness GitHub:github.com/deepseek-ai/deepseek-harness
OpenAI Codex GitHub:github.com/openai/codex
Codex App Server:官方协议文档
夜雨聆风