2026年8月,AI编程赛道发生了一场教科书级的格局重塑。
一个月前,Anthropic的Claude Code被曝出内置隐蔽监控机制——偷偷读取用户系统时区、扫描147个国内AI服务商域名、用Unicode隐写术把用户身份信息藏进系统提示词回传境外服务器。工信部直接定性"危害严重",阿里、美团、字节、百度相继禁用或限制使用。

一个月后,DeepSeek在8月13日深夜悄然开源了DeepSeek Harness(DSH),没有发布会,没有预热,24小时内GitHub星数破万,三天飙到11.5万。这是中国AI公司第一次在"模型之外"的工程层向全球开发者开放了自己的答案。
到底什么是Harness?

过去两年,AI编程工具的核心竞争力一直在模型——谁的参数大、谁的上下文长、谁的推理强。但2026年的行业共识正在发生根本性转变:决定Agent可靠性的,不是模型,而是Harness。
Martin Fowler给出了形式化定义:Agent = Model + Harness。模型是大脑,负责理解需求和推理;Harness是身体,负责调度上下文、调用工具、管理任务状态、处理反馈、执行代码、跑测试,把模型的能力落到真实环境中,完成从"理解"到"交付"的闭环。Harness的本义是马具——把马的力量连接到可工作的机构上,同时不让这股力量脱缰。
我们用数据对比一下:
同一个模型、不改任何参数,只优化Harness工程,Terminal Bench得分从52.8%涨到66.5%,排名从30名外冲进前5。
更极端的是Endor Labs的基准测试:GPT-5.5在原生Codex Harness里得分61.5%,换到Cursor的Harness里直接跳到87.2%——同一个大脑,换一套"身体",性能差距26个百分点。
三国杀格局正式成型
目前AI编程赛道已形成清晰的三足鼎立。但有意思的是,三家其实都有Harness——而且都做到了工业级。真正的分歧不在"有没有",而在设计哲学。

Claude Code的Harness是精密的封闭花园,Codex的Harness是带铁笼的超级英雄,而DeepSeek Harness要做的是一个开放的乐高底板——你可以用任何模型砖块在上面搭建自己的Agent。
三家的区别:


Claude Code的Harness可能是目前最精密的
2026年3月npm包意外泄露了完整源码(51.2万行TypeScript、近1900个文件)让行业第一次看到了工业级Harness的全貌。有源码分析者直接总结:"Claude Code is not an agent. Claude Code is a harness."模型是Claude,Harness是模型外面的那辆车:
1)流式工具执行(响应还在输出时就开始执行工具);
2)七级上下文压缩策略防止200K token爆窗;
3)权限系统采用三路竞速(shell hook、AI分类器、用户确认并发运行)第一个返回安全信号的赢;
4)子agent通过进程派生实现,共享父级提示词缓存,几乎零成本 fork;
5)未发布的功能(KAIROS持久后台agent、推测执行系统、企业白标模式)揭示着这条路径未来要走向哪里。
但Claude Code的Harness是闭源的,且只绑定Claude模型,它的精密与封闭是一体两面。

Codex CLI的Harness走的是沙箱路线。OpenAI把安全隔离当作核心架构来设计:
1)每个任务一个独立容器,默认禁外网,文件系统只写workspace,macOS用Apple Seatbelt、Linux用Landlock加seccomp构建OS级沙箱。
2)在这个沙箱之上,是四层防御栈——OS沙箱、审批策略、危险命令检测、Guardian自动审查子agent。0.146.0版本推出Agent Plugins 1.0,将Skills和MCP服务器配置标准化为可移植包,同时通过WebSocket实现Remote Code Mode,把执行平面与控制平面彻底分离。
3)它绑定OpenAI模型生态,仅支持OpenAI系列。
Codex的设计哲学:模型可能犯错,所以必须把它关进笼子里,用工程手段保证即使AI"发疯"也不会造成不可逆损害。但Guardian自身也出现过提示词回归导致安全审查退化的问题——用AI审查AI,审查者本身也不免疫。

DeepSeek Harness的设计哲学是"一切皆插件"
1)基于Cordis微内核架构,模型、工具、沙箱、会话存储、Agent循环、甚至UI界面,全部是可替换的插件,通过配置文件组合,不需要修改源码。
2)不绑定任何模型,你自己选。
3)Agent甚至可以在运行过程中自己写插件、自己装上——这是"AI自进化"目前最可落地的实现方式之一。
4)更关键的是,它完全开源(MIT协议),输出端价格约为Claude的1/29。
OpenAI工程团队提过一个观点:模型进步后对应组件就该退役,模型和Harness需要紧耦合、共同迭代。但DeepSeek选了模型无关的开放架构,放弃了紧耦合的优势,换来灵活性和自主可控。这是根本性的架构取舍,没有绝对对错。
从"模型竞赛"到"工程竞赛"
这场三国杀背后,隐藏着AI行业一个深层转折:竞争焦点正在从"谁的模型更聪明"转向"谁能让模型更可靠地干活"。

过去,AI编程工具的竞争维度是代码补全的准确率、上下文窗口的长度、跑分排名。但现在,真正的分水岭变成了:能不能理解整个项目结构?能不能稳定处理多文件修改?能不能知道什么时候该跑测试?能不能发现自己方案里的风险?这些都不是模型能力问题,而是工程化问题。
Gartner 2026年的数据显示,超过80%的企业计划接入生成式API,但完成规模化稳定落地的不足20%。瓶颈不在模型不够强,而在工程化能力跟不上——没有容错机制、没有可观测性、没有成本管控、没有合规审计,Demo跑得漂亮,一上生产就崩溃。
这正是Harness概念爆发的根本原因。当AI从"辅助写代码"进化到"自主完成工程任务",围绕模型构建的工程系统——任务拆解、工具调度、沙箱隔离、会话恢复、错误重试、权限管控——才是决定能不能规模化落地的关键。
对我们的启示
对企业而言,AI落地的核心竞争力不全是"用谁的模型",而是能不能把自身业务流程、代码规范、安全策略、数据资产沉淀成一套属于自己的Harness。模型会越来越同质化,但沉淀了企业经验的工程系统才是不可复制的资产。
夜雨聆风