乐于分享
好东西不私藏

OpenAI 把 Agent 的「发动机」开源了:Codex Harness 到底意味着什么

OpenAI 把 Agent 的「发动机」开源了:Codex Harness 到底意味着什么

这不是新模型发布,但可能比一次新模型更重要。

北京时间 8 月 20 日,OpenAI 发布了一篇题为《Codex as a platform: build on the open agent harness》的博客,并正式宣布:

把 Codex 底层的 Agent 执行框架 Harness,以 Apache-2.0 许可全面开源。

换句话说,驱动 OpenAI 自家顶级编程 Agent 的那套「发动机」,现在免费送给你了。

开发者不再需要把所有业务流程硬塞进一个通用聊天框。你可以把这套 Agent 循环,无缝镶嵌进自己的产品、工程工具、运营看板,甚至是最枯燥的财务报表系统里。

OpenAI 总裁 Greg Brockman 的转发很直接:

> Codex 能驱动的,远不止编程工具。

这句话,才是这次开源真正的题眼。

---

、Harness 是什么?模型是大脑,它是身体

很多人对 Agent 有一种误解:

好模型 + 好 Prompt = 好 Agent。

大错特错。

一个真正能跑在生产环境的智能体,需要一套极其复杂的底层执行系统:

- 理解任务、拆解步骤

- 在漫长对话中保持记忆

- 调用 MCP 工具获取实时数据

- 执行读写、改库、调接口

- 对外流式展示进度

- 处理崩溃与失败

- 在关键时刻停下,等待人类审批

- 最后把有用的结果回传系统

这个包揽所有脏活累活的「执行系统 + Agent 循环」,就是 Harness。

> 模型是大脑,Harness 是身体。同一颗大脑,换一副好身体,表现可以脱胎换骨。

---

二、一个实验,打脸了「唯模型论」

![ARC-AGI-3 数据对比]

OpenAI 拿出了一个极具说服力的对照实验。

在 ARC-AGI-3 公开任务集上,同一个 GPT-5.6 Sol模型、权重完全不变,只调整 Harness 的两项设置:

| 维度 | 官方 harness | 优化后 harness |

|------|-------------|---------------|

| 推理保留 | 每次动作后丢弃私有推理 | 用 Responses API 让推理跨轮次存活 |

| 上下文管理 | 超过 175,000 字符后滚动截断 | 用 compaction 压缩长历史 |

| 公开集 RHAE 得分 | 13.3%| 38.3%|

| 输出 token | 基准 | 约减少 6 倍 |

注意关键事实:

> 模型权重没变,只改了运行系统。得分从 13.3% 跳到 38.3%,同时输出 token 降到原来的约六分之一。

这意味着:AI 不仅变得更聪明,调用成本还更低了。

所以,真正决定 Agent 上限的,常常不是模型本身,而是你怎么管理这个模型。

---

三、三大组件,按集成深度递进

![三大组件]

这次开源不是放个 SDK 意思一下,而是直接给了完整的三层武器库,全部在 `github.com/openai/codex`:

1. `codex exec`:最轻量

适合脚本、CI 流水线、一次性后台任务。

一条命令跑完一个有界 Agent 工作流,直接返回结构化输出。简单粗暴。

2. Codex SDK:中等复杂度

支持 TypeScript / Python。

用代码启动、恢复、流式传输任务,精准控制线程与任务生命周期。

适合在应用里内嵌 Agent 能力。

3. Codex app-server:本次明星

这是把 Agent 做成产品核心的关键基础设施。

它通过 JSON-RPC 让应用连接到本地 Codex 进程,提供:

- 持久会话状态

- 流式事件传输

- 中途打断 Agent

- 把应用自有工具暴露给 Agent

- 人工审批回调

> 前端审批界面与底层执行循环,第一次被干净地解耦了。

你的产品继续掌控界面、数据、权限,AI 负责在底层跑循环。

---

、这场开源为什么重要?因为它在「反套壳」

![范式对比]

过去一年,行业陷入了一种怪圈:

1. 拿到大模型 API

2. 套一个聊天框

3. 加点 RAG

4. 包装成「AI 助手」发布

结果是产品越来越像,护城河越来越浅。

OpenAI 这次表达了一个清晰的判断:

> 不要为了 AI,把用户熟悉的专业界面降级成聊天框。

安全分析师看的是预警队列和受影响服务。

客服工程师看的是账户历史和产品日志。

产品经理看的是需求看板。

界面的存在是有意义的,它本身就是最重要的上下文。

真正好的产品形态应该是:

- 用户留在自己的仪表盘里

- 点一个操作按钮,不写 Prompt

- 应用自动把当前界面数据作为上下文喂给 Agent

- Agent 调用 MCP 工具拿实时数据

- 危险操作弹审批框,人类确认后才执行

- 结果自动写回业务系统

AI 不是霸占屏幕的主角,而是隐形的、聪明的帮手。

---

、它已经在各行各业开始落地

Codex 不是只能写代码。这次开源的合作伙伴已经给出了几个方向的验证:

| 案例 | 场景 | 效果 |

|------|------|------|

| Thrive Holdings + Crete| 税务准备工作流 | 试点处理 7,000 份申报表,准备时间缩短约 1/3 |

| Cisco| 云控制平台 App Builder | 客户用自然语言创建自定义应用 |

| Relay(官方演示)| 物流运营看板 | 选中延误货单 → AI 比较方案 → 审批 → 自动写回 |

这些案例的共同点是:Agent 被拆成零件,装进了已有的业务系统里。

---

、三个维度,把控制权还给开发者

这次开源给了开发者三个维度的最高控制权:

1. 界面控制权

别再强迫用户适应聊天框。让用户继续使用熟悉的仪表盘、编辑器、地图和列表。

2. 上下文与工具控制权

你可以把公司最核心的系统、机密文档、内部 API,通过 MCP 服务直接开放给 Agent。

AI 不再是「不懂公司制度」的门外汉,而是精通你业务系统的专家。

3. 运营边界与安全控制权

宿主应用决定 Agent 在哪里运行、能访问什么文件。

修改数据库、发送客户邮件这类危险动作,必须等人类点击放行。

> 前端业务规则归你,底层 Agent 循环归 Harness。

---

七、为什么说这是「平台级」野心?

Apache-2.0 许可意味着可商用、可修改、可审查。

但这背后还有一层战略意味:

OpenAI 希望把 Harness 变成 Agent 时代的事实标准——就像 Kubernetes 之于容器编排。模型是可替换的能力层,Harness 才是基础设施层。

当开发者习惯了在 OpenAI 的 Harness 上构建 Agent,模型之间的竞争会变成 Harness 生态内的竞争。这个算盘,打得一点都不遮掩。

---

写在最后

我们常说,AI 的落地卡在最后一公里。

过去一年,大家一直把目光放在「模型更强」上,却忽略了另一个变量:

模型周围那套运行系统,才是真正把 AI 从玩具变成生产工具的关键。

Codex Harness 的开源,标志着一个转变:

> 通用聊天框不再是默认答案,原生 AI 应用正在成为新的主战场。

下一次你做产品决策时,可以问自己三个问题:

1. 你的用户真的需要一个聊天框吗?

2. 你的 Agent 能看到多少业务上下文?

3. 你的 Harness 设计,能不能让同一个模型表现更好?

答案可能决定你的产品,是又一个套壳 ChatBot,还是真正的行业解决方案。

---

原文参考

- OpenAI 官方博客:Codex as a platform: build on the open agent harness

- GitHub 仓库:`github.com/openai/codex`

- ARC-AGI-3 对照:OpenAI 2026.07.29 技术博客

---

> 本文由 AI 辅助整理与制图。如果觉得有用,欢迎点赞、在看、转发给关注 AI 产品落地的朋友。