OpenAI 悄无声息地干了一件很大的事。
它把自己最核心的产品之一——Codex 背后的关键能力,正式开源了出来。
这次开放的不是一个新模型,也不是给 Codex 增加几个小功能,而是 Codex 为什么能够像一个真正的 Agent 一样持续工作、调用工具、处理复杂任务的那套底层系统:Codex Harness
很多人可能会问:Harness 到底是什么?它跟 Agent 又是什么关系?
这里先科普一下,其实可以用一句话概括:

模型负责思考,Harness 负责让模型真正行动起来。
如果只是传统 Chatbot,这个区别没有那么明显。你问一句,模型答一句,任务就结束了。
但 Agent 完全不同。
现在越来越多人用 Codex、Claude Code、WorkBuddy 这类工具,不再只是问“这件事情怎么做”,而是直接把整个任务交给 AI,让它自己读文件、查资料、调用工具、执行命令,甚至连续工作几十分钟、几个小时。
这时候,光有一个聪明的模型显然不够。
一个 Agent 做到第 50 步以后,还记不记得最初的目标?上下文越来越长以后怎么办?工具调用失败以后,是重试还是换方案?哪些文件可以访问?哪些操作必须先经过用户批准?
这些东西,都不是模型本身负责的。
负责把这一整套事情组织起来的,就是 Harness。
OpenAI 对它的定义也非常直接:真正的 Agent 不只是 Prompt 加模型,它还需要长期维护上下文、检查信息、调用工具、展示进度、处理失败,在必要时请求人工审批,并最终把任务完成。
包在模型外面的这套执行系统,就是 Harness。
所以如果把模型理解成“大脑”,Harness 更像是 Agent 的工作系统:它负责记忆、工具、权限、执行流程,以及怎么把一个长任务一直跑下去。
而 Harness 的好坏,对 Agent 能力的影响,可能远比很多人想象得大。
OpenAI 这次公布了一个特别夸张的数据。同样都是GPT-5.6 Sol,模型完全没换,只是优化了推理信息的保留和上下文压缩机制,在 ARC-AGI-3 上的成绩就从13.3% 提升到了 38.3%, 同时输出 Token 还减少到了原来的大约六分之一。
也就是说,模型没变,只是外面的 Harness 变了,实际表现就能接近翻三倍。
这也是为什么最近 Harness 突然成了 AI 圈一个非常火的词。
前不久,DeepSeek 刚刚把自己的 DeepSeek Harness 开源,很快就在开发者社区引发大量关注。
而现在,OpenAI 也把 Codex 背后的 Harness 正式摆到了台前。
这其实是这次最关键的问题。
Codex 本身已经是一个非常成熟的 Agent。既然需要 Agent,大家直接用 Codex 不就好了?
为什么还要把它背后的 Harness 开源出来?
原因其实很简单:
Codex 最早是围绕软件开发构建的。它知道怎么读代码、操作仓库、运行终端、执行测试,也有自己的一套界面和工作流程。
但一个物流公司的 Agent,需要的显然不是这套东西。
物流人员需要看到订单、地图、运输状态;Agent 需要调用物流系统的数据,可能还要重新预订运输。
一个销售 Agent 又完全不同。它可能需要读取 CRM、邮件、报价单和客户历史,然后帮销售判断下一步怎么跟进。
安全分析师需要的是告警、服务器状态、日志以及修复工单。
这些 Agent 底层可能都使用同一个 GPT 模型,但它们需要的 Harness 完全可以不同。
它们接入的数据不同,能够调用的工具不同,权限不同,需要人工批准的动作也不同,甚至连界面都完全不同。
OpenAI 自己也明确说了,开放 Harness 的目的之一,就是让开发者可以检查并修改“应用和模型之间的这一层”,然后决定自己的 Agent 使用什么界面、什么上下文、什么工具,以及哪些行为需要审批。
所以这次真正重要的,并不是:OpenAI 让大家重新做一个 Codex。
而是:
以前你只能使用 OpenAI 已经做好的 Codex。
现在则可以把 Codex 的“内核”塞进自己的软件。
这就是 OpenAI 这次文章标题里真正重要的一句话:Codex as a platform.
Codex 不再只是一个产品,它开始变成一个平台。
目前 OpenAI 提供了三种主要方式,让开发者使用 Codex Harness。
第一种是codex exec。
这是最简单的一层,适合脚本、CI 或者一次性的后台任务。比如自动跑测试、检查代码、执行某个批处理任务。
你把工作交给 Codex,它执行完以后返回结果。
可以把它理解成:临时叫一个 Agent 过来,把这一件事情做完。
第二种是Codex SDK。
如果你已经有自己的应用,可以直接通过 SDK 启动、恢复或者实时接收 Codex 任务的执行过程。
比如你做了一套企业知识库,用户点一下“整理本周所有客户反馈”,后台可以直接启动 Codex,让它读取相关资料、分析内容,然后把结果返回到你自己的产品里。
第三种,也是这次最有意思的一层:Codex app-server。
如果你想让 Agent 真正成为软件的一部分,就可以使用 app-server。
它允许你的应用和本地 Codex 进程保持连接,可以长期维持会话、实时接收 Agent 执行过程、打断任务、提供自己的工具,还能在关键动作发生之前处理人工审批。
💡 简单理解:
只是想让 Codex 在后台跑个任务,用codex exec;
想在自己的程序里调用 Codex,用 SDK;
想把一个完整的 Agent 真正嵌进产品里,用 app-server。
需要特别说明的是,这次开源的并不是 GPT 模型本身。
OpenAI 开放的是Harness 和集成层,模型访问和托管服务依然是另外一层。
换句话说,OpenAI 开源的是“怎么把模型变成 Codex”这一层。
这可能才是这次最值钱的东西。
OpenAI 在文章里还特别强调了一个观点。
最有意思的机会,并不是把 Codex App 换一个 Logo,然后再做一个一模一样的产品。
真正有价值的,是:
这一点非常重要。
因为我们现在看到很多所谓“AI 化”,其实方式都非常简单:在原来的软件旁边再塞一个聊天框。
CRM 右边加一个 AI 助手,客服系统加一个 Ask AI,办公软件里也放一个聊天窗口。
但人真正工作的时候,并不是活在聊天框里的。
物流人员看的是地图和订单,销售看的是客户记录和报价,安全人员看的是告警和日志。
OpenAI 希望做的,是保留这些原来的软件界面,同时把 Codex Agent 放到后面去工作。
OpenAI 对这个架构的描述非常清楚:
企业自己的应用继续掌握业务上下文、业务规则和工具,而 Codex app-server 提供 Agent Loop 和沙箱执行。

这也是为什么不同公司需要不同 Harness。
Agent 的“大脑”可能一样,但它周围的业务环境完全不同。
为了让开发者看懂这件事情,OpenAI 专门做了一个叫Relay的 Demo。

它模拟的是一家物流公司的运营系统。
假设一批货物出现延误。
传统方式可能是工作人员自己找到订单、查运输状态、查看替代路线,再比较不同补救方案。
在 Relay 里,用户不需要重新打开 Codex,更不需要先写一大段 Prompt。
他直接在物流系统里选中这批异常货物,然后点击“比较补救方案”。
接下来,应用会自动把相关上下文交给 Codex。Codex 通过企业提供的 MCP 工具获取最新业务数据,再分析不同的处理方案。
如果只是读数据、做分析,Agent 可以自己完成。
但如果最后需要真正重新预订运输,这属于一个会产生实际后果的操作,Agent 就会停下来请求用户批准。
用户确认以后,它才真正修改业务记录。
整个过程中,用户面对的依然是熟悉的物流系统。
订单还是订单,地图还是地图,业务流程也没有被一个万能聊天框取代。
Codex 只是变成了后台那个会自己分析、调用工具、持续工作的 Agent。
这其实就是 Codex Harness 最值得想象的地方。
这套模式并不是 OpenAI 自己画出来的 PPT。
GitHub 和 JetBrains 已经把 Codex 接入现有的 IDE 工作流;Cisco 则在 Cisco Cloud Control 的 App Builder 里使用了 Codex SDK。
还有一个很具体的案例。
Thrive Holdings 和 Crete 把 Codex 接入了报税流程,试点一共处理了7000 份报税材料,最终把准备时间缩短了大约三分之一。
这就说明,Codex 平台化以后,它的目标已经明显不只是 Coding。
同样的架构完全可以进入客服、运营、安全、销售和其他专业工作流程。
比如 CRM 完全可以让 Agent 自动读取客户记录、邮件和会议纪要,先判断这个客户现在处于什么状态,再给出下一步建议。
客服系统则可以让 Agent 自动查看账户历史、产品日志和内部文档,再生成一个处理方案。
安全平台可以让 Agent 先分析告警和受影响服务,最后在真正创建修复任务之前要求人工确认。
底层可能都是 Codex。
但最终做出来的,是完全不同的 Agent。
过去两年,我们判断一个 AI 强不强,主要看模型。
GPT、Claude、DeepSeek、Kimi、GLM……,大家不断比 Benchmark、参数量和推理能力。
但 Agent 真正开始进入工作以后,模型显然已经不是全部。
同一个模型,怎么管理上下文,给它什么工具,如何控制权限,遇到失败以后怎么恢复,这些都会直接影响最终结果。
但 Agent 真正开始进入工作以后,模型显然已经不是全部。
好马还得配好鞍,如果说模型是马,Harness 就是马鞍。
所以 DeepSeek 前脚开源 Harness,OpenAI 后脚又把 Codex Harness 平台化,并不是偶然。
模型依然决定了 Agent 的能力上限。
但 Harness 决定的是:
现在新的 ChatGPT 桌面客户端已经把 Chat、Work 和 Codex 放进了同一个应用里,而 Codex 本身的增长速度也非常夸张。
根据 OpenAI 公布的数据,Codex 活跃用户从今年 2 月初的 100 万,一路增长到 8 月 12 日的 1500 万,半年时间扩大了 15 倍。
尤其是最近一个月,用户数又从约 600 万猛增到 1500 万,短短 31 天新增约 900 万用户。

已经不是一个小众的编程工具,而是在快速变成 OpenAI 最重要的 Agent 入口之一。
这背后的方向其实越来越清楚。
过去,我们使用 AI,是打开一个聊天框,然后问它一个问题。
现在,我们开始把一整件事情交给 Agent。
而再往下一步,可能连单独“打开 AI”这个动作都不需要了。
Agent 会直接长进物流系统、CRM、财务软件、安全平台,以及各种我们原来就在使用的软件。
你甚至不一定知道后台跑的是 Codex。
但它已经开始真正替你干活了。
这可能才是 OpenAI 这次开放 Codex Harness 最值得关注的地方。
参考资料:
1. OpenAI:Codex as a platform: build on the open agent harness
https://developers.openai.com/blog/codex-as-a-platform
2. OpenAI:How agents are transforming work
https://openai.com/index/how-agents-are-transforming-work/
3. OpenAI:Codex for every role, tool, and workflow
https://openai.com/index/codex-for-every-role-tool-workflow/
4. Codex Harness:GitHub
https://github.com/openai/codex
夜雨聆风