夜雨聆风学习资料网

ARTICLE · 1021245

OpenAI的软件工厂:Codex接管后,软件工程不存在了

OpenAI的软件工厂:Codex接管后,软件工程不存在了

Gergely Orosz 又去了一趟 OpenAI 总部。回来后在 The Pragmatic Engineer 上发了一篇深度报道,标题叫《Inside OpenAI's agentic software factory》。

他和七位 OpenAI 的工程师及工程负责人聊了聊:应用基础设施 VP Venkat Venkataramani、ChatGPT 工程负责人 Sulman Choudhry、桌面端负责人 Andrew Ambrosino、核心代理团队负责人 Joe Gershenson、生产力团队工程负责人 Akshay Nathan,还有两位工程师 Ahmed Ibrahim 和 Steve Coffey。

核心信息就一句:Codex 已经从"锦上添花"的工具,变成了这家公司的事实基础设施。

非工程师先"叛变"了

OpenAI 内部的使用数据很有意思。四个月内,财务、招聘、法务这些非工程部门对 Codex 的使用率从接近 0% 涨到了 90%。

时间线是这样的:Codex Mac 版 2 月发布,Windows 版 3 月,ChatGPT Work(底层是 Codex harness)7 月上线。在 Mac 版发布后的头两个月,界面还很"程序员友好",屏幕上直接显示代码。但非技术同事照样用,拿来做研究、做 PPT、写表格。他们不在乎代码,在乎结果。到 Codex 在非工程团队达到近 40% 采用率的时候,界面都没改过。

真正的转折发生在 4 月到 5 月。OpenAI 在 Codex 里加了 /goal 功能:设一个目标,代理会一直干到完成为止。这期间使用率从 60% 跳到 90%。

桌面端负责人 Andrew Ambrosino 观察到一个有意思的变化:人们开始在一个线程上花很长时间,甚至好几天。设一个目标,然后让模型自己跑。长任务跑起来之后,代理经常会自动派生子代理去处理其他事情,人需要同时管理的表面区域反而变小了。

生产力团队工程负责人 Akshay Nathan 用一个概念解释了这个现象。他说之前是"capability overhang":模型能力够了,但产品没跟上,发挥不出来。现在反过来了,变成"awareness overhang":产品已经够好,但很多人还不知道能用它干什么。有人发现了能用 Codex 监控 Slack、更新 Airtable、做入职材料,但更多人还是只用它完成一个任务就关了,然后靠同事口口相传才学会新用法。

还有一个加速因素:每个团队开始把自己好用的工作流打包成插件分发。Ambrosino 说得很直接:"如果你做一个什么都能干的产品,团队需要一种方式把它变成自己的。不能给每个人一个空盒子。"

现在 OpenAI 新工程师入职,会被引导去问 Codex,因为它掌握的上下文量多得吓人。Codex 内部版本接入了几乎所有 OpenAI 系统——Git、Slack、Notion、Databricks、Datadog,全通。OpenAI 把所有文档都搬进了源码库,代理能读到的上下文远比任何人类工程师多。

一个很微妙的细节:Codex 一些内部 skills 的维护者就是 Codex 自己——蛇吃自己尾巴。内部版本比外部版本先进得多,因为它深度接入了公司所有系统,这和 Ramp 做 Inspect AI 的思路一样,深度集成比通用能力更重要。

依赖程度到了什么地步?一个小故障出现,同事的 Slack 消息往往比自动化告警还快。工作几乎只通过 Codex 和 ChatGPT Work 进行。两年前还没有 AI 代理,只有高级的 AI 自动补全。

IDE 和 PR 都在退场

去年底,Codex 团队还在犹豫要不要发桌面应用。Ambrosino 当时的担心很具体:终端有 Codex CLI,IDE 有各种功能齐全的选择,中间还能塞下什么?他拿 iPad 打比方——很多人买了 iPad 然后吃灰,要么用更便携的手机(相当于 CLI),要么用功能齐全的笔记本(相当于 IDE)。

11 月 Antigravity 作为 VS Code 的 fork 刚出来的时候,这个怀疑加深了。团队内部也有声音说,要不我们也 fork VS Code 算了。但他们最后赌了一把:AI 代理越强,IDE 越不重要。

赌对了。今年 1 月之后,IDE 用量一路下滑。Codex 桌面端后来也加了一些 IDE 特性,6 月上线了应用内文件编辑,但方向已经定了。

PR 的情况更剧烈。Venkat Venkataramani 说,每个工程师产生的 PR 数量呈曲棍球棒式增长,CI/CD 系统负载大约涨了 10 倍,而这个过程只用了 6 个月。大多数公司经历这个量级的增长需要两三年。

"每个月都会遇到一组新的基础设施瓶颈。刚以为容量够了,模型又解锁了新能力,瓶颈出现在另一个地方。"

他们的应对方式不是硬扛,而是直接重新思考 PR 和代码审查还该不该这样搞。Venkat 说得很直接:"今天做代码审查的方式越来越没道理了,PR 也一样。"

现在 OpenAI 用多个代理并行审查代码,每个代理扮演一个领域专家——云基础设施工程师、安全工程师分别看各自领域。这在以前根本不现实。变更按风险分级,低风险 PR 可由代理自动批准,不用等人。只有高风险变更才强制要求人类参与。

Gergely 在文章里坦承了一个疑虑:他一开始对"领域专家代理"的说法是怀疑的——一个被告知"你是云基础设施专家"的代理,和通用代理审出来的结果真会不一样?后来他想通了:这些代理有 OpenAI 全部代码和文档的访问权限,它们各自聚焦自己的领域,在有限的上下文窗口内做到精深的审查。

软件工厂怎么运转

Orosz 把这套体系叫做"agentic software factory"。类比制造业里的"黑暗工厂":全自动化到不需要开灯,因为没有人。

整条流水线是这么跑的:

定义目标。 工程师或产品经理描述问题和期望结果。Venkat 提到一个关键观察:工程师正在变得更像产品经理,判断力、优先级和品味比写代码本身更重要。

收集上下文。 Codex 接入 Git、Slack、Notion、Databricks、Datadog、内部日志等一切数据源。文档全在代码里,代理能看到的远超任何人脑能承载的。

实现代码。 Codex 做一系列代码改动直到达成目标,验证软件能正常工作。

构建、测试、CI。 代理构建代码、跑测试、修失败、提 PR。它守在 PR 旁边直到变绿,自动修 CI 失败、更新 PR。还有一个 perf harness,把可能有性能问题的 PR 送去做 A/B 评估。

代理代码审查。 多个领域专家代理并行审查,按风险分级。代码产出速度太快,人根本审不过来。

代理部署。 每个变更分配专属代理,任务可以概括为"护送这个变更安全上线"。代理会自己读代码、找 feature flag、决定哪些信号代表成功或失败、自己构建监控面板。以前工程师手动建面板监控服务,现在代理按每次部署的粒度来做。OpenAI 的长期目标是做一个"per-change autonomous SRE"。

Perf Factory。 自动化性能工厂:代理扫描告警、去重、识别真实延迟回归、定位根因、提出修复。把工作流从部署延伸到了持续优化。

Sevbot。 内部事件响应代理。事故发生时,它收集上下文、提供缓解建议、回答提问,但不会自己动手执行操作。OpenAI 的梦想是让 Sevbot 自主处理夜间例行事故,不再把人叫醒。不过目前,oncall 还没有被淘汰。

最扎眼的瓶颈:App Store

所有环节都在加速,只有一处还在堵车:苹果和谷歌的应用商店审核。

ChatGPT 工程负责人 Sulman Choudhry 之前在 Facebook 干过。他说 2010 年代的 Facebook 靠 feature flag 把移动端发版从月度压到双周、再到周度。代码可以提前写好藏着,远程打开。

现在 Codex 写代码只需要几分钟,把代码送到用户手机上要等好几天。

"如果软件几分钟就能写出来,等几天才能上架到手机,这个矛盾会越来越荒谬。"

一个容易被忽略的事实:2008 年 App Store 上线,18 年过去了,应用审核几乎没有变化。苹果仍然不允许应用绕过审核流程发布有意义的体验改动。

工程岗位也在变

Orosz 采访的七位工程师和负责人都提到了同一个趋势:工程专业化分工在模糊,判断力和主动性比写代码本身重要得多。以前看起来"不可能完成"的重写和迁移,现在一两个工程师加一个代理就能搞定。

还有一个组织变化。OpenAI 把领域专家嵌入了 ChatGPT Work 的工程团队。原因是模型在幻灯片设计、财务报表这些领域的"品味"已经超过了开发者——开发者自己判断不了输出好不好,需要真人专家来把关,告诉工程师什么才算一份好的汇报材料、好的财务报表。Gergely 在文章里忍不住补了一句:这其实是个几十年历史的老最佳实践,每隔几年就在不同语境下被重新发现一次。

几组数据

OpenAI 在 2026 年 6 月发了一篇经济研究论文,给内部使用画了更精确的画像:

  • 到 2026 年 5 月,80.6% 的抽样个人用户至少做过一次估计超 30 分钟人工劳动的 Codex 请求,70.2% 做过超 1 小时的,25.6% 做过超 8 小时的。
  • Codex 占 OpenAI 内部每周输出 tokens 的 99.8%。不是 90%,是 99.8%。
  • 重度用户(99 分位)一天让 Codex 代理跑了超过 60 小时的 agent turns,靠并行多代理实现。
  • 从 2025 年 8 月起,个人用户中非开发者增长 137 倍,组织用户中增长 189 倍。
  • 业务部门(财务、营销、运营等)通过 Codex 完成的工作里,超过四分之一是编码或工程类任务。代理在打破岗位边界。

一个判断已经很清楚了:Codex 在 OpenAI 内部不是工具,是基础设施。而这个基础设施上面跑的,已经不是传统意义上的软件工程了。

关注公众号回复“进群”入群讨论

相关学习资料

返回首页浏览学习资料