OpenAI昨天甩出四张图表,等于当众承认一件事:自己的公司,已经被AI智能体接管了。
数字摆在那儿。内部28天活跃用户里,97.9%离不开Codex。工程师、律师、财务、招聘,统统在用。公司每天产出的工作结果,99.8%出自这个AI智能体之手。
镜头切到公司外面,个人用户的采用率只有,0.7%。
同一款产品,同一套模型,内部和外部之间隔出一道近乎荒谬的鸿沟。OpenAI把这道鸿沟原封不动地公布出来,配上论文、官方博客、四张图表,潜台词很明显:这就是两年后所有公司的样子。
从「问答案」到「甩任务」:一年时间,内部彻底变了天
时间拨回2025年8月。那时候OpenAI员工手里的AI工具,主力还是ChatGPT。普通员工花在Codex上的token,占比不到10%。
Codex这款代理式编程工具,那阵子刚以CLI和云端形态重新上线不久,更多被当成程序员的辅助玩具。
十个月后,风向彻底转了。2025年10月Codex全量开放,12月工程团队率先集体转向,2026年2月桌面客户端上线、支持同时管理多个代理,4月前后法务、财务、招聘这些非技术部门也跨过了「以Codex为主」的门槛。
到今年6月,OpenAI官方博客这样写道:
"Agentic AI changes the unit of knowledge work from single interactions to delegated, long-horizon tasks."
「智能体式AI正在改变知识工作的基本单位,从一次性的单次互动,变成可以长时间运行、委托出去的任务。」

▲ OpenAI官方博客《How agents are transforming work》:2025年8月前,普通员工花在Codex上的token不到10%;如今,包括法务、招聘在内的每个部门都把Codex当作主力工具。
97.9%背后:四张图表拼出的真相
OpenAI这次没有藏着掖着,把内部数据摊开给全世界看。
第一张图,看部门产出token的增长曲线:以2025年11月为基准,Research部门涨了53倍,客服涨了32倍,工程涨了26倍,法务涨了12倍,几乎每条曲线都在过去几个月里陡然拉升。
第二张图,看工作类型占比:工程部门72%的产出属于编码,但也有18%流向了「知识型工作」;财务与业务运营部门里,34%的活儿是知识型工作,16%是财务分析;产品与市场部门,51%都成了知识型工作产出。这说明Codex早就不只是写代码的工具了。
第三、四张图对比开发者和非开发者的采用曲线:开发者这边,组织用户涨了85倍,个人用户涨了61倍;非开发者这边,组织用户涨了189倍,个人用户涨了137倍,非开发者的增长曲线反而更陡。而OpenAI自己内部,由于起点已经很高,只涨了4到12倍。
OpenAI在推文里写道:
"Across our entire company, people are using Codex to do work that is more complex, longer-running, and increasingly cross-functional."
「在整个公司范围内,人们正在用Codex完成更复杂、运行时间更长、越来越跨部门的工作。」


▲ OpenAI官方推文原图:左上为各部门产出token增长曲线,右上为部门工作类型占比表,下方两张分别对比开发者/非开发者在个人、组织、OpenAI内部三类群体中的采用速度。
员工一天甩出去60小时的活
比采用率更能说明问题的,是任务本身在变大变长。
论文数据显示,截至2026年5月,个人用户里有80.6%至少交付过一次相当于人工30分钟以上工作量的任务,70.2%的用户交付过1小时以上的任务,25.6%的用户交付过8小时以上的任务。而从年初到现在,「8小时以上任务」的用户占比涨了将近10倍。
OpenAI内部的重度用户走得更远。日活用户里排名前1%的那批人,单日能同时驱动超过60小时的代理工作量,靠的是并行跑多个代理。超过10%的员工每周会同时管理3个以上代理,26.6%的人已经在用可复用的「技能模板」(skills)来批量处理重复工作。
这组数字被Peter Diamandis转发放大,配文毫不含糊:
"98% of OpenAI employees now use Codex agents. Research usage up 56x in 7 months. 8-hour task requests up 10x. The company building AGI is already running on AI agents internally. This is the preview of what every company looks like in 2 years."
「98%的OpenAI员工现在都在用Codex智能体。研究部门的使用量7个月内涨了56倍,8小时任务请求涨了10倍。这家正在构建AGI的公司,内部已经完全跑在AI智能体上,这就是两年后每家公司会变成的样子。」

▲ 知名科技投资人Peter Diamandis转发OpenAI数据并放大关键数字:725个赞,把「内部全面代理化」解读为整个行业两年后的预演。
工作单元的定义,正在被彻底改写。过去是「问一句答一句」,现在变成「交代一整段项目,几小时或几天后回来收活」。当使用一个AI智能体的边际成本几乎为零,人们真的会这样把工作甩出去。
非开发者才是真正的信号
如果只是程序员用得更多,这条新闻的分量会小很多。真正让人意外的,是非开发者的增长曲线比开发者还要陡。
法务部门的月度输出token,从2025年11月到2026年6月涨了13倍。有意思的是,据《The Register》报道,同期该团队实际处理的联邦诉讼案件量只增加了11%,任务量没有暴涨,但产出的token量翻了十几倍,说明这些代理承担的更多是结构化分析、文档整理这类原本需要专门技术支持的活儿。
招聘、财务这些部门也是同样的路径:增量并非工作量本身暴涨,而是原本要排队等工程师帮忙做的自动化、数据清洗、报表生成,现在业务人员自己就能让代理去干。技术门槛被大幅拉低了。
但走出OpenAI大门,只有0.7%的人在用
内部数据讲得漂亮,可一旦把镜头对准外部世界,画风完全变了。
组织用户的采用率是17.3%,个人用户只有0.7%。同一款产品,同一套能力,外部的采用速度跟内部完全不在一个量级上。
《The Register》记者Thomas Claburn的报道标题正面怼上这个数字:
"OpenAI says 97.9 percent of its employees are now using agents" / "Codex, it's not just for developers, really"
「OpenAI宣称97.9%的员工正在使用智能体」,副标题调侃道:「Codex,其实真的不只是给程序员用的。」
报道里有段吐槽相当不客气:
"OpenAI did not immediately respond to a request to clarify whether it incentivizes or encourages employees to use its AI tools... But we'll take it on faith that when there's enough Kool-Aid on-premises, employees may just develop a taste for it regardless of whether their jobs depend on Kool-Aid consumption."
「OpenAI没有立即回应记者的提问:公司内部是否在激励或者要求员工使用自家AI工具。不过姑且相信,只要办公室里的『迷魂汤』管够,员工多半会慢慢喝出味道来,不管他们的工作是否真的需要靠喝这碗汤过日子。」
《The Register》还点出一个更现实的动机:任务运行时间越长,消耗的token就越多,如果这些token能计费,正好能缓解OpenAI账面上数千亿美元的债务压力。

▲ 《The Register》记者Thomas Claburn的报道,标题直击97.9%这一数字,同时质疑OpenAI是否在内部激励员工使用自家工具、以及这背后的收入动机。
「早期预览」还是自卖自夸?
行业分析师给出了更平衡的解读。SmarterX创始人Mike Kaput的标题干脆写成:
"Inside OpenAI, AI Agents Have Replaced the Chatbot"
「在OpenAI内部,AI智能体已经取代了聊天机器人。」
他在文章里点出几个关键判断:知识工作的基本单位,正从简短对话,变成需要长时间运行的委托任务;验证正在成为新的瓶颈;实验室里近乎无限的使用配额,本质上是一次「预览」,还称不上普通公司的日常状态。

▲ SmarterX创始人Mike Kaput的解读文章:把内部数据框定为「代理取代聊天机器人」的信号,同时提醒读者验证工作正在变成新瓶颈。
AI Weekly的编辑按语则更谨慎,把关注点从内部数字挪开:
"The number that matters most here is not 97.9% but 0.7%... The company also openly links longer tasks to token revenue in the same paper, which is a reason to read these self-reported metrics with care."
真正值得盯住的数字其实是0.7%,这是外部个人用户的采用率,说明智能体式AI的转型,在OpenAI自家围墙之外依然十分狭窄。论文里也坦承,任务运行得越久,消耗的token越多,这与收入紧密挂钩,所以这些自己报出来的数据,读的时候得留个心眼。

▲ AI Weekly的TL;DR与编辑按语:提醒读者真正该盯住的是仅0.7%的外部个人采用率,97.9%的内部渗透率反而没那么关键,还要留意自报数据背后的收入动机。
真正的瓶颈,正在从「生成」挪向「验证」
把这些数字拼在一起看,能读出比「代理很厉害」更深一层的东西。
当一个人可以同时驱动三个以上并行运行的代理,当日活用户里排名前1%的人一天能派发60小时的活,真正稀缺的技能变成了判断AI做得对不对。生成端的产能早已过剩,验证和协调才是卡住整条流程的地方。
这次披露也有明显的局限。任务时长是用另一个AI模型当裁判估算出来的,属于方向性估算,并非精确统计;论文全篇没有提供任何错误率、返工率或者质量数据;OpenAI内部的环境是「无使用上限、知识共享文化浓厚、组织高度买账」的极端理想状态,本身就不具备代表性;论文和博客也都写明白了,这更像是「前沿实验室的早期预览」,算不上行业当下的平均水平。
还有一层更微妙的反差:这条主推文下面429条回复里,相当一部分人根本没在讨论采用率数字,而是在抱怨模型下线、要求「把4o还回来」。官方想聊的是「工作的未来」,评论区里不少人聊的却是「这个月的额度又不够用了」。官方想传递的说法和用户当下的真实体验,中间也隔着一道缝。
类似的反差,行业里早有先例。GitHub Copilot在2021到2023年的采用研究就发现过类似的模式:生产力确实提升了,但随之而来的是不低的「信任税」,人们愿意用,但要花额外的精力去核对AI给出的结果。早期RPA(机器人流程自动化)的落地路径也差不多:先攻克IT部门,再扩散到业务部门,瓶颈从「谁来执行」逐渐挪到「谁来处理例外情况」。
OpenAI这次拿出的,是一份写满具体数字的「内部体检报告」:97.9%对0.7%,99.8%对16.5%,56倍对11%。这些数字目前只描述了一家公司,一家把全部业务重心都压在AI智能体上的公司。
至于两年后,这套模式会不会真的在每家公司复制一遍,答案还没写出来。眼下能确定的是,验证这一关,才刚刚开始被真正重视。
夜雨聆风