Agent工作效率革命:OpenAI内部99.8%的Token流向Codex,聊天时代正在终结
一、一天只有24小时,他们跑出了71小时
一个人,一天只有24小时。
但在OpenAI,最重度的1%员工,一天累计跑出了约71小时的智能体运行时长。
钟表依旧正常。奥秘在于并行:多个Agent在同时开工。一个查数据,一个改代码,一个写报告,另一个还在测试。人类坐在屏幕前,身份已经从"工具使用者"变成了机器团队的调度员。
2026年6月25日,OpenAI同时发布博客《How agents are transforming work》和约50页的研究论文《The Shift to Agentic AI: Evidence from Codex》。这一次,OpenAI拿自己做了实验。
数字冷静得可怕:公司内部活跃用户里,97.9%的人已经在用Codex。把ChatGPT和Codex的产出加在一起算,Codex吃掉了99.8%的份额。
换句话说,那个曾经统治办公室的聊天窗口,正在自己家里被自己的孩子边缘化。
二、99.8%这个数字,最容易被读错
先看统计口径。
截至2026年6月11日前后一周,在OpenAI员工通过Codex与ChatGPT产生的输出Token中,99.8%来自Codex。
这个比例并不表示"99.8%的员工都只用Codex"。Token可以理解为AI读写信息的基本单位。有人偶尔打开一次工具,也算一个用户。但真正把多个智能体连续跑几小时的人,会产生海量Token。
因此,Token份额反映的是AI工作发生在哪里,含义与简单的"点开率"不同。
三类用户的差距相当惊人:
OpenAI内部:Codex占输出Token的99.8%,活跃用户使用率约97.9%。
企业与组织用户:Codex占63.3%,过去28天约17.3%使用过。
个人用户:Codex占16.5%,活跃用户占比不到1%。
个人侧呈现出一个有趣结构:人很少,但用上的人很猛。这不到1%的人,几乎是把Codex当成了主力生产力,用量深到完全不像尝鲜。
三、十个月大迁徙:ChatGPT还是聊天框,Codex已成"指挥部"
Codex在2025年4月有限发布时,首先是一款面向软件开发的智能体工具。
到了2025年8月,OpenAI内部平均员工花在Codex上的Token还不到10%。ChatGPT仍是默认入口。
随后,迁徙开始加速。
2025年12月,工程师率先跨过临界点,超过一半使用转向Codex。
2026年4月,法务、财务、招聘等非工程部门也完成主力切换。
到论文发布时,平均工程师约99%的输出Token来自Codex,律师和招聘人员也超过85%。
从2025年11月到2026年6月,内部活跃用户的合并输出Token中位数增长约为:研究部门56倍,客户支持32倍,工程27倍,法务13倍。
为什么软件是第一块倒下的多米诺骨牌?
因为代码天然适合机器接管:它能测试、能比较差异、能回滚、能部署。错误会直接呈现为红色报错、失败用例和明确日志。
一旦这种"可验证的执行链"扩展到文档、表格、工单和业务系统,智能体便开始越过工程部门的围墙。
四、任务时程暴增十倍:AI不再只接"零活"
更深的变化落在人类敢交出去多大的工作包。使用次数已经退居其次。
论文对个人用户抽了0.1%的随机样本,估算每次委托相当于人类要花多少工时。
2025年12月,约35.4%的用户提交过1小时以上的任务,约2.1%提交过8小时以上的任务。
到了2026年5月,80.6%的用户至少提交过估计需要人类30分钟以上的任务。70.2%提交过1小时以上的任务。25.6%提交过8小时以上的任务。
短短五个月,8小时级任务的用户占比增长约十倍。
任务时长来自模型对"资深人类不用AI需要多久"的估算,并非秒表实测。样本也来自允许数据用于训练的约0.1%个人账号随机样本。
但趋势已经足够清楚:过去,人们让AI补短句、改一段代码。现在,第一轮指令就可能把半天甚至一天的工作整包扔过去。
五、一个人同时管理五个"数字同事"
任务一旦变长,并行就会出现。
OpenAI内部约28.6%的用户,曾在同一周把并发智能体峰值推到五个及以上。只有约10.7%完全没有并发。
员工单日累计智能体运行时长中位数约为2.5小时,第99百分位达到约60至71小时。
所谓"一天71小时",正是多个线程重叠运行后的累计值。
Anthropic的外部研究也显示,Claude Code最长轮次从约25分钟升至45分钟,但多数用户给予AI的自主度依然谨慎。能力已经能跑得更远,人类却未必敢交出去。
六、下一个爆点:Skills
2026年3月1日,只有约5.4%的活跃用户使用Skill。
到6月11日,这一比例已经升至26.6%。OpenAI内部更达到约96.2%。
Skill可以理解为交给智能体的标准作业程序:固定指令、工具连接、检查步骤和输出格式。
一次好用的提示词,可能只帮助一个人。一套Skill,则可以被整个团队反复调用。
这意味着AI使用正在从"个人灵感"变成组织制度,从临时对话沉淀为可复制、可审计的流程资产。
更关键的是,约26.6%的用户开始使用Skills,把指令、能力和集成封装成可复用工作流。AI不再是一次性问答框,而开始变成组织里的生产基础设施。
岗位边界也随之松动。自2025年8月以来,非开发者活跃用户在个人端增长约137倍,组织端增长约189倍。业务职能使用Codex完成的工作中,超过四分之一被归为工程或编码类。
招聘人员做自动化,销售人员处理数据,法务人员搭建小工具。过去需要排队交给工程部门的"工单",正在被业务人员自己消化。
七、从Copilot到Autopilot:行业范式转移
微软在Build 2025大会上做了一个重要升级:GitHub Copilot正式从IDE中的代码补全助手进化为具备Agent智能的编程伙伴。
微软CEO Satya Nadella强调,Copilot正在从"结对编程的副驾驶"转变为真正的"同伴编程"角色。
过去Copilot主要在编辑器中根据上下文提示完成代码,而Copilot Agent可以自主接管完整的开发任务。从GitHub上的issue列表中拾取请求,自动创建新分支,编写实现代码,设置好GitHub Actions进行CI测试,最终提交初步完成的拉取请求供人审核。
整个过程中,Copilot Agent在自己的分支上工作,遵循团队的代码安全措施,开发者几乎无需亲自动手。
这意味着开发者可以将某些问题直接指派给Copilot处理。错误修复、新功能开发、代码重构维护,Copilot将自主完成。
Copilot CLI进一步提供了几类能力:/fleet负责把复杂任务拆成可以并行处理的子任务。Autopilot负责让Copilot在本地终端里持续执行。Hooks负责在关键节点插入安全检查和审计逻辑。/delegate则把任务交给GitHub上的Copilot cloud agent,在远端创建分支和draft PR。
中国信通院的观察是,编程能力正在从"代码补全"迈向"全栈开发智能体"。这意味着,未来的软件开发,可能只需要人类定义好需求和验收标准,剩下的架构、编码、测试、部署,将完全由多个协作的智能体完成。
斯坦福大学的《AI指数报告2026》指出,尽管软件行业整体在扩张,但22岁至25岁的初级软件开发者就业率下降了近20%。这并非岗位消失了,而是"复制粘贴"型的初级工作被智能体取代了。
八、外部世界还没穿越:OpenAI的前沿样本与普通公司仍有距离
人群之间的差异显著。
OpenAI员工:Codex占输出Token的99.8%,约97.9%活跃用户使用。
组织账号:Codex占63.3%,过去28天约17.3%使用。
个人账号:Codex占16.5%,活跃用户占比低于1%。
OpenAI自己也反复提醒:这里的人熟悉前沿模型,有充分算力、权限、培训和知识共享。这个低摩擦的未来实验室拥有普通企业今天难以复制的条件。
论文借用了工厂电气化的历史:早期企业只是把蒸汽机换成电动机,厂房布局不变,收益有限。真正的生产率跃迁,发生在整条产线按电力特性重新设计之后。
决定胜负的,是模型能力以及企业有没有:清晰的权限与数据边界;检查点、审计、回滚和人工闸门;能够验收多个智能体的管理者。
因为短任务失败,浪费几分钟。长任务失败,可能浪费几天。
正如沃顿教授Ethan Mollick所说,OpenAI像煤矿里的金丝雀。它的现在,可能是领先企业的三到五年后。但方向已经确立。
九、实操:普通团队怎么踩下油门
不需要成为OpenAI,也可以从今天的工具中受益。
先把任务分类。零活类的润色、翻译、摘要,继续用对话式AI。超过30分钟、有明确输入输出边界的工作,开始尝试用Agent完成。
建立Skills或Prompt模板库。一个团队成员摸索出的成功Prompt,固化成模板,全团队可复用。Skill的价值不在于精巧,在于可复制。
从工程师扩展到法务、财务、招聘。Codex的数据证明,非技术团队的迁移速度比工程师更快——法务团队从20%到75%只用了一个月。关键不是会不会写代码,而是有没有把工作流程拆成可执行的步骤。
设置闸门。Autopilot模式可以连续工作,但不要在一个模糊目标下乱扩展。先进入Plan模式收敛范围,再进入执行。涉及删除文件、改部署脚本、改数据库迁移这类操作时,加上限制。
记录和审计。所有Agent完成的任务,保留Prompt、输出和验收记录。这不仅是质量追溯的需要,也是组织知识资产的一部分。
FAQ
Q:OpenAI内部的99.8% Token占比,能直接套用到普通企业吗?
A:不能直接套用。OpenAI员工熟悉前沿模型,有充分算力、权限、培训和知识共享。普通企业的迁移路径会更慢,但方向一致:对话式AI→委派式Agent→多Agent并行调度。
Q:非开发者真的能用Codex吗?需要什么基础?
A:数据已经给出了答案。自2025年8月以来,非开发者在个人端增长137倍,组织端增长189倍。法务、财务、招聘等岗位的员工无需编程基础,只要能清晰描述工作目标和步骤,就能委派任务给Agent。
Q:从Copilot到Autopilot,会不会让大量程序员失业?
A:短期内是角色转型而非岗位消失。斯坦福数据显示的是初级"复制粘贴"型工作被压缩,但顶层的架构师和复杂系统设计岗位反而更稀缺。开发者从"亲自写每一行代码"变成"定义目标、分配任务、验收产出"。
Q:Skills和普通Prompt有什么区别?
A:Prompt是一次性的,Skill是可复用的标准作业程序。Prompt帮你完成一次任务,Skill让整个团队重复完成同类任务。Skills包含固定指令、工具连接、检查步骤和输出格式,是AI使用从"个人灵感"变成"组织制度"的标志。
云南奇崛数字传媒科技有限公司,交个朋友云南独家代理。双事业部驱动:奇崛传媒(全域电商/跨境出海/MCN/品牌运营/达人孵化)+ 奇崛AGI研究院(AI Agent开发/GEO优化/大模型部署/云计算/AI咨询)。巨量引擎认证代理|小红书聚光平台授权|腾讯云·阿里云·火山引擎·智谱多AI生态
参考文献
OpenAI. 《How agents are transforming work》. 2026-06-25. https://openai.com OpenAI. 《The Shift to Agentic AI: Evidence from Codex》. 2026-06. https://openai.com/research GitHub Blog. 《GitHub Copilot Agent: from autocomplete to peer programming》. 2025. https://github.blog Microsoft Build 2025. 《Copilot everywhere to Agent everywhere》. 2025. https://build.microsoft.com Anthropic. 《Claude Code usage trends and long-horizon task data》. 2026. https://www.anthropic.com 中国信通院. 《从Copilot到Autopilot:编程能力演进观察》. 2026. https://www.caict.ac.cn 斯坦福大学. 《AI Index Report 2026》. 2026. https://aiindex.stanford.edu CSDN. 《从codex、copilot agent到编程自动化的AI软件开发范式转变》. 2026-07-19. https://blog.csdn.net CSDN. 《临界点的回响:当AI从"大脑"进化出"双手"》. 2026-07-19. https://blog.csdn.net AIDB. 《OpenAI Codex 99.8%: Token share analysis and methodology notes》. 2026. https://www.aidb.io Harvard Business Review. 《The Factory Electrification Parallel to AI Adoption》. 2025. https://hbr.org David Holtz. 《Managing multiple agents: lessons from OpenAI internal data》. 2026. https://www.davidholtz.com
夜雨聆风