乐于分享
好东西不私藏

OpenAI Codex实证数据研究:AI需求的发展现状和驱动因素分析

OpenAI Codex实证数据研究:AI需求的发展现状和驱动因素分析

OpenAI联合哥伦比亚商学院、沃顿商学院及杜克大学撰写了《The Shift To Agentic AI Evidence From Codex.pdf》,文章认为:

AI正在完成从咨询助手自主执行智能体的范式转移:Codex实证表明,前沿环境下员工已大规模委托高复杂度、长周期、多线程并行任务,通过标准化工作流批量复用AI能力。当前采用差距并非源于模型能力,而是组织配套、流程改造、人员认知的摩擦差异;未来知识工作者的核心工作将从动手执行,转向管理、监督、协调多AI智能体协同完成业务。即:

1Agentic AI的渗透率快速提升,但企业端仍有很大的提升空间,前沿用户与普通用户已开始拉开生产力差距;

2Agentic AI的任务处理强度、深度在快速提升,应用场景也在持续泛化,意味着token消耗和结果产出会持续增长;

3)组织互补要素决定AI价值的释放:仅靠模型能力无法实现生产力大幅提升,必须配套员工培训、权限系统、内部流程重构、审核校验机制;OpenAI内部高渗透率印证组织配套的关键作用;

4)如同早年电力替代蒸汽机,短期难以看到宏观统计生产力大幅提升;企业需要时间完成流程、组织、人员技能配套改造,需要围绕并行AI工作流重新设计岗位职责、团队分工、考核体系,Agentic AI长期生产力红利会逐步释放。

一、研究样本与核心研究目的

1、对比三类用户群体:OpenAI 内部员工用户、企业组织账户用户、个人散户用户,采用隐私脱敏方式分析Codex全量使用行为;

2、验证智能体AI如何重塑人类工作模式,量化AI从“被动问答”到“主动执行任务”的行业范式转移速度与落地现状。

二、核心结论:Agentic AI正在承接更复杂、更宽维度、更丰富场景的任务,重塑人类工作角色和产出规模

核心结论(一):Agentic AI迎来爆发式增长,但渗透率极度不均衡,组织远领先于个人

1Codex活跃用户2026H1增长超5倍,用户增长主力早已跳出最初的程序员群体,法务、财务、运营等非技术岗位成为新增核心人群,Agentic AI突破程序员圈层,向通用知识工作者快速扩散

2企业是Agentic AI落地的第一场景,个人市场尚处于培育阶段。

3、三类样本群体的渗透率、Token产出占比差距巨大,组织环境、配套流程、培训决定AI落地深度

1OpenAI内部高渗透:组织培训完善、使用门槛低、全员认知智能体价值、配套工作规范适配Agent模式;

2)企业中度渗透:具备数字化基础,但缺少配套流程改造、员工使用培训不足,仅技术、数据部门率先落地;

3)个人低渗透:缺少复杂长周期任务场景、个人无流程复用需求、缺少本地权限/工具环境支撑,只能浅层使用智能体能力。

4、技术岗位先行,非技术岗位快速跟进,所有职级员工均在使用

核心结论(二):基础场景仍是软件开发,但深度落地环境(e.g.OpenAI)拓展至全品类知识工作

1Codex起源于编程工具,所有用户群体最主流用途仍围绕软件全生命周期;但采用无摩擦的组织内部,使用边界突破代码,覆盖研究、法务、人力、销售、数据、运营全职能

2、通用任务分布(三类群体均值)中,工程运维、代码编写、代码理解、应用管理、代码验证占全部使用量最大份额;使用已不限于写新代码,大量用于理解存量代码、环境配置、BUG修复、代码评审、发布流水线、文档撰写,覆盖完整软件研发流程

3、群体场景分化:1)「外部组织用户」高度集中在软件开发、代码实现;2「前沿用户,e.g.OpenAI」除代码外,研究、商业流程、协同沟通、数据分析、销售等占比大幅提升

4、分岗位任务结构:1)技术岗:工程运维、代码实现为主;2)市场/销售/人力:知识文档、协作沟通、业务流程为主;3)管理者/高管:文档、协同、规划类任务占比更高。

核心结论(三):Codex使用核心是任务委派生产,而非简单咨询,用户委托任务复杂度持续飙升

1、传统ChatGPT提问、获取信息为主;Codex用户核心诉求是交付完整产出(写代码、文档、数据分析、运维等),且委托任务难度持续提升,大量人类全天工作量级任务交给 AI自主完成

2、全面切换Codex后,各岗位AI产出量呈数十倍暴涨智能体工具大幅放大人类知识产出总量,重构个人工作产能上限

3、多轮对话首条请求复杂度最高,超过4轮之后需求复杂度显著下降,用户先交付整体大任务,后续仅做微调

核心结论(四):用户使用深度大幅升级,人类从使用AI”变成管理AI团队

1、轻度用户仍是单次单线程交互;重度用户形成三大全新工作模式:多Agent并行、长时间异步独立运行、可复用工作流(Skills)体系化。深度使用者彻底重构工作流,人类角色从执行者转为AI管理者、监督者、审核者类比电力革命:新技术价值不在于替换旧工具,而在于重构整套生产流程。

1)前沿用户形成多智能体并行工作模式,外部用户仍以单线程交互为主;多智能体协同成为常态,人类角色从执行者转变为AI管理者。

2)重度用户会长期运行异步智能体,内部前沿用户日均累计Agent运行时长极高;任务复杂度跨越式提升,大量用户开始委托需要8小时以上长周期、多步骤、需自主调用多工具的复杂项目任务,AI具备长时序规划、自主排错、持续迭代的能力。

3)可复用工作流(Skills)普及率快速上涨,组织、内部员工大量使用标准化流程模板;通过「Skills」功能,封装复杂任务流程、标准化指令并团队内共享,实现工作流程资产化。

2ChatGPT时代,交互模式是单轮/多轮问答、人实时引导AI输出结果,AI只做信息整理、片段内容生成;AgenticCodex)时代,交互模式是一次性下发任务目标、设定约束边界,AI自主拆解步骤、调用工具链、长时间独立运行闭环交付最终成果,人类仅做结果审核与目标修正。

OpenAI基于Codex的实证研究,对于市场近期的需求担忧有很好的启示作用,正如之前提到的,AI转化为生产力是一个循序渐进的过程,这个过程会伴随应用场景的拓宽和token消耗的持续增长:

从B端的角度看,大规模部署agent的企业仅占8%,行业发展仍处于早期阶段,伴随企业内部配套规则的建立,agent的使用深度、行业渗透率仍将进一步扩散。

根据Anthropic的内部数据统计,其工程师的季度代码提交量达到了2021-2024年平均水平的8x,AI开始接管编程、测试环节,人类主要负责审核结果。而这一结果本身在加速AI的递归式自我改进——AI能力本身已经非常强大了。

401K,公众号:401K-景交所市场波动率放大,如何看待近期AI的悲观叙事

但是AI能力的强大并不能直接转换为GDP和企业利润的增长。当下AI的技术能力已远远领先于技术扩散,因为模型需要数据权限、业务流程、跨部门协作、刻印在员工脑中的隐性经验,但当下的组织并没有完全准备好去适应这一技术。类似当年的电气革命,最优秀的企业不是仅仅把煤油灯换成电灯,而是直接按照电力系统重新设计整个工厂流程——同样,当下简单的使用AI工具的效果有限,优秀的企业会围绕AI重新设计和组织数据、产品、流程。

401K,公众号:401K-景交所市场波动率放大,如何看待近期AI的悲观叙事

而庆幸的是,这一拥抱和重构的过程正在持续发生,从大企业向小企业持续扩散。以三星为例,李在镕(三星执行会长)于6月9日表示:“为了引领AI时代、抢占跃迁机会,公司将推动一场重大革新,把社长、管理层和员工的工作方式、组织文化,乃至企业DNA本身,都转变为以AI为中心。各公司的CEO将把AI引入研发、采购、制造、物流、市场营销、销售、服务和经营支持这八大业务流程中,并亲自主导经营革新。通过人工智能转型,推动公司向创新型企业全面转变。”——世界最强的存储厂商也才刚启动“AI全面转型”,未来会有更多产业巨头把AI当作企业生命力重塑的核心工具,这是未来token消耗、算力需求增长的核心,而非简单的关注短期ARR的变化速率。

401K,公众号:401K-景交所市场波动率放大,如何看待近期AI的悲观叙事

Anthropic预测,如果AI在美国经济中扩散,未来10年每年可以提高1.8%的生产力,但考虑到前述瓶颈的影响,这个数字短期可能会下降0.6-1.2pct,但依旧是亮眼的增长。

401K,公众号:401K-景交所市场波动率放大,如何看待近期AI的悲观叙事

----------分割线----------

之前市场一直很担心,觉得在coding之后找不到下一个大的应用场景,怀疑AI的需求出现瓶颈。但codex的实证数据表明,coding能力的加强是第一步,基于强coding能力和模型的递归进化,使用场景会逐步拓展至更广泛的范围;这是用户需求决定的,而no code的实现会加速各种需求的落地和放大

人们之所以会如此看重coding,是因为:

  • coding场景的价值量化极清晰:代码产出速度、Bug率、人力工时、项目交付周期全部可量化,每一行代码、每一次调试都能折算成工程师薪酬成本;

  • 部署门槛极低:研发团队本身有数字化底座、完整代码库、开发工具链,数据原生标准化,几乎不用额外改造业务系统;

  • 落地零合规硬约束:无强监管、无生命安全风险、无隐私红线,PoC到全量上线周期仅 1-3 个月;

  • 付费主体预算充足:科技企业研发预算刚性,愿意持续付费,API/IDE 插件订阅模式天然闭环。

即,coding场景具有ROI清晰、可快速验证、部署难度低、部署速度快的特点。相比之下,其他场景的往往会遇到“ROI感知弱、验证难、部署难”的问题:

  • 业务割裂、数据孤岛:制造、零售、医疗、政务存在大量线下流程、老旧IT系统,打通数据改造成本高,前期投入拉高回本周期;

  • 价值指标模糊:营收提升、客户留存、风险损失减少属于滞后指标,不像coding能立刻看到工时下降;

  • 合规与试错成本高:金融风控、医疗诊断、工业生产一旦出错直接产生巨额损失,企业不敢一次性全量替换人工,只能小范围试点,短期看不到立竿见影的大规模效果。

但随着企业逐步拥抱AI-native的环境,这些产业需求的价值和规模都会放大,只是兑现节奏会分层。正所谓“积小流已成江海”,大量企业的大量场景持续渗透,足以催化一个巨大的市场。

下面列示几个场景作为案例(AI整理的数据):

第一梯队:6-12个月回本,渗透率快速提升,行业刚需(ROI 150%-420%

1、金融全链路自动化

  • 场景:实时反欺诈、信贷审批、票据/合同/财报文档OCR+大模型提取、合规报告自动生成、智能催收、量化投研;

  • 验证数据:89%项目6个月内实现正向收益,单银行每年减少数千万人工审核成本,欺诈损失下降30%-60%

  • 规模化基础:银行、券商数字化程度全球最高,交易、文档全结构化,监管倒逼流程标准化;

  • 落地现状:国内外头部金融机构100%上线,中小机构批量采购SaaS方案,算力调用量持续爬坡。

2、企业全流程文档智能处理(所有行业通用基础场景)

  • 场景:合同审查、发票报销、招投标资料、人事档案、供应商资质审核;

  • ROI逻辑:替代大量初级文员、法务、财务,人工处理70%-90%工作量,错误率大幅下降;

  • 回报周期平均6.2个月,不分行业、通用性极强,制造业、律所、地产、政府采购全面普及。

3、智能客服+客户全生命周期运营

  • 场景:售前咨询、售后工单自动处理、语音情绪识别、客户流失预警、智能外呼;

  • 数据:头部企业客服人力成本下降50%-65%AI承接70%-85%标准化咨询,人工只处理复杂高客单问题;

  • 规模化:电商、运营商、互联网、本地生活全覆盖,属于企业必配基础设施,不存在行业天花板。

4、营销内容工业化(素材、投放、优化全链路AI

  • 场景:商品文案、短视频脚本、AI素材生成、千人千面广告定向、投放出价自动优化、多语言本地化;

  • 提效:素材生产效率提升30-100倍,广告获客成本下降40%-60%

  • 落地:电商、品牌、跨境广告行业已经规模化使用,汇量、Meta广告平台AI工具为核心收入来源。

第二梯队:12-18个月回本,制造业/供应链核心增量,空间巨大

1、工业视觉质检+设备预测性维护

  • 场景:产线缺陷检测、设备故障预判、能耗优化;

  • ROI:停机损失降低25%-45%,质检人力减少60%,单工厂百万级年度成本节约;

  • 长期空间:全球制造潜在年价值6000亿美元,当前渗透率不足10%,属于增量蓝海。

2、供应链智能优化(需求预测、库存、物流调度)

AI修正传统统计模型偏差,预测误差下降20%-40%,库存降低15%-30%,零售、汽车、电子制造大规模落地,联想iChain等智能体已全集团推广。

第三梯队:中长期高价值、当前处于规模化前夜(Agent驱动增量)

政务智能审批、医疗文书自动化、能源电网调度、企业内部数字员工(多智能体协同处理跨部门流程),短期改造投入高,但长期ROI极高,2026-2027年随Agent成熟加速渗透。

AI应用场景的演进节奏看:

阶段12024-2026):单点工具化AI(现状)

  • 以单一功能工具为主:代码助手、客服机器人、文档提取、质检视觉,解决单一重复性工作,ROI确定性强,但场景碎片化,市场容易觉得缺少超级大场景

  • 核心矛盾:AI仅嵌入局部流程,未打通企业端到端业务,价值释放不充分

阶段22027-2029):多智能体协同数字员工(下一轮爆发)

  • 突破单点工具局限,AI智能体串联采购、生产、财务、售后全流程自主决策,形成端到端业务自动化场景,会诞生一批规模堪比编码赛道的巨型场景,如:1)制造业全域智能调度智能体;2)集团财务、供应链一体化数字员工;3)零售全域投放+库存+会员一体化运营智能体;

  • 这一阶段会大量出现千万级、亿级付费客户,解决市场缺少大规模场景的核心担忧。

阶段32030+):AI原生产业重构(长期终局)

  • 行业业务流程基于AI重新设计,而非在传统IT上叠加AI,同时,物理AI在制造、能源、物流、国防等领域持续渗透:自动驾驶、工业机器人、全自动柔性工厂……AI进入工厂、电网、仓库、实验室,数字孪生+仿真数据成为工业AI底座。

  • AI从降本工具变成产品核心竞争力,创造全新增量市场,而非仅替代现有人力。

AI需求“长期增长、短期不降速”的三大底层逻辑:

1)企业数字化渗透率极低:实体产业AI整体渗透率仅10%,对比互联网80%,渗透空间充足,传统行业替换人力的长期趋势不可逆;

2AI具备复利式降本:一次性部署后持续降低人力、损耗、风险成本,属于Capex后持续产生现金流的资产,支撑企业长期投入Opex

3)技术迭代持续拓宽场景边界:多模态、长上下文、工具调用、自主智能体不断解决此前无法落地的复杂业务流程,持续创造新需求,而非存量替代。

部分市场认为,前述部分场景在大语言模型出现之前就已存在,在传统小NLP时代就已解决。但传统小NLP时代的AI只解决标准化单点任务、依赖人工预配置、无法处理结构化复杂信息,价值仅停留在简单降人力OpenAI/Anthropic/DeepSeek/智谱等高参数LLM普及后,完成“工具单点自动化端到端业务Agent闭环”、“被动应答主动推理决策”、“固定模板动态生成推理”三层质变,会驱动核心运营指标出现量级提升,进而带动渗透率、付费使用率、业务ROI全面上台阶

1/ 金融全链路自动化(信贷审批、反欺诈、合规尽调、财报解析)

1、传统规则阶段

  • 逻辑:阈值规则+结构化特征小模型,仅能读取表格、数字类结构化数据;合同、流水、问询录音、舆情等非结构化文本完全无法深度解析。

  • 流程割裂:审批、尽调、风控、合规分属独立系统,数据无法互通,人工跨系统搬运材料。

  • 维护成本极高:新型欺诈、新型信贷产品出现,需业务+技术团队耗时数周新增、调试规则;无法识别从未见过的欺诈模式(零日欺诈)。

  • 价值边界:仅替代基础录入岗,无法参与风险推理、撰写尽调报告、交叉核验多渠道证据。

2、高参数大模型时代

  • 非结构化全域理解:长文本财报、数千页贷款合同、多轮客户沟通录音、跨行流水、公开舆情统一输入推理,多模态VLM兼容扫描件、手写凭证。

  • 端到端自主流程Agent:自动调取征信、解析流水、提取风险点、生成尽调初稿、自动触发异常复核、输出合规意见书,打通全链路无需人工中转。

  • 自主泛化推理:无需人工新增规则,自动识别新型团伙欺诈、隐蔽套现、虚假经营流水;RAG绑定监管文件,自动校验业务合规性。

  • 价值升级:从单纯节省审核人力,延伸至降低坏账损失、缩短放款周期、减少监管处罚三重经营收益。

2/ 智能文档处理(合同、发票、招投标、人事档案、票据)

1、传统OCR+规则抽取阶段

  • 仅识别印刷文字,表格、合并单元格、模糊扫描件、手写内容识别失效;只能提取预设固定字段,超出模板直接报错。

  • 无语义推理:只能输出文本,无法对比条款冲突、计算金额逻辑、识别隐藏风险条款。

  • 多格式兼容差:PDF、图片、Word、扫描件需分开部署解析引擎,维护多套配置。

  • 产出单一:仅输出结构化表格,无法生成摘要、风险提示、对比报告。

2、大模型多模态文档方案

  • 单通道统一处理:图片、扫描件、手写、多语言混合文档一体化解析,自动还原复杂表格结构。

  • 语义推理+逻辑校验:自动识别合同违约金、担保风险、金额前后矛盾,跨文档交叉比对条款差异。

  • 全链路生成能力:一键输出文档摘要、风险清单、对比表、归档标签,直接推送至财务/法务系统。

  • 零模板快速落地:全新品类文档无需提前标注训练,开箱即用,交付周期从数月缩短至1–2周。

3/ 智能客服+客户全生命周期维护(金融/电商/运营商通用)

1、传统关键词/简易NLP机器人

  • 单轮浅层匹配,多轮对话丢失上下文;无法识别复合、隐含诉求,用户必须拆分问题重复描述。

  • 话术固定僵硬,无情绪感知,投诉、不满场景极易触发转人工;仅能回答标准化FAQ,复杂业务无法承接。

  • 知识库维护繁重:新增业务需人工编写数百条意图、正则、话术,更新周期按月。

  • 边界局限:仅做咨询应答,无法联动订单、账单、资产数据做个性化经营挽留。

2、大模型Agent客服体系

  • 超长上下文记忆(128K+上下文窗口),自动继承多轮历史对话,一次性拆解多重复合需求。

  • 情绪感知+动态拟人应答:识别客户愤怒、犹豫、流失倾向,自动安抚并推送挽留方案。

  • 业务系统原生联动:自动查询账单、订单、资产、工单,直接办理挂失、分期、改址等轻业务,不止问答。

  • 主动运营:咨询结束后基于客户画像推送适配产品,从成本中心转为营销转化渠道。

  • 知识库自动化更新:上传业务文档即可自动问答,无需人工配置意图,运营工作量大幅下降。

4/ 营销内容自动生成(文案、短视频脚本、投放素材、千人千面策略)

1、传统模板化营销AI

  • 固定模板拼接:仅替换商品名称、价格,文案同质化严重,无法适配细分人群。

  • 无闭环投放优化:只产出素材,不能关联投放数据迭代创意,无法自动调整定向、出价。

  • 产能天花板低:一套素材仅产出3–5个变体,测试样本不足,难以找到高转化创意。

  • 仅覆盖文本,图文、短视频脚本生成能力弱,多语种本地化成本极高。

2、生成式大模型营销链路

  • 原生千人千面动态文案:基于用户标签、消费层级、地域、偏好自动生成差异化话术,无模板痕迹。

  • 全链路闭环Agent:需求简报多版本文案/脚本多尺寸素材投放效果复盘自动迭代创意,全流程无人干预。

  • 海量变体极速产出:单次brief生成50–100组差异化素材,快速放量测试优胜创意。

  • 多模态一体化:文本、配图、短视频分镜、直播话术、海外多语言素材统一生成。

  • 直接驱动ROI优化:自动关停低效素材、加大高转化素材投放预算,AI深度介入投放决策。

上述4个行业案例可以看出一些跨场景共性,持续迭代后的大模型给垂直场景的应用带来了全局性变革:

1、架构逻辑反转,从“人工预定义规则”到“模型自主推理”:旧方案所有边界、意图、字段、话术必须人工提前定义;LLM依靠通用语义理解,未见过的业务、文档、咨询均可自主处理,交付周期、维护成本断崖式下降。

2、能力边界拓宽,从“结构化数据”到“全域非结构化数据”兼容:传统AI只能处理规整表格;大模型统一消化长文本、扫描件、语音、图像、多语言混合信息,打通企业80%以上无法数字化的线下资料。

3、角色定位升级,从“单点工具”到“业务数字员工/Agent”:AI只完成单一环节“辅助录入”;LLM可以串联多系统、多步骤自主完成完整业务闭环,具备工具调用、流程触发、结果复盘的自主决策能力。

4、价值衡量标准迭代,从“单一人力节省”到“多维经营收益”:传统落地仅考核“省多少人工工时”;大模型场景可量化坏账下降、客户留存提升、广告ROAS上涨、监管处罚减少等收入端增量,ROI计算维度更丰富、回报更高。

5、落地门槛大幅下降,从“重定制项目化”到“标准化SaaS轻量化交付”:传统项目实施周期36个月、百万级定制费用;大模型垂直产品开箱即用,中小企业付费门槛显著降低,行业渗透率快速抬升,更丰富的付费手段打开后续Opex运营增长。

这会带来企业付费渗透率提升、API调用/工具调用/token消耗提升、企业部署回本周期缩短、企业留存续约率提升、业务规模放大等积极影响。

所以,伴随大模型能力的升级、企业配套的完善,AI应用场景的宽度和深度都在放大。AI需求增长的可持续性并不像市场想的呢么乏力,这也是供给失衡背景下,Capex持续增长的底气。