ARTICLE · 1147311
《State of AI Report 2026》最新洞察:模型公司开始卖交付 AI,产业的分工正在被改写


10 月 8 日《State of AI Report 2026》正式发布,OpenAI 与 Anthropic 今年 5 月组建企业部署服务公司的动作被放在了同一页 —— 前线工程师要进入客户现场,接入业务系统,把模型变成实际可用的流程,再持续维护它们。最有能力提供 AI 的公司,开始亲自承担把 AI 用起来的工作。

官方导读用了一个接近日常生活的比喻:AI 需要自己的 Genius Bar,帮助人们选工具、完成设置。这个主意看上去像售后服务,背后却是软件产业分工正在发生的变化。
过去,模型提供能力,软件提供工具,实施和服务团队负责把工具放进企业。Agent 开始跨系统执行任务后,这些边界不再清晰:模型公司向部署延伸,软件公司开始承诺工作结果,服务团队尝试把经验写成能够重复运行的系统。竞争的对象也随之扩大,从谁能提供更好的回答,延伸到谁能持续交付一件完整的工作。
这并不意味着模型竞争已经结束,也不意味着服务收入会自动变成软件利润。报告一面记录能力进步与使用扩张,一面提醒更强的模型会淘汰旧的运行框架设计。新一轮产业变化的悬念,是更多工作被交给 AI 之后,收入、客户关系和责任最终留在哪一层。
▍能力供给扩张,工作成为新的竞争单位
谁会为 AI 的使用付费,已经不能只从开发者社区里找答案。OpenAI 6 月公布的研究显示,Codex 的非开发类使用者增长快于开发类,个人与组织人群都出现了这种变化。研究按请求内容推断使用类别,并非核实用户的真实职业;从低基数起步的用户增长,也不能换算成生产率的增幅。
低基数会让增长曲线显得陡峭,使用深度仍有差异。报告进一步提醒,工程工作仍占绝对用量的大头,法律、销售、招聘和营销的快速增长,大多从接近零的位置开始。需求正在越过研发部门的边界,但新使用者带来的并非同一种工作:他们需要的输出、能授予的权限、愿意承担的错误都不一样。

非开发应用增长
招聘团队需要的可能是把多份面试反馈归到同一名候选人名下,标出缺失意见,再形成供负责人复核的材料。销售团队需要的可能是把一次会议里的承诺准确带回客户系统,而不是多一份读起来流畅的纪要。这些是用来解释产品边界的典型工作场景;它们的共同困难,在于资料分散、权限不同,以及“做完”的含义只存在于团队的实际流程里。
Morgan Stanley 的部署提供了一个更具体的参照。OpenAI 披露的客户案例中,Debrief 在取得客户同意后处理 Zoom 录音,生成笔记和后续邮件草稿,并与 CRM 衔接;顾问仍要审阅、修改和确认。在公司的整体 AI 评测体系中,团队还开展每日回归测试,持续检查检索与回答质量,这是一份供应商公布的实施案例,而非独立效果审计。
这条工作链上,录音许可、客户身份匹配、信息提取、系统写入和人工审阅都要成立。只把其中一个环节换成更强模型,并不能自动补齐其余环节。对于客户来说,交付对象是下一位同事能够接着处理的记录,是一封可以放心发出的邮件,而不是一次令人惊讶的演示。
技术研究也开始给这种经验提供更明确的解释。报告引用的一项研究把 3 个模型与 3 套运行框架交叉测试,在难度分层抽取的 100 个 SWE-bench Verified 任务上,同一个 GLM-5.1 的平均 pass@1 从 52.5% 提高到 65.5%。每个组合运行两次,模型权重没有改变,改变的是上下文处理、工具、检查与恢复机制。

框架改变表现
它支持的结论很有限,也足够重要:在这组代码任务与指定实验条件下,围绕模型的系统设计会显著影响结果。它没有证明给任何企业装一套 Agent 都能提高 13 个百分点,更没有测量部署公司的回报率。但产业里的能力归属正在因此变得复杂,一次成功交付是模型、环境和流程共同作用的结果。
当交付对象从回答变成完整任务,原本属于软件售后的工作,会进入产品本身。系统能不能读懂内部记录、调用正确工具、在失败后恢复,开始影响客户买到的核心体验。实施不再只是把一个标准软件安装到企业里,它也在决定这个产品最终具有什么能力。
这让企业采用 AI 的过程,和增加一批软件账号有所不同。管理层看见的是试点演示,业务人员面对的却是第二天要交出的材料;如果审阅一次结果比自己重做还慢,系统就很难成为习惯。席位已经售出、工作仍由人完成的落差,正是部署和持续服务能够进入价值链的地方。
▍软件开始接管流程,交付成为持续过程
“把公司资料接进去”听上去是一项集成任务,做起来往往涉及组织内部对事实的定义。哪一版价格有效,合同里的特殊约定是否覆盖标准政策,某项审批究竟由职位还是具体负责人决定,都不是把文件装进知识库就能解决的。文档越多,过时信息与例外情况也可能越多。
上下文因此具有两种成本。一种发生在开始部署时,要识别可信来源、清理冲突、建立权限;另一种发生在运行之后,要知道规则何时变了,旧经验还适不适用。一个只在上线当天正确的系统,很难承担按月续费的承诺。
比如同一份客户政策在季度末更新,旧版本还留在文件夹里,新版本已经发到群聊。系统需要知道哪个版本正在生效,哪些尚未完成的任务应当重跑,以及谁有权批准例外。这类变化很难用一次培训解决,却天然适合被做成持续检查的机制。
Nubank 团队今年发表的一篇生产部署论文,把这种工作拆得相当具体。客户问银行卡为什么还没送到,Agent 要读取实时物流、比较承诺时效,再根据住址与投递条件追问;无法解决时,还要走向补发或人工接手。团队将指令、流程、工具说明和记忆等内容分开管理、分别版本化,缺少信息或超出流程时保留上下文转人工。
论文覆盖 5 个生产场景,并报告卡配送 Agent 相对旧版本的 A/B 测试中,交易型净推荐值提高 37 个百分点,自助服务率提高 29 个百分点。这一场景的满意度仍低于专家人工;这是实施团队报告的结果,不能写成已经消除了人工,或普遍节省了 37% 的成本。
值得关注的不是某一条提示词写得更长,而是“错误”的正确打开方式。一次错误理解客户意图,可以成为下一次更新之前必跑的测试;一次误用业务规则,可以促使团队修改上下文模块。业务知识不再只靠实施顾问记在脑子里,而能沉淀为别人可以检查、复用和更新的资产。

反馈驱动改进
报告的生产反馈页描述了类似循环:运行真实任务,记录纠正与重试,把失败改造成可重复测试,再决定调整工具、上下文、路由还是模型。它也给模型创业的热情加了一道顺序要求:先找出客户需要什么,建立自己的评测,只有数据和质量、速度或成本上的收益足够清晰时,进一步控制模型才可能值得。
这种积累改变了软件和服务之间的接口。退货规则、权限关系和某个客户的合同不能随意搬到另一家公司,测试方法、异常分类和连接器却可能迁移。过去由实施团队反复完成的一部分工作,可以变成产品能力;客户特有的业务判断,则仍需要人来定义和确认。
这也改变了“数据壁垒”的含义。存着更多文档,不等于知道哪条信息有效;留下大量聊天记录,也不等于知道哪一步造成失败。对于持续交付公司,更有价值的可能是带有业务判定的过程:当时看到了什么,采取了什么动作,为什么被驳回,后来如何修正。
但记录得越细,权限边界就越不能含糊。客户服务中的纠正可能包含个人信息,销售流程里的例外可能对应合同秘密,适合内部改进的记录未必获准跨客户训练。商业上的学习能力,必须建立在明确的数据授权、隔离和保留机制上,否则原本想积累的资产会成为合作障碍。
因此,AI 软件的边界有可能沿工作流程重新划分。一次客户跟进,可能横跨会议、文档、邮件和 CRM,用户却只把它视为一件事。既有软件按功能和部门划分市场,Agent 按任务穿过这些边界,两种组织方式会在同一个客户内部相遇。
新的执行入口却不一定能替代底层业务系统。客户身份、交易记录、权限和历史状态,仍需要可信的地方保存;一次工具故障或资料缺失,也可能把任务重新推回人工。界面可以被绕过,记录和责任未必能被绕过,这使既有软件既面临入口被削弱的风险,也可能因成为 Agent 的基础设施而继续留在流程中。
▍模型公司向下走,服务公司向上走
一个值得重视的信号是,最有能力卖模型的公司,也开始自己做部署。OpenAI 在 5 月 11 日宣布成立部署公司,并披露达成收购 Tomoro 的协议,计划把约 150 名部署专家与前线工程师的能力带入新公司;当日公告仍列有交割条件。Anthropic 则在 5 月宣布与合作方成立企业 AI 服务公司,提供实施与长期支持。

模型走向部署
OpenAI 的公告描述了相当传统、也相当必要的工作:和客户识别高价值流程,进入现场设计、构建、测试和部署,把模型接入客户的数据、工具和控制机制。它同时强调把经验转成可重复的部署模式。模型平台亲自承担这些工作,说明“客户用了就会获得价值”还不是一个可以省略实施过程的假设。
模型平台因此进入了原本由咨询、系统集成和企业软件伙伴承担的一部分市场。基础模型提供方能够把产品、技术支持与分发放在一起,行业软件公司拥有现成客户和业务入口,传统服务商则熟悉采购与组织流程。这几类公司的能力开始重叠,客户关系也不再天然属于最先售出软件账号的一方。
成本下降也不会自动解决这个问题。Epoch AI 对 5 项基准的分析估计,自 2023 年以来,达到固定表现水平的成本平均每季度下降约 47%。研究测量的是可用模型中达到相应基准表现的成本前沿,现实客户不会持续无摩擦地切换到最便宜模型,基准成绩也不等同于完成业务工作。

推理成本下降
推理便宜了,可以让产品多做一次检查、多尝试一条路径;但如果每个客户都要实施人员手动整理两周数据,最大的成本仍在人的时间里。一次任务的真实成本,还包括重试、人工复核、系统故障、客户沟通和失败后的补救。只披露 token 费用,很容易把最昂贵的部分留在财务模型之外。
报告本身提供了一个必要的反面提醒:更强的模型也会淘汰旧的运行框架设计。为了弥补上一代模型不足而叠加的提醒、计划和行为限制,可能在新模型上变得多余,甚至妨碍表现。报告认为,更耐久的投入是环境接口、状态管理、可观测性与运行基础设施,而不是永远增加规则的复杂度。
这种变化同时推动着服务市场的扩张和收缩。新的能力进入企业,会创造集成、调整和运营需求;模型一旦学会原本需要专门补偿的动作,某些配置劳动又会消失。部署市场不会只沿一个方向增长,不同层次的服务可能在同一次技术进步中出现相反命运。
服务公司向产品延伸的路径,也在这里分岔。一条路径依赖专家进入更多现场,收入随项目和人员扩张;另一条路径把连接器、异常处理和评测积累为系统,让相同劳动不必再次发生。两者都可能有客户,却对应不同的成本结构,不能仅凭合同里出现“订阅”就视作同一种公司。
模型公司的优势也有边界。官方报告提醒,两家部署公司受各自母公司技术栈的约束;一家企业同时使用多种软件和模型时,选择可能涉及已有合同、数据安排与迁移成本。独立部署团队的空间,取决于这些跨系统问题是否持续存在,以及平台自己会覆盖到多深。
Standard Metrics 的初步 Q2 数据,给这一变化提供了一个值得追问、却不能直接归因的背景。在年化收入 100 万至 2000 万美元的样本中,AI 原生公司的同比收入增速 第 75 百分位为 256%,给既有软件增加 AI 的公司为 90%;更大收入组也存在差距。它比较的是分位数,不是平均公司,更没有证明换成 AI 产品便会带来同样增长。

原生企业增长
高增长可以吸引资金,客户究竟为何续费却需要另外解释。是任务量增长了,交付覆盖更深了,还是仍靠新的定制项目推着收入往前走?对于创始人与投资人,这几种收入的外观可能相似,所需要的组织、毛利与资金却很不一样。
▍收入在增长,但价值归属还没有定型
按结果收费,是这场分工变化最直观的表现之一。报告把从聊天到协作的变化,描述为逐渐走向可审阅的工作与按任务定价,但它并没有证明某种收费方式已经赢下市场。任务越接近业务结果,验收和责任的约定就越重要。

从工具到工作
以会议后的客户跟进为例,生成草稿、写入 CRM、得到顾问批准、收到客户回复,是 4 个不同的完成状态。系统可以控制前两个状态的一部分,却无法承诺客户一定回复。把付费节点绑在真正可以验证、也可以归责的交付物上,比笼统承诺“提高销售业绩”更有条件形成稳定交易。
交付承诺还把安全问题带进商业关系。报告中的监控实验提示,查看实际行动比只读模型的推理文字更有助于发现问题,但实验结果不能证明生产环境风险已经消失。系统一旦获得执行权,权限、证据和可追溯性就成为交付的一部分。
对企业买家来说,能否查看证据、暂停流程、收回权限、追溯责任,通常会影响哪些工作可以交出去。一次涉及客户记录的错误,比一段回答写得不好更难处理。人工接手机制也因此应当作为交付设计的一部分,既要知道何时交回,也要把已经获得的信息一并交回,避免客户再从头讲一次。
席位、调用量与任务结果,也在重新划分收入。减少一位使用者的操作时间,不一定减少模型调用;让一个 Agent 同时完成更多工作,也可能降低客户新增软件席位的意愿。谁获得更多收入,取决于客户为哪一种单位付费,而不仅是技术上谁更强。
现有软件公司的处境因此不只是被替代或不被替代。它们可能失去部分操作界面,也可能成为执行不可缺少的记录系统;可能承受席位定价的压力,也可能把自动完成的工作变成新的收入项目。相同的 Agent 能力,在不同业务结构里会产生不同后果。
这也是收入高增长暂时无法回答的问题。客户数量和合同金额能显示需求,却不能单独说明利润会留在模型、软件还是实施层;上线时间、人工复核与失败补救仍在分配成本。一个行业开始更快地卖出产品,和它已经找到稳定的产业分工,是两件不同的事。
这并不意味着每一家好生意都必须变成高毛利软件公司。行业实施、培训和运营支持可以独立成立,只是需要按照相应的人员与利润结构经营。危险之处在于把一次性的专家劳动称为产品收入,却没有建立让下一次劳动减少的机制。
报告对未来 12 个月的一项预测,恰好可以作为观察点:某个 Agent 在为客户工作一个月后,不升级模型,就把新任务的失败率减半。它目前仍是预测,不能当作行业已经实现的能力;值得注意的是,衡量对象已经从模型考试成绩,移动到真实工作留下的改进。
从这个角度看,Genius Bar 只是一个容易理解的入口。更大的变化发生在它后面:软件开始执行工作,服务开始写进系统,模型公司开始走入客户现场。AI 能力的增长正在重组这些环节之间的关系,下一阶段的竞争,既发生在模型里,也发生在谁能够接住工作、持续完成工作,并承担结果的地方。
✦ 精选内容 ✦