ARTICLE · 1122773
从工具到同事-OpenAI DevDay 2026 与 AI 智能体产业解析
第一章 一场把"交付物"换掉的发布会
开发者大会通常只有两种看法。一种看参数:模型在哪些基准上涨了几个点,价格降了多少。另一种看故事:厂商把未来描述成什么样子。这两种看法都容易错过真正的变化,因为参数和故事都可以在一年内被推翻,而产品形态的改变往往不可逆。OpenAI 在 DevDay 2026 上一口气发布了二十余项更新,从模型到订阅到开发工具,看起来很散。但如果把它们按一条线索串起来,会发现这些发布指向同一件事:产品交付的东西变了。过去 ChatGPT 交付的是"一段回答",现在它想交付"一件做完的事"。这个转变一旦成立,围绕它的一切都得跟着改——计价方式要改,因为按对话收费无法衡量一件事的价值;交互界面要改,因为人不可能全程盯着;安全机制要改,因为机器要用自己的账号去操作真实系统;甚至采购归谁的预算也要改,因为买的不再是软件。
一、五层结构:一次看懂二十余项发布

图 1-1 DevDay 2026 发布内容的五层结构
把这些发布分成五层来读会清楚很多。最底层是模型与算力,GPT-6.1 Sol 用约五分之一的价格提供接近旗舰的能力,Ultrafast 把生成速度提到每秒 300 Token。这一层解决的是"太贵"和"太慢"。往上是计价方式,新增 500 美元的 Pro 500 档位,同时下调 Pro 200 的权益,把收费逻辑从买 Token 改成买产出和时效。再往上是人机协作界面,Dots 作为全天候智能体登场,ChatGPT Space 和 Pages 提供人和 AI 共同办事的地方。第四层是开发者工具,Codex 全面云端化,Codex Harness 开源,Agents API 和 Decisions API 开放。最上层是分发与商业闭环,Sign in with ChatGPT、应用市场、算力与软件预算通兑。
这五层的因果方向是自下而上的:没有下面两层的成本和速度改善,上面三层的产品形态根本跑不起来。一个要连续工作几小时的智能体,会消耗远超单轮对话的 Token。按旗舰模型的原价,这种产品在经济上无法成立。所以 Sol 的降价不是常规的产品线扩充,它是 Dots 能够存在的前提条件。
二、本文关心的三个问题
围绕这场发布会,值得追问的不是"OpenAI 又发布了什么",而是三个更基础的问题。
"从工具到同事"这个说法,在技术上成立到什么程度?哪些部分是已经做到的,哪些部分仍是营销语言?
如果这个方向成立,它会怎样改变 AI 产品的商业模式、企业的采购逻辑和开发者的技术栈?
中国厂商在同一条路上走到了哪里?由于市场条件不同,中国的智能体商业化会呈现什么不同的形态?
第二章到第四章回答第一个问题,分别处理模型底座、Dots 的架构与自主性边界、以及协作与开发工具。第五章处理商业模式。第六章把 OpenAI 放回竞争格局,与 Anthropic、Google、Microsoft 以及国内厂商对照。第七章做中外对比。第八章讨论真实的工程瓶颈与风险。第九章给出趋势判断、结论和值得观察的信号。
第二章 底座:把长时间运行变成一笔算得过来的账
一、准旗舰的真正含义
GPT-6.1 Sol 的定位是"准旗舰"。从公布的数字看,它在软件工程 DeepSWE v1.1 上性能媲美旗舰而成本只有五分之一,在文档测试上超过 Opus 5.5 而成本不到一半,在电脑操作 OSWorld 2.0 上与 Astra 相差 2.1 个百分点以内。价格方面,输入从旗舰的每百万 Token 10 美元降到 2 美元,输出从 50 美元降到 10 美元,缓存输入降到 0.10 美元,仅为旗舰的十分之一。

图 2-1 Sol 与 Astra 的价格与能力相对位置
"能力退一小步、价格退一大步"这种组合,过去两年在整个行业反复出现:GPT-4o 相对 GPT-4、Claude Haiku 相对 Opus、Gemini Flash 相对 Pro、DeepSeek 的 V 系列相对 R 系列,都是同一个套路。它背后是一组相对成熟的工程手段:蒸馏、混合专家架构的稀疏化、推理阶段的量化与缓存复用、以及把长思维链压缩成更短的有效推理。
但在智能体场景里,这种降价的意义和过去不同。单轮对话时,价格差异影响的是毛利率;长任务时,价格差异决定的是产品能不能做。一个连续运行三小时、反复读取网页和文件、多次自我纠错的任务,Token 消耗可能是单轮问答的几百倍。五分之一的单价意味着同样的预算可以跑五倍长的任务,或者让五倍多的用户用上。缓存输入降到十分之一更关键,因为智能体在长任务中会反复携带相同的系统提示、工具描述和历史上下文,这部分正是缓存命中的主要来源。
二、速度为什么突然变成卖点
Ultrafast 在 Codex 中把生成速度提到标准模式的 8 倍,约每秒 300 Token,通用 API 场景最高 6 倍,收费按标准模式的 8 倍额度扣除。这是一个值得留意的定价设计:它明确把"快"作为一种可以单独付费的商品,而不是技术进步的免费附赠。
从工程上看,推理速度的提升主要来自三类手段:投机采样用小模型起草、大模型批量验证;低精度计算减少显存读写;以及把预填充与解码阶段分离部署,让两类硬件特性不同的工作负载互不拖累。这些技术在过去两年已经在开源推理引擎中成熟,SGLang、vLLM 和 NVIDIA 的 Dynamo 都把它们作为核心能力。OpenAI 把它包装成一个付费档位,相当于把基础设施层的优化成果直接变现。为什么速度在这个时点变成卖点?因为任务变长了。单轮问答时,响应从两秒变成一秒,体验提升有限。但当一个任务需要几十步连续推理时,每步的延迟会累积成小时级的差异。更重要的是,速度直接决定了智能体在单位时间内能试错多少次。自主任务的成功很大程度上依赖反复尝试与自我修正,速度提升 8 倍,意味着同样时间内可以多走 8 倍的弯路再回到正轨。这解释了为什么发布会提到,借助 Ultrafast,耗时一整天的自主科研任务无干预成功率超过三分之一。
三、Decisions API:把大炮换成扳机
Decisions API 基于 GPT-6 Luna 的微调版本,专门在固定选项中快速做判断,比如邮件该归到哪一类、页面上该点哪个按钮,延迟低至约 150 毫秒。这个接口看起来不起眼,却反映了智能体工程的一个真实痛点。一个长任务里,绝大多数步骤其实是简单的分流判断,只有少数步骤需要真正的推理。如果每一步都调用旗舰模型,成本和延迟都会被这些琐碎决策吃掉。工程上常见的做法是自己搭一套路由:用小模型或分类器处理简单判断,只在复杂处升级到大模型。Decisions API 是把这套路由中最常见的一环产品化,省掉开发者自己训练和维护分类器的功夫。它也透露出一个判断:智能体的成本结构里,高频低价值的调用占了大头,优化这部分比优化旗舰模型本身更划算。

四、放在行业趋势里看

图 2-2 能力固定时的价格与速度变化方向(示意)
把时间拉长,会看到一个稳定的规律:在能力水平固定的前提下,达到该能力的单位价格在持续下降,生成速度在持续上升。这个规律在业内被反复观察到,有人称之为推理成本的摩尔定律。它的成因是多重的:芯片性价比提升、推理引擎优化、模型架构稀疏化、以及厂商之间的价格竞争,尤其是开源模型对闭源定价形成的压力。这条曲线正是智能体产品在 2026 年集中出现的根本原因。长时间自主运行一直是技术理想,但在成本和速度没有降到某个阈值之前,它只能作为演示而非产品。换句话说,Dots 这类产品的出现,不是因为模型突然变聪明了,而是因为运行它终于变得便宜和快了。
第三章 Dots:自主性的边界在哪里
一、架构:它真正拥有的三样东西
Dots 由 GPT-6 Astra 驱动,运行在独立的云端隔离沙盒里,配有独立的浏览器,并可通过插件连接四千多个应用。用户设定目标后,它在后台自主推进,遇到关键决策时弹窗请示。它可以在 ChatGPT 各端、Slack、Teams 中使用,也支持短信交互和实时电话语音沟通。企业版还有 Specialist Dots,拥有专属账号和权限,像虚拟专职同事一样承担会计、营销、法务等职能,并与微软的 Agent 365 对接。

图 3-1 Dots 的运行结构
这套架构里有三样东西是关键,而它们恰好对应智能体从演示走向可用的三个门槛。
自己的电脑。独立的云端沙盒意味着它有持久的文件系统和终端,可以下载文件、运行脚本、保存中间结果。过去的浏览器智能体多数是无状态的,每次操作都从干净环境开始,无法处理需要积累中间产物的任务。有了持久环境,"把这批数据整理成报表"才成为可能。
自己的浏览器。这是绕开接口限制的办法。企业内部系统大多没有开放 API,大量工作发生在网页界面上。能操作浏览器,意味着智能体可以覆盖那些"没有接口但有界面"的长尾系统。这条路线 Anthropic 的 Computer Use、Google 的 Project Mariner、以及国内的 AutoGLM 都在走,共识程度很高。
自己的账号。Specialist Dots 拥有独立账号和权限,这是从技术问题跨入管理问题的一步。它意味着智能体在企业的身份系统里成为一个独立主体,有自己的权限边界、审计记录和责任归属。微软 Agent 365 的思路一致:把智能体当作需要被纳管的"数字员工"来治理。
二、从同步到异步:真正变化的是人的时间

图 3-2 同步问答与异步托付的区别
"从工具到同事"听起来像营销话术,但它对应一个具体的技术转变:从同步到异步。同步问答里,人提问、等待、拿到回答、再提问,每一轮都需要人在场,注意力被切成碎片。异步托付里,人交代目标后就可以离开,智能体自主推进数小时到数天,只在关键决策点回来请示。这个转变的价值不在于机器变强,而在于解放了人的注意力。一个人可以同时托付多个任务,自己的时间从执行转向设定目标、判断方向和验收结果。这也解释了发布会强调的那些细节:夜间整理信息、早晨提炼待办、主动跟进、逐渐学习用户的注意力标准。这些功能单独看都很小,合起来是在构造一种"托付关系"——你不需要记得追问它,它会记得向你汇报。多通道交互也服务于同一个目标。支持 Slack、Teams、短信甚至打电话,表面上是渠道扩张,实质是降低"查看进度"的摩擦。如果每次了解任务状态都要打开特定应用,异步的优势就被削弱了。
三、"请示"这个设计里藏着责任分配
Dots 最值得琢磨的设计是遇到关键决策时弹窗请示。它看起来是个交互细节,实际上是整套产品的安全与责任机制的核心。
技术上,这是经典的 human-in-the-loop,在高风险动作前插入人工确认。配套机制包括:账号密码不暴露给模型,由系统托管凭据;非执行期只读不写;所有操作保留完整行为审计日志;账号变动等敏感操作需要自动过审加人工确认。这些机制与业界共识一致,Anthropic 在 Computer Use 上强调的沙盒隔离与权限最小化,思路相同。
但请示机制有一个内在矛盾。请示太频繁,异步的价值就消失了,人还是得随时在场;请示太稀疏,风险就转移给了用户,而用户往往没有足够信息判断。更棘手的是"什么算关键决策"本身需要判断力,而这个判断是由模型做的。一个模型如果能准确识别出所有需要人类拍板的时刻,它的判断力已经相当接近人类专家;如果做不到,就会漏掉本该请示的动作。这是当前所有自主智能体共同面对的问题,没有厂商真正解决。
四、与同类产品的横向对照

横向看,各家的技术要素高度重叠:沙盒、浏览器操作、工具调用、权限控制。差异主要在两处——任务可以托付多久,以及产品摆在用户的哪个位置。OpenAI 在前者上走得最激进,Microsoft 和 Google 在后者上占据天然优势,因为办公套件本身就是工作的默认入口。这个差异会在第六章展开。
第四章 协作空间与开发工具:给智能体准备工位
一、Space 与 Pages:反向做文档
过去两年,办公软件接入 AI 的主流做法是在现有文档里塞一个侧边栏助手:你写文档,它在旁边提建议。微软 Copilot、Google Workspace 的 Gemini、国内的各类文档助手,基本都是这个形态。ChatGPT Space 的做法是反过来的:不是在文档里加 AI,而是先造一个 AI 原生的协作空间,再在里面放文档。Space 像一个团队网盘,里面包含 Pages。在 Pages 中可以写方案、做研究、自动生成图表,可以像 @同事 一样 @某个 Dot 参与编辑。团队共享统一知识库,页面可以配置长期指令,比如让它持续盯住某个 Slack 频道并自动更新内容。还有专为智能体预留的协作式幻灯片格式,支持人和多个智能体共同修改评论,并导出为 PPT 或 Google Slides。
这个差别不只是产品形态上的。侧边栏助手的前提是"人在写,AI 帮忙",所以它的能力边界被限定在建议和补全。而长期指令意味着页面本身有了生命:没人打开它的时候,它也在被更新。这是文档从"记录结果的地方"变成"任务持续发生的地方"。在传统文档模型里很难表达这件事,因为文档的修改总是由某次人类操作触发的。
不过这条路线也有明显的代价:它要求用户迁移工作场所。企业的文档资产、权限体系、协作习惯都沉淀在现有工具里,让团队把方案写在 ChatGPT 里而不是 Google Docs 或飞书里,阻力相当大。这正是 Microsoft 的结构性优势——它不需要用户搬家。
二、Codex 云端化:开发工具先行一步
开发工具一向是智能体落地最快的场景,这次的更新也最密集。Codex 全面云端化,环境配置一次即可跨设备使用,支持手机操控;命令行支持语音驱动,并加入 /agents 多智能体并行视图;桌面端自动审查代码改动并推回 GitHub 或 GitLab;Codex Security Cloud 搭配 Daybreak Blue 模型扫描代码库并自动提交安全修复方案。
编程之所以跑在最前面,原因很具体,而且值得推广到其他领域来看:
验证信号是免费且客观的。编译是否通过、测试是否通过、代码能否运行,这些都是机器可以自动判定的结果,不需要人来评分。这为智能体提供了可以反复自我纠错的反馈回路。
任务可以被分解成明确的小步。修一个 bug、加一个接口、重构一个函数,边界清楚,交付物明确。
错误代价可控。有版本控制、有代码审查、有测试环境,改错了可以回滚。这降低了放手让智能体尝试的风险。
训练数据丰富且结构化。开源代码及其提交历史,天然包含了"问题到解法"的配对。
反过来看,一个领域要让智能体真正可用,大致需要凑齐这四个条件:客观的验证信号、可分解的任务、可控的错误代价、以及足够的示例数据。这也解释了为什么法务审查、财务对账、运维排障这几个方向进展相对较快——它们都有比较明确的对错判定;而战略咨询、创意设计这类进展慢,因为好坏难以自动判定。
三、Harness 开源与接口开放:争夺事实标准
Codex Harness 的核心框架全面开源,Agents API 把电脑操作、多智能体协作、工具搜索打包公测,并支持在 AWS Bedrock 上托管部署。这几件事放在一起,指向的是同一个意图:在智能体的开发范式上建立事实标准。这是一场正在进行的竞赛。Anthropic 用 MCP(Model Context Protocol)定义了模型与外部工具的连接方式,由于协议中立、实现简单,它在开发者社区获得了广泛采用,连竞争对手的产品也在支持。Google 推出 A2A 协议处理智能体之间的通信。开源社区有 LangGraph、AutoGen、CrewAI 等编排框架。OpenAI 开源 Harness 并开放 Agents API,是在这个格局里确立自己的位置。
支持 AWS Bedrock 托管这一点尤其值得注意。它意味着 OpenAI 愿意让自己的智能体框架运行在竞争对手的云上,以换取企业客户的可达性。这是一个用渠道换生态位的选择:在标准之争里,被广泛使用比被独占使用更重要。
四、企业安全:真正的采购门槛
Private Intelligence 私密审查节点与零数据留存(ZDR)这两项,在发布会上不如 Dots 抢眼,但它们决定了企业能不能大规模部署。企业抗拒 AI 智能体的原因很少是"不好用",更多是三个具体顾虑:数据会不会流出去、出错了谁负责、能不能事后查清发生了什么。

这张表里右列的内容,是当前企业落地真正卡住的地方。其中"确认疲劳"值得单独说:当请示弹窗每天出现几十次,人会很快退化成无脑点"同意",人工确认机制就从安全保障变成了责任转移的形式。这不是技术问题,而是流程设计问题,而目前几乎所有厂商的方案都还停留在技术层面。
第五章 商业模式:当 AI 开始按"干完的活"收费
一、订阅阶梯的重构

图 5-1 订阅阶梯与 Pro 200 权益调整
新的订阅结构里有两个动作。一是新增 Pro 500 档位,月费 500 美元,算力额度为 Plus 的 25 倍,并且是个人套餐中唯一包含 Ultrafast 超速权益的档位。二是下调 Pro 200 的权益:自 10 月 30 日起,Work 和 Codex 的用量额度从 20 倍 Plus 降为 10 倍,GPT-6 Pro 每周消息数从 200 条降为 100 条。Dots、资料空间、动态页面、Ultrafast 均需 Pro 起步。把 20 美元的 Plus 当作一份标准额度,整个阶梯就变成了"你要买几份"的问题。这个设计很清晰,但同时发生的加价与减配,传递出一个明确的信号:智能体的运行成本高于厂商此前的定价假设,所以要重新切分蛋糕。这与第二章的观察吻合:单价在下降,但消耗量上升得更快。
二、三种计价逻辑的演变
AI 产品的计价方式在三年里走过了三个阶段,每一阶段对应不同的产品形态。
按 Token 计费,对应模型即服务阶段。它的优点是公平透明,缺点是用户无法预估成本,也无法把支出和业务价值对应起来。开发者报价给客户时,很难说清一次业务操作值多少钱。
按席位订阅,对应助手阶段。这是传统 SaaS 的逻辑,每人每月多少钱。它的问题在智能体时代很突出:一个人可以同时托付十个智能体,席位数和实际消耗完全脱钩。Microsoft Copilot 按席位收费已经遇到这个矛盾——重度用户的成本远超订阅费,轻度用户则觉得不值。
按产出与时效计费,对应智能体阶段。Pro 500 的额度分级加上 Ultrafast 的加急费,本质是"干多少活、要多快"的组合定价。这更接近人力外包的报价方式,也是"数字同事"这个定位的商业必然结果。业内还有一类更激进的尝试——按结果付费,比如客服智能体按成功解决的工单数收费,代表是 Intercom 的 Fin 和 Sierra 的方案。

三、预算归属的迁移:这才是最大的变量
商业模式变化中最具冲击力的一点,不在定价公式,而在钱从哪个口袋出。
软件采购的预算通常归 IT 或研发,规模受限于企业的技术投入;而人力与外包预算是另一个数量级。一个中型企业每年的软件支出可能是几百万,人力成本则是几千万甚至上亿。如果智能体被当作"数字员工"采购,它争夺的就不再是软件预算,而是人力与外包预算。这是 AI 厂商敢于推出 500 美元月费的真正底气——对标的不是软件订阅,而是一个人的部分工时成本。
发布会上"企业可用 OpenAI 承诺的最低消费额度购买生态内软件产品"这一设计,是同一逻辑的延伸:让算力预算和软件预算可以互相兑换,等于把 OpenAI 的消费承诺变成一种企业内部的通用货币。配合 Sign in with ChatGPT 允许用户把订阅额度带进第三方应用,以及可以把 Figma、Adobe、Salesforce 等完整应用嵌入 ChatGPT 的插件扩展与应用市场,OpenAI 想做的是入口加结算层,而不只是模型供应商。这条路线的对标对象是应用商店和支付体系,而非软件产品。
第六章 竞争格局:四种打法与一个共同难题

图 6-1 主要厂商的智能体定位(定性判断)
一、OpenAI:用产品形态定义品类
OpenAI 的打法是在自主性上走到最前面,用一个有辨识度的产品形态定义品类。Dots 的"全天候在线、有自己的电脑、会主动汇报"是一个容易被记住的概念,这种定义权在新品类形成期价值很高。配合 Sign in with ChatGPT 和应用市场,它试图让 ChatGPT 成为工作的起点而不是一个被调用的工具。它的软肋是入口。ChatGPT 虽然用户量巨大,但企业的工作流仍然跑在邮件、办公套件和内部系统里。要让 Dots 成为"同事",它得被拉进这些场景,这也是接入 Slack、Teams 并与 Agent 365 对接的原因。这是一个有趣的局面:品类定义者需要借用对手的渠道来触达用户。
二、Anthropic:用协议和可靠性做地基
Anthropic 的策略重心在开发者与企业。Claude 在代码能力上长期受专业用户认可,Claude Code 在工程师群体里有扎实的口碑。更重要的是 MCP 协议——它用一个中立、简单的开放标准定义了模型与外部工具、数据源的连接方式,并且被整个行业广泛采用,包括竞争对手的产品。
这是一种不同的占位方式:OpenAI 争的是用户界面的入口,Anthropic 争的是技术栈的接口。前者赢在品牌和分发,后者赢在被嵌入的深度。Anthropic 对安全与可解释性的持续投入,在企业采购场景中也构成实际优势,因为风控和合规部门更关心边界清晰、行为可控。它的短板是消费端存在感较弱,缺少 ChatGPT 那样的大众入口。
三、Google 与 Microsoft:守住默认位
这两家的共同优势是,用户已经在它们的产品里工作。Google 把 Gemini 嵌入 Workspace、Chrome 和 Android,坐拥搜索与浏览器两个超级入口,并且在自研 TPU 上有独特的成本优势——这让它在价格战中有更深的弹药。Microsoft 把 Copilot 铺进 Office、Teams、GitHub 和 Windows,再用 Agent 365 把智能体作为可纳管的数字身份接入企业目录体系,直接对接了企业的身份治理与采购流程。
这两家不需要说服用户换地方,只需要让功能出现在用户已经打开的窗口里。在企业市场,这种默认位往往比能力领先半代更有决定性。历史上多次重演过同一规律:更好的产品输给预装的产品。它们的挑战在另一面——庞大的存量包袱让产品形态难以激进调整,Copilot 侧边栏助手的形态就是一个例子,它受制于 Office 既有的交互范式。
四、垂直玩家:在窄场景里做深
Devin、Cursor、Lovable 等产品选择在编程这个单一场景里做到极致;Harvey 做法律,Sierra 做客服,Glean 做企业搜索。它们的共同逻辑是:通用智能体要处理所有场景,垂直玩家只需在一个场景里把成功率做到可商用的水平。在可靠性仍是瓶颈的阶段,这种聚焦往往能带来更好的实际效果,因为它们可以针对特定场景做工作流约束、领域知识注入和专用验证逻辑。
垂直玩家面临的长期风险是被通用能力覆盖。每当基础模型能力跃升一档,一批垂直产品的差异化就会被削薄。它们的护城河通常不在模型,而在工作流嵌入深度、行业数据积累和客户关系。
五、国内厂商:同一方向,不同节奏
国内在智能体方向上并不落后于思路,差异更多体现在产品形态和商业路径上。
模型能力。DeepSeek 以极高的性价比和开源策略改变了全球定价预期,其技术路线被广泛研究和复现。阿里的通义千问系列在开源生态中影响力很大,衍生模型数量庞大。月之暗面、智谱、MiniMax 等在长上下文、智能体和多模态方向各有侧重。整体上,国内头部模型与国际第一梯队的差距在缩小,但在最难的长程推理任务上仍有距离。
智能体产品。智谱的 AutoGLM 在手机和电脑操作上做得较早,走的是用界面操作替代接口的路线,与 Dots 的浏览器思路同源。字节的扣子(Coze)提供低代码的智能体编排平台,降低了普通人搭建智能体的门槛,这条路径在国内接受度很高。阿里的百炼、腾讯的相关平台则更偏向把智能体能力作为云服务输出给企业客户。
落地重心。国内的智能体落地更多发生在具体业务流程里:电商客服与选品、金融风控与投顾辅助、政务问答、工业质检与排产、以及手机端的系统级助手。相比"全天候数字同事"这种通用叙事,国内更倾向于把智能体做成某个业务环节的自动化模块。这既是市场选择,也与付费方式有关——企业更愿意为明确的业务指标改善付费,而不是为一个通用的虚拟同事付费。

六、一个共同难题
把各家放在一起看,会发现竞争焦点已经不在"模型能不能做到",而在三件更难的事上:长任务的可靠性、企业级的责任机制、以及如何进入用户已有的工作流。第一件是技术问题,第二件是管理问题,第三件是渠道问题。没有任何一家在三者上同时领先,这也是当前格局分散、各家打法迥异的根本原因。
第七章 中外对比:同样的技术,不同的收钱方式

图 7-1 中美 AI 商业化土壤与变现方式对比(定性判断)
一、为什么 Pro 500 在中国很难复制
500 美元月费折合人民币三千多元,这个价格在中国的个人市场几乎没有空间。原因不是单一的消费能力问题,而是几个因素叠加。中国的软件付费习惯建立在不同的历史路径上:长期的免费加增值模式、激烈的价格竞争、以及"工具应该免费、服务才收费"的普遍预期。国内主流 AI 应用的订阅价格大多在每月几十元档位,且免费版功能已经相当完整。更关键的是竞争结构:当有多家大厂把同类能力作为战略入口免费提供时,高价订阅在商业上就难以站住。美国市场的 AI 订阅定价之所以能撑在高位,部分原因是人力成本高——用两百美元替代几小时的人工,账算得过来;而在人力成本结构不同的市场,这个对比的说服力会弱很多。
二、变现方式的分流
付费意愿的差异导致两边走向了不同的变现路径。
美国以订阅和接口调用为主。按席位收费的 SaaS 传统成熟,企业习惯为软件许可付费,财务流程也支持这种支出。这让"卖智能体订阅"成为一条自然的路。
中国以项目制交付、云消耗和终端捆绑为主。企业客户更倾向于采购一个解决具体问题的项目,包含定制开发、集成和运维,按项目结算。这种模式毛利率较低、复制性较弱,但符合客户的采购习惯和验收逻辑。同时,手机厂商把 AI 助手作为系统能力捆绑在终端上,通过硬件销售回收成本,这条路径在中国尤其发达,因为智能手机的渠道深度远超其他国家。此外,国内也更擅长通过流量与广告间接变现 AI 能力。
这种分流的后果值得注意:美国的路径更容易形成高毛利的标准化产品,中国的路径更容易形成贴合场景的实用方案。前者有利于积累研发投入,后者有利于快速渗透产业。两者各有代价——标准化产品可能不够贴合,项目交付难以规模化。
三、落地场景的差异

四、基础设施与约束条件
在算力层面,两边的约束不同。美国厂商面对的主要是资本开支和电力供给的瓶颈,但芯片供应相对充裕。国内厂商在高端算力获取上存在限制,这反过来推动了两个方向的发展:一是推理效率优化,国内在量化、稀疏化、推理引擎和国产芯片适配上投入很大;二是模型小型化与端侧部署,把能力放到手机和终端设备上运行。
约束催生了不同的技术路线偏好。当算力受限时,"用更小的模型做更多的事"就从一种优化选择变成必需能力。这也解释了为什么国内在开源小模型、端侧推理和混合专家稀疏化上成果密集。长期看,这种能力在全球范围内都有价值,因为成本永远是产业化的核心变量。
治理环境也不同。欧盟的 AI 法案采用风险分级监管,对高风险应用提出明确要求;美国以行业自律和分散的州级立法为主;中国实行生成式 AI 服务备案与内容管理制度,同时以"人工智能加"等政策推动产业应用。对自主智能体而言,三地都还没有成熟的规则来界定"机器自主行为的责任归属",这是一个共同的空白。
第八章 真正卡住的地方
发布会展示的是能力的上限,而产业化取决于下限。这一章讨论四个在演示里看不见、但在落地时必然遇到的问题。
一、可靠性的复合衰减

图 8-1 单步可靠性在长任务中的复合衰减
这是智能体工程最基本也最残酷的算术。假设智能体每一步的成功率是 95%,听起来已经不错。但如果一个任务需要连续完成 20 步,整体成功率就是 0.95 的 20 次方,约 36%。需要 50 步时,降到约 8%。即便单步成功率提升到 99%,50 步后也只剩约 61%。
这解释了为什么自主科研任务的无干预成功率停在三分之一左右,也解释了为什么"演示很惊艳、实用很勉强"是智能体产品的普遍评价。任务越长,对单步可靠性的要求就越苛刻,而这个要求是指数级上升的。要让百步任务有九成成功率,单步可靠性需要达到 99.9% 以上,这是一个远超当前水平的目标。
工程上应对这个问题有几条路,都不是靠模型变强来解决的:
增加检查点与回滚:把长任务切成有明确验收标准的小段,每段失败就重试而不是整体失败,把乘法变成分段的乘法。
引入外部验证:用编译、测试、规则校验等客观信号替代模型的自我判断,这也是编程场景领先的原因。
让人介入在正确的位置:请示机制本质上是在最容易出错、代价最高的节点插入一次确定性校验。
冗余与投票:多个智能体并行尝试,取一致结果,用算力换可靠性。这是 Agents API 支持多智能体协作的实用动机之一。
二、上下文、记忆与成本的三角
长任务的另一个难题是记忆。一个跑几小时的智能体会产生大量中间信息:读过的网页、执行过的命令、失败的尝试、已确认的结论。全部塞进上下文,成本和延迟都无法承受,而且过长的上下文会导致注意力分散,模型反而容易忽略关键信息。只保留摘要,又可能丢掉后面需要的细节。当前的主流做法是分层记忆:短期用上下文窗口,中期用结构化的工作记录或草稿文件,长期用向量检索或知识库。这其实是在用工程手段模拟一个操作系统的内存管理,而目前还没有公认的最佳实践,各家实现差异很大。从这个角度看,Dots 拥有持久文件系统是一个重要设计——它让智能体可以把记忆写到磁盘上,而不是全靠上下文携带。
三、评测的困境
智能体的评测比模型评测难得多,这直接影响了产业的判断能力。

业界已有一些努力,比如 OSWorld 这类电脑操作基准、SWE-bench 系列的代码任务基准、以及把任务按所需时长分级的评测思路。但共同的问题依旧存在:当厂商既是产品提供方又是评测设计方时,公布的数字只能作为方向参考,不能作为采购依据。对企业来说,唯一可靠的办法是用自己的真实任务做小规模试点,并且重点记录失败案例和人工介入的频率。
四、安全与责任的空白
自主智能体带来了一类新的安全问题,其中最棘手的是提示注入。当智能体会阅读网页、邮件和文档时,这些内容里可能藏着针对它的指令。一个精心构造的网页,可以让智能体在毫无察觉的情况下泄露它能访问的数据,或者执行不该执行的操作。这个问题的困难在于:智能体的核心价值来自它能读取外部信息并据此行动,而这恰好就是攻击面本身。业界目前没有根本性的解法,只能通过权限最小化、敏感操作确认、输出过滤等方式降低风险。
责任归属的空白同样现实。如果一个企业智能体发错了对外邮件、改错了生产配置、或者在采购中做了不当承诺,责任在使用者、在部署企业、还是在模型提供方?现有的软件许可协议通常把责任限定在很小的范围,但"数字员工"这个定位天然带有更高的责任预期。这个落差迟早要由合同条款、保险产品或监管规则来填补,而目前三者都还不成熟。
第九章 趋势、结论与观察信号
一、六个趋势判断
模型分层会进一步细化。旗舰、准旗舰、轻量决策三层的结构会成为标准配置,调用成本的大头会被路由到最便宜的那一层。能力竞赛的焦点从"最强模型"转向"同等能力下的单位成本"。
速度会成为独立计价的商品。延迟与吞吐从技术指标变成产品档位,加急付费会在更多产品中出现,因为长任务让时间成本变得可感知。
计价单位会继续向"完成的任务"靠拢,但完全的按结果付费只会在结果可被机器判定的场景落地,其他领域将长期停留在混合模式:订阅打底加用量浮动。
智能体会被纳入企业身份与权限体系,成为被治理的独立主体。围绕智能体身份、权限、审计和合规的管理工具会形成新的产品类别,这条线的市场空间可能不输智能体本身。
协议与框架之争会持续,并且大概率走向多标准共存。工具连接、智能体通信、任务编排三层会分别形成事实标准,胜出者未必来自同一家。
可靠性工程会取代模型能力,成为产品差异化的主要来源。检查点、回滚、外部验证、冗余投票这些看起来不性感的工程手段,决定了谁的智能体能真正交付。
二、结论
第一,这场发布会的实质是交付物的改变,而非能力的突变。二十余项更新的内在逻辑是:产品要交付"做完的事"而不是"一段回答",于是模型要降价、速度要可购买、界面要支持异步、账号要独立、计价要换单位。理解了这条线,发布内容就不再是一堆散落的功能。
第二,这个转变的前提是成本和速度,而不是智能。Sol 的五分之一定价和 Ultrafast 的八倍速度,是 Dots 得以存在的经济基础。如果把因果关系倒过来理解,就会高估模型能力的进展,低估基础设施优化的贡献。
第三,"从工具到同事"在交互形态上已经成立,在可靠性和责任机制上尚未成立。异步托付、主动汇报、关键决策请示这些设计是真实有效的;但单步可靠性的复合衰减决定了长任务成功率仍然有限,而责任归属、提示注入、确认疲劳这些问题都还没有解法。能托付容易验收的事,不等于能托付责任重大的事。
第四,竞争已经从模型能力转移到三个新战场:可靠性工程、企业责任机制、以及工作流入口。没有厂商在三者上同时领先,这是格局分散的根本原因。OpenAI 领先在产品定义,Anthropic 领先在协议与安全,Google 和 Microsoft 领先在默认位,垂直玩家领先在单场景成功率。
第五,中外差异的核心不在技术快慢,而在收钱方式。美国走订阅与接口计费,中国走项目交付、云消耗与终端捆绑。前者更容易形成高毛利标准产品,后者更容易快速渗透产业。算力约束推动国内在推理效率和端侧部署上形成了实际能力,这在成本成为核心变量的长期竞争中是资产而非负债。
第六,最值得关注的变量是预算归属。如果智能体采购开始从软件预算转向人力与外包预算,AI 产品的市场天花板会被重新计算,这是比任何模型发布都更有分量的信号。而这个转变能否发生,取决于可靠性是否跨过企业敢于托付的门槛。
三、值得盯住的五个信号

图 9-1 判断智能体是否真正落地的五个信号
这五个信号各有侧重,而且都比基准测试分数更难被包装。任务平均持续时长反映自主能力的真实水平;无人干预完成率反映可靠性是否跨过了实用门槛;采购预算的归属反映企业是否真的把它当人力替代;账号与权限体系反映责任机制是否建立;计价单位反映商业模式是否完成转换。其中最硬的指标是第三个——当企业开始用人力预算而不是软件预算采购智能体时,这个品类才算真正成立。
四、写在最后
技术史上有一个反复出现的规律:新技术初期总被塞进旧的产品形态里,直到某一刻有人换掉形态,技术的价值才真正释放。早期的电力被用来驱动原有的中央传动轴,工厂布局照搬蒸汽时代,生产率提升有限;直到工厂改用分布式小电机、重新设计车间动线,电力的潜力才显现出来。早期的网页只是把纸质内容搬上屏幕,直到有人意识到网页可以是应用。AI 这两年的轨迹很相似。先是被塞进搜索框,然后被塞进文档侧边栏,形态始终是"人在工作,AI 在旁边帮忙"。DevDay 2026 的意义在于它尝试换掉这个形态:不再让 AI 在人的工位旁边站着,而是给它一个自己的工位、自己的电脑和自己的账号。这个尝试会不会成功,取决于一件很朴素的事——它能不能把活干对。
所以对这场发布会的恰当态度,既不是"AI 同事已经到来",也不是"又一次营销表演",而是承认一个具体的进展和一个具体的距离:产品形态的转变已经发生,交付可靠性的鸿沟仍然存在。前者决定了方向,后者决定了时间。