伯恩斯坦——软件行业——“token冲击”会阻碍AI普及吗?(附下载)
伯恩斯坦——软件行业——“token冲击”会阻碍AI普及吗?
翻译精华
1. 现象:“token冲击”正在改写企业AI账单
生成式AI早期靠免费或低价订阅(如每月19/29美元无限用量)快速铺开,但随着AI走向商业化、大模型厂商要兑现收入,计费模式正从“包月不限量”全面转向按“代币(Token)”消耗付费。一个代币约等于4个字符,输入输出分开计价,且上下文窗口越大成本越高。企业突然发现AI不再是“固定成本”,而是随使用量剧烈波动的“可变成本”,预算频频失控——这就是“代币冲击”。典型案例包括:法国某保险公司上线Claude仅两月就因后台自动化调用远超预期被迫缩减部署;基建初创公司Pylon员工数跨过150人阈值后,年AI账单飙涨3.5倍至140万美元;Uber仅用4个月就花光2026年全年AI编程预算,不得不给每位员工设置1500美元/年/工具的硬性上限;沃尔玛限制员工使用表格与PPT辅助AI工具Code Puppy的代币额度;安永数据显示,从简单搜索到智能体(Agentic AI)多步任务,单次交互成本可暴涨30倍。
2. 本质:成本约束已超越技术可行性,成为AI普及最大障碍
企业AI部署的核心矛盾已从“能不能用”变成“划不划算”。与传统软件按席位收费不同,AI成本高度不可预测:推理成本随并发量、GPU等级、重训频率非线性上升;多轮对话需反复回传历史上下文,链式思考(CoT)会生成大量不可见的“推理代币”,检索增强生成(RAG)要加载海量文档,智能体则要多次调用模型做规划、调用工具和反思,代币消耗呈指数级放大。德勤预计,到2028年至少一半的生成式AI项目将超预算,而模型全生命周期成本中,推理环节可能占到80%。埃森哲、IBM、德勤、凯捷、普华永道等机构反馈,大量客户因成本不确定性和ROI模糊,推迟、缩水或干脆取消了AI项目,仅不到四分之一的试点项目能看到正向ROI。
3. 企业自救:从“狂飙”到精细化运营
面对账单压力,企业正像当年管理云计算成本一样建立“AI FinOps”体系:一是实施代币治理,按业务部门、应用场景分摊成本,设置预算上限和实时监控看板;二是从“按代币计量”转向“按业务结果计费”,不再纠结用了多少Token,而是算清处理一张保单、解决一个客诉、完成一个工作流的实际成本,只要产出足够高,贵一点也值得;三是模型路由与分层推理,简单任务(分类、检索、基础客服)用小模型/开源模型(如Llama、Mistral、Qwen),复杂推理和高价值决策才动用顶级大模型,SAP早在2024年就开始实践这一策略;四是优化提示词、上下文和工作流,压缩冗余历史记录、改进RAG检索精度,减少不必要的推理步骤;五是部分高稳定、高重复度场景转私有化部署,法国某大行已将部分AI用例从微软Azure迁至本地基础设施以控本。此外,企业正将采购决策权从IT部门下放至业务线,要求业务方自行验证ROI,同时频繁切换高性价比工具,并对AI功能引入试用机制(如HubSpot对新客户开放数月免费试用再收费)。
4. 厂商应对:优化成本与探索新定价
AI厂商也在调整策略:一是加速模型优化,2025年初DeepSeek带来的效率冲击促使各大实验室压降推理成本,微软Build大会发布的自研模型已在保持性能的同时显著降低运行成本;二是推广小模型和专用模型,SAP等企业软件厂商针对特定场景定制小模型,微软Office 365则根据任务复杂度动态切换模型;三是部署“前线工程师(FDE)”,既帮客户选高ROI项目、监控价值实现,也优化智能体和应用的架构以降本;四是试水“按结果付费”,如HubSpot按每个销售线索5美元收费,而非按Token收费,为客户成本设上限。部分AI实验室也在考虑下调代币单价以刺激 adoption。
5. 投资启示:谁把Token变价值的能力更强,谁就赢
代币单价下降本身无法解决经济账——智能体普及、自动化深化和用量爆发会让总支出继续攀升。未来企业AI的竞争核心,不是谁能拿到最便宜的Token,而是谁能最高效地把Token转化为业务价值。AI治理、FinOps能力、模型路由技术、工作流优化和“每美元业务产出”度量,将从行政职能升级为核心战略能力。报告持“谨慎乐观”态度:智能体技术前景广阔,但ROI验证和成本控制需要时间,AI普及速度可能慢于市场预期,期间可能引发行业阶段性泡沫反应。当前重点应关注AI落地能力强、ROI可见度高的应用场景及相关软件厂商。
「原研报」可长按下方二维码
(若下方过期,至公众号最新一条)

夜雨聆风