一个产业酝酿了三年的判断,在2026年7月的旧金山,由一位女CEO亲口确认
那句话,震动了整个科技界
2026年7月23日,旧金山。
AMD董事长兼CEO苏姿丰(Lisa Su)站在Advancing AI 2026的舞台上,用她一贯平静的语调,说出了一句让整个行业屏息的话:
"We can say that in 2026, for the first time, the world is using more AI compute to run models than to train them."
“2026年,全球用于运行模型的AI算力首次超过训练模型的算力”
她用现在时态描述了这场变化:此刻正在发生
她随即补了一个数字:今年,全球大约60%的AI算力容量将用于推理(inference)

▲ The Transcript 整理的苏姿丰原话:首次确认全球AI算力60%用于推理
这条消息像石子落进平静的湖面,涟漪迅速扩散到整个科技与金融圈读懂这项判断的人会意识到:这个市场数据标记了AI时代底层逻辑的一次彻底翻转
先搞懂:“训练”和“推理”到底是什么
很多人听到这里会有点懵。训练?推理?傻傻分不清?
训练(Training),就是"教会"模型的过程把海量数据喂给模型,反复调整数亿乃至数千亿个参数,直到它"学会"了语言、代码、图像……这个过程时间长、算力集中、烧钱凶猛,通常只有少数顶级实验室和云厂商才玩得转训练一个大模型,可能需要数周到数月,堆满一整栋楼的高端GPU
推理(Inference),则是模型"上班"的过程你每次问ChatGPT一个问题,它给你回答,背后就是推理每次AI帮你写代码、做分析、生成图片,全是推理推理如同一条24小时不停工的流水线,只要有用户在使用,算力就在消耗
过去几年,训练一直是算力消耗的主角毕竟,训练大模型才是"最难的事"。
但苏姿丰宣告:拐点来了。
160倍!一个让人窒息的数字
为什么推理会在2026年突然超越训练?
苏姿丰在演讲中展示了一条曲线,全球AI模型的使用强度,以"token"为单位来衡量
Token,可以简单理解为AI处理文本时的最小计量单位,大约相当于一个英文单词的3/4你每发一条消息,AI每回复一段话,都在消耗token
结果是:全球每个月的AI token消耗量,已经达到35千万亿(35 quadrillion),两年内增长了约160倍
160倍。
足足一百六十倍。



▲ 科技账号整理的关键数据:35千万亿tokens/月,两年160倍增长,推理首次超越训练
这个数字背后,藏着AI商业化最真实的速度它描述的是已经发生在全球服务器上的算力消耗
罪魁祸首:AI智能体,把一个请求变成了一百个
推动这场爆炸的,正是Agentic AI(AI智能体)的崛起
还记得早期的AI聊天机器人吗?你问一句,它答一句。一问一答,干净利落。消耗的算力,也就是一来一回。
但现在的AI智能体,完全是另一回事
你对一个编程智能体说:"帮我优化这个项目"
它会自己拆解任务、搜索文档、调用代码执行工具、反复测试报错、循环迭代修改,可能要几十次甚至上百次模型调用,才能交付一个结果
本来是一次推理,变成了一百次。
Box CEO Aaron Levie早在今年3月就发出了预警:
"前沿AI用例的token消耗量,大概是一年前的100倍。我们已经看到编程智能体在做更复杂、更长周期的项目,吞噬的推理容量是'疯狂'的。而这,只是知识工作的一小部分。"

▲ Box CEO Aaron Levie早在今年3月已预判:智能体将把推理需求推向"天文数字"
他说的"一小部分",是警告,也是预言。 当同样的智能体架构蔓延到财务分析、法律审查、医疗诊断、工程设计……每一个知识工作者身后,都会有一台永不休息的AI在消耗算力
万亿市场:AI加速器要吞下整个半导体行业
这是苏姿丰演讲中最让投资人心跳加速的部分
苏姿丰给出了她对未来市场的最新判断:
- AI加速器市场
:2030年达到约1.4万亿美元,年复合增长率约45%; - 服务器CPU市场
:从目前约250亿美元,增长到2030年超过2000亿美元(八倍以上); - 高性能与自适应计算总市场
:接近2万亿美元。
苏姿丰的原话是:"到本十年末,AI加速器市场的规模,将接近今天整个半导体市场的大小"


▲ Yahoo Finance转述:AMD预计AI加速器市场2030年达1.4万亿美元,GPU占据绝大多数份额

▲ GamesBeat报道:AI加速器年复合增长45%,服务器CPU增速同样惊人
AMD此前也多次上调预测,每次上调的幅度都让人咋舌 2023年,AMD还在估计2027年加速器市场是"数百亿美元量级";两年后,这个数字膨胀到1.4万亿。
是AMD过于乐观?还是AI真的在以超出所有人预想的速度扩张?
目前来看,历史一直是后者赢了。
一个被低估的故事:CPU的“王者归来”
这次演讲里,有一个细节极少被主流报道点透,但极度值得深思
苏姿丰说:"GPU alone is not enough"
问题不在GPU本身的性能。AI智能体还依赖大量矩阵运算之外的能力
智能体要调用工具、管理上下文、执行代码、在步骤之间搬运数据……这些"调度与协调"工作,是CPU的主场Meta基础设施负责人Santosh Janardhan在现场的表态,让业界重新审视这个芯片界的"老大哥":
"It's not just a GPU game anymore,it's CPU and GPU; and in some ways, CPU is at least as important."
服务器CPU不再只是服务器上的"管家",它正在成为AI时代不可或缺的"大脑调度中枢"
这也解释了为什么苏姿丰把服务器CPU市场的预期从250亿直接拉到2000亿,增长的逻辑是,每一个AI智能体"沙箱"背后,都需要CPU来撑起运行环境,而智能体数量可能以数十亿计
从"买芯片"到"买整栋AI工厂"
苏姿丰这次发布的核心产品,叫Helios
它是一个机架级AI系统:约72颗Instinct MI455X GPU + 18颗第六代EPYC "Venice" CPU + Pensando网络 + ROCm软件,全部打包成一个可以直接插入数据中心的"AI工厂砖块"
AMD宣称,相比竞争对手同级别产品,Helios可提供最多约30%的inference tokens per dollar优势
客户名单同样醒目:Anthropic计划部署高达约2GW的MI455X/Helios;OpenAI预计2026年四季度上线,2027年加速;Meta已验证Venice CPU并测试Helios……

▲ AMD官方新闻稿:Helios全栈发布,Anthropic、OpenAI、Meta等巨头站台背书
AI基础设施的采购逻辑,已经从"买几张显卡"进化到"买整个机架系统",再到"规划整栋数据中心"竞争的维度,从单芯片跑分,跳跃到了系统成本(tokens per dollar)、软件生态可迁移性和整机架交付能力
苏姿丰说出了一个残酷的基础设施真相
有一位评论者,把这场演讲的本质,用极其精准的语言总结了出来:
"Inference is where this hits the physical economy. Training is bursty; inference is a 24/7 baseload draw."
训练是脉冲式的,推理是7×24小时的基础负载
训练,像工厂偶尔开一次大窑炉,高温、高耗,但是阶段性的,烧完就停
推理,像城市的自来水系统,永远在跑,永远在消耗,每增加一个用户,负载就增加一分
随着推理成为主导工作负载,数据中心的电力规划、冷却系统、铜缆网络、物理空间,全部要从"周期性冲刺"模式,切换成"持续高功率运行"模式基础设施投资的节奏,正在被根本性地重写
这一切,才刚刚开始
苏姿丰在演讲尾声说:"We're still in the very early innings of the AI era."
我们还在最早的早期。
用棒球的比喻:九局比赛,现在还没打完第一局
回看那条token消耗曲线,两年160倍,然后想象:当AI智能体真的渗透到科学研究、医疗诊断、工程设计、教育、金融……每一个行业加速采用的那一刻,这条曲线还会继续陡峭地往右上角延伸
当然,这些数字也有边界:60%推理占比来自AMD内部估算,尚无全球装机独立审计;1.4万亿的TAM属于厂商展望,不能视为确定的市场份额AMD上调预测的历史,既证明了它的眼光,也提醒我们:指数曲线不会永远保持斜率
但有一件事,已经很难被否认:
AI,正在从少数实验室的"训练竞赛",演变成全球基础设施的"持续运行"
这个转变,比所有人预想的都快。
而苏姿丰在旧金山的那句话,不过是给这件已经发生的事,盖上了一个公开的时间戳
夜雨聆风