乐于分享
好东西不私藏

谷歌一刀把AI芯片劈成两半!推理成本暴降80%,"万卡超算"杀疯了?

谷歌一刀把AI芯片劈成两半!推理成本暴降80%,"万卡超算"杀疯了?

一颗芯片统治一切的时代,终结了。

2026年4月,拉斯维加斯,Google Cloud Next大会谷歌AI与基础设施高级副总裁Amin Vahdat走上台,说出了一句让整个芯片行业屏息的话,"Two chips for the agentic era."

十年了。从第一代TPU到第七代Ironwood,谷歌一直在用同一颗芯片同时干训练和推理两件事现在,他们第一次承认:这条路,走不通了

于是,第八代TPU被一刀劈成两半:TPU 8t,专管训练;TPU 8i,专管推理。

为什么"劈开"?因为AI Agent把老架构逼到了墙角

先说一个直觉:你跟ChatGPT聊天,背后只跑了一次推理但一个AI Agent替你订机票、查天气、比价、改行程,它可能在几秒内连续跑十几次推理,每一步都依赖上一步的结果

延迟一旦累积,整条任务链就可能崩掉

训练需要什么?疯狂的算力密度,成千上万张卡之间的高带宽同步通信,日以继夜地跑推理需要什么?极低的延迟、每一美元能撑住尽量多的请求、内存系统得喂得上注意力缓存和专家路由

把这两种截然不同的需求硬塞进同一颗芯片,结果就是,两边都在将就,两边都不极致

社区里一条高赞评论说得痛快:

"训练芯片优化算力密度与互联,推理芯片优化延迟、每美元内存与功耗。把两者焊在同一架构上,等于两边都次优。训练上头条,推理付账单,因为生产AI开销的90%往往在服务侧。"

▲ 开发者@eshanbuilds认为,生产环境中的推理开销更高

谷歌给出的判断是:Agent时代的主战场正在转向推理

8t:把训练从"月"压到"周"的暴力美学

先看训练怪兽TPU 8t。

一个superpod,9600颗液冷芯片,共享约2 PB高带宽内存,系统级峰值算力约121 ExaFLOPS(FP4)芯片间互联带宽相比上代直接翻倍。配合谷歌自研的Virgo网络和Pathways软件栈,逻辑集群可以扩展到百万颗芯片量级,追求近线性扩展

▲ 谷歌云官方三词概括8t:Massive scale / Maximum utilization / Near-linear scaling

峰值跑分之外,工程师还盯着一个叫goodput的指标,有效有用的计算时间占比谷歌的目标是超过97%。怎么做到?大规模遥测监控、故障互联链路自动绕行、光路交换无人干预重配……目标是让一万张卡同时运行时尽量不浪费时间

分析师Patrick Moorhead的评价是:"goodput比峰值FLOPs更有参考价值"

8i:为Agent而生的"推理引擎"

再看推理侧的TPU 8i。它是这次发布里最有冲击力的杀手锏

谷歌给它起的slogan是"The reasoning engine",推理引擎四大创新,每一条都直指Agent时代的痛点:

第一,打破"内存墙"。 约288 GB高带宽内存,配合约384 MB片上SRAM,后者是上一代的3倍目标很明确:把模型的活跃工作集和推理所需的KV cache尽量留在离计算最近的地方,不搬数据,就不会等数据

第二,Boardfly拓扑革命。 芯片间互联带宽拉到约19.2 Tb/s,更深一层的变化发生在网络拓扑新的Boardfly设计把最大网络直径砍掉一半以上,原来16跳才能到的地方,现在7跳搞定

▲ 技术博主@semidoped拆解:8t用3D环面,8i用Boardfly,两套完全不同的scale-up网络

第三,集合加速引擎(CAE)。 把全局集合运算卸载到专用硬件,片上同步延迟最多降低约5倍

第四,Axion主机效率。 每台服务器物理CPU主机翻倍,采用谷歌自研的Axion Arm CPU,NUMA隔离优化整机效率

▲ 官方四词定义8i:Breaking the memory wall / Axion-powered / Scaling MoE / Eliminating lag

核心商业承诺:相对上一代,约80%的每美元性能提升 换句话说,同样的预算,能服务接近两倍的用户

"便宜10倍"?别被标题骗了

社交媒体上疯传的"AI便宜10倍",到底怎么来的?

答案是:拼贴。

把谷歌官方对8i说的"约80%每美元性能提升"、Ironwood相对v5p的"约10倍峰值性能"、以及媒体报道中在研项目Frozen v2的"6到10倍tokens per watt工程投影",三个完全不同的数字,搅进同一段话,就诞生了那个让人血脉偾张的标题

说法
出处
真实含义
8i约80% perf/$
谷歌官方
相对前代推理性价比
8t/8i约2× perf/watt
谷歌官方
相对Ironwood的能效提升
Frozen v2约6-10× tokens/watt
媒体转述
未量产
,约2028年目标
"服务成本最多降10×"
分析师/二次标题
特定负载的外推

官方硬承诺停在约80%和约2倍附近;"10倍"来自二次标题,并未写进规格书

▲ 投资向账号整理的核心数据:8i约80% better perf/$,8t/8i能效提升超一倍

Frozen v2:把Gemini"刻进"晶体管?

但"10倍"的故事也不完全是空穴来风

2026年7月,多家媒体转述了谷歌在研的Frozen v2推理芯片项目:把Gemini模型的架构固化进硅片,同时保留权重更新能力,减少运行时的通用决策开销工程投影是6到10倍的tokens per watt,部署目标最早2028年

▲ Tom's Hardware报道Frozen v2:目标6-10倍tokens/watt,但距离量产还有两年

有意思的是,谷歌最初设想的Frozen v1是把模型权重永久烧进芯片,后来发现模型迭代太快,芯片还没出厂模型就换代了于是Frozen v2转向"架构冻结、权重可更新":只要Gemini的骨架不大改,芯片就能跨版本存活

这是一条高风险路线。方向踩准,推理能效飙升;模型架构一旦大改,整批芯片就可能变成昂贵的电子废物

芯片之外的系统之战

一个容易被忽略的事实是:Agent的瓶颈同时落在"算"和"查"

Agent完成一次任务,可能触发几十次数据库调用、向量检索和状态写回推理层已经快到毫秒级,数据层还停在批处理节奏,体验会在数据侧崩盘这就是为什么谷歌同期推出Agentic Data Cloud和跨云数据湖:一边加速"想",一边让"查得到、写得回"跟上节拍

而在更宏观的竞争格局里,亚马逊早就有Trainium和Inferentia的训练/推理双轨;英伟达则坚持用同一架构覆盖两端,靠软件生态和互联标准锁定客户谷歌的独特之处在于,它同时控制着模型(Gemini)、加速器(TPU)、主机CPU(Axion)、数据中心网络和液冷系统

掌握从模型到晶体管的整条垂直栈后,"分芯"会同时牵动技术路线和供应链

一度电能换回多少个token?

最后说一个被所有炫酷数字遮住的朴素问题:电力

谷歌反复强调,今天的数据中心里,电力和芯片供应一样,是绑死的硬约束Agent可能24小时×7天常驻运行"更便宜"首先意味着:同一个机柜的电力预算下,能吐出更多有效token

过去五年,谷歌数据中心单位电力可交付的算力提升了约6倍第八代继续这条路:整机动态功耗管理、第四代液冷、把网络与计算更紧密地塞进同一系统以减少搬运数据消耗的电力

Frozen v2选择tokens per watt作为核心指标,与这一逻辑一脉相承,它关注一度电能换回多少可用的输出

这次芯片发布背后,谷歌用十年积累向整个行业抛出一个根本性提问:

当永远在线的Agent群成为常态,你的基础设施,准备好了吗?

相关学习资料