一颗芯片统治一切的时代,终结了。
2026年4月,拉斯维加斯,Google Cloud Next大会谷歌AI与基础设施高级副总裁Amin Vahdat走上台,说出了一句让整个芯片行业屏息的话,"Two chips for the agentic era."
十年了。从第一代TPU到第七代Ironwood,谷歌一直在用同一颗芯片同时干训练和推理两件事现在,他们第一次承认:这条路,走不通了
于是,第八代TPU被一刀劈成两半:TPU 8t,专管训练;TPU 8i,专管推理。
为什么"劈开"?因为AI Agent把老架构逼到了墙角
先说一个直觉:你跟ChatGPT聊天,背后只跑了一次推理但一个AI Agent替你订机票、查天气、比价、改行程,它可能在几秒内连续跑十几次推理,每一步都依赖上一步的结果
延迟一旦累积,整条任务链就可能崩掉
训练需要什么?疯狂的算力密度,成千上万张卡之间的高带宽同步通信,日以继夜地跑推理需要什么?极低的延迟、每一美元能撑住尽量多的请求、内存系统得喂得上注意力缓存和专家路由
把这两种截然不同的需求硬塞进同一颗芯片,结果就是,两边都在将就,两边都不极致
社区里一条高赞评论说得痛快:
"训练芯片优化算力密度与互联,推理芯片优化延迟、每美元内存与功耗。把两者焊在同一架构上,等于两边都次优。训练上头条,推理付账单,因为生产AI开销的90%往往在服务侧。"

▲ 开发者@eshanbuilds认为,生产环境中的推理开销更高
谷歌给出的判断是:Agent时代的主战场正在转向推理
8t:把训练从"月"压到"周"的暴力美学
先看训练怪兽TPU 8t。
一个superpod,9600颗液冷芯片,共享约2 PB高带宽内存,系统级峰值算力约121 ExaFLOPS(FP4)芯片间互联带宽相比上代直接翻倍。配合谷歌自研的Virgo网络和Pathways软件栈,逻辑集群可以扩展到百万颗芯片量级,追求近线性扩展

▲ 谷歌云官方三词概括8t:Massive scale / Maximum utilization / Near-linear scaling
峰值跑分之外,工程师还盯着一个叫goodput的指标,有效有用的计算时间占比谷歌的目标是超过97%。怎么做到?大规模遥测监控、故障互联链路自动绕行、光路交换无人干预重配……目标是让一万张卡同时运行时尽量不浪费时间
分析师Patrick Moorhead的评价是:"goodput比峰值FLOPs更有参考价值"
8i:为Agent而生的"推理引擎"
再看推理侧的TPU 8i。它是这次发布里最有冲击力的杀手锏
谷歌给它起的slogan是"The reasoning engine",推理引擎四大创新,每一条都直指Agent时代的痛点:
第一,打破"内存墙"。 约288 GB高带宽内存,配合约384 MB片上SRAM,后者是上一代的3倍目标很明确:把模型的活跃工作集和推理所需的KV cache尽量留在离计算最近的地方,不搬数据,就不会等数据
第二,Boardfly拓扑革命。 芯片间互联带宽拉到约19.2 Tb/s,更深一层的变化发生在网络拓扑新的Boardfly设计把最大网络直径砍掉一半以上,原来16跳才能到的地方,现在7跳搞定

▲ 技术博主@semidoped拆解:8t用3D环面,8i用Boardfly,两套完全不同的scale-up网络
第三,集合加速引擎(CAE)。 把全局集合运算卸载到专用硬件,片上同步延迟最多降低约5倍
第四,Axion主机效率。 每台服务器物理CPU主机翻倍,采用谷歌自研的Axion Arm CPU,NUMA隔离优化整机效率

▲ 官方四词定义8i:Breaking the memory wall / Axion-powered / Scaling MoE / Eliminating lag
核心商业承诺:相对上一代,约80%的每美元性能提升 换句话说,同样的预算,能服务接近两倍的用户
"便宜10倍"?别被标题骗了
社交媒体上疯传的"AI便宜10倍",到底怎么来的?
答案是:拼贴。
把谷歌官方对8i说的"约80%每美元性能提升"、Ironwood相对v5p的"约10倍峰值性能"、以及媒体报道中在研项目Frozen v2的"6到10倍tokens per watt工程投影",三个完全不同的数字,搅进同一段话,就诞生了那个让人血脉偾张的标题
| 未量产 | ||
官方硬承诺停在约80%和约2倍附近;"10倍"来自二次标题,并未写进规格书


▲ 投资向账号整理的核心数据:8i约80% better perf/$,8t/8i能效提升超一倍
Frozen v2:把Gemini"刻进"晶体管?
但"10倍"的故事也不完全是空穴来风
2026年7月,多家媒体转述了谷歌在研的Frozen v2推理芯片项目:把Gemini模型的架构固化进硅片,同时保留权重更新能力,减少运行时的通用决策开销工程投影是6到10倍的tokens per watt,部署目标最早2028年

▲ Tom's Hardware报道Frozen v2:目标6-10倍tokens/watt,但距离量产还有两年
有意思的是,谷歌最初设想的Frozen v1是把模型权重永久烧进芯片,后来发现模型迭代太快,芯片还没出厂模型就换代了于是Frozen v2转向"架构冻结、权重可更新":只要Gemini的骨架不大改,芯片就能跨版本存活
这是一条高风险路线。方向踩准,推理能效飙升;模型架构一旦大改,整批芯片就可能变成昂贵的电子废物
芯片之外的系统之战
一个容易被忽略的事实是:Agent的瓶颈同时落在"算"和"查"
Agent完成一次任务,可能触发几十次数据库调用、向量检索和状态写回推理层已经快到毫秒级,数据层还停在批处理节奏,体验会在数据侧崩盘这就是为什么谷歌同期推出Agentic Data Cloud和跨云数据湖:一边加速"想",一边让"查得到、写得回"跟上节拍
而在更宏观的竞争格局里,亚马逊早就有Trainium和Inferentia的训练/推理双轨;英伟达则坚持用同一架构覆盖两端,靠软件生态和互联标准锁定客户谷歌的独特之处在于,它同时控制着模型(Gemini)、加速器(TPU)、主机CPU(Axion)、数据中心网络和液冷系统
掌握从模型到晶体管的整条垂直栈后,"分芯"会同时牵动技术路线和供应链
一度电能换回多少个token?
最后说一个被所有炫酷数字遮住的朴素问题:电力
谷歌反复强调,今天的数据中心里,电力和芯片供应一样,是绑死的硬约束Agent可能24小时×7天常驻运行"更便宜"首先意味着:同一个机柜的电力预算下,能吐出更多有效token
过去五年,谷歌数据中心单位电力可交付的算力提升了约6倍第八代继续这条路:整机动态功耗管理、第四代液冷、把网络与计算更紧密地塞进同一系统以减少搬运数据消耗的电力
Frozen v2选择tokens per watt作为核心指标,与这一逻辑一脉相承,它关注一度电能换回多少可用的输出
这次芯片发布背后,谷歌用十年积累向整个行业抛出一个根本性提问:
当永远在线的Agent群成为常态,你的基础设施,准备好了吗?
夜雨聆风