夜雨聆风学习资料网

ARTICLE · 1135721

AI芯片需求仍超供给:下一轮算力竞赛,拼的为什么是HBM与先进封装

AI芯片需求仍超供给:下一轮算力竞赛,拼的为什么是HBM与先进封装

当生成式人工智能从训练走向推理,算力基础设施的短板正在从“有没有足够多的计算核心”,扩展到“能不能把计算核心稳定地供起来”。一颗AI加速器的性能,既取决于逻辑芯片本身,也取决于旁边的高带宽内存、封装基板、先进封装产线、测试设备和数据中心电力。只要其中一环没有同步扩产,整套系统就可能无法按计划交付。

下一轮算力竞争,表面比芯片,底层比的是一条更长、更窄、也更需要协同的供应链。

供给紧张不只是“芯片不够”

传统服务器处理器的供应链,往往可以把处理器、内存、主板和整机相对分开采购。AI服务器则不同。训练和推理需要大量矩阵运算,计算单元必须持续获得权重、激活值和中间结果。如果内存带宽跟不上,计算核心就会等待数据;如果封装不能把多个芯片和内存可靠地连接起来,单颗芯片的理论吞吐也无法转换为整机吞吐。

因此,AI芯片交付通常是多个条件同时满足的结果:先进制程晶圆完成,逻辑芯片通过测试,HBM颗粒具备足够容量和带宽,封装工艺能将它们组合,基板和电源模块能够承载高功耗,最后还要经过整机验证。任何一个环节的良率、产能或交付节奏出现偏差,都会延迟最终系统。

公开报道中,AMD首席执行官苏姿丰曾把AI产品的供给视为需要提前多年规划的问题。这里需要区分两件事:一是企业对未来三到五年供应链能力的规划,二是某个季度能够实际交付的数量。前者说明产能建设具有长期性,后者则会受到晶圆、内存、封装、测试和客户部署节奏的共同影响。若没有完整可核验的订单与产能口径,就不宜把任何单一数字当成行业总量。

HBM为什么成为关键瓶颈

HBM并不是普通内存的简单升级。它把多层DRAM芯片垂直堆叠,通过硅中介层或类似的高密度互连方式,连接到计算芯片附近。这样做的目的,是在有限的封装面积内提供更宽的数据通道,让加速器可以更快读取模型参数和中间数据。

容量决定模型和缓存能否装下,带宽决定数据能否及时送到计算单元,功耗和散热则决定系统能否持续工作。AI工作负载通常需要同时关注这三个维度。仅提高计算核心数量,却没有匹配的内存带宽,可能造成“算得快、等得久”;只提高容量,若访问效率和软件调度没有改善,也不一定带来线性收益。

HBM供给之所以难以快速追上需求,还因为它涉及晶圆制造、薄化、堆叠、键合、封装、测试和验证等多个步骤。堆叠层数增加后,单个环节的缺陷都可能影响整叠产品;产品还要在高带宽、低功耗和长期可靠性之间取得平衡。对供应商来说,扩产不只是添置设备,更要把良率逐步提升到客户可以接受的水平。

真正稀缺的不是一块孤立的内存,而是经过验证、能够与特定加速器和封装方案稳定协同的HBM组合。

先进封装把“组合能力”变成产能

在先进AI系统中,封装不再只是保护芯片的最后一道工序,而成为决定产品形态的重要环节。逻辑芯片、HBM和互连结构需要在封装内保持短距离、高密度和低损耗。封装尺寸越大、互连越复杂,对设备精度、材料稳定性、热管理和测试方法的要求就越高。

台积电公开资料长期把先进封装列为AI平台的重要组成部分,CoWoS等技术也经常出现在相关行业讨论中。需要注意的是,媒体报道中的“封装产能”可能指设备能力、晶圆级处理能力、封装完成能力或客户可用的合格产能,口径并不总是一致。台积电公开新闻页面在本次访问中受到访问限制,因此本文不引用未经直接核验的扩产数字,只讨论其技术方向和供应链影响。

封装产能的约束还有一个特点:它往往比新建一座逻辑晶圆厂更容易被忽略,却同样需要厂房、设备、材料、工程人员和验证周期。即使逻辑芯片已经完成,若封装线排队,产品仍然不能交付。对于采用多颗芯片组合的系统,任何一颗芯片或任何一种互连材料缺货,都会拖慢整套产品。

先进封装也在改变供应链的协作方式。芯片设计公司需要更早确认HBM规格和封装尺寸,代工厂需要协调逻辑晶圆与封装安排,内存厂需要围绕不同加速器进行验证,整机厂则必须同步准备散热、电源和网络连接。过去按季度采购的模式,正在更多地转向跨年度的联合规划。

三个环节为何难以简单替代

第一,HBM不是通用插拔件。不同代际的接口、电气规范、堆叠高度和控制方式存在差异,换用另一种产品通常需要重新验证。替代品即使在容量上相近,也可能在带宽、功耗、温度或软件支持上不满足要求。

第二,先进封装具有明显的工艺耦合。逻辑芯片的尺寸、HBM数量、中介层设计、基板规格和散热路径彼此关联。改变其中一项,往往会影响设计规则、设备参数和测试程序。因此,封装环节的扩容不能完全依靠短期外包来解决。

第三,数据中心部署要求可靠性。AI服务器需要长时间高负载运行,内存错误、互连失效或散热不均都可能导致整机维护。供应链增加一个新来源,不能只看样品能否点亮,还要看持续负载、温度循环、故障率和服务体系。

这解释了为什么“有芯片”与“有可用算力”之间存在距离。可用算力是芯片、内存、封装、网络、电力、软件和运维共同产出的结果。任何环节缺少可预测性,客户就难以安排集群上线时间。

从单颗芯片转向系统级供给

AI加速器的竞争正在从单芯片性能,转向系统级性能。系统级指标包括单位机柜的有效吞吐、内存带宽利用率、互连效率、持续运行时间、功耗和升级便利性。一个峰值很高但受制于内存访问或散热的方案,未必能在真实数据中心里保持同样表现。

这也让芯片厂商越来越重视整机和软件协同。编译器需要理解内存层级,运行时需要安排数据搬运,模型框架需要减少不必要的复制,网络系统需要让多卡之间高效交换数据。只有把这些工作做好,HBM提供的带宽才不会被调度开销抵消。

供应链管理同样要从“买多少颗芯片”转向“交付多少套经过验证的系统”。客户需要看到的是可上线的机架、可持续的服务和明确的升级路径,而不是仓库里分散的零部件。对供应商而言,这意味着预测、产能预留、质量管理和售后支持需要更早协同。

未来三到五年,拼的是规划能力

公开信息显示,AMD、台积电以及主要内存厂商都在围绕AI基础设施进行更长期的产品和产能规划。这里的三到五年不是对某个具体数字的承诺,而是说明从技术路线、设备采购到客户验证,周期已经足够长,无法只靠临时加班或短期调货解决。

未来的HBM可能继续提高单叠容量和带宽,也可能通过新的接口、封装结构和混合键合降低能耗。与此同时,系统设计会尝试用更高效的模型、分层内存和更合理的数据复用减少无效搬运。技术路线并非只有“堆更多内存”这一条路,而是硬件扩展与软件优化同时推进。

对供应链来说,更重要的变化是需求可见性。芯片公司、内存厂、代工厂和数据中心客户如果能共享更稳定的产品路线和验证计划,就能减少临时变更带来的浪费;如果规格频繁变化,产能即使增加,也可能因重新验证而无法立即转化为交付能力。规划能力因此成为产能之外的另一种稀缺资源。

观察AI供给,不能只看一个数字

判断AI基础设施是否缓解供给压力,至少要看四个层面。第一是逻辑芯片和HBM的组合交付,而不是各自的出货量。第二是先进封装的合格产能和良率,而不只是名义设备数量。第三是从封装到服务器整机的验证周期。第四是数据中心电力、制冷、网络和运维能否跟上。

还要注意代际切换带来的波动。新一代HBM或新封装方案初期可能拥有更好的规格,但产线需要重新爬坡,客户也需要重新验证。旧一代产品仍可能在部分系统中继续使用,形成多代产品并行的局面。供需关系不是一个开关,而是随着产品代际、客户结构和部署区域持续变化。

因此,报道中的“需求超过供给”应被理解为多个环节存在不同程度的紧张,而不是所有芯片、所有内存和所有地区都处于同样状态。中性地看,供应链正在通过扩产、替代设计、系统优化和更长期的采购安排逐步提高弹性,但短期内仍会受到工艺良率、封装排队和基础设施建设速度的影响。

写在最后:算力竞赛进入协同阶段

AI芯片需求仍然强劲,真正的挑战是把需求转化为可稳定交付的算力。HBM解决的是数据供给,先进封装解决的是高密度组合,逻辑芯片提供计算能力,数据中心则负责把这些能力长期运行起来。它们不是互相独立的模块,而是一条需要共同验证的链路。

下一轮算力竞赛的关键,未必是谁先公布更高的峰值参数,而是谁能把芯片、HBM、封装、软件和机房组织成更可靠的系统。对于观察者而言,理解这条链路,比追逐单一型号或未经核验的产能数字更重要。

当算力从“芯片问题”变成“系统供给问题”,HBM与先进封装就不再是幕后配角,而是决定交付节奏的主舞台。


关注公众号,获取更多精彩内容!

相关学习资料