乐于分享
好东西不私藏

国产AI芯供货不足,倒逼大厂从hopper迁移到Blackwell架构

国产AI芯供货不足,倒逼大厂从hopper迁移到Blackwell架构
中国和美国成为世界上最大的算力使用国家,也是全球唯二的两个在芯片-模型-应用独立构建产业化的国家,其他国家只能做环节配套,地球村里一山不容二虎,导致产生了两个阵营,
以咱为主导的东大阵营和以美国为主导的西大阵营;
更简单来说就是咱和美国之争,其他都是配角;
英伟达GPU 全球霸主,打造牢不可破的 cuda 生态,行业有一句话,用英伟达不省钱,但是省时间,生态好,训练或者推理,都极其容易使用,也更容易成功;
ASIC 为主导的挑战阵营,行业有一句话,用非CUDA 生态,省钱,但不省时间,生态刚开始建设,训练和推理都极其难,因此不容易使用;
两个阵营在中国的竞争和在全球的竞争是一样的,在中国,英伟达面临寒武纪/华为等ASIC 正营竞争,在全球面临谷歌、微软、亚马逊等 ASIC 阵营竞争,咱今天只谈国内;
互联网大厂是算力的使用大户,算力的 95% 的算力被大厂调度和使用,这是毋庸置疑的事实,要想扶持自主可控的算力生态,搞定大厂使用,基本上就成功啦。
大厂内部 cuda 生态为绝对主力,主要是Ampere(含ada)、hopper、Blackwell 三代算力为主,目前大厂主力是 hopper,但是很不幸,因为禁运和停产,导致 hopper 扩容受阻,目前大厂训练算力和推理主力都被迫向 Blackwell 架构迁移,训练 B300/GB300 为主(国内不够,就用海外的),推理以 Pro 5000 和 5090 为主!
目前,国内是全球最大的 hopper 架构生态,全球 hopper 生态上的算法优化和创新几乎都来自中国,deepseek 是 hopper 算力优化的绝对主力,因为 deepseek 在 hopper 的突出贡献和开源实现,带飞了全球 hopper 算力建设!
做过模型训练和推理优化的朋友都知道,所有优化都是基于算力芯片架构的,ai 算力不够,算法来凑,是有天花板的,ai 芯片是优化的基础。
经过几年的发展,国内头部国产 ai 芯的架构效率已经能赶上 hopper 架构,让国产大厂看到了部分曙光,但是因为现在目前 hopper 扩容受阻,被迫加速 Blackwell 架构的迁移,导致大厂迁移到效率更高的架构上去,再一次甩开了国产架构几条街。
大厂生态,由俭入奢易,由奢入俭难,他们在 hopper 架构的时候,国产架构跟 hopper 差距还小点,迁移到 Blackwell 架构之后,再次把国产架构甩几条街;
大厂程序员用惯了飞一样的 Blackwell,你再让他用国产架构,他能体验好么?就好像。hopper 相当于大众,Blackwell 相当于宝马,国产 ai 芯相当于吉利,开关了大众的人,开吉利,差距还是能接受的,但是如果开习惯宝马的人再开吉利,那真的是差距满满,
对于大厂来说,大家都是希望支持国产自主可控生态的,但是国产架构要差不多啊,不能差太多啊。
互联网厂商大多是为了商业化市场,如果有性价比高且供应稳定的产品,凭啥不用,举一个最简单的例子:
Pro 5000 72G/48GGDDR7 5w左右/片,目前是大厂推理算力建设主力,也是下单量最大的推理卡;
最新某国产芯片A,144GB hbm3e,目前 hbm3e 例子 36GB1500 刀预计 1 万 rmb, 144GB 4 颗 4 万 rmb,再加加上 die 和封装,预计 成本 5.5w 左右/颗芯片,对于国产 AI 芯片 A来说 ,至少定价要到 15w 以上;另外 A 的产量有限,主要受到 HBM3e 供应、代工、封装产能的制约,导致 A 的产量非常有限,无法像pro 5000 这样KK级量产来摊薄生产成本,最终导致 A 的成本居高不下。且 A 的生产厂家为了维持股价,最终选择
  1. 不卖芯片,只卖卡,
  2. 少卖卡,多卖整机,
  3. 少卖整机,多卖超节点集群
目的只有一个,在有限的芯片数量前提下,尽量多的做营收和利润,维持股价和现金流,让企业尽量健康的活下去,只有活下去,才能有机会迭代下一代 AI 芯片,才有成功的希望
要知道 A 虽然定位为高端 AI 芯片设计,但是实际上最后只能去打推理市场,跟 pro 5000 pk,但是还很难 pk 的过,这种情况下让互联网大厂怎么选?
大厂也是非常无奈的。这只是说的性能,还没算功耗,因为对方采用先进的 4/3nm 工艺,整体功耗更低,更省电,所有人都清楚,算力服务器是一个巨大的电老虎,堆更多芯片可以达到同样的算力规模,但是总功耗更高,最后在市场化的条件下,整体竞争力依然很弱。
综上,倒闭大厂从hopper迁移到Blackwell架构!
关注不迷路⬆️