ARTICLE · 1106974
AI模型开始省HBM,Scale-up光互联会少卖吗
AI模型开始省HBM,Scale-up光互联会少卖吗
AI模型开始省HBM,Scale-up光互联会少卖吗
DeepSeek-V4.1-Flash 最近被 SemiAnalysis 测了一下,结果把光互联圈看愣了。
这模型有个 189GB 的 Engram 表。测试发现,把它从 GPU 昂贵的 HBM 挪到普通内存里,每次只读 12.4KB,性能根本没掉。HBM 压力一下就释放出来了。
腾出空间后,神奇的事发生了:原本需要 4 张 GPU 紧密配合的任务,现在 2 张就够了。TP 宽度直接从 4 降到了 2,卡间通信跟着大减,性能和成本最高改善了 1.6 倍。
这下以前算光模块销量的老公式得改了。不能只看多少张 GPU,还得看平均 TP 宽度——也就是这些 GPU 到底有多黏着彼此。
不过别急着喊利空。单副本通信是少了,但推理便宜了,云厂商很可能会用省下的算力去跑更多任务。总流量未必跌,只是需求没那么好猜了。
原文AI模型开始省HBM,Scale-up光互联会少卖吗?
作者提示: 个人观点,仅供参考
广东,1分钟前,