搞AI的人都知道,模型越大,内存越不够用。这不是新闻。但很少有人意识到,这个问题正在从"够不够快"变成"够不够省"。训练大模型时,大家拼的是带宽,HBM(高带宽内存)因此成了硬通货,供不应求。但风向在变——现在业内讨论的重心,正从"怎么训练更大的模型"转向"怎么让更多人用得起推理"。而推理这件事,对内存的诉求很微妙:它不需要训练时那种变态的带宽,但它对容量和功耗极其敏感。
采用I²C(Inter-Integrated Circuit)通信协议的EEPROM,是中小容量数据存储的经典方案。
Micron最近推出的256GB SOCAMM模块,就是这个转向的标志性产品。这东西本质上就是把手机用的LPDDR内存,重新打包成服务器能插的模块。听起来像是"降维打击"——结果是,它的功耗只有传统DDR5服务器内存的三分之一,容量和带宽却更高。Micron云内存产品VP Praveen Vaidyanathan说得直白:"低功耗DRAM在数据中心的机会非常大。"翻译一下:以前我们嫌它不够"服务器",现在发现它太适合AI推理了。

如果钱和供应链都不是问题,HBM确实应该无处不在。它快、猛,它是AI训练的亲儿子。但现实是,HBM贵且难造,产能被几大巨头锁死。更关键的是,不是所有AI任务都配得起这级别的待遇,于是业界开始用一种更务实的眼光重新规划内存阶层:
热数据(Hot KV Cache):留在HBM里,GPU随时取用,快如闪电;
温数据(Warm KV Cache):搬到LPDDR/SOCAMM,容量大、够省电,推理时随叫随到;
冷数据(Cold KV Cache):直接扔进SSD,便宜大碗,不常用的别占着GPU的宝贵床位。
这种分级的思路,本质上是在性能和成本之间做一道精明的算术题。正如Objective Analysis的分析师Jim Handy说的,超大规模运营商会做电费账和总拥有成本的数学题——性能每瓦,正在成为比绝对性能更硬的指标。
这场内存重构的剧本里,主角不只有DRAM。NOR Flash这个"老古董"正在AI机架里找到新饭碗。Nvidia的GB200机架里,NOR Flash负责存储启动代码和安全密钥,成了硬件可信链的"锚点"。
Infineon的Sandeep Krishnegowda甚至认为它是"AI时代最被忽视的赋能者之一"。而MRAM(磁阻内存)这个更小众的选手,则在边缘AI场景里看到了机会。Everspin的Sean Dougherty指出,MRAM的非易失性和写入速度优势,让它在工业和边缘设备里能扛住断电、快速恢复现场——这在"推理下沉"的大趋势下,是个被低估的实用价值。
还有一个不能忽略的角色:CXL(Compute Express Link)。它的核心卖点是"内存池化",就是把原本绑死在每个CPU/GPU上的内存,变成整个机架可以共享的资源。这直接解决了一个长期困扰数据中心的顽疾:内存"搁浅"(买了但用不上)和"饥饿"(想用但不够)。不过CXL不是万能药。它要求软件重新设计,把对延迟极度敏感的数据留在本地DRAM,把带宽饥渴的大数据集丢到池化内存。Handy把这形容为"把需要好 latency 的东西扎根在本地,其他一切迁到CXL"。翻译过来:好钢用在刀刃上,剩下的去共享。
AI对内存的需求,从来不是在单一维度上"更高更快更强"。它更像是在逼迫整个行业承认一个朴素的道理:没有一种内存能包打天下,也没有一种技术值得无限溢价。从手机到服务器,从HBM到MRAM,从本地到池化——内存世界的"阶级秩序"正在松动。未来的AI数据中心,不会是一座由单一内存技术统治的宫殿,而更像是一个分工精细的生态系统:各有各的地盘,各有各的活法。对于从业者来说,这意味着选型思路要变。别再问"哪种内存最好",要问"哪种内存最适合这个workload、这个预算、这个功耗 envelope"。当AI从实验室走向生产线,从训练场走向推理端,"够用且省电"往往比"极致但烧钱"更有生命力。

联系邮箱丨baoxingwei@sst-ic.com地址丨深圳市福田区华强广场A座20F-20G
夜雨聆风