过去两年,AI 产业最热门的词是 GPU,第二热门的词是 HBM。
很多人开始形成一个直觉:
AI 算力 = GPU + HBM。
这个判断对,但不完整。
真正的大模型训练和推理,不是只靠 GPU 和 HBM 就能跑起来。它背后还有一整套分层存储体系。
它像一座金字塔:
寄存器 / SRAM
↓
HBM / GDDR / LPDDR / DDR
↓
CXL 内存扩展
↓
NAND Flash / SSD
↓
HDD / 磁带 / 对象存储
越往上,速度越快、离计算越近、容量越小、价格越贵。
越往下,容量越大、成本越低、速度越慢、离计算越远。

AI 产业真正的问题,不只是“有没有算力”,而是:
数据能不能在正确的时间,以正确的速度,出现在正确的位置。
GPU 再强,数据喂不上来,也会空转。 HBM 再快,容量不够,也会被模型权重、激活值和 KV Cache 填满。 SSD 再大,如果读写和调度跟不上,也会拖慢训练流水线。 对象存储再便宜,如果数据治理混乱,也会让 AI 工程变成数据搬砖。
所以,理解 AI 基础设施,不能只看 GPU。
要看这座存储金字塔。

一、为什么 AI 时代重新重视“存储”?
AI 的本质,是计算;但 AI 的瓶颈,常常是数据搬运。
大模型训练时,GPU 要不断读取模型参数、训练数据、中间激活值,还要在多卡之间交换梯度。
大模型推理时,GPU 要加载模型权重,还要维护不断增长的 KV Cache。
KV Cache 可以理解为大模型在生成文本时保存的“上下文记忆”。上下文越长,并发用户越多,KV Cache 占用的显存和内存就越大。
学术研究已经指出,在 Transformer 尤其是解码器模型中,内存带宽可能成为主导瓶颈,很多时候不是算不动,而是数据供不上。(arxiv.org)
NVIDIA 在 2026 年介绍 AI 推理的上下文存储平台时也提到,长上下文和 Agentic AI 正在给现有内存层级带来压力,使 AI 服务商不得不在稀缺的 GPU HBM 和通用存储层之间做取舍。(developer.nvidia.com)
这就是“存储金字塔”重要的原因。
它不是教科书里的抽象概念,而是 AI 工厂里的现实瓶颈。
二、第一层:寄存器和 SRAM,离计算最近的小仓库
寄存器和 SRAM,是 AI 芯片内部最靠近计算单元的存储。
先看金字塔最顶端:
寄存器 / SRAM
这一层速度最快,但容量最小。
寄存器在计算核心内部,直接服务于指令执行。
SRAM,也就是 Static Random Access Memory,静态随机存储器,通常用于芯片内部的 Cache、Shared Memory、Scratchpad、片上 Buffer。
在 GPU 或 AI 加速器里,Tensor Core、矩阵乘法单元、向量计算单元都不可能每算一步都去外部内存拿数据。
那样太慢,也太耗电。
所以芯片会把即将计算的数据切成小块,搬到寄存器和 SRAM 里反复使用。
可以这样理解:

在 AI 里,SRAM 的价值主要体现在四件事上:
第一,减少外部内存访问。 第二,提高矩阵计算的数据复用率。 第三,降低数据搬运功耗。 第四,决定芯片架构的实际效率。
很多 AI 芯片设计,表面看是算力设计,本质上是数据复用设计。
同样的 TOPS,同样的晶体管数量,如果片上 SRAM 和数据流设计不好,实际跑模型时就可能吃不满。
所以,AI 芯片不是只比算力峰值。
还要比:
数据怎么进来 数据怎么缓存 数据怎么复用 数据怎么出去
顶层存储越高效,计算单元越不容易饿肚子。
三、第二层:HBM / GDDR / LPDDR / DDR,AI 的主战场内存
金字塔第二层,是现在产业最关注的部分:
HBM / GDDR / LPDDR / DDR
这一层属于 DRAM 家族,是 AI 系统中最重要的工作内存区。
它们都叫“内存”,但角色完全不同。

1. HBM:高端 AI GPU 的黄金显存
HBM 是当前高端 AI 训练和高端推理最关键的存储器。
HBM,全称 High Bandwidth Memory,高带宽内存。
它通过 3D 堆叠 DRAM,并用硅中介层、先进封装等方式靠近 GPU 或 AI 加速器,提供极高带宽。
在 AI 里,HBM 主要存放:
模型权重 激活值 梯度 优化器状态 KV Cache 部分中间计算结果
NVIDIA Blackwell Ultra 的官方资料提到,其每颗 GPU 配备 288GB HBM3e,相比 H100 的封装内存容量提高 3.6 倍,并强调这对万亿参数模型、长上下文和高并发推理很关键。(developer.nvidia.com)
这说明,AI GPU 的竞争已经不是单纯比 FLOPS。
它还在比:
HBM 容量 HBM 带宽 HBM 能效 GPU 与 HBM 的封装能力 HBM 供应链稳定性
HBM4 也正在成为下一阶段重点。SK hynix 在 2025 年展示 HBM4 时提到,HBM4 具备 2048 个 I/O 通道,是上一代的两倍,并带来显著带宽提升和超过 40% 的能效提升。(news.skhynix.com)
一句话:
HBM 是 AI GPU 的近身弹药库。
弹药库越大、补给越快,GPU 越能持续开火。
2. GDDR:消费级 GPU、AI PC 和推理卡的性价比显存
GDDR 是很多 GPU 的主流显存路线,尤其适合成本、容量和性能之间的平衡。
GDDR,全称 Graphics Double Data Rate。
它最早服务于图形渲染,但现在也广泛用于 AI PC、消费级 GPU、专业显卡、边缘推理卡和部分特殊 AI 加速器。
和 HBM 比,GDDR 的特点是:
封装更简单 成本更低 产业成熟度高 带宽低于 HBM 能效通常不如 HBM
GDDR7 是最新一代图形内存标准之一。JEDEC 发布 GDDR7 标准时提到,JESD239 GDDR7 相比 GDDR6 可提供两倍带宽,单颗器件最高可达 192GB/s,用于满足图形、游戏、计算、网络和 AI 应用对内存带宽的增长需求。(businesswire.com)
Micron 也把 GDDR7 定位为支持 GPU,并扩展 AI、游戏和高性能计算负载的图形内存。(micron.com)
所以,不是所有 AI 芯片都必须用 HBM。
对于很多推理场景,尤其是边缘推理、本地大模型、AI PC、图像视频生成、轻量模型部署,GDDR 仍然有价值。
可以粗略理解:
3. LPDDR:低功耗 AI 的关键内存
LPDDR 是手机、AI PC、边缘设备和低功耗服务器路线中越来越重要的内存。
LPDDR,全称 Low Power DDR,低功耗双倍数据率内存。
它最初主要用于手机和平板,因为这些设备最看重功耗和封装体积。
但 AI 时代之后,LPDDR 的应用边界正在扩大。
端侧大模型、AI 手机、AI PC、智能汽车、机器人、边缘推理盒子,都需要在有限功耗下运行 AI 模型。
这时 LPDDR 的价值就凸显出来:
功耗低 封装紧凑 容量可观 带宽持续提升 适合端侧和边缘 AI
JEDEC 在 2025 年发布 LPDDR6 标准,称 JESD209-6 旨在提升内存速度和效率,面向包括移动设备和 AI 在内的多种应用。(design-reuse.com)
这意味着 LPDDR 不再只是“手机内存”。
它正在成为低功耗 AI 设备的重要底座。
未来很多 AI 终端,不会用 HBM,也不会用传统服务器 DDR,而会依赖 LPDDR 来平衡性能、功耗和成本。
4. DDR:服务器 CPU 的主内存
DDR 是服务器最基础、最普遍的主内存。
DDR,包括 DDR4、DDR5,以及未来的后续标准,是 CPU 服务器的主内存。
在 AI 系统中,它不一定直接承担 GPU 的核心计算数据,但它非常重要。
它负责:
数据预处理 数据加载 CPU 任务调度 模型服务编排 向量数据库 特征工程 缓存部分中间结果 与 GPU 交换数据
如果 HBM 是 GPU 的近身弹药库,DDR 就是服务器主机的工作区。
很多训练任务跑不快,并不一定是 GPU 不够强,而是数据加载和预处理跟不上。
比如图像、视频、语音、多模态数据,在进入 GPU 前要经过解码、增强、切分、格式转换、批处理。
这些工作大量依赖 CPU、DDR、SSD 和网络。
所以,DDR 虽然没有 HBM 那么耀眼,却是 AI 数据流水线的基础。
四、第三层:CXL 内存扩展,数据中心的新缓冲层
CXL 是存储金字塔里最值得关注的新层级之一。
CXL,全称 Compute Express Link。
严格说,CXL 不是一种存储颗粒,而是一种高速互连协议。
它的作用是让 CPU、内存设备和加速器之间以更高效、更一致的方式互联。
CXL 官方资料把它定义为一种高速互连技术,用于处理器、内存设备和加速器之间的高效通信,并支持内存池化和共享。(computeexpresslink.org)
为什么 AI 需要 CXL?
因为 HBM 太贵、太稀缺,容量也有限。
而很多 AI 工作负载并不总是需要 HBM 级别的带宽。
于是系统开始需要一个“中间层”:
比 DDR 更灵活 比 SSD 更接近内存 比 HBM 更便宜、更容易扩容 能被多个主机或设备共享
这就是 CXL 内存扩展和内存池化的想象空间。
CXL 可以用于:
大容量内存扩展 内存池化 多主机共享内存 降低服务器内存浪费 承载部分 AI 推理缓存 支持向量数据库和 RAG 系统
CXL 联盟在 2025 年关于 AI 内存墙的文章中提到,CXL 内存可用于 AI 推理和 KV Cache 扩展,帮助 GPU 显存之外承载上下文缓存。(computeexpresslink.org)
但要注意:
CXL 不是 HBM 的替代品。
HBM 是贴着 GPU 的高速显存,适合最热、最急、最频繁访问的数据。
CXL 更像数据中心里的共享缓冲池,适合承接容量压力和资源利用率问题。
可以这样分工:

CXL 的战略意义在于:
它让内存从“每台服务器固定配置”,走向“数据中心级资源池”。
这对 AI 集群很重要。
因为 AI 的内存需求不是均匀分布的。
有的任务需要巨大上下文。
有的任务需要大量并发。
有的任务只是短请求。
如果每台服务器都按最高需求配置内存,就会浪费。
如果能通过 CXL 做内存池化,就可能提升利用率,降低整体成本。
五、第四层:NAND Flash / SSD,AI 数据的高速仓库
SSD 是 AI 数据中心里承上启下的一层。
再往下,就是:
NAND Flash / SSD
NAND Flash 是 SSD 的核心存储介质。
SNIA 对 SSD 的解释中提到,SSD 使用非易失性存储保存数据,没有机械运动部件,今天绝大多数 SSD 使用 NAND Flash。(snia.org)
在 AI 中,SSD 负责的不是单个矩阵乘法,而是整个数据工程链路。
它保存:
训练数据集 预处理后的样本 模型权重文件 模型 checkpoint 向量索引 RAG 文档库 日志和监控数据 中间结果
训练大模型时,checkpoint 非常关键。
模型训练过程中,需要定期保存状态。否则一旦任务中断,前面几天甚至几周的训练可能白费。
推理系统中,SSD 也越来越重要。
过去我们常把 SSD 看成“慢速存储”。
但在长上下文推理、RAG、AI Agent、多模态检索里,SSD 开始承担更积极的角色。
NVIDIA 在 2026 年提出 BlueField-4 驱动的上下文内存存储平台,就是为了应对长上下文和 Agentic AI 带来的 KV Cache 压力,避免传统路径把数据在 CPU、DRAM、NVMe 之间低效搬运。(developer.nvidia.com)
这代表一个趋势:
SSD 不再只是放文件,而是在变成 AI 推理的数据缓冲层。
尤其在以下场景中,SSD 很重要:
RAG 检索增强生成 向量数据库 长上下文推理 多模态数据加载 大规模训练 checkpoint 模型热切换 数据集缓存
但 SSD 也不能被神化。
它比 HBM、DDR 慢得多。
它适合承载大容量、非易失、高吞吐的数据,不适合替代核心计算中的高速显存。
所以 SSD 的角色是:
把数据准备好、缓存好、组织好,然后尽量顺畅地喂给上层内存和 GPU。
六、第五层:HDD / 磁带 / 对象存储,AI 的数据地基
AI 产业最底层,不是 GPU,而是海量数据。
金字塔最下面是:
HDD / 磁带 / 对象存储
这一层速度最慢,但容量最大,成本最低。
它负责长期保存 AI 产业真正的原材料:
文本 图片 视频 语音 传感器数据 日志数据 代码数据 科研数据 企业文档 用户行为数据 备份和归档
这些数据不可能全部放在 HBM、DDR 或 SSD 里。
那太贵,也不现实。
所以 AI 公司需要更底层的数据湖和归档系统。

1. HDD:低成本大容量存储
HDD,也就是机械硬盘,速度不如 SSD,但单位容量成本更低。
在 AI 数据中心里,HDD 适合保存:
冷数据 原始训练数据 历史日志 视频素材 备份数据 不频繁访问的大文件
很多大规模数据集,尤其是图片、视频、自动驾驶感知数据、工业检测数据,不会一开始就全放进 SSD。
通常做法是:
HDD / 对象存储保存原始数据 SSD 保存热数据和预处理数据 DDR / HBM 承载正在训练或推理的数据
这就是分层存储。
2. 磁带:AI 时代仍然没有过时
很多人以为磁带是上个时代的产物。
但在企业归档、合规、冷数据保存、灾备场景中,磁带依然重要。
LTO Program 在 2025 年发布 LTO-10 相关规格时提到,新一代 40TB LTO-10 磁带盒面向高密度、AI-ready 归档存储,并强调更少磁带盒、更少机架、更低能耗和更强安全姿态。(lto.org)
磁带的优势不是快,而是:
容量大 成本低 离线保存安全性高 适合长期归档 能耗低
AI 训练数据会不断积累。
企业不会把所有数据都删掉,因为未来模型、算法、标注方法可能变化,历史数据可能重新变得有价值。
所以磁带在 AI 时代不是消失,而是退到更底层,成为长期数据资产的保险柜。
3. 对象存储:AI 数据湖的主流形态
对象存储是云时代最重要的存储形态之一。
它不像传统文件系统那样以目录和文件为核心,而是把数据作为一个个对象存放,每个对象带有元数据和唯一标识。
Amazon S3 是典型代表。AWS 官方介绍称,S3 是对象存储服务,提供可扩展性、数据可用性、安全性和性能,适用于数据湖等多种场景。(aws.amazon.com)
AWS 数据湖白皮书也提到,基于 S3 的数据湖可从 GB 扩展到 PB 级内容,并提供高持久性和可扩展性能。(docs.aws.amazon.com)
Google Cloud 的 AI/ML 存储文档也把 Cloud Storage 描述为面向训练和批量推理等 AI/ML 任务的大规模数据集处理和存储系统。(docs.cloud.google.com)
这就是为什么 AI 公司离不开对象存储。
因为它适合放:
训练语料 多模态原始数据 数据湖 模型版本 特征数据 RAG 文档库 日志和审计数据
如果说 HBM 是 AI 的短期记忆,那么对象存储就是 AI 的长期记忆。
七、把整座金字塔放到一个 AI 任务里看
假设我们要训练或部署一个大模型。
数据路径大致是这样的:
对象存储 / HDD / 磁带
存放原始数据、历史数据、归档数据
↓
NAND Flash / SSD
保存热数据、预处理样本、checkpoint、向量索引
↓
DDR
CPU 做数据加载、解码、预处理、任务调度
↓
CXL 内存
扩展内存池,承接部分缓存、KV Cache、内存池化需求
↓
HBM / GDDR / LPDDR
加速器直接运行模型权重、激活值、KV Cache
↓
SRAM / 寄存器
矩阵计算时最高频访问的小块数据
↓
Tensor Core / AI Core
真正执行计算

这条路径说明一件事:
AI 不是一个芯片问题,而是一个数据流问题。
模型越大,数据流越复杂。 上下文越长,缓存压力越大。 并发越高,内存调度越重要。 多模态越丰富,底层存储越关键。
所以未来 AI 基础设施的竞争,不会只发生在 GPU 层。
它会发生在每一层:
片上 SRAM 怎么设计 HBM 供应够不够 GDDR 能否承接成本型推理 LPDDR 能否进入更多端侧 AI DDR 和 CXL 如何做内存池化 SSD 如何支撑 checkpoint 和 RAG 对象存储如何管理海量非结构化数据 磁带和 HDD 如何保存长期数据资产
八、不同存储层,在 AI 中分别解决什么问题?
可以用一张表总结:
九、AI 产业里的几个判断
第一,HBM 仍然是高端 AI 的核心瓶颈,但不是唯一瓶颈。
HBM 决定高端 GPU 能不能高效运行大模型。
但 HBM 之外,还有 DDR、SSD、CXL、对象存储、网络和数据工程。
只盯着 HBM,会低估 AI 基础设施的复杂性。
第二,推理时代会让存储层级更复杂。
训练更关注吞吐和规模。
推理更关注延迟、并发、上下文长度和成本。
当 Agent、长上下文、多轮对话、RAG 成为主流后,KV Cache、向量索引、文档检索、上下文存储都会让存储架构变得更重要。
第三,CXL 可能成为 AI 内存体系的重要变量。
CXL 的核心价值不是“比 HBM 更快”,而是“让内存更灵活”。
未来 AI 数据中心可能不再是一台服务器配固定内存,而是把内存做成资源池,按任务动态分配。
这会影响服务器架构、云计费、推理成本和数据中心资源利用率。
第四,SSD 和对象存储正在从后台走向前台。
过去,存储系统像后勤。
未来,存储系统会越来越像 AI 推理的一部分。
尤其在 RAG、长上下文、AI Agent、多模态生成中,数据检索、上下文管理和缓存调度会直接影响用户体验。
第五,AI 公司的护城河不只是模型,还有数据资产和存储工程。
模型可以开源。
算法可以模仿。
但高质量数据、数据治理、数据流系统、训练与推理的存储架构,不容易短期复制。
谁能把数据更好地组织起来,谁就能更高效地训练模型、服务用户、降低成本。
十、常见误区
误区一:AI 只需要 HBM。
不对。
HBM 是高端 AI 加速器的关键,但它只是金字塔的一层。
没有 SSD、DDR、CXL、对象存储和数据管道,HBM 也无法发挥最大价值。
误区二:SSD 可以替代内存。
不对。
SSD 是非易失存储,容量大,但延迟和带宽与 HBM、DDR 不在一个层级。
它可以做缓存、checkpoint、数据集存储和向量索引,但不能直接替代核心显存。
误区三:CXL 会替代 HBM。
不对。
CXL 更适合内存扩展和池化。
HBM 负责最热、最急、最靠近 GPU 的数据。
两者更多是互补,而不是替代。
误区四:磁带已经没用了。
也不对。
磁带不适合热数据,但适合长期归档、冷数据保存和灾备。
AI 数据越多,长期归档反而越重要。
误区五:对象存储只是云盘。
对象存储不是简单云盘。
它是现代数据湖的底座,也是 AI 训练数据、企业文档、多模态数据和模型资产管理的重要基础设施。
十一、结尾:AI 的尽头,是数据流
AI 产业表面上在比 GPU。
再深一层,是在比 HBM。
再往下,是在比先进封装、网络、电力、散热和光互联。
但更底层,还有一座不太被普通人看到的存储金字塔。
寄存器和 SRAM 负责让计算单元不空转。 HBM、GDDR、LPDDR、DDR 负责让模型运行起来。 CXL 负责让内存从单机资源变成数据中心资源。 SSD 负责让数据和模型快速进出。 HDD、磁带和对象存储负责保存 AI 的长期记忆。
未来的 AI 公司,不只是“谁有更多 GPU”。
而是:
谁能把数据放在最合适的位置;
谁能用最低成本调动最大规模的数据;
谁能让模型、内存、存储和网络协同起来;
谁就能把算力真正变成生产力。
最后用一句话总结:
AI 的表面是算力,底层是数据;数据不只是被存起来,更要被快速、低成本、低延迟地送到计算发生的地方。
这就是 AI 时代的存储金字塔。
夜雨聆风