这一轮半导体结构性演进,已经从 “算力竞赛” 彻底走向AI 推理主线。而推理时代最大的瓶颈,只有一个:内存与存储。市场现在最大的三个灵魂拷问:HBM/DRAM/SSD,能不能真正摆脱传统周期性?依赖 HBM 指数增长的 GPU 架构路线,会不会停?何时停?长期需求膨胀过后,会不会重新跌回周期泥潭?本篇尝试建立一个统一框架,把这几个问题一次说透。
一、判断 “能不能摆脱周期”,只看三条铁律
万物皆周期,但周期强弱天差地别。内存之所以周期特别猛,根源是:供给扩产慢、需求波动大、产品同质化、一旦过剩杀价惨烈。一家公司 / 一个品类,只要满足下面任意一条,就能弱化周期;满足两条以上,基本可以告别传统强周期,走向成长周期性。三条标准:高度定制化,产品不可互换,产能不能随意转移,必须签长约结构性指数级需求增长,需求曲线陡峭,供给长期追不上技术迭代极快,旧代际快速贬值,没人敢囤货、打价格战接下来我们用这个尺子,量一量 HBM,再量一量 DRAM。
二、HBM:三条占了 “两条半”,已经不是传统内存
定制化:算半条HBM 确实有定制成分,但主要在Base Die层面,与 NVIDIA、AMD 的接口、控制器、路由 Die 深度绑定,需要长期紧密配合。但上面堆叠的 DRAM Die 本身是 JEDEC 标准品,物理上可以互通。当年三星 HBM3E 在 NVIDIA 认证失利,份额从 60% 跌到 20%,这批产能并没有直接转给 AMD,不是不能,而是客户锁定、商业绑定、封装排期锁定。严格说:物理可转移 ✦商业不可转移 ✔封装深度协同 ✔所以 HBM 的定制化,算半条。 指数级需求增长:完全满足Token 吞吐量 = HBM 容量 × HBM 带宽这个公式,每一代基本翻倍。单 GPU 搭载 HBM 容量每年 + 40% 以上KV Cache 对带宽与容量的需求近乎刚性即便 HBM 涨价 3–5 倍,投在 HBM 上的边际收益仍远高于其他硬件SRAM、HBF、CXL、PIM 各类路线,在 KV Cache/Attention 主赛道上,5–10 年内都无法替代 HBM。需求曲线陡峭到供给完全追不上。这一条:满分。 技术迭代极快:完全满足DDR3 活了十几年才到 DDR5;HBM 是两年一代,且近年在加速。HBM 带宽每两年接近翻倍,旧世代产品价值快速衰减,没人敢囤货、没人敢赌产能、更不敢打价格战。行业逻辑从:“拼产能抢份额” → 变成了“拼技术迭代速度”传统周期里那种 “越亏越不减产” 的囚徒困境,在 HBM 身上基本失效。这一条:满分。 三、结论:HBM 不是无周期,是变成了 “成长周期性” 传统周期:上行赚得多,下行亏到爆。成长周期性:上行赚得多,下行赚得少,但很难大亏。HBM 再加上第四层压制供给的力量:DRAM 密度提升越来越慢,HBM 堆叠却越来越吃 wafer早年 DRAM bit 密度年增≈45%后来降到≈20%现在只有≈9%而 HBM3e 要消耗约 3 倍 DRAM wafer,HBM4 更进一步,接近 4 倍。单位 wafer 产出的 bit 越来越少,相当于供给端天然通缩。所以:HBM 不会回到传统 DRAM 那种惨烈周期。 四、关键问题:GPU+HBM 这条路线,会不会停? 答案非常明确:只要 Attention 与 KV Cache 还在,这条路线就不会停。Attention 不是某家公司的架构选择,它是数学上被验证的、对序列任务最有效的基础操作之一。就像 FFN(前馈网络)从 2012 年活到今天,Attention 也会在下一代架构中继续存在,只是形式可能进化。只要有 Attention,就一定有 KV Cache;只要有 KV Cache,就一定需要极高带宽、极大容量、极低延迟的内存系统。HBM 的逻辑,不是 “暂时紧缺”,而是推理时代的底层硬件刚需。 五、DRAM:市场还没意识到,它也在走出周期 HBM 走出周期,市场已有共识;DRAM 走出周期,市场几乎还没反应。但现实正在发生不可逆的变化。回到三条标准:定制化:刚开始,但不重要指数需求:正在出现,而且来自全新维度技术迭代:速度明显加快真正的变量,来自Agentic CPU 时代。 六、Agent 时代,DRAM 迎来第二增长曲线:CPU 侧大爆发 过去 DRAM 看手机、看 PC;未来 DRAM 看AI Agent 服务器。两层爆发逻辑同时发生: 第一层:CPU TAM 量级上修,根本停不下来GPU 集群内 CPU/GPU 配比从 1:4 → 1:2 → 正在走向 1:1Agent 流程中,CPU 延迟占比高达 50%–90%,必须同步扩容AI Coding 带来软件 API 调用指数增长,直接吃 CPU HoursSandbox 隔离机制导致大量内存与计算冗余,且长期无法优化AMD 对 2030 年 CPU TAM 预测:60B → 100B → 223B而真实量级,可能往300B–400B走。 第二层:单 CPU 配 DRAM 容量,直接跳级传统 Web 服务是无状态(stateless),用完即释放;Agent 是有状态长驻进程,一跑就是分钟级、小时级。对话历史、系统提示、工具调用结果全部常驻内存上下文窗口从 32K → 256K → 1M → 还在膨胀Sandbox 强制复制数据,进一步放大内存占用单 Core DRAM 配比从 4–8GB,直接跳到16–32GB 甚至更高。两层逻辑一乘:服务器 DRAM 需求是数量级增长。 七、DRAM 的周期属性,正在被 AI 彻底改写 需求结构变了不再依赖消费电子弱周期,而是由AI 推理 + Agent 服务器双引擎拉动。技术迭代变快了以前 DDR 升级对消费端感知不强,现在端侧 AI、服务器 AI 对内存速度极度敏感,DDR/LPDDR 迭代明显提速。供给刚性依然极强扩产慢、折旧高、先进制程集中,再叠加 HBM 对 wafer 的吞噬,DRAM 很难再回到过去那种全面过剩的时代。 八、终局总结 HBM 已经不是传统周期股,是成长周期股,且高景气极长DRAM 正在从周期股走向成长股,市场预期差巨大只要 Attention 与 KV Cache 不消失,GPU+HBM + 高带宽 DRAM 的主线就不会中断这一轮不是短期紧缺,是AI 硬件底层架构的永久性重构过去的周期经验、估值框架、供需分析,正在全面失效 所谓周期,是需求回落、供给过剩;而这一轮,是需求指数向上,供给被技术与产能深度锁死。这不是周期归来,是内存的终局,已经换了人间。
夜雨聆风