摘要:HBM解决GPU身边的高速带宽,CXL则试图把更多DDR5内存变成可扩展、可共享的资源池。随着模型参数和KV缓存膨胀,AI服务器开始同时争夺带宽、容量与利用率。本文拆解CXL控制器、交换芯片、Retimer、内存模组及系统软件产业链。
HBM像放在GPU手边的高速工作台:速度极快,但空间昂贵而有限。
CXL更像在AI服务器旁边修建一座共享仓库,再用高速、可保持数据一致性的通道把仓库接入计算系统。它没有HBM那么快,却能扩展容量、分层存放数据,并减少某些服务器“内存闲着、另一些服务器却不够用”的浪费。
2026年7月31日,澜起科技宣布试产CXL 3.2内存扩展控制器;英特尔则在2026年6月更新了至强6平台的Flat Memory Mode说明,让本地DDR与CXL内存在硬件管理下呈现为统一地址空间。标准、芯片、服务器和软件正在逐步接上。
但这里有一条重要边界:CXL不是HBM替代品,更不是插上一张卡就能让所有GPU直接获得无限内存。
真正值得研究的,是AI服务器如何从“每台机器固定配内存”,走向“内存扩展、分层和资源池化”。
一、为什么HBM还不够:AI同时撞上三堵内存墙
市场习惯用GPU数量衡量AI算力,却容易忽略:计算单元只有不断拿到数据,才能保持忙碌。
1. 带宽墙:数据送不到,GPU只能等待
HBM把多层DRAM堆叠在GPU附近,通过超宽接口提供高带宽,是训练和推理的核心部件。它首先解决的是“搬得够不够快”。
但HBM容量受到封装空间、堆叠层数、成本和供应能力约束。模型参数、激活值、专家模型路由数据和推理阶段的KV缓存持续膨胀后,单靠本地HBM很难同时满足全部需求。
2. 容量墙:模型能算,不代表装得下
大模型推理时,KV缓存会随着并发用户、上下文长度和批处理规模增加。容量不够,就要在GPU内存、主机DDR和SSD之间搬运数据。
如果所有数据都留在HBM,成本太高;如果频繁落到SSD,延迟又可能过大。系统需要在“极快但贵”“较快且大”“更大但更慢”之间建立分层。
3. 利用率墙:内存被固定在单台服务器里
传统服务器内存主要插在CPU直连的DIMM槽位中。服务器配置完成后,容量相对固定。一台机器可能内存紧张,旁边一台却有大量闲置,但两者很难动态共享。
CXL的目标之一,就是把内存从“焊死在一台服务器的固定资产”,逐步变成可扩展、可分配的基础设施资源。
二、CXL到底是什么:在PCIe物理层上增加“内存语言”
CXL全称Compute Express Link,是面向处理器、加速器和内存设备的开放互连标准。它运行在PCIe物理连接之上,但增加了缓存一致性和内存语义。
通俗讲,普通I/O更像寄快递:设备提交请求,数据经过一套搬运流程;CXL则让处理器能够用更接近访问内存的方式,读取外部扩展内存,并维持数据一致性。
CXL包含三类协议:
▪️ CXL.io: 负责设备发现、配置和传统I/O管理。
▪️ CXL.cache: 允许设备一致性访问主机内存。
▪️ CXL.mem: 允许主机以负载、存储方式访问设备内存。
面向内存扩展的Type 3设备,核心使用CXL.io与CXL.mem,把外部DDR5内存接入服务器。
2025年11月发布的CXL 4.0规范将速率从64 GT/s提高到128 GT/s,并加入捆绑端口、更多Retimer支持和内存可靠性增强。但规范发布只是生态起点,实际部署还需要CPU、控制器、交换芯片、内存模组、主板、固件、操作系统和应用共同成熟。
三、从扩展到池化:CXL的三步商业化路径
第一步:单机内存扩展
这是最现实的落地方式。一台服务器通过CXL内存扩展卡或EDSFF模组增加DDR5容量。
它适合内存数据库、数据分析、高性能计算及部分AI负载。优势是无需无限增加CPU直连DIMM通道,也能扩展容量;代价是CXL内存延迟通常高于本地DDR,因此需要把冷、热数据合理分层。
第二步:硬件或软件管理的分层内存
系统把本地DDR作为较快层,把CXL内存作为大容量层。英特尔Flat Memory Mode可以让两者呈现为统一物理地址空间,并由处理器硬件管理数据放置;默认模式下,也可以把CXL内存作为独立NUMA节点,由操作系统或应用管理。
分层是否有效,取决于软件能不能识别数据冷热。如果把高频访问数据错误地放到慢层,扩容反而可能拖累性能。
第三步:跨主机内存池化
在CXL交换芯片和Fabric管理软件配合下,多台主机可以按需获得池中的内存容量。云厂商理论上能减少闲置内存,提高整机配置弹性。
但这也是最复杂的阶段。故障隔离、服务质量、数据安全、计费、热插拔和多厂商互操作都要解决。因此,单机扩展与分层有望先落地,真正的机架级动态内存池需要更长验证周期。
四、CXL控制器:把主机请求翻译成DDR访问
CXL内存扩展控制器是整条链的核心翻译器。前端接收主机的CXL请求,后端控制DDR4或DDR5颗粒,还要处理地址映射、错误校验、性能监控和安全管理。
澜起科技: 公司2026年7月宣布试产CXL 3.2内存扩展控制器。产品支持CXL.mem与CXL.io,基于PCIe 6.x与CXL 3.2设计,最高支持64 GT/s,并集成双DDR5内存控制器。这里的准确阶段是“试产”,下一步应观察客户送样、平台验证、合规测试和规模量产,而不能直接等同于服务器订单放量。
Astera Labs: 公司Leo系列CXL智能内存控制器面向内存扩展、共享和池化,支持连接DDR5。其优势来自与主流处理器、服务器和云平台的互操作生态,观察重点是CXL产品收入在AI平台中的真实占比。
五、CXL交换芯片:内存池的“交通枢纽”
只有控制器,解决的是主机与单个扩展设备之间的连接;要让多个主机和多个内存设备动态互联,还需要CXL交换芯片。
交换芯片负责端口汇聚、路由、资源分配和隔离。随着CXL从2.0走向3.x、4.0,拓扑会从简单扇出向Fabric演进。
这一环节的难点是低延迟、高端口带宽、可靠性和管理软件。交换芯片必须与不同CPU、控制器和模组稳定互通,否则“共享内存池”就会变成一组无法协同的设备。
市场容易把交换芯片发布理解成内存池已经成熟。实际上,芯片只是枢纽,真正商业化还需要整机平台和云端调度系统完成长时间验证。
六、Retimer与高速连接:距离越长,信号越需要被“扶一把”
CXL建立在高速PCIe物理层上。速率提高后,主板走线、连接器和线缆中的信号损耗会迅速增加。
Retimer可以重新接收、恢复并发送信号,相当于高速链路中的中继站。CXL 4.0增加对最多四个Retimer的支持,反映了机架级连接距离和拓扑复杂度正在上升。
产业链不仅包括Retimer芯片,还涉及高速PCB、低损耗材料、连接器、线缆、时钟芯片和测试设备。它们的放量节奏取决于PCIe 6.x及CXL平台的实际出货,而不是标准速率提高后立刻兑现。
七、DDR5内存模组:CXL扩展容量的主体
CXL本身不制造容量,真正承载数据的通常还是DDR5 DRAM。控制器与DDR5颗粒被组合成扩展卡、E3.S模组或内存盒。
三星电子: 公司CMM-D产品通过CXL连接DDR5,并面向AI、HPC和内存数据库等场景。其CMM-B内存盒可容纳多块CMM-D,展示了从单卡扩展向池化设备演进的产品形态。下一步要观察新平台采购和真实工作负载中的性价比。
美光科技: 公司CZ120 CXL内存扩展模组已经达到qualification sample阶段,并进行CPU、OEM、操作系统和虚拟化软件兼容测试。该里程碑说明生态验证推进,但“资格样品”仍不等于大规模商业采购。
DRAM厂商在CXL时代不只是卖颗粒,还要提供控制器适配、固件、监控和系统级验证能力。产品价值从单一内存芯片向解决方案延伸。
八、企业级SSD:不是CXL内存,却是更低一层的容量底座
SSD的延迟高于DRAM,但容量更大、单位成本更低,并具备持久化能力。在AI推理中,模型权重、KV缓存和数据集可能在HBM、本地DDR、CXL内存与企业级SSD之间形成多级存储体系。
企业级SSD并不因为接入同一服务器就自动成为CXL内存。它通常仍通过NVMe协议工作。其机会来自分层存储扩大,而不是概念上的“所有存储都CXL化”。
未来也可能出现DRAM与NAND混合的CXL设备,但这类产品需要软件准确判断数据冷热,并权衡耐久性、延迟和成本。
九、服务器主板与系统软件:硬件接通只是第一步
CXL商业化最容易被低估的部分,是BIOS、固件、Linux内核、虚拟化、内存分配器和应用适配。
一套系统至少要回答:
▪️ 哪些数据放在HBM、本地DDR、CXL内存和SSD?
▪️ 数据什么时候迁移,迁移成本是否超过收益?
▪️ 某块内存设备故障时,如何隔离而不拖垮服务?
▪️ 多租户共享内存时,如何保证数据安全和服务质量?
▪️ 扩展容量带来的性能改善,能否覆盖硬件和软件成本?
这意味着CXL的最终价值不只由芯片参数决定,更取决于系统软件能否把新增容量转化为更高吞吐、更低服务器数量或更好的资源利用率。
十、CXL如何服务AI:重点不是替代HBM,而是给HBM“减负”
HBM承担最热、最需要带宽的数据;主机DDR承担通用计算和较大工作集;CXL内存承接容量扩展与较冷数据;SSD负责更大规模的持久化存储。
在大模型推理中,一种潜在路径是把部分KV缓存或低频数据卸载到CXL内存池,减少对昂贵本地内存容量的占用。三星在2026年发布的白皮书已经研究了通过CXL交换式内存池卸载KV缓存的方案。
但必须强调:不同GPU、CPU、互连和软件栈对CXL的支持方式不同。当前很多CXL内存产品首先连接CPU主机,GPU是否能够高效、直接使用扩展内存,要看具体平台架构。不能把“支持CXL”简单翻译成“GPU显存无限扩容”。
十一、市场最容易误判什么?
误判一:CXL会取代HBM
两者解决的问题不同。HBM追求GPU附近的极高带宽,CXL更强调容量扩展、资源共享与灵活配置。CXL是内存层级的补充,不是HBM的平替。
误判二:通过合规测试等于大批量出货
进入Integrators List、获得资格样品或完成互操作演示,只能说明产品跨过一道技术门槛。真正形成收入还要经历客户验证、平台定型、服务器采购和数据中心部署。
误判三:容量越大,AI性能越好
如果软件没有做好冷热分层,数据频繁跨层搬运,额外容量可能伴随更高延迟。性能必须用具体工作负载测试,不能只看TB数。
误判四:产业链所有公司同步受益
控制器、交换芯片、Retimer、DDR5、主板和软件的导入节奏不同。早期订单可能集中在验证平台和样机,只有服务器规模出货后,需求才会沿产业链扩散。
十二、判断CXL拐点,盯住五个指标
▪️ 平台支持: 新一代CPU和服务器支持哪些CXL版本、端口数量与工作模式。
▪️ 产品阶段: 控制器和模组处于试产、送样、资格样品、验证还是量产。
▪️ 互操作性: 不同CPU、交换芯片、模组、操作系统之间能否稳定协同。
▪️ 工作负载收益: AI推理、数据库和虚拟化场景的性能、延迟与TCO改善。
▪️ 真实采购: 云厂商和服务器厂商是否从概念验证转向标准配置及批量部署。
结语:AI服务器争夺的下一种资源,是可调度的内存
过去,服务器内存像一套买来就固定的房间:每台机器有多少,部署时基本决定。
CXL想做的,是把部分内存改造成园区里的共享空间,哪个任务需要,就动态分配给谁。这种变化不会一夜完成,却可能改变服务器的配置方式、内存利用率和数据中心成本结构。
小谢判断:CXL最先兑现的不会是“无限共享内存”的宏大故事,而是单机扩容、硬件分层和少数内存密集型负载。只有这些场景证明经济账成立,机架级内存池才可能真正走向规模部署。
HBM让GPU跑得快,CXL要解决的是AI系统能不能装得下、用得满,并把昂贵内存放在真正需要的位置。
数据与信息来源
1. CXL Consortium:CXL 4.0规范发布,2025年11月
2. CXL Consortium:CXL 3.2规范发布,2024年12月
3. Intel:Xeon 6与CXL内存的Flat Memory Mode,2026年6月
4. 澜起科技:试产CXL 3.2内存扩展控制器,2026年7月
5. 澜起科技:CXL内存扩展控制器产品页
6. Astera Labs:Leo CXL智能内存控制器
7. Samsung Semiconductor:CXL Memory产品与应用
8. Samsung Semiconductor:CMM-D CXL内存模组
9. Samsung:CXL交换式内存池的KV缓存卸载白皮书,2026年
10. Micron:CZ120 CXL内存扩展模组资格样品进展
风险提示
本文仅作产业研究与信息交流,不构成投资建议。CXL可能面临服务器平台导入慢于预期、多厂商互操作困难、延迟与软件优化不达预期、云厂商采购不足、标准迭代造成产品换代,以及相关公司研发投入无法及时转化为收入等风险。
往期精彩
夜雨聆风