8月6日,FMS 2026(全球闪存峰会)闭幕之际,英伟达放出一枚重磅炸弹——正式发布SCADA存储架构,让GPU直接发起存储I/O请求。这被业界解读为"KV Cache卸载"赛道最关键的硬件信号:当KV Cache越来越像"数据资产"而非"临时缓存",GPU与SSD之间的那条数据路径,正在被重新定义。
与此同时,铠侠发布CXL闪存内存扩展模块XL1系列、三星抛出zHBM"垂直堆叠"内存蓝图;学术界则有两篇与PD分离、KV卸载直接相关的论文值得深读。以下为今日精选分析。
一、英伟达SCADA正式发布:GPU接管存储IO,KV Cache卸载的"最后一公里"打通
在FMS 2026上,英伟达宣布将GPU存储加速API cuFile全面开源,并正式发布SCADA(GPU直发存储I/O)架构,彻底打破传统"CPU主导IO"的传输瓶颈。实测数据:处理数据分析任务时,SCADA速度是CPU触发模式的5.3倍;以图计算负载衡量,硬件成本最高可降低21.7倍。
核心思路:把CPU从存储控制路径上"请出去"
此前的GDS(GPU Direct Storage)已让数据通过DMA在硬盘与GPU显存间直接搬运、绕过CPU内存,但每一次读取请求的构造、提交与完成处理仍要CPU亲自下场。大数据块读写时这点控制开销可忽略,可面对AI推理中每秒百万级的小粒度请求,CPU的IO资源率先被耗尽——性能瓶颈提前到来。SCADA的思路简单粗暴:允许GPU直接发起存储I/O请求,自己管理NVMe硬盘的队列深度,把原本属于CPU的调度职责全部揽到GPU身上。
美光展示的参考设计将潜力具象化:仅用3颗H100显卡,驱动了44块PCIe Gen6固态硬盘(美光9650),实现2.3亿次随机读IOPS、约118GB/s存储吞吐,而负责调度的CPU几乎完全空闲。从1块到44块SSD的扩展近乎完美线性,说明架构余量远未用尽。
Storage-Next联盟:专治KV Cache的"8倍读取放大"
除了架构本身,英伟达还针对AI推理中更隐蔽的痛点正式推出Storage-Next产业联盟(成员已超40家,覆盖DDN、铠侠、美光等存储原厂与控制器、散热、标准化组织):传统SSD以4KB为最小扇区操作单位,而KV Cache读写经常是512字节小数据——每次读取只用到512字节,却要搬出整整4KB,造成8倍读取放大,白白浪费带宽与寿命。联盟目标是联合产业链共同定义"当GPU取代CPU成为存储访问主体,SSD应如何适配"。硬件侧,承载cuFile开源生态与SCADA架构的新一代STX架构系统基于VeraBlueField-4存储处理器,计划2026年下半年推出商用整机。
值得关注的原因:
KV Cache卸载到SSD的最大工程障碍从来不是"能不能放",而是"GPU怎么高效地把KV读回来"——PCIe带宽有限、CPU控制开销巨大、小粒度IO放大严重。SCADA+cuFile开源+Storage-Next联盟三连击,等于把这条数据路径的硬件、软件、标准三层同时打通。对超节点从业者而言,这标志着"SSD级KV Cache池"从学术实验走向产业标准的拐点:当GPU可以像读显存一样直接调度SSD队列,存储池在推理数据路径中的角色将从"最后防线"升级为"一等公民"。
二、铠侠XL1系列:CXL内存池迎来"闪存介质",8月起交付样品
铠侠在FMS 2026上宣布展出KIOXIA XL1系列CXL兼容内存扩展模块:基于低延迟、高性能的XL-FLASH™闪存技术,使传统用于存储的闪存首次以"内存扩展方案"的身份进入CXL体系。评估样品计划于2026年8月向行业生态合作伙伴交付。
XL1的核心定位是填补传统DRAM与SSD之间的性能/成本缺口:将访问频率较低的数据放置于该模块,从而提升昂贵DRAM的利用效率。这并非孤例——三星、SK海力士围绕CXL内存模组展开系统验证,澜起科技试产CXL 3.2内存扩展控制器,Marvell、Astera Labs持续加码控制器与交换芯片。FMS 2026释放的最明确信号是:CXL的讨论重点已从"单台服务器外挂内存"转向"内存池化、共享和分层",而AI推理的KV Cache正是厂商反复强调的第一目标场景。
值得关注的原因:
当闪存介质进入CXL内存池,"内存池化"的容量经济性才真正成立——DRAM级延迟、NAND级成本的中间层级,正是KV Cache冷数据分层的理想归宿。结合英伟达SCADA对"GPU直读SSD"的推动,一条HBM→DRAM→CXL闪存→NVMe SSD的完整多级KV Cache存储体系正在快速成型,内存与存储的边界被彻底改写。
三、三星zHBM + V10 BV-NAND:内存架构的"垂直革命"与国产LPDDR6突破
三星在FMS 2026发布面向下一代AI基础设施的存储技术路线图,两大亮点直指超节点的内存瓶颈:
1. zHBM:把HBM"垂直堆叠"到加速器上方。通过先进晶圆键合技术将高带宽内存直接垂直堆叠于AI加速器之上,大幅缩短数据传输路径。据三星介绍,系统性能预计达HBM5的8倍,内存密度提升超10倍,能效提高3倍,热阻降低逾50%,并支持客户定制IP集成——这是"片内内存池化"的终极形态。
2. V10 BV-NAND + LPDDR5X-PIM。采用全新键合V-NAND架构,层数突破400层,密度较前代V9提升约58%;业界首款集成存内计算(PIM)技术的LPDDR5X-PIM则可在内存内部直接处理数据,缓解"内存墙"。
国内侧同样传来捷报:长鑫存储LPDDR6已进入风险试产阶段,首批芯片速率达12.8Gbps,在制造工艺与技术迭代进度上基本追平三星、SK海力士、美光,有望年内进入大规模量产——国产内存供给链为本土AI基础设施的内存池化提供了关键底座。
值得关注的原因:
当HBM容量成为超节点扩展的第一约束,厂商的破局路径出现明显分化:一条是"向外池化"(CXL/UALink把内存搬到GPU外),另一条是"向上堆叠"(zHBM把内存贴到计算die上),而LPDDR5X-PIM与SCADA则分别代表"算进内存"与"算直连存储"两个方向。多条路线并进的格局意味着:内存架构的竞争正在从"容量竞赛"升级为"系统形态竞赛"。
四、论文深度分析1:HERALD——让CPU去"选KV",PCIe从瓶颈变帮手
论文标题:HERALD: High-Throughput Block Diffusion LLM Serving via CPU-GPU Cooperative KV Cache Retrieval
作者:Omin Kwon, Doyeon Kim, Jongseok Park, Seung Yul Lee, Ion Stoica, Jae W. Lee
arXiv编号:2606.21633(v2,2026年8月3日修订)
关键词:KV Cache卸载、CPU-GPU协作、块扩散模型(block dLLM)、稀疏注意力
KV Cache卸载到CPU DRAM的传统困境众所周知:PCIe带宽有限,稀疏注意力虽只需取回一小部分关键KV,但自回归解码的"关键集"每个token都在变,选择与取回每步都要重来,吞吐仍被PCIe卡死。HERALD观察到一类新模型形态——块扩散大模型(block dLLM)——彻底改变了这个局面。
核心洞察:KV访问模式与CPU-GPU算力不对称性完美匹配
block dLLM一次解码B个token,经历T次去噪步骤。其稀疏推理天然分成两阶段:selection阶段每块扫描一次全量KV,denoising阶段将选中的小子集复用T次。这个"扫描一次、复用T次"的不对称性,恰好与CPU-GPU系统"CPU算力弱但内存大、GPU算力强但显存小"的不对称性对齐——于是selection放CPU、denoising放GPU,关键KV每块只跨PCIe一次,互连不再是瓶颈。
两个工程障碍与解法
• 阶段串行依赖:用draft block将selection与denoising重叠成双流流水线;
• CPU端B-query选择计算密集:以单个[MASK]查询大幅降低选择成本,并基于双缓冲稀疏KV池执行。
实验验证
• 在两个生产级block dLLM上,仅5%的KV预算即保持近无损精度;
• 解码吞吐最高达GPU-only方案的2.28倍,且增益随上下文长度增大而扩大。
为什么值得关注?HERALD证明了KV卸载的胜负手不在"搬多少数据",而在"是否利用了模型访存模式把卸载成本摊销掉"。它与英伟达SCADA(GPU直连存储)形成绝妙互补:一个在系统软件层按"块"摊销PCIe开销,一个在硬件层消灭CPU控制开销——KV Cache的"异地存取"正在被一层层拆掉墙。
五、论文深度分析2:负载感知Prefill Deflection——PD分离的"柔性调度"
论文标题:Towards Load-Aware Prefill Deflection for Disaggregated LLM Serving
作者:Shrikara Arun, Anjaly Parayil, Srikant Bharadwaj, Renee St. Amant, Victor Rühle
arXiv编号:2607.02043 | 提交日期:2026年7月2日
关键词:PD分离、Prefill Deflection、KV Cache传输消除、vLLM
PD分离(Prefill与Decode分池部署)虽消除了两阶段互相干扰,却引入了新痛点:突发重尾负载下,Prefill节点饱和排队,而Decode节点算力闲置。论文在生产型A100集群(2P2D:2个Prefill节点+2个Decode节点)上实测发现:Prefill实际执行仅占P95首Token延迟(TTFT)的2%-23%,其余时间都耗在排队与跨节点GPU-GPU的KV Cache传输上。
核心方案:让Decode节点"就地"承接Prefill
论文提出主动式Prefill Deflecting调度器:允许Decode节点以chunked-prefill步骤穿插在自己的在途Decode批次中,服务部分请求的Prefill阶段。对每个排队请求,调度器估计其在Prefill节点与每个Decode节点上的TTFT,搜索能保持in-flight Decode在TBT(token间隔)SLO内的最大chunk调度,并在Decode路径有助于改善尾延迟时执行deflect。关键收益:被deflect请求的Prefill在Decode节点就地执行,跨节点KV Cache传输被直接消除。
实验验证
• 基于vLLM实现,DeepSeek-V2-Lite + 生产风格trace:P95 TTFT最高降低81%;
• SLO达成率较最先进的分离调度器最高提升79%;
• 每次请求的路由决策开销低于亚毫秒。
为什么值得关注?PD分离最大的代价是KV Cache传输,而这篇论文给出了一条釜底抽薪的路线:"与其把KV搬过去,不如把计算挪过来"。这与KARAT(让Attention计算住进KV Cache所在的内存)的思路异曲同工,也与无问芯穹PDD"前缀缓存+增量传输"的降带宽策略互补——KV Cache传输成本,正在成为决定"分离边界到底划在哪"的第一变量。当deflection、就近计算、增量传输与硬件直连(SCADA)叠加,PD分离的部署形态将比今天灵活得多。
六、总结与展望
8月6日的产业与学术动态,拼出"KV Cache物理归宿"演进的完整图景:
硬件层三路并进:英伟达SCADA让GPU直连存储(数据路径革命)、铠侠XL1让闪存进入CXL内存池(介质革命)、三星zHBM把内存堆上计算die(形态革命)——KV Cache"能住的地方"正在从GPU HBM一路扩展到整机柜、整机架;
系统层两个范式:HERALD证明"计算可以去找数据"(CPU选KV、GPU去噪,PCIe按块摊销);Prefill Deflection证明"分离可以更柔性"(就地Prefill免传输,P95 TTFT降81%);
一条主线贯穿始终:KV Cache的访问路径效率,正在取代"容量大小"成为推理架构的第一优化对象。无论是把数据搬近计算、把计算搬到数据旁,还是从控制路径上消灭CPU,所有方案的最终目标只有一个——让每一次KV访问都以最低的成本、最短的路径到达。对超节点从业者而言,接下来的竞争焦点将聚焦于:池化内存、近存算力、直连存储与调度软件四层如何协同,把"KV Cache的物理归宿"从成本负担变成架构优势。
— END —
夜雨聆风