夜雨聆风学习资料网

ARTICLE · 979819

内存成为新瓶颈:池化、卸载与PD复用之争

内存成为新瓶颈:池化、卸载与PD复用之争

2026年9月3日 · 观天下

如果说8月的主题是"KV池化的概念发布",9月初的画风则变成了"巨头集体站队"。昨天(9月2日),SK海力士系统架构副总裁在首尔公开断言:AI的瓶颈已从算力转向内存,性能、能效、资源利用的问题全都摆在了内存面前,"内存中心计算"是下一战场——这是HBM最大供应商第一次把CXL共享内存、3D堆叠与PIM放进同一张代际路线图。同一天,2026全球AI芯片峰会的"大模型KV Cache技术研讨会"议程落定,Mooncake、SGLang HiCache、华为XY-Serve、HiSparse等各路KV Cache玩家确认集结。学术侧两篇新作则一正一反地把边界划得更清:蚂蚁系团队AInfer-PD给"PD分离万能论"泼了盆冷水——RL Rollout场景下"就地复用+通信隔离"比物理分离更划算;阿里等团队的OasisKV则把decode阶段的KV整体搬出HBM,用投机解码当"预言机"做稀疏预取。内存,正在从配角变成整场戏的主角。

一、行业动态

1. SK海力士:AI瓶颈已转向内存,CXL共享内存与3D堆叠、PIM并列下一代路线图

据韩国《亚洲日报》报道,9月2日SK海力士系统架构(System Architecture)负责人、副总裁朱英表在首尔举行的第18届"善良增长、良好就业全球论坛(2026 GGGF)"上发表演讲,给出一个直白的判断:"瓶颈所在即是计算的中心,目前的瓶颈是内存。"随着AI从聊天机器人进化到推理与Agent阶段,性能、能效与资源利用问题全部集中在内存上。他给出的论据很具体:人与AI对话约每秒20个token,而Agent时代机器与机器之间对话需要以"数千token/秒"的速率作答,系统性能要求数量级抬升,显存与内存的吃紧比Chat时代陡峭得多。应对方向上,SK海力士把筹码押在三件事:其一,缩短内存与算力之间的距离——把DRAM以三维方式堆叠在处理器上方或下方(3D堆叠DRAM),减少数据搬运路程;其二,PIM(存内计算)——在内存内部或附近直接做运算,因为"把数据取出来做一次运算的能耗,远高于在内存里做完";其三,CXL——让多个加速器共享内存池。朱英表同时坦言3D堆叠仍面临发热与存储密度等技术挑战。

值得关注:这条表态的分量在于"说这话的是谁"。SK海力士是HBM的最大供应商,HBM卖得越贵它赚得越多,但它主动说"光靠HBM不够、下一战是内存中心计算"——这等于给整条内存池化产业链发了官方背书:CXL交换/控制器芯片(Astera Labs、Marvell、澜起科技、Synopsys等)、CXL内存扩展模组、以及超节点里的"统一内存编址"架构,都被纳入了存储巨头的代际叙事。结合9月2日韩国媒体语境与近期DRAM价格暴涨(DDR5合约价翻倍、服务器内存已占超大规模厂商30%资本开支),这条演讲还有一层潜台词:当内存贵到成为Capex大头,"把内存做成共享资源、提高利用率"就从成本优化变成了生存策略——这也解释了为何Meta回收DDR4组CXL池、Marvell把KV Cache spillover做成产品线的逻辑能成立。对国内关注点而言,CXL内存池化与存算一体的国产替代(澜起等)值得持续跟踪验证节奏。

2. KV Cache技术研讨会9月21日议程落定:Mooncake、HiCache、华为XY-Serve集结,KV Cache正式"成学"

9月2日,智猩猩披露2026全球AI芯片峰会(GTIC)分会场"大模型KV Cache技术研讨会"(9月21日举办)最终议程:Mooncake项目维护者马腾(分离式KV Cache基础设施)、SGLang HiCache、南京大学STAR(解码阶段动态重调度技术)、腾讯混元TurboQuant(在线向量量化,已在混元模型落地4bit KV Cache)、斯坦福联合Meta与北大的HiSparse(重新设计KV Cache存储布局)、华为×清华XY-Serve(面向昇腾NPU的生产级推理系统,开源)、焱融科技(存储侧)等一线研究者将同台。议程背后是各家工作的一幅全景:Mooncake解决"KV随计算资源独立扩展",HiSparse解决"长上下文怎么存",STAR解决"解码阶段怎么动态调度",TurboQuant解决"KV怎么压到4bit不伤精度",XY-Serve解决"这套负载怎么高效跑上国产芯片"。

值得关注:两条信号值得放大。其一,华为联合清华开源的XY-Serve是面向昇腾NPU的生产级推理系统,它的开源补上了昇腾生态"硬件强、软件栈薄"的短板——超节点硬件(Atlas 950系列、灵衢互联、256TB统一内存编址)需要一套能把这颗"内存池化到芯片级"的硬件真正用起来的系统软件,XY-Serve正是冲着这个身位去的,KV Cache精细化调度是其中关键模块。其二,KV Cache从"显存优化小技巧"升级为独立研讨会主题,标志着行业共识完成了一次跃迁:它不再是某个推理框架的内部细节,而是与算力、网络、存储并列的第四类基础设施资源。对产业链的启示是:KV Cache管理层的竞争正在形成事实标准(Mooncake/LMCache/HiCache的connector生态),谁的缓存层能兼容最多推理框架、适配最多芯片,谁就卡住了推理系统栈的咽喉,9月21日的议程值得当成"国内KV Cache技术版图"来读。

二、论文分析

论文1:AInfer-PD——给"PD分离万能论"划边界:RL Rollout场景下,就地复用+通信隔离更划算(arXiv:2609.00993)

事件:9月1日arXiv上线论文《AInfer-PD: Communication-Safe In-Place Prefill-Decode Multiplexing for Distributed MoE Rollouts》(作者Guowei Wang等,出自AInfer推理引擎团队)。切入点非常尖锐:大规模强化学习(RL)的墙钟时间大头在Rollout推理;而Agentic RL里每条轨迹都在"模型生成-环境交互"间交替进行,异步轨迹会让新的Prefill(P)任务与仍在Decode(D)的旧任务持续共存——P/D共存是Rollout的常态属性,不是一次性提示注入事件。主流解法PD分离要付出"独立设备池+KV Cache跨池传输"的双重代价;而"就地复用"(在同一批设备上让P/D并行交错)虽保住共享权重与KV状态,却缺通信隔离——大规模MoE(注意力TP/DP+分布式Expert执行)下,P和D可能以不一致的跨rank顺序发出相交的集合通信,DeepEP的P/D两条路径还共享可变协议状态,直接并发有死锁/错乱风险。AInfer-PD的解法是两招:①跨rank协调P/D的集合通信顺序;②给DeepEP的P/D两条路径分配相互独立的通信状态,让交叉的ADP/ATP与DeepEP路径在并发P/D执行下安全。实测:单节点prefill密集负载下,相比同一引擎关闭复用,固定工作量Rollout完成时间降低7.1%-22.5%;对比SGLang降低24.8%-32.9%;双节点下分别降低18.0%-35.3%与18.3%-31.8%;同引擎消融中,细粒度边界比整轮异步入队再省8.6%-19.8%。

值得关注:当"PD分离"几乎成为长上下文推理的标准答案时,这篇论文提供了稀缺的反向证据:分离不是免费的——设备池分裂带来利用率损失,KV跨池传输带来带宽与时延开销;在"P/D持续共存"的RL Rollout负载上,"不分离但管好通信"的在位复用反而全面占优,最高省三成以上完成时间。对架构决策有三点启发:其一,PD分离与PD复用不是路线之争而是负载之争——一次性长提示注入(聊天/RAG)倾向分离,持续P/D共存的RL/Agent训练侧倾向复用,判断标准是"P/D共存是常态还是偶发";其二,MoE+PD进入深水区后,通信安全(DeepEP协议状态、跨rank集合通信顺序)成为比算力调度更隐蔽的瓶颈,这篇论文把"通信隔离"提为复用架构的第一性要求;其三,对国产芯片与推理框架(如昇腾XY-Serve、各类自研引擎)而言,"通信安全的多路复用"是同款必答题——集合通信库与推理引擎的接口边界必须为并发P/D预留隔离机制,这比堆算力更能决定RL训练的整体吞吐。

论文2:OasisKV——decode阶段把KV整体搬出HBM,用投机草稿当"预言机"做稀疏预取(arXiv:2608.08097)

事件:阿里系与KAIST、帝国理工等机构研究者(Can Xiao、Yongqiang Xiong等)8月8日提交的系统论文《OasisKV: Scaling In-Decode KV Cache Beyond HBM with Lookahead Sparse Prefetching》。问题陈述很直白:长上下文与长程推理(long-form reasoning)普及后,decode阶段的KV Cache同时主导内存占用与访存流量;HBM容量稀缺且昂贵,直接卡死batch size与系统吞吐。OasisKV给出一个"内存中心"的系统设计:decode期间把KV Cache的完整存储与HBM解耦——利用decode注意力天然稀疏的特性,HBM里只保留"最相关token"的KV参与attention计算,其余KV下沉到更高容量层级(主机内存或远端内存)。关键洞察在于"怎么知道哪些token未来重要":投机解码(Speculative Decoding)生成的lookahead草稿token可以提前"剧透"未来——论文发现未来重要token能借助草稿被准确预测,于是用一条高效的attention后台流水线识别重要KV块,先把它们从大容量层预取、暂存进HBM,待正式解码到来时直接命中。效果上,OasisKV在保住精度的前提下显著扩大了解码可用的有效KV容量,把"显存放不下"的长上下文请求重新装进了系统。

值得关注:这篇论文与当下"内存池化"的硬件叙事正好咬合成闭环:CXL池化内存、共享SSD层负责"放得下",OasisKV这类稀疏+预取调度负责"用得准"——HBM只留马上要算的部分,其余KV睡在大容量层,需要时提前抬升。它与中科曙光ParaCache的"Best-effort预取"思路同构,但把预取预言从"热度统计"升级成了"投机解码草稿"——因为decode的注意力访问模式天然可预测,预测器甚至不需要额外训练。对超节点/内存池化系统设计有三点启示:其一,"KV全量住HBM"的观念正在被终结,分层内存(HBM热层+DRAM温层+SSD/远端冷层)是长上下文推理的必然形态,这与昇腾950的256TB统一内存编址、NVIDIA CMX上下文存储是同一趋势;其二,投机解码的价值边界从"加速生成"延伸到了"KV寻址预言机",一套草稿两用,边际收益可观;其三,预取要真正兑现,取决于"预测准确率×预取带宽"能否压过误取开销——这对CXL/池化内存的延迟指标(微秒级)提出了明确工程要求,也给国产推理框架在异构内存层上的调度器设计留出了创新空间

三、结语

9月第三天的信息密度很高,但四条动态指向同一个结论:内存正在从"配套资源"变成"第一瓶颈",从"单机配件"变成"池化基础设施"。SK海力士从芯片巨头视角宣布内存中心计算时代开启,为CXL池化、3D堆叠、PIM三条路线站台;国内KV Cache生态在9月21日集结成会,华为XY-Serve开源补上昇腾的软件栈拼图;AInfer-PD提醒我们PD分离有适用边界,RL Rollout场景就地复用更优;OasisKV则示范了"投机解码当预言机"的KV卸载新玩法。硬件侧有人给容量、软件侧有人给调度、系统侧有人划边界——内存池化这条赛道的四梁八柱正在同时成型。接下来值得盯的信号:SK海力士3D堆叠与CXL产品的量产时间表、XY-Serve在昇腾950超节点上的KV池化实测、AInfer-PD对国产MoE通信库的启发落地、以及OasisKV式预取在真实长上下文Agent负载上的吞吐数据。显存墙还在,但墙的另一边,已经有人在修路了。

免责声明:本文基于公开信息整理,仅供参考,不构成投资建议。

相关学习资料

返回首页浏览学习资料