ARTICLE · 1024217
内存池化分两路 KV卸载开始拼标定
2026年9月17日 · 观天下
9月16日这一天,超节点这条线上出现了一个很值得琢磨的分岔:内存池化正在裂成"向外借"和"向内挂"两条路线,而KV卸载的竞争焦点,正在从"选什么介质"退到"标定得准不准"。其一,中国台湾存储厂商威刚科技旗下企业级品牌TRUSTA在AI Infra Summit 2026现场发布AIScaler扩展内存方案——一块PCIe Gen5插槽、一段轻量驱动、一套自研调度引擎,把服务器里闲置的DDR5内存和高速SSD拼成GPU的"外挂池",官方口径是延迟比传统RDMA方案低40%、功耗降27%,70B MoE模型上单卡A100-80G的显存利用率从98%降到63%、推理吞吐提升2.3倍。其二,美光在9月16日全球首秀512GB DDR5 RDIMM,用TSV垂直堆叠把单模组容量顶到512GB、速率最高9200 MT/s,24个内存插槽的双路服务器可做到12TB主存,而单条功耗16W对比四条128GB的44.2W,降幅超过60%。其三,同一天的AI Infra Summit第二日与上周的CIOE光博会给出了两条相反的答案:Marvell把Photonic Fabric机架级内存共享正式摆上台面、上调FY2027指引至约120亿美元,股价一度涨5.2%至233.34美元;而英伟达那边讲的是另一套话术——Vera Rubin加Groq 3 LPX在2万亿参数长上下文下宣称每兆瓦词元吞吐比GB200 NVL72高最多35倍,靠的是NVLink 6在72卡之间直接分发KV Cache,而不是把KV搬到机架外。论文侧,两篇同日提交、作者完全相同的作品,恰好把这件事的两个层面各问了一遍:KV块该住在哪一层,以及请求该路由到哪个实例。五条放在一起,回答的是池子从哪扩、池化的收益到底来自容量还是策略、以及调度层的红利还剩多少这三问。
一、行业动态
1. 威刚TRUSTA发布AIScaler:不用NVLink,把闲置DDR5和SSD做成GPU的外挂池
9月16日,中国台湾存储厂商威刚科技旗下企业级品牌TRUSTA在AI Infra Summit 2026(9月15-17日,圣克拉拉;部分中文报道写作圣何塞)现场,展出名为AIScaler的扩展内存解决方案。这场展会今年约8000名专业观众、250家上下游厂商,比去年的3500人翻了一倍多。
AIScaler的形态极简:一块PCIe Gen5插槽、一段轻量驱动、一套自研的AIScaler Memory Orchestrator调度层。它不走"抢GPU显存"也不走"求英伟达开放NVLink"这两条路,而是用厂商自己讲的"内存联邦制"思路——把服务器里闲置的DDR5 R-DIMM内存池,连同高速PCIe Gen5 NVMe SSD(同场展出了TD7P51E企业级固态盘),一起变成GPU可用的外挂缓存层。调度规则是教科书式的三级温控:热数据进显存、温数据驻留DDR5、冷数据沉入SSD,全程毫秒级响应。
厂商披露的实测口径是:延迟比传统RDMA方案低40%、功耗直降27%;在70B参数MoE模型上,单卡A100-80G的显存利用率从98%降到63%、推理吞吐提升2.3倍,地端AI部署成本降低超过五成(另有中文报道口径为"降低超过50%")。
【解析】把这条和昨天Astera Labs的动作并排看,分岔就出来了。Astera的Leo X-Series是把KV Cache专用内存层直接挂进AI加速器的Scale-up织物,走的是"向内夺织物";AIScaler是把主机侧闲置内存借出来,走的是"向外借主机"。两条路线的物理边界完全不同:前者争的是交换芯片边上的那条链路,后者争的是PCIe Gen5那点带宽。
我的判断是,AIScaler这类方案的天花板不在调度算法,而在PCIe Gen5的物理带宽——调度再聪明,也变不出带宽。但它的真实价值恰恰不在性能而在"盘活存量":DRAM合约价今年一季度涨了90%到95%的背景下,一台已经买回来的服务器里闲着的那部分内存,边际成本约等于零。它的对手不是HBM,是"什么都不做"。
需要提醒的是,以上数字全部来自厂商现场披露,目前没有第三方独立基准,也没有公布具体测试配置(batch size、上下文长度、并发数)。"显存利用率从98%降到63%"这句话读起来很漂亮,但它同时也意味着有37%的请求工作在主机内存上——如果那部分请求的延迟没有被单独列出来,这组数字的价值就要打七折。值得跟踪的第一个信号,是它能不能给出"降级到DDR5的那部分请求"的P99延迟分布。
2. 美光首秀512GB DDR5 RDIMM:池子的"物料"从工艺微缩转向封装堆叠
同样在9月16日,美光宣布已在多个服务器平台完成全球首款512GB DDR5 RDIMM的展示,最高传输速率9200 MT/s,预计2027年下半年按客户需求投入量产。
容量的来源不是制程,而是封装:美光用先进垂直互连技术,通过硅穿孔(TSV)把多颗DRAM晶粒纵向堆叠并连接,在单一封装内把密度最大化。落到系统层面,一台配有24个内存插槽的双路服务器,DDR5主存总容量最高可以做到12TB。
能效数字比容量数字更值得看:单条512GB RDIMM的运行功耗约16W,而四条128GB RDIMM凑出同样容量要44.2W,降幅超过60%。性能侧,在基于Spark支持向量机的内存受限型数据分析场景里,512GB配置最高可达到256GB DDR5配置的1.4倍;对RocksDB、Redis这类内存型数据库与缓存平台,更大容量意味着更高吞吐与更高并发承载能力。生态侧,AMD与Intel都在各自下一代服务器平台上做兼容性验证——美光云计算内存事业部高级副总裁兼总经理Raj Narasimhan的说法是,512GB RDIMM能支撑多TB级别的服务器,让更庞大的数据集直接留在主存里,降低对低速存储的依赖与数据搬移成本。
【解析】这条对内存池化的意义,在于它抬高了"中间层"的天花板。分层池化的中间层就是主机DRAM——它既是KV卸载的第一落点,也是CXL池化扩容时的成本基准。当单条模组做到512GB、双路做到12TB,中间层与HBM之间的落差就缩小了一档,而功耗降60%这个数字,恰好对应池化之后最敏感的那个指标:单位Token电费。
但要冷静。2027年下半年量产,意味着它对眼下这一轮推理成本战几乎没有任何帮助。它是一条"下一轮"的曲线,而当前那轮的价格压力已经由DDR4回收、CXL扩容和KV压缩在扛了。另外一个容易被忽略的点是:当中间层变大,驱逐算法的容错空间也变大——这正好引出下面那篇论文,它证明分层的主要收益其实来自容量比,而不是策略。
3. 尺度之争:KV是向外池化,还是向内高速分发
AI Infra Summit 2026的第二日(9月16日),Marvell把面向AI数据中心连接与内存的全套方案摆到超大规模客户面前:Photonic Fabric平台(定位机架级内存共享)、RELIANT互连遥测平台(提供实时光电网络可见性)、以及Teralynx T100——一颗102 Tbps的以太网交换芯片。配合CEO Matt Murphy此前上调的中期收入指引(FY2027约120亿美元、FY2028约180亿美元),Marvell股价盘中涨5.2%至233.34美元。
同一天,英伟达侧给出的是另一套叙事。官方口径是Vera Rubin配合Groq 3 LPX,在2万亿参数以上的长上下文模型上,每兆瓦词元吞吐比GB200 NVL72最多高35倍;SemiAnalysis的AgentX基准(393条来自Claude Code的真实agentic编码轨迹)显示Vera Rubin NVL72对GB300有约30倍每兆瓦吞吐优势。真正和本栏目相关的是它背后的理由:NVLink 6提供每GPU 3.6 TB/s双向带宽、整机架260 TB/s,官方明确说这条带宽是为了"在72张GPU之间分发KV Cache与路由MoE专家"而存在;MegaMoE融合核则把计算与跨GPU通信合并进单个CUDA执行过程,让GPU在等数据搬运时也不空转。英伟达还引用了另一个数字:agentic会话消耗的词元约为一次简单对话的15倍。
而上周CIOE中国光博会上的表态,把国内侧的思路讲得更直白。腾讯网络及数据中心负责人邹贤能(9月16日报道)指出两点:其一,随着MoE大模型与Agent推理爆发,网络通信开销最高可占到模型训练总时长的30%到40%,网络不再是算力集群的配套而是核心瓶颈;腾讯WorkBuddy已达到数千万日活,单用户三个月词元调用量增长十倍。其二,在Scale-up超节点路线上,128卡超节点对比传统8卡GPU服务器,单卡推理性能提升40%以上;但AEC铜线加DSP的方案互连距离只支持57米,只能覆盖64卡、128卡,4柜以上场景无法使用,行业普遍看好NPO(近封装光学)接棒。更棘手的是故障隔离:256卡、512卡超大超节点下,单卡失效若无冗余机制,整组集群必须下线——腾讯给出的解法是OCS光交换,用拓扑动态重构把备用GPU接进超节点。
【解析】把Marvell和英伟达放在一起,就是一个很清楚的二选一:一条路线把KV搬到更远(光子跨机架、CXL池、SSD),另一条路线把KV留在机架内、靠更高的Scale-up带宽分发。
这两条不是替代关系,而是被"瓶颈位置"定价的:当机架内带宽够用,向外池化就只是一门容量生意(卖每GB成本);当机架内带宽不够,向外池化才有延迟价值(卖每次搬运)。今天资本市场给Marvell的5.2%,和内存原厂股价承受的压力,本质上是同一道题的两种答案在抢同一个预算额度。
这里有一个必须并列呈现的口径冲突:英伟达给出的30倍到35倍,是"每兆瓦词元吞吐",也就是能效口径;SemiAnalysis自己也在峰会前的分析里指出,实测结果比黄仁勋在GTC 2026上讲的3倍优势高出约7倍,说明这类数字高度依赖软件版本与基准治理。而AgentX目前只采集了一类agentic工作负载(编码),跨负载的泛化性尚未测量。看到"30倍"这三个字时,请务必先问:比的是什么、在什么软件版本上、谁在治理这个基准。
二、论文分析
1.《Where Should the KV Cache Live?》:分层池化的收益,可能全在容量,不在策略
论文:arXiv:2609.16215,9月14日提交,作者Srikanta Datta Tumkur、Jay Iyer、Mehar Simhadri、Sai Pavan Kumar、Sai Kapil Kumar、Ramesh Nampelly。
这篇论文要回答的是MVP(Mooncake、LMCache、FlexGen、InfiniGen、AttentionStore)们都在绕开、但从没人系统测过的那个问题:既然GPU HBM又贵又少,而KV缓存被聊天、Agent循环、文档问答不断堆积——那么到底哪些KV块该住在哪一层、什么时候搬或驱逐、预取到底有没有用?
方法是用一个覆盖GPU HBM、CPU DRAM、SSD三级的离散事件模拟器,并用随机森林执行时间预测器做标定;场景覆盖聊天、Agent、文档问答三类负载;策略上对比了最近使用(recency)、复用频率(reuse frequency)、预测复用(predicted reuse),以及带预取前瞻的EWMA预测器。
正面结论很漂亮:分层可以让单张GPU支持的并发会话数提升73.02倍,单会话成本降低62.04倍。
但接下来的话才是重点:这些收益来自1:8:64的层级容量比,而不是放置策略。在论文的设定里,batch size为1时decode是算力受限的,所以放置策略几乎不影响吞吐,它主要改变的是PCIe迁移流量和首词元延迟。细分来看:聊天负载下recency产生的迁移流量比复用频率少2.30倍;Agent与文档问答负载下复用频率表现最好。
然后是两组否证,写得相当不客气:
第一,现有的"预测复用"策略与recency的输出是字节级相同的——也就是说,它在Agent场景上给出的那个"推荐",实质就是recency,换了个名字而已。真正实现一个EWMA预测器确实会改变行为,但在那些"预测本该发挥作用"的负载上,它仍然排在复用频率后面。
第二,预取无法证明它的带宽成本是值得的。在策略与缓存大小的整个网格上,即使给一个知道未来请求的oracle,在迁移流量上也从未胜过"不预取"。
【解析】这篇是给KV分层泼冷水的,而且泼得很有分量。它把收益归给容量、把策略降级成细节,对产业界的直接含义是:买更大的池子比买更聪明的驱逐算法更划算。这对最近一年疯狂的"打分器创新"(从H2O到各种注意力分数驱逐)是一个相当克制的提醒——如果你的收益主要来自层级容量比,那么在驱逐算法上做花活,边际回报可能远低于把DRAM那一层加厚。
但必须指出它的前提被限定了:论文自己承认"decode在batch size为1时是算力受限,所以放置几乎不影响吞吐"。这与生产环境正好相反——真实decode是大batch、内存带宽受限的。换句话说,"放置策略不重要"这个结论,是在它自己的设定下成立的;一旦搬到大batch、带宽受限的超节点场景,放置策略的重要性有可能被重新放大。这是一个非常值得跟踪的复现点,也是本文把它放在这里而不是当作定论的原因。
2.《Calibrate, Then Route》:PD分离的路由优劣,取决于标定有多真
论文:arXiv:2609.16206,9月14日提交,与上一篇作者完全相同——Srikanta Datta Tumkur、Jay Iyer、Mehar Simhadri、Sai Pavan Kumar、Sai Kapil Kumar、Ramesh Nampelly。同一组人同一天投了两篇,一篇管"KV住哪",一篇管"请求去哪",这个安排本身就值得注意。
问题设定很明确:PD分离把算力密集的Prefill和内存密集的Decode放到不同的GPU池上,DistServe、Splitwise、Mooncake这类系统已经让这个分离跑得很快——但路由仍然决定了每个请求最终落到哪个实例上。而路由一旦选错,前面所有优化都会被抵消。
论文设计的路由器,用四个维度估算"如果这个请求落到某个实例上,它的完成时间会增加多少":精确的prompt长度、预测的输出长度、准入之后的KV Cache压力、以及SLO等级。方法学上有意思的地方是两段式:先在离散事件模拟器里把策略开发出来,然后在8张NVIDIA A40上做实测验证——每张卡跑一个vLLM引擎,用NIXL在Prefill池与Decode池之间传KV Cache。所有负载都在"实测饱和"状态下运行,不是跑个demo。
结果:在三条混合、突发式的到达轨迹上,经过硬件标定的路由器取得最高平均goodput——0.864,而轮询(round robin)、最少负载(least loaded)与长度启发式分别在0.835到0.847之间;同时它跨轨迹的方差最小,在三条轨迹上都胜过轮询与长度启发式,在两条上胜过最少负载,第三条只落后0.003,属于运行间噪声范围。
然后是本文最关键的一句:硬件标定决定成败。用仿真推导出来的常数,会损失4.5个goodput点、以及大约40%的尾延迟优势,把整个评分器退化成"数队列长度"。换句话说,同一套算法,标定错了就基本没有意义。
边界条件也交代得很清楚:收益随decode池规模与流量异质性增长,但在只有三个实例的池子里会消失——那种规模下数队列长度就够了。在极端资源稀缺时,贪心最小化成本会把请求全部压到最便宜的那个被评分实例上,此时"盲撒"反而表现更好。而一旦成本标定准确,这个学习路由器可以用6张卡达到轮询7张卡的goodput。
【解析】这篇是昨天那篇MAPS(arXiv:2609.15359)的续章,但方向刚好相反。MAPS说:给调度器一个"带目标覆盖率"的输出长度上界,就能拿到42.6%的平均端到端延迟改善与最多84.8%的尾延迟改善。而这一篇说:路由器评分必须用真实硬件标定,否则连队列计数都不如。两篇合起来,给出的是PD分离第二阶段的纪律——调度层的红利,不在策略有多新,而在标定有多真。
另外注意"三实例阈值"这个细节,它有很强的工程价值:小池子上学习路由是负收益。行业里关于"要不要上智能调度"的争论经常原地打转,原因就是双方在讨论不同规模的池子。把池子大小写进结论的前提里,比争论算法本身有用得多。
顺便说一句方法学:这两篇论文加上MAPS,三篇都在用同一套"离散事件模拟器开发策略 + 真实硬件验证"的两段式路径。这个范式正在成为PD分离与KV分层研究的事实标准——因为它同时规避了两类失败:纯仿真的数字不可信,纯实测的结论不可外推。做技术选型的人可以把这一点当成筛选论文质量的一个快捷标准。
三、结语:三条判断
判断一:内存池化正在分叉成"向外借"与"向内挂",判断路线胜负的标准是瓶颈位置,不是技术先进度。向外借(威刚AIScaler式的联邦制、CXL池、SSD三级缓存)拼的是每GB成本与容量盘活;向内挂(Astera Leo X-Series直挂Scale-up织物、英伟达NVLink 6分发KV)拼的是每条链路的带宽与延迟。如果机架内带宽够用,向外池化就只是容量生意;如果机架内带宽不够,向外池化才有延迟价值。今天Marvell被资本市场奖励的,和内存原厂被资本市场压制的,是同一道题的两份答卷。
判断二:KV卸载的竞争焦点,已经从"选介质"退到"标定层"。2609.16215把分层收益归给容量比而非放置策略;2609.16206把路由优劣归给硬件标定而非算法设计。两者共同指向同一件事——这一层已经过了算法红利期,进入工程标定期。这对采购方的含义很实际:在KV池化上,先把池子加厚、把标定做准,比追新的驱逐打分器回报更高。
判断三:AF分离会放大而不是缩小这两个问题。AF分离(把Attention与FFN拆到不同特性的芯片上)在架构上省的是计算资源,但它同时让KV的物理位置变得跨芯片、跨介质,也让"谁来接这个请求"变成一道跨越两类算力的调度题。9月16日中国日报网再度报道了移动云联合中国电子科技南湖研究院、灵汐科技、天数智芯等发布的国内首个国产GPU加类脑芯片异构混合推理系统——Attention交由国产GPU、FFN交由类脑芯片(存算一体、片上大容量SRAM),在DeepSeek V4 Flash上完成调优验证,宣称推理输出与能效均提升1倍以上、业务运营成本降低40%以上。值得跟踪的不是这组数字,而是它什么时候公布第三方独立集群基准——因为按2609.16206的教训,跨芯片调度这类系统,标定不准的话理论增益会在真实流量下消失。
四、超节点与内存池化观察清单
1. 9月20-21日上海全球AI芯片峰会的三个闭门场:超节点技术研讨会定在9月21日全天(新华三、华为云、南京大学、科华数据、灵汐科技等12位嘉宾,议题覆盖超节点全栈协同架构、整机柜设计、Scale-up互联、智能网卡、通信库、NPO、OCS);大模型KV Cache技术研讨会同为闭门制;Token工厂异构混训混推技术研讨会由中国移动研究院、商汤、上海人工智能实验室、先进编译等分享。今年8大核心议题把"超节点""大模型KV Cache""Token工厂异构混训混推""新型存储器"并列,等于官方认定了内存层级与调度层级是同一件事的两面。
2. 2609.16215的"1:8:64"容量比在真实大batch场景下是否仍成立。这是本文最想看到复现的一条——如果换成带宽受限的大batch Decode设定,"放置策略不重要"的结论很可能被推翻。跟踪方式很简单:看有没有人把它的模拟器参数换成生产级并发配置重跑一遍。
3. 2609.16206的"三实例阈值"。小池子上学习路由是负收益,这个门槛会不会随模型规模、上下文长度变化?如果能形成一张"池子规模—是否值得上智能路由"的对照表,对工程选型的价值远大于再发一篇算法论文。
4. PD分离路由的硬件标定会不会成为标准动作。判断标准有三项:主流引擎(vLLM、SGLang、Dynamo)是否把硬件标定后的成本模型作为路由默认输入;有没有开源工具能一键产出"本机标定常数";以及各家云厂商的路由文档里,是否开始公布标定方法而不只是标定结果。
5. 美光512GB RDIMM的客户验证进展与DRAM价格周期的相互作用。如果2027年下半年量产顺利,主机DRAM这一层的成本曲线会被重写,直接利好CXL池化与KV卸载的中间层。反向信号是:如果HBM产能继续挤压普通DRAM晶圆,这条曲线可能比预期更晚到来。
6. 威刚AIScaler能否给出"降级到DDR5那部分请求"的P99延迟分布。"显存利用率从98%降到63%"是容量口径的好消息,但池化方案真正的成本藏在被降级请求的尾延迟里。没有这个数字,2.3倍吞吐就是一个不可比的口径。
7. Marvell Photonic Fabric与Structera S的第一批量产客户。光子跨机架共享内存(最远50米、最高32TB暖KV Cache)在概念上非常漂亮,但真正决定它是不是一个品类的,是有没有非示范性质的生产集群跑在它上面。同时注意它与英伟达NVLink Fusion路线的边界——两条路线是竞争还是分层共存,未来一年会见分晓。
8. OCS与NPO在超节点故障隔离上的落地节奏。腾讯明确表态采用OCS做拓扑动态重构以替换故障GPU,谷歌已在TPU集群规模部署多年,微软、Meta 也在验证。把光交换从"互联设备"重新定义为"可靠性组件",是超节点走向256卡、512卡规模的必要条件。这一层如果落地慢,超节点的经济性会被故障率直接吃掉。
9. AF分离系统的第三方基准。移动云那套国产GPU加类脑芯片的异构方案,架构故事讲得很完整(Attention归GPU、FFN归类脑、自研编译器与统一推理引擎),但所有数字都来自合作方内部验证。按本栏目一贯的判断标准:先看有没有独立实验室在其他模型、其他流量模式下复现,再决定这套范式值不值得跟。
免责声明:本文所涉信息均来自公开渠道,仅代表作者个人观点,不构成任何投资建议。市场有风险,决策需谨慎。