8月15日,KV Cache内存池化的"国产化"与"精细化"两条主线同时推进。国产侧,XSKY星辰天合率先在阿里平头哥真武810E PPU上跑通KV Cache卸载——国产KV存储系统第一次真正接入国产高端推理芯片,存储与芯片的生态闭环就此合拢;阿里灵骏真武M890超节点实例上线,成为国内首个承载超2万亿参数大模型服务的超节点形态算力;无问芯穹则把PD分离从"单集群内分工"推向"跨集群、跨地域调度"。论文侧,vToken用Token级虚拟化让驱逐后的KV内存"可回收",TriAttention用三角级数洞察把KV Cache压缩10倍。国产放量与微观优化共振,KV池化正在从"技术选项"变成"平台标配"。
一、XSKY率先跑通真武810E PPU KV Cache卸载:国产"芯片×存储"协同首次闭环
8月14日,XSKY星辰天合宣布完成对平头哥真武810E PPU的适配验证:旗下AI推理加速产品MeshFusion已在真实PPU环境中成功跑通MiniMax M3、GLM-5.2两个大参数模型的KV Cache Offloading全流程,成为率先完成真武PPU适配的国产KV Cache存储系统之一。
真武810E是阿里平头哥自研的高端AI芯片:GPGPU架构、96GB显存、700GB/s片间互联带宽,定位训推一体,自研软件栈提供统一编程接口,原生支持vLLM/SGLang/PyTorch等主流框架。MeshFusion则基于端到端RDMA把多个节点的DRAM与NVMe SSD组织成大容量KV Cache存储池,配合KV Cache感知路由与管理引擎,把推理上下文记忆从TB级扩展到PB级,以低成本存储替代昂贵显存。在此次验证中,KV Cache可从PPU显存正确卸载至存储池,并在后续请求中命中复用、快速取回,全程稳定,且无需改造推理框架即可开箱启用。
值得关注的原因:
KV Cache卸载的国产化,卡点从来不在存储系统本身,而在"存储系统×国产芯片"的适配生态。过去国产KV卸载方案大多在英伟达GPU上验证,而国产推理芯片集群要真正跑通"显存不够、SSD来凑",需要存储厂商逐芯片做软硬件适配。XSKY这一步的意义在于:国产高端芯片(真武PPU)与国产KV存储池首次完成真实环境的卸载-复用闭环,且对vLLM/SGLang生态零侵入——这意味着国产超节点在推理侧的"以存储换显存"路径,从单点验证走向了可复制。
二、真武M890超节点实例上线:国产超节点进入"放量元年"
8月12日,阿里云灵骏真武M890超节点实例正式上线,首批在乌兰察布地域开售。该实例是国内首个成功运行超2万亿参数大模型的超节点形态算力——Kimi K3和Qwen3.8 Max均已通过该实例对外提供服务。此前WAIC 2026上,华为Atlas 950 SuperPoD真机首次对外展出(单柜64卡为基本单元、最大可扩展至8192张NPU),曙光8000十万卡全国产集群完成全球真机首秀,联想问天超节点、摩尔线程MTT C256等新品同步亮相。
放量逻辑正被产业数据印证。国海证券测算,2026至2028年国产超节点市场规模将分别达到889亿元、4151亿元和11089亿元,年均复合增速341%,在国产AI芯片出货中的渗透率从2026年的约15%快速提升至2028年的约55%。同期,联想发布问天超节点算力解决方案,配套的万全异构智算平台V5.0以"分层解耦PD分离架构+KV Cache共享缓存优化"为核心技术——单节点可搭载40张GPU、FP8算力超28 PFLOPS、HBM显存突破5.76TB、访存总带宽超80TB/s、百纳秒级芯片P2P时延。
值得关注的原因:
超节点从"概念验证"进入"放量元年",竞争焦点从单卡参数转向系统级交付——而KV Cache共享/池化与PD分离已成为头部方案的"平台标配"。M890以统一内存寻址的Scale-Up域把128张卡织成"一台计算机",本质就是在做内存池化的超节点形态落地;联想把PD分离与KV Cache共享写进V5.0平台的核心能力,说明推理侧的内存效率优化,已经从论文和初创公司扩散到整机厂商的出货清单。对国产芯片而言,这是以系统优化弥补单点差距的关键窗口。
三、无问芯穹PDD:把PD分离推向跨集群、跨地域
据8月13-14日报道,无问芯穹披露其首创的跨集群异构PD分离架构(Prefill-RelayDecode-MainDecode,PDD):用高效的以太网把各地独立建设的异构算力集群连接起来,让擅长不同任务类型的集群算力分别承担Prefill与Decode,协同完成推理——"偏科的硬件只刷自己最擅长的题"。在此基础上,无问芯穹进一步将传统PD分离链路解构为三级分离式推理架构,以解决实际落地时的传输延迟卡点。公司已联合中国电信在新疆哈密—深圳两个算力集群间,验证了跨越4000公里的超远距离跨域协同。
数据上,无问芯穹已通过技术触达16种异构芯片(多数为国产)、3.7万P算力,服务Kimi、智谱、MiniMax、阶跃星辰等头部厂商;近一年将Token成本削减10倍,其CEO夏立雪判断随着PDD规模化落地,推理成本"依然有10倍的下降空间"。
值得关注的原因:
PD分离正在经历"第二跳":从单集群内GPU池分工,升级为跨集群、跨地域的算力调度。当KV Cache可以经以太网在异构集群间流转,内存池化的边界就从机柜扩展到了数据中心甚至城市之间——这对盘活碎片化国产算力、把"每度电炼出更多Token"有直接意义。PDD的RelayDecode(中继解码)环节解决的是传输时延暴露问题,这与超节点内部百纳秒级P2P形成互补:柜内靠Scale-Up,柜间靠智能调度,两者叠加才是完整的池化图景。
四、论文深度分析1:vToken——Token级虚拟化,让驱逐后的KV内存"可回收"
论文标题:vToken: Token-Level Virtualization for Reclaimable KV Caches
作者:Yuanhang Gao, Xiangrui Yang, Yuanfeng Chen, Hongjia Chen, Qianru Lv, Wenfei Wu, Dongsheng Li 等7人
arXiv编号:2608.13263 | 提交日期:2026年8月13日
关键词:KV Cache、Token级虚拟化、可回收内存、vLLM、驱逐策略
一个常被忽视的"内存黑洞":PagedAttention用固定大小内存块管理KV Cache,而新一代驱逐算法却在token粒度上做取舍——块级管理与token级驱逐之间的粒度错配,造成大量"块内碎片":一个块里只要还活着一个token,整块内存就无法归还。论文测算,这类不可回收的已分配内存占比相当可观,直接压缩了可服务的并发请求数。
核心思路:轻量Token级虚拟化层,解耦"逻辑存活"与"物理放置"
vToken引入token-table间接寻址:维护一个稳定的逻辑token视图,把"这个token还活不活"与"它物理上放在哪个块"彻底解耦;当token被判驱逐,后台异步执行repacking(紧凑重排),把存活token搬移到一起、腾出整块内存归还分配器。整个设计刻意保持了PagedAttention kernel与CUDA Graph兼容——不改变算子,只改管理层。
实验数据(vLLM实现,搭配H2O/Random/Scissorhands三种驱逐策略):与配对的Naive-Evict基线相比,每请求保留的KV块减少27.2%~72.3%,SLA约束吞吐最高提升1.37倍;在受限活跃KV预算下,最大可行并发扩展2倍;而各驱逐策略的集成代码从500+行降到不足50行——几乎"零成本"接入。
为什么值得关注?内存池化的经济账,一半取决于"能不能把内存池起来",另一半取决于"池子里的内存能不能被高效回收再利用"。vToken把被驱逐token浪费的块内空间重新变成可用内存,等于在不增加任何硬件的情况下提高有效池容量——这在显存紧张的超节点推理场景直接换算为并发与营收。它同时回答了池化系统的经典难题:精细化内存管理能否不牺牲PagedAttention的性能底座。
五、论文深度分析2:TriAttention——三角级数洞察,KV压缩10倍
研究名称:TriAttention(据8月14日行业报道,MIT / NVIDIA / 浙江大学联合团队)
核心成果:KV Cache压缩10倍、推理速度提升2.5倍
关键词:注意力压缩、三角级数、RoPE、推理剪枝(注:论文正式编号以官方发布为准)
主流KV压缩(SnapKV、H2O等)的思路是"看最近的Query注意力分数,判断哪些Key重要"。TriAttention的作者却指出一个根本性问题:现代大模型普遍使用RoPE旋转位置编码,不同位置的Query向量被旋转到不同方向,彼此间根本没有可比性——在错误的地方找答案,正是现有压缩方法的软肋。
核心思路:把注意力分数写成Q-K距离的解析函数
论文发现一个优雅的数学结构:RoPE作用下,注意力分数是Q-K距离Δ的函数,且可展开为三角级数——logit(Δ) ≈ Σ_f [a_f·cos(ω_f·Δ) + b_f·sin(ω_f·Δ)],系数完全由Q/K的中心向量决定,ω_f即RoPE频率。据此设计两阶段方案:离线标定(用少量任意文本收集各注意力头的Q/K中心向量与集中度,仅一次、代价极低)+ 推理时打分剪枝(每生成128个token触发一次,按三角级数分+范数分加权,保留Top-B个Key)。验证显示,该三角级数对真实注意力的Pearson相关系数达0.6~0.9,在Qwen3、Qwen2.5、Llama3三种架构上均成立;实测KV Cache压缩10倍、速度提升2.5倍,24GB显存即可顺畅运行需长链推理的32位模型Agent任务。
为什么值得关注?TriAttention把KV压缩从"经验性删token"提升到"可解析、可预测的注意力建模"——一旦注意力分布可以被解析函数刻画,压缩策略就有了数学依据,还能与池化、卸载叠加:模型侧把KV压到1/10,系统侧再分层卸载,两条路相乘。对超节点而言,这意味着"单位显存的token产出"这个核心指标,将同时被架构压缩和系统池化双轮驱动。
六、总结与展望
8月15日的动态与论文,从芯片、系统、架构、算法四个层面拼出KV Cache内存池化的完整演进图景:
芯片协同:真武PPU卸载闭环。XSKY在真武810E PPU上跑通KV Cache卸载,国产存储系统首次真正接入国产高端推理芯片,"以存储换显存"在国产算力栈内首次端到端成立;
系统放量:超节点元年开启。真武M890上线服务2万亿参数模型,国产超节点2026-2028年市场规模剑指889亿→11089亿元,PD分离与KV Cache共享成为整机平台的出货标配;
架构升维:PDD跨集群调度。无问芯穹把PD分离推向跨集群、跨地域,4000公里级协同验证跑通,异构碎片化算力池化有了系统级答案;
算法攻坚:微观效率双线突破。vToken让驱逐后的KV内存可回收(池容量不增硬件而增)、TriAttention用三角级数把KV压到1/10(单位显存产出翻倍),一收一压共同改写内存经济学。
一条主线贯穿始终:当国产超节点进入放量元年,KV Cache内存池化的竞争已从"能不能做"进入"谁能把系统效率做到极致"。接下来最值得跟踪的,是真武PPU卸载方案在国产超节点集群上的规模化数据、PDD跨集群调度的商业化落地节奏,以及TriAttention正式论文的公开与复现——它们将共同决定国产推理成本曲线的下一段斜率。
— END —
夜雨聆风