ARTICLE · 1133845
KV卸载进了废标条款,池化头回算出负账
2026年10月7日 · 观天下
AI SUPERNODE · KV CACHE DAILY
10月7日,本期 6 条:行业动态 3 条、论文分析 3 篇,池化从技术方案变成了招标条款,而「该不该池」第一次被算出了负值。其一,中国移动一份超节点的集采文件,把「全部 AI 卡内存全局统一编址、任一计算单元可用内存语义直接访问其他 AI 卡内存」与「KV Cache 动态卸载至外置存储并按索引复用」一起写成了不满足即废标的条款,20,480 张卡的规模与 72 套智算存储同时挂上采购清单。其二,华为轮值董事长徐直军与海思首席科学家廖恒的媒体圆桌完整中文版在 10 月 6 日扩散,把昇腾 950PR 与 950DT 的供货时间表明确切开,也把「昇腾在中国市场份额已超英伟达」这句内部口径摆上台面。其三,Vast Data 的 CTO 把 agent memory 判给了存储——长会话的 KV缓存不该一直占着显存,而该由存储层按三级去接。技术侧解剖两篇:一篇让 prefill 与 decode 之间的弹性从「加机器」变成「原地换角色」(FluidPD);一篇给多智能体的持久记忆层算出第一份负账(Persistent Memory)。
一、行业动态INDUSTRY PULSE
▍1. 中国移动超节点集采:内存语义直访与 KV Cache 卸载被写成废标条款
事件 9 月底,中国移动发布《2026 年至 2027 年新一代人工智能超节点设备集中采购项目》招标公告(编号 CMCC20260500251),10 月 5 日一份基于三个征求意见包、共 14 份原始技术文件的解析在国内扩散。采购清单四行:人工智能超节点设备 20,480 卡、无损以太网交换机(RoCE)448 台、智算存储 72 套、分布式文件存储 10 套;不划分标包,选 4 至 5 家中标人,只接受超节点设备制造商投标,不接受代理商与联合体。超节点按液冷整机柜交付,单柜 1024 卡的装法是 8 个计算节点(每节点 8 卡)加 4 个 ScaleUp 交换节点,AI 卡为昇腾950(547T/144GB 与 425T/96GB 两档显存),卡间互联双向 1008 GB/s,CPU 与 AI 卡液冷、液冷散热占比不低于 70%。写死的硬指标里,第一条就是对全部 AI 卡内存全局统一编址、任一计算单元可用内存语义直接访问其他 AI 卡内存;智算存储一侧则把 KV Cache 存储列为多项★条款——KV Cache 动态卸载至外置存储并按索引复用,须覆盖生命周期、多模型隔离、多节点一致性与多级缓存,并兼容 vLLM/SGLang/MindIE;另有存储与 AI 加速器直通(要求实配),不经过主机 CPU、直接从存储拷到 AI 卡显存,并点名兼容昇腾、沐曦、壁仞。评分表 100 分里,推理性能 30 分最重,供应链与生态类合计 20 分,供应能力要求提供加速卡原厂发票、出货 80 亿元以上才得满分。
值得关注 其一,这是本系列第一次看到「内存语义直访」与「KV Cache 外置卸载」被写成运营商集采的废标条款——此前池化与卸载都是厂商方案书里的亮点,进了招标文件就变成了及格线:不满足直接废标,意味着这两件事从「要不要做」变成了「能不能买」,而超节点这一路线的基本命题,也第一次被采购方用条款写了下来。其二,条款的颗粒度暴露了真实的验收方式:KV Cache 存储不是写「支持卸载」就完事,而要交出生命周期、多模型隔离、多节点一致性、多级缓存四件东西,并点名三家推理框架——采购方要的是能对上索引、能跨节点对得上账的卸载,不是把缓存倒进一个黑盒。其三,评分结构说明了比的是什么:推理性能 30 分加训练 15 分共 47 分,供应链与生态合计 20 分且要求原厂发票与 80 亿元出货——本项目比的不是单卡参数,而是「加速卡原厂生态等级加实际出货体量」,这也解释了为什么超节点集采只接受制造商投标。
冷静提示 以上数值均来自公开的采购意见征求稿与第三方解析,投标以正式招标文件为准,规模与指标在正式文件中可能调整;本案为 2026 至 2027 年度框架,交付与落地节奏未公开。
◆◆◆
▍2. 华为媒体圆桌补上供货时间表:950PR 管推理,950DT 管训练
事件 10 月 6 日,华为轮值董事长徐直军与海思首席科学家廖恒在上海 HC 大会期间的媒体问答摘要,在中国新闻网、财联社、网易等多源扩散了完整中文版。徐直军在交流中把超节点的定义又收了一次——「超节点的真正挑战,是让数千、数万颗处理器组成一台计算机」,并称基于 950 芯片的超节点背后是华为自研的 Peerium 计算架构(嵌套并行、统一内存寻址、平等互联,提出 Nested BSP),Atlas 950 超节点目前25.6 万卡规模的集群已在部署与测试中。本次最值得记的新信息是供货节奏被明确切开:徐直军说「950 率先推出的是 PR 版,主要面向推理,目前上市量不算大;基于 950DT 的超节点主要用于训练,目前还在测试中,规模供货应该在今年年底或明年初」,并判断明年起大量模型的训练会构筑在 950DT 超节点上,瓶颈则从「推动力度」回到「供货能力」。他同时给出一个内部口径——昇腾在中国市场的份额已超英伟达。廖恒补充了 25.6 万卡这个数字的来由:模型参数已达 5 万亿级,未来两年预计中国出现约 6 至 7 个前沿实验室、目标训练 10 万亿至 40 万亿参数的基础模型,而单园区电力输送设计使 20 万卡成为一个相对保守的上限。灵衢/统一总线(UnifiedBus)的四大特征里,明确列出了「面向 Transformer 的分级硬件加速可实现注意力—前馈网络分离(AFD)」,以及混合介质资源池化、DDR 作为 NPU 的替代内存。
值得关注 其一,这是本系列第一次拿到昇腾两代产品的供货时间差:PR 版管推理、DT 版管训练,且 DT 要等到年底或明年初才规模供货——此前多篇「千卡超节点落地」的报道里出现的是 950DT,把它与「950 率先推出面向推理的 PR 版」放在一起读,正好解释了为什么同一型号在同一个月里会出现「已商用」「已落地」「最大可扩展 8192 卡」等多套口径,也提示看这类数字时先确认定语指的是已发布、已落地还是可扩展上限。其二,「份额超英伟达」这句内部数据必须标注口径:徐直军原文是定性判断,未给出统计区间、出货口径与第三方来源,与本系列此前记录的无口径内部数据属同一类,只能当作趋势信号、不宜当作份额结论。其三,AF分离 在华为体系里被写进统一总线的特征清单:与「混合介质资源池化」「DDR 当 NPU 替代内存」并列,说明注意力—前馈网络分离在华为方案里不是一个可选项,而是总线级架构要支撑的能力——这与本期顺带的那篇 CPU 侧专家卸载论文,正好构成这条技术线的两端。
冷静提示 以上内容出自公开媒体报道的媒体交流摘要,非官方新闻稿全文;「份额超英伟达」「25.6 万卡」「10 万亿至 40 万亿参数」均为现场表述,无第三方核验,供货时间表也可能因产能变化而调整。
◆◆◆
▍3. Vast Data 把 agent memory 判给存储:显存不该是会话的终点
事件 10 月 6 日,SiliconANGLE 发布对 Vast Data 联合创始人兼 CTO Alon Horev 的专访(Fully Connected 2026 现场)。Horev 的判断是:agent 的 memory 与普通推理缓存不同,它至少分两类——一类是长时记忆(智能体回看过去对话与交互、从经验里学习),另一类是一次会话进行中的上下文;而压力首先出现在推理侧。一次 50 万 Token 的长会话会占掉单张 GPU 显存的十分之一到二十分之一,而当智能体因为编译代码、测试软件,或者「人想喝杯咖啡」而暂停时,这段 KV缓存留在显存里就是纯粹占用。他的解法是按层分配:先用显存、再是同机 CPU 内存、最后是能存 PB 级 KV缓存的持久介质,由英伟达 Dynamo 软件做编排;会话可以从一台忙的 GPU 迁到较闲的 GPU,KV缓存要么走网络搬运、要么直接从 Vast 读取。定性句是:一旦把推理当成一个分布式问题——显存、CPU 内存与存储可以跨机群一起用——可选的调度空间就大了。他还提到,企业部署成千上万个智能体之后,需要记录并留存它们的全部动作,agent memory 因此同时是治理资产与性能资产。
值得关注 其一,这是存储厂商少见地把「agent memory 归谁」当成立场问题讲出来:过去几期里,KV 卸载层的出现都是推理框架或系统厂商在做,存储厂商是被接入的一方;这次是存储厂商直接说「这活该我做」,并把分层顺序、编排软件、会话迁移一并画出——接入方开始定义接口,说明这一层的归属还没有定论。其二,「显存的十分之一到二十分之一」是个可用的估算锚点:它把长会话的 KV 占用与显存容量直接挂上,配合「会话暂停时缓存仍在占位」这句,正好解释了为什么卸载层必须支持按索引取回而不是简单丢弃——被卸掉的不是垃圾,是随时可能被唤醒的会话现场。其三,它与本期论文二形成交叉验证:论文二指出持久记忆层在多智能体里可能不产出精度收益,而 Horev 给出的动机是「暂停期间不占显存」与「企业合规留存」——两者说的其实是同一层的两种目的,一个为了省钱、一个为了留档,而这两种目的对内存池化的技术要求并不相同。
冷静提示 以上为厂商高管在行业活动上的访谈口径,未给出基准测试与大规模部署数据;三级分层与 Dynamo 编排的具体实现细节、延迟代价与成本结构均未披露。
二、论文分析PAPER REVIEW
▍4. 论文一:FluidPD——PD 的弹性,从「加机器」改成「原地换角色」
事件 论文:FluidPD: In-Place Elasticity for SLO-Aware Prefill-Decode Disaggregated LLM Serving(arXiv:2610.06917,10 月 2 日提交,Kartik Ramesh、Kaidi Fu、Zihan Zheng、Jiahuan Yu、Minjia Zhang(伊利诺伊大学厄巴纳-香槟分校),Fabio Oliveira、Carlos Costa(微软))。问题设定很直接:PD分离 已经是 LLM 服务的常见架构,但现有系统通常把 prefill 与 decode 的 worker 比例固定下来、再在上面做请求路由;而真实负载既有短时突发、也有需求比例的持续漂移,一个当下配置合理的部署可能很快失配,即使别处还有空闲容量,延迟 SLO 也会被打破。已有的自动扩缩容能加容量,但反应慢、需要备用 GPU,且不直接解决短时间尺度的阶段失衡。FluidPD 给出两个互补机制:FluidToken 应对短时失衡——当 decode 侧出现余量时,把一部分 prefill 计算卸载给 decode worker;FluidRole 应对持续失衡——把正在运行的 worker 在 prefill 与 decode 角色之间原地重分配,避免模型重载与引擎重启。两者都由轻量压力指数驱动,在压力变成 SLO 违规之前就将其暴露出来。在 Azure 生产 trace 负载上,FluidPD 的 SLO 达成率较静态 SGLang 最高提升 94.6 个百分点,且不额外增加 worker。
值得关注 其一,这是 10 月 6 日 SGLang 那条记录在学术侧的对应机制:上周我们记录过 SGLang v0.5.21 让 PD 实例在线换角色(默认关闭、一串配置被拒、切换前要估算显存余量),FluidPD 把同一件事做成了有论文支撑的双机制——不只换角色(FluidRole),还把一部分 prefill 计算卸载给 decode 侧(FluidToken),后者是那版运行时里没有的新动作。其二,「不增加 worker」才是这条的核心收益:94.6 个百分点说的是 SLO 达成率,而不是吞吐——同等的机器数量下少违约,等价于把已经买下的算力用得更满;这与前几期「池化解决容量、调度解决弹性」的分工一致,本论文补上的是「弹性可以不用新硬件」。其三,压力指数先于违规暴露压力,是可直接借鉴的运维判据:能在 SLO 被打破之前看到 prefill 与 decode 两侧的资源压力,意味着调度决策可以提前做,而不是等首 token 时间恶化之后才触发扩容——对运营商与云厂的长尾流量,这一条比加速比更实用。
冷静提示 结论来自作者在 Azure 生产 trace 回放上的自测,未附第三方复现;94.6 个百分点为相对静态 SGLang 的达成率差值,绝对达成率与基线配置未在摘要中给出;原地换角色的工程代价、显存要求与并行度限制需参考全文。
◆◆◆
▍5. 论文二:持久记忆层的第一份负账——拆解省了 KV,持久层没省
事件 论文:Persistent Memory in Multi-Agent LLM Inference: What It Costs, What It Buys, and When You Can Tell(arXiv:2610.07782,10 月 6 日提交,Hochan Son、Kyungdoe Han、Jaehan Koh、Xiaowu Dai、Wenlu Xu、Guang Cheng)。论文把多智能体长上下文推理看作一种「把活跃 KV缓存按调用切分、而不是压缩总证据」的做法,并指出许多系统在这之上又加了一层持久化记忆层(存储与召回推理轨迹),而这类设计通常只用一个消融实验、报个精度提升来证明有效。作者在同一套三层智能体架构上把两件事都测了:拆解确实有效——每查询峰值 KV 工作集 14.3 MiB,对比单遍 35.5 MiB 与检索增强 35.3 MiB;持久层没有效果——在八组受控数据集对(每臂 n=100)上,它带来的是 +0.368 MiB([+0.167, +0.590])的峰值缓存增量,而精度变化不可检测(+0.015,95% 置信区间 [-0.011, +0.046])。作者认为这个「零效应」是结构性的:单题基准给每个条目配好了自己的证据、且独立评分,正确性还要求在不同条件之间重置已存的轨迹,召回因此「没有什么可检索的信息」。他们特别说明,得到这个结论之前做了四次测量修正——前三次都在抬高表观收益,第四次才让这个量级的效应看起来可分辨,而这些在结果表里都看不见。论文最后给出 agent-memory 消融实验必须满足的条件,以及不依赖具体缺陷知识的检测流程。
值得关注 其一,这是本系列第一篇给内存池化的一层报负账的论文:此前记录过的每一层——HBM、CXL 池、本地 NVMe 共享层、外置分布式存储——给出的都是正向收益,而这条说的是:多智能体的持久记忆层在标准基准上「加了 0.368 MiB 峰值缓存、换不来可检测的精度提升」。在本系列持续跟踪池化的语境里,一个可信的负结果比又一个加速比更有价值。其二,「单题基准自带证据」这句点中了评测口径的要害:持久记忆的价值在于跨会话复用,而单题基准每题都是独立的、还要求条件间重置轨迹——等于把要测的能力从题目里剔除了;这也直接指向一个采购问题:如果你要验收一层持久记忆,用什么负载去测。其三,四次测量修正的坦白,对工程验收是直接的提醒:前三次修正都在抬高收益,说明这类消融实验的默认做法系统性偏向「看起来有效」;作者给出的检测流程不依赖具体缺陷知识,可直接搬进内部评测流程。
冷静提示 结论基于一层特定的三层智能体架构与八组受控数据集对,n=100 每臂,未覆盖真实生产的多会话长时负载;「无精度变化」是统计上不可检测,不等于任何场景都没有收益;持久层的价值可能体现在显存节省与企业留存需求上而非精度,本文未对此展开测量。
◆◆◆
▍6. 顺带一篇:HiNa-MoE——AF 分离的权重侧,落到 CPU 上
事件 论文:HiNa-MoE: High-Performance, Non-Intrusive MoE Inference on CPUs with Matrix Engines(arXiv:2610.05123,10 月 4 日提交,Weiling Yang、Junwen Zhang、Dezun Dong、Jianbin Fang、Enda Yu、Zhe Bai、Xiaopeng Deng,国防科技大学)。问题设定:MoE 推理越来越多落在本地与私有化环境,专家参数经常超过显存容量;在延迟敏感、低并发场景下,反复把被路由到的专家权重从 CPU 内存搬到 GPU 代价过高,于是被路由专家的前馈网络(FFN)落在了多路 CPU 的关键路径上。已有的 CPU 加速方案多依赖侵入式的硬件或拓扑要求(比如 AMX 专属权重布局、手写 NUMA 放置),可移植性差、也难与标准的 CPU-GPU 卸载流水集成。HiNa-MoE 做成非侵入式:用优化过的 AMX 微内核保持专家权重的标准布局,把轻量布局变换融进 token 聚合与写回;用简单的页交错策略做 NUMA 感知的任务划分,不改框架的内存分配器;并把 decode 阶段的访存型矩阵-向量运算改写成小矩阵-矩阵,以便用上 AMX。多个 MoE 模型上,FFN 内核最高 3.37 倍、端到端推理最高 2.09 倍加速,且可与现有框架和部署流程即插即用。
值得关注 其一,AF分离 的权重侧终于有了带数字的 CPU 方案:本期华为把 AFD 写进统一总线的特征清单,而这条论文处理的是 AFD 里最难的一半——FFN 侧的权重。当专家参数放不下显存时,FFN 不是「被切给另一张卡」,而是被切给 CPU 的矩阵引擎;分离的对象因此从「注意力与 FFN」进一步细化为「FFN 与它所在的计算介质」。其二,「非侵入式」这个约束本身就是对超节点方案的提醒:论文刻意不要求专属权重布局、不改框架分配器,说明在真实部署中,AF分离 能不能落地往往取决于它要不要改动既有栈——前几期我们记录过某机组把 FFN 交给 3D DRAM 堆叠芯片、把 Prefill 交给大算力芯片,那是硬件分工;这一条是纯软件的同类分工,门槛低得多。其三,2.09 倍的端到端加速落在「低并发、延迟敏感」这个被大集群叙事忽略的场景里:超节点的故事都围绕万卡规模,而这条论文服务的是一台机器放不下全部专家的私有化部署——同一个「专家装不下」的问题,在两种规模上用的是不同解法。
冷静提示 结论为作者自测,未附第三方复现;加速比依赖 Intel AMX 指令集与具体模型结构,摘要未给出被测模型清单与基线配置;「非侵入」是对权重布局与框架分配器而言,实际集成仍需按其实现方式接入。
三、结语TAKEAWAYS
今天几条线索合起来指向同一件事——池化与卸载已经过了「要不要做」的阶段,开始被写成条款,也开始被算出负值。其一,中国移动把「内存语义直访」和「KV Cache 外置卸载」写成了不满足即废标的硬指标,并把生命周期、多模型隔离、多节点一致性、多级缓存列为必答项——池化的账进了招标书,接口的定义权就从厂商方案书转移到了采购方。其二,弹性与分离都在往下切:PD 弹性从「加机器」变成「原地换角色」,AF 分离的 FFN 侧从「切给另一张卡」变成「切给 CPU 的矩阵引擎」,而这两刀都比上一刀更靠近既有栈、也更便宜。其三,也是本期最该记住的一条:多智能体的持久记忆层被算出第一份负账——拆解确实把峰值 KV 工作集从 35.5 MiB 压到 14.3 MiB,但持久层加了 0.368 MiB 缓存、换不来可检测的精度提升,而作者坦白的四次测量修正都在抬高表观收益。这提醒我们,池化的每一层都该有自己的负账报告。接下来的观察清单:中国移动正式招标文件中 KV Cache 存储条款是否维持★;昇腾 950DT 的规模供货时点是否落在明年初;Vast 所谓「PB 级 KV 持久层」的延迟与成本数据何时公开;FluidPD 的原地换角色在并行度大于 1 的拓扑上是否成立;持久记忆层在真实多会话长时负载上是否仍为零收益;HiNa-MoE 在非 Intel 平台上的等效方案何时出现。池化走到今天,比的已经不是拆不拆、池不池,而是每一层搬完之后那笔账有没有人接着——以及有没有人敢把负账也报出来。
四、引用信息来源REFERENCES
1. 中国移动 2026 至 2027 年新一代人工智能超节点设备集采:中国移动《2026 年至 2027 年新一代人工智能超节点设备集中采购项目》招标公告(编号 CMCC20260500251,2026 年 9 月底发布);《中国移动 2026 年至 2027 年新一代人工智能超节点设备集采技术解析》(鲲鹏昇腾开发者社区,2026-10-05,基于三个征求意见包共 14 份原始技术文件)。
2. 华为 Peerium 架构与灵衢总线媒体圆桌:中国新闻网《华为开创 AI 时代计算架构:让百万处理器成为一台计算机——徐直军与媒体圆桌交流摘要》(2026-10-06);财联社/网易《华为徐直军:开创 AI 时代计算架构,让百万处理器成为一台计算机》(2026-10-06);腾讯网《华为徐直军:昇腾中国市场份额已超英伟达,中国芯片自主化是必然之路》(2026-10-06)。
3. Vast Data CTO 谈 AI agent memory 与 KV Cache 卸载:SiliconANGLE《Vast uses tiered storage to ease AI agent memory demands》(theCUBE 对 Vast Data 联合创始人兼 CTO Alon Horev 的专访,Fully Connected 2026,2026-10-06)。
4. FluidPD:PD 分离的原地弹性:Ramesh、Fu、Zheng、Yu、Zhang(伊利诺伊大学厄巴纳-香槟分校)与 Oliveira、Costa(微软),arXiv:2610.06917(2026-10-02)。
5. Persistent Memory in Multi-Agent LLM Inference:Son、Han、Koh、Dai、Xu、Cheng,arXiv:2610.07782(2026-10-06)。
6. HiNa-MoE:CPU 矩阵引擎上的 MoE 推理:Yang、Zhang、Dong、Fang、Yu、Bai、Deng(国防科技大学),arXiv:2610.05123(2026-10-04)。
免责声明:本文基于公开信息整理,仅供参考,不构成投资建议。
— 观天下 · 聚焦 AI Infra 与超节点