ARTICLE · 1050459
KV卸载有了官方成绩 PD分离写进产品型号
2026年9月21日 · 观天下
今天有三条线索,都在回答同一个问题:KV Cache 和算力之间的这笔账,到底由谁来算。第一条来自第三方——开放数据中心委员会(ODCC)在 2026 开放数据中心大会(ODX)上给 KV Cache 推理存储发了第一批专项测评成绩,中国信通院工程师在存储系统分论坛上逐项解读;同一时间,MLPerf Storage v3.0 也把 KV Cache 收进了正式基准。第二条来自华为——昇腾 950 超节点正式上市,PD分离 第一次从调度器里的一个策略,变成了采购单上的两个型号。第三条来自阿里——IDC 报告披露阿里云凭 35.2% 拿下中国 AI 云存储份额第一,而它给 KV Cache 排的层级编号是"G3.5"。论文侧今天选两篇:一篇用实验证明"复用"不等于"共享",一篇把"少算几层"变成卸载场景下的省搬运手段。三条线索收在同一个判断上:内存池化和 KV卸载 正在从"厂商自说自话",进入"第三方出题、统一口径、按结构降本"的阶段。
一、行业动态
1. ODCC 给 KV Cache 卸载发了第一批"官方成绩",MLPerf 同步把它收进基准
9月20日,消费日报网等媒体披露:2026 开放数据中心大会(ODX)期间,开放数据中心委员会(ODCC)正式发布 KV Cache 推理存储专项测评结果,深圳市泛联信息科技有限公司、广东省绿算技术有限公司、三星(中国)半导体有限公司等企业代表获颁测试证书,颁发人是 ODCC 技术专家组主任张炳华与 ODCC 轮值主席杨明川。中国信通院工程师段世茹在 ODX 存储系统分论坛上详细解读了 AI 推理场景 KV Cache 存储方案的测试结果。
先把这套评测的来路说清楚,因为它比单条成绩重要。ODCC AI 存储实验室于 2025 年开放数据中心大会成立,承载单位是超擎数智,方向是给"推理场景的存储加速"做标准化验证。在泛联这一批之前,实验室已经陆续发过焱融 YRCache、英韧 N3X、星辰天合 MeshFusion、大普微 R6101 等评测结果。也就是说,KV Cache 卸载这件事已经有了一条公开的、持续更新的成绩单,而且发榜方是行业组织加信通院,不是厂商自己。
这批复盘里,泛联 UbiPower 18000 的口径最完整。技术路线是自研 GPU Direct RDMA 零拷贝传输模块加精细化 RDMA 并发调度,卖点是"极简架构"——绕过宿主机 CPU 调度链路,砍掉传统文件系统元数据操作的开销,让 GPU 显存与分布式存储池之间的 KV Cache 张量块直接高速读取。整个数据通路是:推理框架(vLLM / SGLang)→ 缓存卸载层(LMCache / Mooncake)→ 推理传输库(NIXL)→ UbiPower KV Agent → IB / RoCEv2 高速网络 → GPU Direct RDMA → UbiPower 18000 KV Cache 存储池(底层是 NVMe SSD 与自研文件系统 UbiXFS)。
这套通路实测出来的两个数,是全篇最值得记的:首 Token 时延(TTFT)最大降幅 98%,系统吞吐(TPS)最大提升 65 倍;推理硬件采购成本可优化 30%~50%。测试条件也有交代:在 HBM GPU 服务端上,采用 GDR 技术加单张 400G 网卡,对 DeepSeek R1 模型做 Prefill-Only 阶段的性能评估;另一组是 Qwen-235B-FP8 的 Prefill-Only 测试,覆盖 2K / 8K / 32K 序列长度与 4 至 256 的不同并发配比,并同时对比了 GPU Direct RDMA 与普通 RDMA 两条传输路径——结论是两条路都大幅提升,GDR 路径更显著。
但这一条真正的分量不在那两个"最大降幅/最大提升",而在第三项成果:大幅缩小高低配算力差距,实现推理业务结构性降本。测试里放了一组对照:把 KV Cache 卸载到 UbiPower 18000 之后,中端 GDDR 显存的显卡与高端 HBM 显存的 H20 之间的 TPS 差距被逐步抹平,某些场景下 GDDR 服务器的并发甚至高于 HBM 服务器。
这句话必须和 9月12日那篇 ODCC/ODX 复盘连着读。当时信通院给出的定性判断是——"KV 卸载可以收窄中端 GDDR 显卡与高端 HBM 显卡之间的吞吐差距,等于用存储替代一部分高端算力采购。"九天之后,同一个实验室、同一场大会,这个判断第一次有了带具体型号和具体配比的实测数据。从"定性判断"到"可复现的对照实验",这才是这条新闻的价值。
同一条线上的第二个信号来自更权威的第三方:MLPerf Storage v3.0 把推理负载正式纳入基准测试,其中一项就是 KV Cache 测试——衡量存储系统在长上下文大模型服务中对注意力状态进行分页换入换出的速度。本轮结果中,Everpure 的 FlashBlade//EXA 以 51 台主机构成的配置跑出 1623.4 GiB/s 的 KV Cache 读取速度,位列第一;泛联 UBIX 443.7 GiB/s 与 FarmGPU 443.6 GiB/s 在标准规模提交中领先。同一轮里,泛联 UbiPower 18000 用三个存储节点、16 块 15.36TB 硬盘加四路 NDR400 网络,拿到 454.1 GiB/s 的训练读取带宽,并在十个训推场景中拿下八项第一。
为什么值得关注:过去一年半,KV Cache 卸载的收益数字都是厂商自己给的,量纲五花八门,测试条件各写各的。现在两件事同时发生——行业组织开始发"官方成绩单",国际基准开始收"标准科目"。这是采购动作的前提:一个数字只有在别人能用同样方法复现时,才具备谈价能力。更值得注意的是发证名单里出现了三星(中国)半导体——存储原厂亲自走到推理场景的评测台上,说明介质侧和系统侧已经开始联合定义测试口径,而不是各卖各的。
2. 昇腾 950 超节点正式上市:PD分离第一次变成了产品型号
第二条在 9月17-19日的华为全联接大会 2026 期间就已落定,9月19-20日随中文技术媒体的复盘稿扩散开来。在"与时代 共昇腾"昇腾 AI 人工智能产业峰会上,Atlas 950 SuperPoD 液冷超节点与 Atlas 850E 风冷超节点正式上市。昇腾从"技术验证"进入其官方口径所说的"规模化商用落地"新阶段。
先把两条产品线的硬参数摆上:
· Atlas 950 SuperPoD(液冷)——面向大规模数据中心与万亿级大模型训练、中心高并发推理,单个超节点集成 1024 卡,支持 256TB 统一内存编址,千卡 MTBF 高达 300 小时、官方称领先业界 25% 以上;依托 TB 级 NPU 互联带宽与 3 微秒超低 RTT 时延,把计算与存储资源的通信瓶颈一起打通。
· Atlas 850E(风冷)——面向传统企业机房,采用昇腾 950DT 处理器,单计算节点 8 卡提供最大 14.2 PFLOPS @mxFP4 算力,支持最大 4.0TB/s 读写带宽;通过灵衢互联设备单层组网支持 32、64、96 超节点,双层组网可扩展至 768 超节点。
而这一条真正的新闻点,在第三句话里:Atlas 850 采用昇腾 950PR 处理器,支持与 Atlas 850E 进行异构 PD分离 部署,可根据业务负载动态调整 PD 配比。叠加大规模专家并行优化后,在万亿 MoE 模型上实现 5-10ms 的极致低时延,单卡吞吐比业界风冷集群提升 2.5 倍。
把这句话翻译成采购语言就是:想搭 Prefill 池,买 Atlas 850(昇腾 950PR);想搭 Decode 池,买 Atlas 850E(昇腾 950DT);两者之间的比例,是一个可以随负载拧的旋钮。这件事本系列追了两周——9月4日彭博与观察者网报道 DeepSeek 拟部署 16 万颗昇腾 950DT 时,我们看到的还是"芯片代次上的 P/D 分工":950DT 是 144GB HiZQ 2.0 解码向,950PR 是 128GB 高带宽 Prefill 向。9月15日移动云的 AF分离 系统里,分离发生在算子层。现在,分离被写进了产品目录——PD分离 不再是调度策略,而是一张可以照着下单的型号配对表。
配套的两件事同样关键:
一是精度侧的覆盖面。昇腾打出的说法是国内唯一全流程支持 mxFP4 推理的厂商,其低精算子库与全链路量化算法覆盖 KV Cache、通信和权重量化全流程,模型精度误差小于 1%;训练侧原生支持 mxFP8,一条指令完成计算与反量化,核心算子 MFU 达 95% 以上。注意"KV Cache"在这个清单里的位置——它被和"通信""权重"并列为需要独立低精方案的三类对象之一。这在半年前还是不可想象的:KV 曾经只是一个推理引擎内部的中间张量,现在它有了自己的量化流水线。
二是软件侧把内存语义做实了。基于灵衢系统高阶服务,跨物理节点实现统一内存编址,编程模式和执行模型与单系统语义一致,超节点域内可以直接用 Load/Store 内存语义访问;基于内存语义和拓扑编排,1024 卡超大 Scale-Up 域内集合通信性能提升 1.6 倍,且包越小,内存语义相对消息传递的时延优势越明显。华为云侧则定了商用时间表:灵衢昇腾 950 智算集群服务 9月30日面向中国客户商用,11月30日面向海外市场。
为什么值得关注:PD分离 从 Paper 到产品,走了大约两年;从产品到"可下单的型号配对",只用了这一个季度。这里有个容易被忽略的细节——Atlas 850E 是风冷产品,目标是"让超节点能力走入传统企业机房"。这意味着 PD分离 不再是大厂液冷集群的专属玩法:一个没有液冷改造预算的金融或政企机房,也能按 850 加 850E 的组合,把 P 和 D 分开配。技术下沉往往比技术突破更快改变市场结构——因为它把原来"要整体换基础设施才能享受"的红利,变成了"买两台机器就能享受"。同时要注意一个仍缺失的口径:官方只给了"动态调整 PD 配比",没有给这个配比是按什么信号自动调的、调整的时间尺度是多少。这两项决定了它在真实业务里是自动化能力,还是运维负担。
3. 云栖大会前夜:阿里把 KV Cache 编成"G3.5 层",并给"128 卡"正名
第三条落在 9月20日,而且分了两个方向的信息,合起来看很有意思。
先看产品侧。国际数据公司(IDC)发布《2025 中国 AI 云存储市场份额》报告,阿里云以 35.2% 的市场份额位居中国 AI 云存储市场首位,超越第二至第四名的总和;报告还提到 2025 年上半年 AI 原生云存储收入在该市场中的占比已超过 90%,其中面向训练的高性能文件存储占据主导。阿里云自己的产品矩阵里,有两句话最值得划线:
· 推理侧:推出 KVCacheStore——官方表述为"全球首个公共云 G3.5 层 KV Cache 存储产品",它可独立于算力部署,并支持弹性扩容。
· 训练侧:9月22日云栖大会期间,阿里云将正式推出新一代全栈自研 CPFS(并行文件存储),面向下一代 AI 训练集群设计,可支撑百万卡级模型训练。
"G3.5 层"这个编号,是本条最该被记住的四个字。把最近三周的三家云厂放一起看:腾讯在 9月13日算博会上讲的是 L3.5 层的 ICMS 内存池(DDR 专用池,单 GPU 约 500GB 容量、400-800GB/s 带宽);华为在 9月17日发布的 OceanStor M900,官方定位是"全球首款 L3.5 层 PB 级 KV缓存集群";阿里这次给的是 G3.5 层。L3 是本地 SSD,L4 是云存储——三家不约而同地把 KV Cache 塞进了 L3 和 L4 之间的同一个"半层"。
这不是巧合,是数学。KV缓存的寿命长于一次请求,所以它不能当普通缓存;它对时延的要求又比常规定义下的"存储"低一个量级,所以它也不想待在 L4。两头都不像,只能额外插一层。而阿里那句"可独立于算力部署,并支持弹性扩容",比"G3.5"更狠——它把 KV池从算力的附庸,改成了可以单独买、单独扩、单独计价的资源。一旦 KV池能脱离算力部署,云厂商的售卖单元就从"多少卡时"变成了"多少卡时加多少 KV 容量",这对长上下文与 Agent 类负载的定价方式是一次结构性改动。
再看第二个方向,是市场叙事的一次校正。9月20日,一份关于超节点板块的分析把阿里的路线摆开:磐久 AL128 整机柜单柜 128 卡,核心是平头哥真武 M890 芯片,144GB 显存、片间互连 800GB/s;自研 ICN Switch 交换芯片(25.6T)把 Scale-Up 互联规模从 16 卡拉到 64 卡;灵骏真武 M890 超节点实例已在乌兰察布地域开放邀测,官方称单实例可承载十万亿参数级 MoE 大模型推理。而这份分析最有价值的不是参数,是它划的一条界线:
64 卡是把 64 颗芯片编进同一套寻址空间,等于共享一个大得多的内存池——这是超节点真正的分水岭,变的不是堆卡数量,是寻址方式。而 128 卡不是更大的基础单元,而是两个 64 卡单元通过光互联连成的集群架构,上下两个单元并不共享同一套寻址空间。
为什么值得关注:这是"内存池化"这个词被市场叙事用滥之后,第一次有人把它拉回到物理层来校正——卡数不等于池的大小,判断能不能池化只看一件事:这些卡是否共享同一套物理地址空间。把两个各 64 卡的单元用光互联连起来,得到的是更大的集群,不是更大的内存池;把 64 卡编进同一套寻址空间,得到的才是可以被当作"一台机器"来编程的对象。这条界线对做架构选型的人有直接价值:如果你要的是 KV池,买的是寻址域;如果你要的是算力总量,买的才是卡数。两件事经常被同一个数字(比如"128 卡超节点")盖住,但它们的成本和收益完全不同。顺便预告一下日程:2026 云栖大会 9月22-24日在杭州国际博览中心举行,主题"智以致用",设三大主论坛与 120 余场分论坛,技术主线是 Agentic AI 与从模型到 Agentic Cloud 的"五层全栈"。同周还有 GMIF 2026 全球存储器行业创新峰会(9月22-23日,深圳,主题"AI 存储,驱动未来")——存储侧的年度峰会与云厂大会同周撞车,通常意味着会后一两周会有一批存储分层与 KV池化的新口径集中释放。
二、论文分析
1. Shared-Prefix KV Reuse Across Standard LoRA Adapters(arXiv:2609.17109):"复用"不等于"共享"
第一篇锚内存池化,而且是池化叙事里最容易被跳过的那一层。作者是 Dushyant Rajput,9月15日提交,单作者。
场景很常见:一套共享主干模型,上面挂几个 LoRA 专家适配器,它们回答的是同一段上下文。最笨的做法是每个专家都把这段共享上下文重新 prefill 一遍。于是问题变成——对已经训练好的标准 LoRA 适配器(注意:不是为缓存兼容性重训过的那些),如果只算一次主干的 prefill KV缓存并跨专家复用,任务质量能保住多少?又能省下多少服务成本?
实验设置很克制:Qwen3-1.7B 主干加两个适配器(HotpotQA 上的抽取式问答、GSM8K 上的算术推理),扫描"专家从复用的基础缓存接管"的边界位置,测量成对的质量差异与服务成本。
结果里有三条值得抄下来:
· 全前缀复用的 prefill 成本最低,质量差异很小但不干净:在留出的 GSM8K 上,160 token 预算下 EM 差 -4.6,320 token 下 -3.0,换第二个训练种子后 -0.8——三次测量全部偏向原生,但只有第一次排除零,且幅度不一致。作者自己写得很直白:质量等价与通用的边界选择规则都没有建立。
· 部分重算没有显示出任何优势;同时报告了一个闭式解的岭回归 KV 转换器,它也没能打败直接复用;关于专家依赖性的对比,置信区间全部包含零。
· 而全篇最硬的一句话在这里:实测的服务收益落在 warm-cache 的首 Token 时延上、随上下文增长(8K 时约 16 倍)——但两个分支的峰值内存只低了 12%,而且经过审查发现,那份前缀从未被物理共享:这个实现复用了 KV 值,却复制了它们的存储,所以共享缓存本该带来的内存节省根本没有实现。
这篇论文应该被所有讲"KV池化"的人读三遍,原因是它拆开了一直被混在一起的两笔账。"复用"省的是算力——少算一次 prefill;"共享"省的是内存——同一份字节只存一次。而这两件事在实现上可以完全脱钩。只要你的代码路径是"从缓存里把 KV 读出来、放进自己的张量里",你拿到的是前者,一分钱显存都没省。这也顺带解释了一个行业现象:为什么很多"KV 共享"的方案在演示里时延很好、一到生产就发现容量账没有变化——因为它们优化的是计算路径,而宣传的是存储收益。
对本系列追踪的方向来说,这篇给了一把很实用的尺子。以后看到任何"共享 KV池"的说法,先问一句:被共享的是值,还是字节?值共享的收益上限是算力(TTFT 与吞吐),字节共享的收益上限才是容量(能挂多少并发会话)。再进一步:真正的池化,要求引用计数、写时复制、生命周期管理和一致性问题都被解决——那些才是"共享"这个词的成本所在,而它们恰恰是这篇论文没有碰到、也坦承没有解决的问题。
2. FlexEE(arXiv:2609.17008):卸载场景下,"少算几层"省的是搬运不是计算
第二篇锚 KV卸载 的另一端——不是把数据搬下去,而是少产生一点数据。作者是 Qihu Xie、Ziwei Li、Yi Kang,9月15日提交。
出发点是一个很具体的观察:大模型推理同时受计算和内存约束,而在基于卸载的部署里,权重需要在内存层级之间被搬运,这个搬运发生在自回归解码的每一步。在这个前提下,减少执行的层数不仅能降低每 token 延迟,还能避免昂贵的权重搬运——同一个动作,省了两笔账。这个动机让"早退出"(early exiting)第一次和卸载场景绑在了一起。
但要把早退出用在解码上,有三个绕不开的坎,FlexEE 对应给了三个设计:一是逐层的退出监督,让中间层预测足够可靠;二是基于 Top-K 局部词表的自投机解码,用极低成本做退出决策;三是动态隐藏状态管理,保证 KV cache 正确性与内存感知的执行。
那个"KV cache 正确性"是全篇最值得琢磨的地方。早退出的朴素实现会让 KV缓存与最终输出错位——你在第 N 层就把 token 定下来了,可 KV缓存是按完整层数写的;一旦这条记录被后续请求复用,或者被卸载到别的介质上,读回来就是一份对不上的状态。过去的早退出研究大多在单次前向的标准设定下做,所以这个假设没有被松开;而卸载场景把它松开了:你的数据布局决定了你能走多快。
结果在两个模型、两类任务上都测了:Llama2-7B 在 0% 与 50% 权重卸载下分别取得最高 1.27 倍与 3.16 倍端到端加速;Llama3-8B 分别是 1.25 倍与 2.83 倍,精度退化很小。
数字里藏着这篇论文真正的边界。看那两组对比:同样是 Llama2-7B,不卸载时加速 1.27 倍,卸载 50% 时加速 3.16 倍;Llama3-8B 是 1.25 倍对 2.83 倍。收益随卸载比例显著放大,说明这个方法赚的主要是"省搬运"的钱,而不是"省计算"的钱——在纯计算受限的环境里,它的红利本来就不大。这恰好和昨天那批账对上了:9月19日的 SemiAnalysis 实测说明,把权重卸载到 DRAM 之所以成立,是因为省下的 HBM 能让人从 TP4 换成 TP2,也就是少买一整张卡;而如果只是把数据挪到更便宜的介质上、并没有省下整卡,账就不成立。
把这篇和第一篇并起来读,会得到一个统一的判据。两篇论文表面上分别在讲"共享内存"和"少算几层",骨子里都在算同一件事:这个优化到底改变了物理资源的占用,还是只改变了执行路径?第一篇说,KV 值复用不改变存储占用;今天的 FlexEE 说,减层计算在卸载环境里才真正改变搬运量。两条合起来给出的结论是:判断一个优化是否值得投入,不看它省了多少操作,看它改变了哪一个物理量——字节数、搬运次数,还是驻留位置。改变了物理量的优化会随环境恶化而增值(卸载越深,FlexEE 收益越大);只改变执行路径的优化,会在环境一变时原地蒸发。
三、结语:三条判断
判断一:KV Cache 的评测权,从厂商手里转移到了第三方。今天这一条线上并排出现了三个信号:ODCC AI 存储实验室在 ODX 上发出新一批 KV Cache 专项测评证书,中国信通院工程师逐项解读;MLPerf Storage v3.0 把 KV Cache 测试收进正式基准,并给出跨厂商可比的数字(Everpure 1623.4 GiB/s、UBIX 443.7 GiB/s);发证名单里出现三星(中国)半导体,说明介质原厂也上了推理评测台。这件事的意义在于:过去一年半,KV 卸载的所有收益数字都是自供的——"TTFT 降 90%""吞吐翻 10 倍"满天飞,但没有一份可以说清是在什么模型、什么序列长度、什么并发、什么命中率下测的。第三方出题之后,那些缺少条件的数字会自然贬值,而带完整条件的账号会升值。对采购方来说,这比任何一次新品发布都更重要。
判断二:KV卸载 的账,正在从"介质便宜"改成"结构降本"。今天最值得反复看的一组对照,是泛联测试里那句"卸载到 UbiPower 18000 后,GDDR 显卡与 H20 的 TPS 差距越来越小,某些场景 GDDR 并发甚至更高",以及官方给出的"推理硬件采购成本可优化 30%~50%"。把它和 9月12日信通院的定性判断、9月19日 SemiAnalysis 的"只有省下整张 GPU 才算账"三条连起来读,逻辑就很清楚了:卸载的价值不在于存储比显存便宜——那个差价往往被带宽和时延吃掉;它的价值在于让一个便宜的计算配置能干出昂贵配置的活,从而改变高低配之间的采购比例。这也是为什么"缩小高低配差距"比"TTFT 降 98%"更有分量:前者是可以写进预算表的,后者只是一个体验改善。
判断三:AF分离 本周第一次被中文技术口径讲清楚了,但仍停在架构主张层。9月20日的复盘稿里有一个很好用的类比:Attention 像查字典,讲究灵活寻址和大量访存;FFN 像做算术,规则固定、吞吐为王——过去两者挤在同一块 GPU 上互相抢资源,AF分离 就是把两者拆到不同算力单元,中间靠编译器和互联协议对接。同一段分析还给了一个更准的定位:AF分离、PD分离、KV Cache 分级,其实是同一股思潮——把大模型推理这个"整体"拆成特性不同的子任务,分别匹配最合适的硬件。这个说法把三条线收成了一个框架,比单条讲各自的参数更有解释力。但界限也要说清:本系列跟踪显示,AF分离 目前在中文口径里只出现在两类场合——华为灵衢的四大特征(分层分级 Transformer 硬加速、解耦 Attention 与 FFN),以及移动云那套国产 GPU 加类脑芯片的异构混合推理系统。它还没有出现当日级的独立芯片或独立产品落地。今天这条线上唯一接近产品化的是 PD分离——它已经从调度策略变成了型号配对。AF分离 要走完同样的路,还缺一个可验证的端到端指标。
观察清单
1. ODCC KV Cache 专项测评的完整报告。官方已经预告"详细报告拆解即将上线"。要盯三个口径:TTFT 降 98% 对应的是哪个序列长度与并发配比;"GDDR 并发反超 HBM"出现在什么条件下;以及双 RDMA 路径里普通 RDMA 与 GDR 的差距有多大。这三个数决定了这套结论能不能外推到自己的业务上。
2. MLPerf Storage v3.0 的 KV Cache 基准会不会冻结口径。目前第一名(Everpure,1623.4 GiB/s,51 台主机)与标准规模提交(443~444 GiB/s)之间差了三倍多,这个差距有多少来自规模、多少来自架构,需要看提交细节。如果这套基准被云厂写进采购规格书,KV Cache 存储就会像今天的企业级 SSD 一样进入可比较市场。
3. 9月22日云栖大会:KVCacheStore 给不给容量与命中的口径。"G3.5 层"和"可独立于算力部署"都是定性表述,缺的是每 TB 对应多少 token、跨节点访问的时延分布、以及弹性扩容的时间尺度。同场要看的还有新一代 CPFS 的"可支撑百万卡级模型训练"是什么定语——是单文件系统挂载规模,还是集群可寻址总量。
4. GMIF 2026(9月22-23日,深圳)与云栖大会同周的产出交叉。存储侧年度峰会与云厂大会同周,通常是介质厂商给系统厂商供货口径的时间窗。重点看 HBF(高带宽闪存)、CXL 内存模块与高速 NAND 有没有新的量产时间表——它们是 KV池第三、第四层的成本基础。
5. Atlas 850E 的"动态 PD 配比"到底由什么驱动。官方只给了这一个短语。要问的是:按什么信号调(队列长度、TTFT 目标,还是缓存命中率)?调整的时间尺度是秒级还是分钟级?以及在传统企业机房那种没有专业推理运维的场合,这个旋钮是自动的还是要人拧。这决定了 PD分离 是真实的可交付能力,还是一份需要配套服务的半成品。
6. 9月30日与11月30日两个商用节点。灵衢昇腾 950 智算集群服务将在 9月30日面向中国客户商用、11月30日面向海外。海外时点尤其值得盯——这是国产超节点整套架构(灵衢互联 + 昇腾 950 + OceanStor M900 记忆存储)第一次给出境外可交付时间。
7. 三星(中国)半导体这类的原厂进入 ODCC KV Cache 评测之后,下一步会不会出"介质 + 系统"的联合方案。单一 SSD 或单一存储系统的评测已经做完了,真正影响架构选型的是组合方案在长上下文与高并发混合负载下的退化曲线。这也正是 MLPerf 那项 KV Cache 测试想回答的问题。
8. AF分离 的产品级证据。判据很明确:出现一个把 Attention 与 FFN 拆到两类芯片上、并给出端到端吞吐与时延对比的方案——不管是芯片、整机还是系统。在那之前,它仍然是架构主张。
免责声明:本文所涉信息均来自公开渠道,仅代表作者个人观点,不构成任何投资建议。市场有风险,决策需谨慎。