夜雨聆风学习资料网

ARTICLE · 992043

昇腾950出海埃及,KV卸载进入系统级拐点

昇腾950出海埃及,KV卸载进入系统级拐点

2026年8月30日 · 观天下

8月最后一个周末,超节点与KV Cache的内外两线都在快速推进。向外,华为昇腾950首次出海——2008颗芯片投标埃及政府AI数据中心,直接触发美国国务院召集英伟达/AMD/微软组建反制联盟,国产超节点从"国内替代"走向"全球竞标";向内,vLLM v0.19.0把CPU KV缓存卸载做成正式特性,V1引擎的多级offload子系统持续壮大,混合KV分配让Qwen3.8-27B的KV池一口气扩了3.75倍,KV卸载从"论文概念"变成"引擎默认能力"。学术侧也有两件值得注意的事:ACache把缓存复用的对象从"前缀"扩展到"词缀",给扩散式大模型(DLLM)的推理缓存问题开了一条新路;GitHub Copilot的生产级追踪则揭示了一个反直觉的事实——Agent场景下KV缓存命中率在单轮内高达90%,跨过一轮就崩塌,工具执行间隔正在重写缓存失效的规则。KV治理的战场,正在从"容量与带宽"扩展到"系统边界与时间尺度"

一、行业动态

1. 昇腾950首次出海:2008颗芯片投标埃及AI数据中心,美国急组反制联盟

彭博社8月26日报道、本周持续发酵:华为已正式向埃及政府AI数据中心项目提交投标方案,计划出口1408颗昇腾950系列芯片搭建AI训练云,另配600颗(950或上一代910B)建设两套推理集群,合计2008颗,承诺12个月内完成建设。这是昇腾芯片一年多来尝试出海后,首个公开确认的海外出口案例——此前华为在波斯湾和东南亚的接触均未成单。方案由华为与科大讯飞联合提交,102页的演示文档还包括车辆/人员识别、全国人口数据库识别系统与城市级态势感知等应用。值得注意的是,埃及自2023年起AI芯片进口就需美国许可(处于约40国管控名单之列),美国国务院得知华为投标后,迅速联系英伟达、AMD、微软,试图组建企业联盟提交反制报价。埃及方面尚未宣布中标结果。

值得关注:这一事件把超节点的竞争维度从"国内市场份额"拉到了"全球AI基础设施主权"层面。华为此次投标的核心底气,正是昇腾950超节点体系的成熟:950PR主打推理(据称性能为英伟达H20的2.87倍、价格约为其四分之一)、950DT主打训练(适配超大规模集群互联),7月WAIC上昇腾950超节点真机亮相、单柜64卡、可扩展至8192张NPU(8/15记忆)。对KV Cache赛道而言,埃及项目"训练云+两套推理集群"的组合意味着国产超节点将首次在海外提供完整的"训练-推理"服务闭环,推理侧的KV内存池化、PD分离等能力会随整机柜一起出海。更深一层:美国这次不是制裁而是"组队抢单",从卡脖子到被截胡,攻守之势在变——当国产芯片+国产存储+国产工程能力能搭起完整的算力基础设施时,KV缓存这类"系统级能力"就成了出口竞争力的组成部分。机构预测2026年华为昇腾将占中国AI加速芯片市场约62%份额(英伟达在华份额从95%+降至约8%),出海则是这条曲线的第二增长极。

2. vLLM v0.19.0正式上线CPU KV缓存卸载:KV池3.75倍、Decode提速43%

vLLM v0.19.0本周发布,核心卖点是"CPU KV缓存卸载"与HuggingFace v5适配。它把KV卸载做成了三层设计:① 零拷贝内存池——初始化时预分配pinned memory锁页内存(默认GPU显存的20%,由--kv-cache-cpu-offload-size控制),通过CUDAGraph与GPU显存建立DMA通道,绕开传统CPU-GPU搬运的PCIe带宽瓶颈;② 智能换入换出——采用LRU-K算法(K=2),当GPU显存使用率超过阈值(默认85%)时,不仅看最近访问时间,还统计过去10个step的访问频次,高频token标记为sticky优先保留,低频文本token优先换出;③ 异步流水线——卸载操作由独立KVOffloadWorker线程处理,不阻塞推理主循环。多模态场景还引入KVCachePriority:视觉token的KV默认LOW,显存不足时优先把视觉token的KV块换到CPU、保留文本KV在GPU——实测LLaVA-1.6(ViT-L,1024×768图+50字提示)在A100 40GB上峰值显存从38.2GB降至31.5GB(-17.5%)。与此同时,V1引擎的多级KV卸载子系统(vllm/v1/kv_offload/,40+文件)持续演进:冷KV块不是"驱逐"而是"异步offload",配合lookup()/加载协议在调度器侧管理,目标直指"前缀缓存命中率"这个成本杠杆。

值得关注:另一个被实测点破的细节:开发者Colin McNamara对比vLLM 0.19.1与0.26.0跑Qwen3.8-27B发现,KV池从419,200 token扩大到1,574,379 token(3.75倍),Decode吞吐从112提升到160 tok/s(+43%),而Prefill几乎不变——原因是Qwen3.8-27B的64层里只有16层是full attention,其余48层是Gated DeltaNet线性注意力(固定大小循环状态,KV不随序列增长),vLLM 0.19.1却给全部64层都预留了逐token KV,直到0.21.0的"Model Runner V2"(混合KV分配)才纠正。这给KV池化的选型提了个醒:引擎对"哪些层真正需要KV"的认知,直接决定KV池的有效容量——混合注意力架构(DeepSeek CSA/HCA、Kimi/KDA、Qwen/Gated DeltaNet,8/29记忆里"3:1混合结构"已成趋势)正在让"KV预算分配"变成模型感知的精细活。vLLM把CPU卸载做成默认能力,意味着KV Cache卸载从"存储厂商的专利方案"变成了"开源引擎的内置选项",对国产GPU生态(vLLM-Ascend等)同样是直接利好。

3. AI Infra Summit 2026倒计时:CXL内存池化进入"部署态"叙事

9月15-17日,圣克拉拉AI Infra Summit 2026开幕在即(约8000名参会者、400位演讲者、250家伙伴)。CXL联盟此前已预告设展(Booth 213)并带来三家成员的内存池化演示:Liqid软件定义内存池(最高160TB DDR5可寻址内存池,机架内免重启动态认领/共享/释放,明确面向KV Cache卸载与长上下文推理);Primemas PMA16 CXL Type-3扩展卡(16个DDR5 RDIMM槽位、最高8TB容量、Falcon-1控制器双CXL 3.2链路64GB/s,带企业级RAS与安全特性,作为JBOM机架级内存积木);VIAVI+澜起科技联合演示(CXL RC Exerciser经澜起PCIe Gen6 Retimer连接CXL 3.2控制器端点)。此外,Primemas与美光的"Abaco项目"(为美国太平洋西北国家实验室打造100TB级CXL共享内存系统)与SLiM无交换机池化内存(1U系统专为KV密集型AI推理设计)也在持续预热。

值得关注:这是8/29记忆里CXL联盟预告的延续,但"部署态"信号更清晰了:Liqid把"零搁浅容量"(zero stranded capacity)当卖点、Primemas把Type-3扩展做到8TB级、SLiM专门为KV Cache推理设计,说明CXL内存池的产品定义已经从"通用扩容"收敛到"AI推理KV载体"。Yole的数据仍很冷静:2025年Q1出货的服务器约三分之二支持CXL,但实际使用率接近零,预计2030年才到13%——不过Meta的MemServers(CXL DDR4回收池,分布式缓存平均时延降29%、任务失败降33%)已经证明规模效应成立(8/14记忆里Vistara ASIC复盘)。对国产阵营的启示依旧:澜起连续出现在CXL联盟官方验证链路里(8/16记忆里MXC导入三星/SK海力士,今日Retimer+控制器演示),国产CXL芯片在"生态验证"环节的卡位正在加深,这决定了国产超节点内存池化底座能否跟上全球节奏。

二、论文分析

论文1:ACache——扩散LLM的"词缀缓存":重算20%锚点Token换55.7%时延降(arXiv:2608.26140,8/28提交,KAUST/港中文/LUMS)

事件:8月28日arXiv上线ACache,面向扩散式大语言模型(DLLM)的缓存复用问题。背景:DLLM采用非自回归解码(迭代去噪、并行生成),双向注意力让"共享上下文的KV状态"与"正在生成的token"耦合在一起——自回归模型那套"前缀缓存复用"在DLLM里直接失效:naive缓存复用是脏的,全量重算又太贵。ACache的思路是把复用对象从前缀扩展到词缀(affix,即任意共享文本段,含后缀/中缀):通过测量各token对masked生成token的影响,识别一小撮请求特定的"锚点Token"(Anchor Tokens),只重算这约20%关键token的KV状态,其余词缀缓存原样复用。基于Fast-dLLM,ACache在多种设置下仅重算约20%词缀token就恢复了直接复用造成的精度损失;在Nano-vLLM引擎上搭的共享前缀原型里,重算时延最高降55.7%、端到端吞吐提升1.68倍

值得关注:这篇论文的价值不在DLLM本身,而在于它定义了一个新的缓存复用维度。过去一年KV复用的技术树几乎全在自回归范式内生长(前缀缓存、块级复用、内容哈希,8/25记忆里KVBoost、8/26记忆里CacheRoute),而ACache证明"哪些token值得重算、哪些可以复用"的判断可以独立于解码范式——锚点Token的选择基于"对生成的影响"而非位置或注意力,这与8/28记忆里TwinKV"注意力分数≠因果贡献"的结论形成呼应:KV治理正在从"按热度/按位置"走向"按因果/按影响"。对超节点的启示是长远的:如果扩散式LLM(或混合式解码)进入生产,现有的前缀缓存基础设施(LMCache/Mooncake/存储池)需要抽象出"任意共享段复用"的接口,锚点重算策略则提供了一条与卸载/压缩互补的路径——不搬数据、不压数据,只重算关键少数。局限:DLLM推理的规模化部署仍在早期,ACache的价值有待生产环境检验。

论文2:Agentic Coding in the Wild——GitHub Copilot生产追踪:KV命中率单轮90%、跨轮崩塌(arXiv:2608.00101,Microsoft Azure Research,本周被重新解读)

事件:微软Azure Research的论文对生产规模的GitHub Copilot智能体编码轨迹做了特征分析(8月4日提交,本周8/29被社区重新解读)。核心发现直击KV缓存的工程假设:Agent编码会话中,KV缓存命中率在单个回合内能保持约90%,但跨过回合边界、上下文压缩或模型切换之后,命中率断崖式崩塌——因为编码Agent每次工具执行都会改变对话状态,工具输出不断使旧缓存失效。同时,开发者Agent的工作负载呈长尾分布:快速程序化执行与长达数分钟的用户空闲交替出现,按"聊天服务"假设做的持续GPU驻留分配,在空闲期大量浪费算力。论文还发现一个反直觉的失败模式:深度智能体搜索的最大失败份额(41.8%)发生在规划器与子Agent的交接处,且多为"流畅自信但错误"的静默失败——检索比深度搜索在可索引仓库的只读问题上更便宜、更可靠

值得关注:这篇论文给"Agent经济即缓存经济"(8/29记忆里SemiAnalysis:Claude Code请求95%为缓存读取、账单省84%)提供了生产侧的铁证,也划出了边界:缓存命中率的上限不是容量,而是失效频率——工具执行间隔正在重写缓存的生命周期。对KV池化系统的直接启示有三:① 缓存池必须按"回合/工具调用边界"管理状态,而不是按时间窗口;② 空闲期要有主动的资源回收机制(呼应vLLM的异步offload与弹性调度);③ 上下文压缩与模型切换是隐藏的缓存杀手,前缀缓存设计要预留"重算感知"的失效路径。这与8/28记忆里BSR"能存下≠能恢复"、8/26记忆里CacheRoute"前缀亲和路由"共同指向一个结论:当负载从聊天转向Agent,KV缓存的价值衡量单位必须从"命中率"升级为"每成功任务的有效token成本"——超节点的KV池,要按Agent工作流的节奏来设计。

三、结语

今天的信息串起来看,超节点的KV治理正出现两条清晰的扩张线:空间上向外——昇腾950携2008颗芯片出海埃及,KV内存池化、PD分离等系统级能力随整机柜走向全球竞标(美国从制裁到组队抢单);时间上向内——vLLM把CPU卸载做成引擎默认能力(KV池3.75倍、Decode+43%),而Copilot的生产追踪提醒我们缓存命中的真正敌人是"回合边界"和"工具执行间隔",ACache则把复用的判断标准从"位置"推向"因果影响"。内存池化的下一站,不再只是把池子挖得更大、把卸载做得更快,而是要让整个KV生命周期(驻留、卸载、失效、重算)对齐真实工作负载的节奏——系统边界的扩张与时间尺度的精细,正在同时发生。

免责声明:本文基于公开信息整理,仅供参考,不构成投资建议。

相关学习资料

返回首页浏览学习资料