ARTICLE · 1151372
KV 缓存改按会话归属,卸载第一次报出电费
2026年10月10日 · 观天下
AI SUPERNODE · KV CACHE DAILY
10月10日,本期 5 条:行业动态 3 条、论文分析 2 篇,缓存第一次有了归属单位,卸载第一次有了电费单。其一,英伟达把缓存的身份从「请求」改成「会话」——Dynamo 用一个会话 ID 串起路由、准入与缓存放置,并抛出一个由编排层声明缓存意图、由推理引擎决定怎么放的接口。其二,由 SK 海力士供芯的美国内存模组商 Penguin Solutions 把内存订单排到未来一年,季度内存营收同比增 158%,本季度起还开始卖 CXL 内存扩展卡。其三,迈威尔把 OCP 全球峰会的展台清单摆出来,CXL 内存扩展与加速被直接写成为应对「内存墙」的方案。技术侧解剖两篇:一篇让 0.6B 的小模型替 14B 的大模型做预填充、只重算三成位置就保住九成五以上精度(RaReCache);一篇把 KV 状态存进本地加密 NVMe,给卸载报出第一份电费账——加载比重算快 2.8 至 4.3 倍、GPU 能耗降 8.8 至 12.3 倍(galahad-kv)。
一、行业动态 INDUSTRY PULSE
▍1. 英伟达把缓存单位从「请求」改成「会话」
事件 10 月 8 日,PyTorch 官方博客刊出英伟达 Dynamo 的会话感知推理方案。文章先给出一组观察:智能体的流量不像聊天——一次编码会话开场就是几万 Token 的预填充,之后每一轮都把变长的上下文整段重发,还会派生出子智能体,而它的绝大部分时钟时间花在等工具返回上,其间那段 KV 缓存就闲置在显存里。问题出在服务栈这一侧:路由、准入与缓存各自只看单个请求,不知道它属于哪个会话。Dynamo 给出的答案是一个原语——会话 ID(子智能体再带一个父会话 ID);Claude Code、Codex 与 OpenCode 已经在请求头里带这类标识,自研 harness 只需补一个 X-Dynamo-Session-ID 头。在此之上长出四件东西:可离线回放(AISimulate)或在线回放(AIPerf)的会话级轨迹、会话感知的路由与准入(在工具边界施加背压,把正在等工具的会话缓存先按住而不再驱逐)、一个共享池索引器(让路由器知道外部存储里哪些 KV 还能复用),以及一个提议中的 KvHint 接口——编排层按会话声明「想保住什么」,vLLM 与 SGLang 这类引擎再决定放到哪一层内存。博客里那句总结最值得记:缓存不再是按请求算的,而是按会话算的。同日披露的还有一个推荐系统侧的对照:HSTU 工作流把可复用的注意力状态存进 FlexKV,八层模型在 RTX PRO 6000 Blackwell 上、批大小 8、GPU 缓存命中率 100% 时,时延最高降到原来的约六分之一。
值得关注 其一,「归属」第一次被做成可以传参的字段:此前几期记录的是这一层该归谁(存储厂商说归存储、DPU 厂商说归网络、推理框架说归引擎),而这条给出的答案是——先给缓存一个身份,让路由、准入与放置都能看见同一个会话;身份一确定,归属之争就变成了接口之争。其二,工具边界背压是这套方案里最有工程价值的一件:智能体大部分时间在等工具,此前的服务栈在等工具的空档照样按请求排队、照样驱逐缓存;一旦知道这个会话在等工具,就可以把它的缓存按住,等下一轮回来时直接接进一个热的工作进程。其三,KvHint 把策略与机制分开了:编排层说留什么,引擎说怎么放——这与 10 月 7 日那份把 KV Cache 外置卸载写成废标条款的招标文件是同一件事的两端,一端要可验收的接口,一端正在提议这个接口。
冷静提示 会话 ID 依赖商用 harness 恰好会带这类请求头,自研或第三方 harness 需要改代码;博客给出的是机制与回放工具,没有端到端命中率、时延或成本对比;KvHint 目前是提案而非已合入上游的能力,标识的隐私与伪造问题未展开。
◆◆◆
▍2. Penguin Solutions:内存订单排到一年后,CXL 扩展卡开始出货
事件 10 月 9 日,韩国《首尔经济日报》报道,由 SK 电信投资 2 亿美元、芯片主要来自 SK 海力士的美国内存模组商 Penguin Solutions,在 10 月 6 日的三季度财报电话会上表示,内存业务在手订单已超过季度营收,交付排期至少覆盖未来四个季度;公司称订单积压的原因是内存供给跟不上需求。三季度内存业务营收 3.41 亿美元,同比增长 158%,远高于二季度 7 月披露的 111%;公司预计 2027 财年内存业务营收再增约 50%。CEO 卡希·谢赫在电话会上说价格与出货量同时在涨,并把需求归因于一点:AI 从「回答问题」转向「按顺序连续执行多件任务」,服务器需要的内存容量一直在往上走。这条消息里还有一个容易被忽略的动作:从本季度起,公司扩大面向 AI 推理企业的 CXL 内存扩展卡业务;而两家公司的股权与技术合作正是围绕 CXL 展开——2024 年 SK 电信投资 2 亿美元,2025 年 1 月三方签署含 SK 海力士的战略协议,约定联合研发与商业化 AI 数据中心方案并共同拓展海外市场。客户结构上两种模式各占一半:一半客户自购颗粒、公司只做模组,另一半由公司从采购芯片做到组装交付。
值得关注 其一,「内存荒」第一次被一家模组厂的订单簿量化:此前几期记录的是分析师对 DRAM 与 HBM 短缺的结构性判断(10 月 6 日)与 HBM 需求向 NAND 外溢的路径(10 月 2 日),这条给的是一个可核对的商业事实——积压超过季度营收、排期至少四个季度;供给侧的紧张由此从预测变成了交期。其二,CXL 内存扩展卡开始进入模组厂的收入结构:模组厂原本的活是把颗粒焊成条子,加进 CXL 扩展卡意味着它开始卖「扩容的形态」而不只是「容量的颗粒」——此前几期记录的池化从整机柜一路下沉,这里落到了一块卡上。其三,「连续执行多件任务」是一个比「长上下文」更好用的需求口径:长上下文说的是单次请求有多长,连续执行说的是容量要一直在位、不能中途驱逐;后者恰好解释了为什么订单会排到一年后,也解释了为什么扩展卡会先出现在推理侧。
冷静提示 营收、积压与增速均来自公司财报电话会口径,未附订单金额、客户名单与交期分布;158% 与 111% 是同比增速,不代表绝对规模的行业占比;CXL 扩展卡业务只有「扩大」的定性表述,没有出货量或收入贡献数字;三方合作的实际产品化进度未披露。
◆◆◆
▍3. 迈威尔把「内存墙」写进 OCP 展台清单
事件 10 月 8 日,迈威尔(Marvell)发布新闻稿,公布其 10 月 12 至 15 日在圣何塞 OCP 全球峰会(展台 B31)的展出清单,并安排 14 场演讲。清单里与本期主题直接相关的一项是 Structera CXL 内存扩展与加速,官方在通稿中把它归为应对「内存墙」(memory wall)的方案;同台还有 Teralynx T100 102.4T 交换机、Ara DSP 1.6T 光模块、Bravera PCIe 6.0 SSD 控制器、1.6T 有源电缆与集成硬件安全模块。通稿的口径是覆盖 scale-up、scale-out 与 scale-across 三个尺度的交换、互连、内存与存储,并把客户动机写成一句很直白的话:超大规模与云数据中心希望对架构有更多选择权,按自己的性能、功耗与负载要求设计下一代 AI 基础设施。作为对照,博通同日公布参展内容,主题是十万张以上加速器的集群组网(Tomahawk 6 与 Tomahawk Ultra 交换机、Thor Ultra 800G 网卡、第三代 TH6-Davisson 共封装光学);本届 OCP 峰会的主题定为「为 AI 时代扩展创新」,门票在开幕前已经售罄。
值得关注 其一,「内存墙」从分析师的议题变成了厂商展台的主题词:10 月 9 日那期记录的是杰富瑞把内存连接列为资本开支第二条曲线,10 月 5 日记录的是 OCP 把内存墙单列专场;这条给出的是厂商自己的说法——它要展出的不是某个带宽数字,而是一个叫「内存扩展与加速」的产品门类。其二,展台清单比架构图更能说明分工:同一块展板上并排放着交换芯片、光模块、SSD 控制器与内存扩展,说明在这一层里内存不是一个独立品类,而是与交换、光一起卖的组合——这正是本期条二里模组厂开始卖 CXL 扩展卡的同一件事,只是一个从芯片侧、一个从模组侧进场。其三,「开放、标准优先」被写成客户动机:这十二个字背后是采购逻辑,要的是能按需拼装的标准件,而不是绑定一家的整机;博通那条则给同一场峰会另一个刻度——十万张以上加速器的集群组网,与超节点侧反复出现的万卡级是同一量级的两套说法。
冷静提示 展出清单与规模口径均为厂商通稿内容,Structera 的具体带宽、容量与时延参数未在通稿中给出;OCP 内存墙专场的分类口径此前已公开,本条新增的是厂商自身的产品定位与展出清单;峰会 10 月 12 日才开幕,实际演示效果与客户采用情况要到会后才能核对。
二、论文分析 PAPER REVIEW
▍4. 论文一:小模型替大模型做预填充
事件 论文:RaReCache: Bridging the Gap in Cross-Model KV Cache Reuse via Rank disagreement-based Selective Recomputation(arXiv:2610.11358,10 月 8 日提交,Sreetama Sarkar、Saptarshi Mitra、Sitao Huang、Souvik Kundu、Peter A. Beerel)。问题设定:编码类智能体与多模型系统越来越常把同一段上下文在不同模型之间转手——用户可能中途换模型,级联系统会把难题升级给更大的模型;而 KV 缓存里存的是模型自己的表示,每换一次模型,接收方通常只能把整段上下文从头预填充一遍。已有工作证明同族模型之间可以用闭式线性映射翻译 KV,但模型规模差得越远,翻译精度掉得越厉害。作者的发现是:这些翻译失败集中在少数「信息密度高」的 Token 上。据此提出 RaReCache——用一个「秩分歧」(rank disagreement)指标给每个 Token 打分,分数高的是映射后在输出方向上支撑不足的位置,只对这些位置重算。结果:在 23 倍参数差(Qwen3-0.6B 到 14B)上,只重算 30% 的位置就保住目标模型 95% 至 99% 的精度;在 8.8 倍差(Llama3-8B 到 70B)上重算 40% 保住 96.5%;预填充最高加速 3.04 倍,单卡在线服务吞吐做到目标模型自己预填充的 1.8 倍,在饱和负载下把首 Token 时延的中位数与 99 分位分别降 5.0 倍与 6.4 倍(重算预算 30%)。
值得关注 其一,它把「谁来算预填充」变成了一个可以外包的问题:此前记录的选择性重算问的是「取回来之后哪一段该重算」(10 月 9 日),这条把对象换成「由谁先算」——小模型先算一遍、大模型只补关键位置,预填充这一段算力由此可以按模型大小拆开买。其二,「规模差」是这条最有价值的变量:翻译精度随规模差扩大而下降是既有结论,而这条说明下降并不均匀、集中在少数 Token 上,于是「补算多少」变成了一次可预算的取舍——30% 换 95% 至 99%、40% 换 96.5%。其三,它给出了跨模型复用的一个中间形态:完全翻译(省算力但掉精度)与完全重算(保精度但费算力)之间,此前只有二选一,现在多了一个「翻译加补算」的比例旋钮——而这个旋钮对池化的意义在于,它让一段缓存的可用范围不再被「同一个模型」锁死。
冷静提示 结果基于两个模型族与五个基准,未覆盖 MoE 与多模态模型;「秩分歧」指标依赖校准数据,校准集与实际负载的分布差异会直接影响召回;5.0 倍与 6.4 倍的首 Token 改善为饱和负载、30% 重算预算下的口径,不适用于低并发;作者为学术团队,未附第三方复现。
◆◆◆
▍5. 论文二:卸载环节的第一份电费账
事件 论文:Real Long-Term Memory for AI: A 50-Million-Token Window That Is Faster and Cheaper Than Recompute(arXiv:2610.10845,10 月 7 日提交,Sietse Schelpe)。方案:一个开源包 galahad-kv,把每约 16,000 个 Token 的 KV 状态存进本机加密的 NVMe 硬盘,之后再按字节精确(byte-exact)取回,不重算。测试:在单张 H100 上经 vLLM 跑 Gemma 4 的 12B 与 31B 两个模型、喂 5,000 万 Token 公开文本,探测的每一个块都从加密存储里取回成功(100 个中 100 个,深度从 0 一直到 5,000 万 Token);加载一个块比重新计算快 2.8 至 4.3 倍,GPU 能耗低 8.8 至 12.3 倍,而整个 5,000 万 Token 流的过程中 GPU 显存占用保持平坦。问及埋在几百万 Token 之前的事实时,31B 模型 100 次答对 98 次,12B 模型答对 82 次,两者都没有编造答案。作者把边界也写清楚了:这是对已存状态的复用,不是把注意力窗口变宽——每次只加载一个块,答得好不好取决于模型本身;写记忆是一次性成本,而这个存储需要数 TB 本机 NVMe。
值得关注 其一,它给卸载环节报出第一份电费账:此前记录的三笔账分别是容量(10 月 9 日的每 Token 约 430KB)、时间(10 月 5 日的逐字延迟与传输时间)与寿命(10 月 8 日的写寿命),这条补上的是能耗——而 8.8 至 12.3 倍这个量级恰好是常驻型智能体最在意的口径,因为它们是长时间在线、反复复用同一段上下文的负载。其二,「显存占用保持平坦」比加速比更值得记:5,000 万 Token 的流跑完,显存曲线是一条水平线,说明这条路径把「上下文长度」与「显存占用」解耦了,而解耦正是分层能成立的前提。其三,它诚实标注的两个边界可以直接当判据用:一是每次只取一个块、并不是全窗口注意力;二是写入是一次性成本且要占用数 TB 本地盘——后者意味着这套方案的成本项从算力转到了存储与运维,与本期行业侧「内存订单排到一年后」讲的是同一件事的另一头。
冷静提示 单卡、单一模型族(Gemma 4 的 12B 与 31B)两档,未与其他卸载方案(LMCache、Mooncake、vLLM 自带换出)做同条件对比;测试协议由软件包作者自定并自报,未附第三方复现;每 5,000 万 Token 需要数 TB 本地 NVMe,未给出每 Token 存储成本与复用率的盈亏平衡点;字节精确复用的前提是模型权重不变,任何权重更新都会让已存的 KV 失效。
三、结语 TAKEAWAYS
今天五条说的其实是一件事——这一层的「身份」与「账单」同时被补齐了。其一,英伟达把缓存的身份从请求改成会话:一个会话 ID 就让路由、准入与缓存放置看见同一条智能体运行,工具边界可以按住正在等工具的缓存而不是驱逐它,编排层还能声明想保住什么、由引擎决定放到哪一层——归属之争由此从「谁拥有这一层」变成「接口长什么样」。其二,给 SK 海力士供芯的模组商把内存订单排到未来一年,三季度内存营收同比增 158%,并开始卖 CXL 内存扩展卡:供给侧第一次被订单簿量化成交期,而池化的形态落到了一块卡上。其三,迈威尔把 CXL 内存扩展与加速直接写成应对内存墙的方案摆进 OCP 展台,博通在同场给出的是十万张以上加速器的集群组网——这一层已经从技术议题变成了产品目录。其四,也是本期最该记住的两笔新账:一篇让小模型替大模型做预填充、只重算三成位置就保住九成五以上精度,预填充由此变成可以拆开买的算力;一篇把 KV 状态存进本地加密 NVMe,报出卸载的第一份电费账——加载快 2.8 至 4.3 倍、能耗低 8.8 至 12.3 倍,且显存占用全程平坦。接下来的观察清单:会话 ID 与 KvHint 能否进入上游主干、自研 harness 的改造成本多大;CXL 内存扩展卡的实际出货量与单价;OCP 会后 Structera 与 Leo 系列的量产认证时点;跨模型补算的比例能否随规模差自适应;以及「卸载省电」在真实复用率下能不能守住八倍这个量级。当缓存有了身份、内存有了交期、卸载有了电费,这一层才真正可以被写进采购合同。
四、引用信息来源 REFERENCES
1. 英伟达 Dynamo 会话感知推理:NVIDIA PyTorch 博客《Session-Aware Agentic Inference with NVIDIA Dynamo》(2026-10-08,作者 Ishan Dhanani、Jamie Li、Karen Chung;含会话 ID 与父会话 ID、X-Dynamo-Session-ID 请求头、AISimulate 离线回放与 AIPerf 在线回放、工具边界背压、共享池索引器、KvHint 接口提案);同源《Deploying an HSTU Generative Recommender with NVIDIA Dynamo-Triton》(含 FlexKV、RTX PRO 6000 Blackwell、批大小 8、100% 缓存命中下的 4.47 倍与 5.93 倍时延改善)。
2. Penguin Solutions 内存订单排至一年后:首尔经济日报(Seoul Economic Daily)《U.S. Memory Firm Backed by SK Says Orders Booked a Year Out》(2026-10-09,记者 Lee Seok-jin,含三季度内存业务营收 3.41 亿美元、同比增 158%、二季度 111%、在手订单超过季度营收且排期至少四个季度、2027 财年再增约 50%、CXL 内存扩展卡业务扩大、SK 电信 2024 年 2 亿美元投资与 2025 年 1 月含 SK 海力士的三方战略协议)。
3. 迈威尔与博通 OCP 全球峰会 2026 参展内容:Marvell《Marvell to Showcase Open AI Infrastructure Solutions at OCP Global Summit 2026》(Business Wire,2026-10-08,展台 B31、14 场演讲,含 Structera CXL 内存扩展与加速、Teralynx T100 102.4T、Ara DSP 1.6T、Bravera PCIe 6.0 SSD 控制器、集成硬件安全模块);Broadcom《Broadcom Redefines AI Infrastructure with Industry-Leading Networking Innovations at 2026 OCP Global Summit》(GlobeNewswire,2026-10-08,含 Tomahawk 6 与 Tomahawk Ultra、Jericho 4、Thor Ultra 800G、第三代 TH6-Davisson 共封装光学);Open Compute Project《2026 OCP Global Summit》(会期 2026 年 10 月 12 至 15 日、圣何塞、门票售罄、主题 Scaling Innovation for the AI Era)。
4. RaReCache:跨模型 KV 缓存复用与基于秩分歧的选择性重算:Sreetama Sarkar、Saptarshi Mitra、Sitao Huang、Souvik Kundu、Peter A. Beerel,arXiv:2610.11358(2026-10-08)。
5. Real Long-Term Memory for AI:5,000 万 Token 窗口,比重算更快也更省:Sietse Schelpe,arXiv:2610.10845(2026-10-07,含开源包 galahad-kv)。
免责声明:本文基于公开信息整理,仅供参考,不构成投资建议。
— 观天下 · 聚焦 AI Infra 与超节点