乐于分享
好东西不私藏

AI SSD上位:KV Cache卸载进入存内计算时代

AI SSD上位:KV Cache卸载进入存内计算时代

8月8日,AI基础设施的讨论焦点出现了微妙但明确的转移:量子位与DeepTech同日发文,不约而同地把目光投向SSD——前者称"AI SSD:大模型推理的存储范式转移",后者称"当大模型开始按Token计价,SSD正在成为AI推理核心"。而在上海沙利文峰会上,忆芯科技首席科学家薛立成给出了国产厂商的答卷:把8TOPS算力直接装进SSD,让KV Cache的量化与检索在盘内完成

从"搬得快"到"自己算",从"堆GPU"到"交付Token"——KV Cache的物理归宿之争,正在进入存内计算时代。以下为今日精选的3条行业动态与2篇论文深度分析。

一、忆芯STAR2000D:国产AI SSD首度把"算力"装进盘内,KV Cache管理下沉存储侧

8月4日至5日,2026第二十届沙利文全球增长峰会(新投资大会)在上海举行。忆芯科技首席科学家薛立成博士在半导体与AI基础设施分论坛发表主题演讲,明确提出:"大模型推理中,KV Cache已成为最重、最贵、也最容易被忽视的基础资源之一"——GPU显存速度快但成本极高、容量有限,应优先留给模型权重与核心算子计算使用。

核心产品:AI SSD STAR2000D,8TOPS盘内算力

忆芯展示的存内计算型AI SSD STAR2000D搭载自研AI SSD主控芯片,在存储管理之外集成8TOPS盘内计算能力,使SSD不再是"被动数据容器",而可以直接参与KV Cache量化压缩、检索匹配等关键处理流程,并支持GPUDirect Storage/RDMA直通链路。其本质是把"数据搬到计算旁边"升级为"让计算靠近数据本身",缩短"存储—CPU—内存—GPU"的传统数据路径,降低CPU资源占用与主机内存需求。

配合超大容量KV Cache扩展型SSD STAR1516E(双主控协同、16通道并行,64TB/128TB/256TB容量规格)与PCIe 5.0高性能企业级SSD STAR1500E(14GB/s顺序读、3500K IOPS随机读),忆芯构成覆盖"盘内计算卸载、超大容量缓存承载、高性能数据访问"三层的AI SSD产品矩阵。

值得关注的原因:

这是国产主控厂商在"主控AI化"方向上的一次明确落子:SSD从KV Cache的"承载介质"升级为"近数据处理节点"。与英伟达SCADA(GPU直发存储I/O,从主机侧消灭CPU控制开销)形成绝妙互补——一个在主机侧让GPU绕开CPU,一个在设备侧让SSD自己把活干完。当"GPU+AI SSD"成为国产AI基础设施的新底座共识,KV Cache卸载的工程成本结构将被重新定价。

二、量子位×DeepTech同日定调:AI Infra正从"堆GPU"转向"交付有效Token"

8月7日,量子位《AI SSD:大模型推理的存储范式转移》与DeepTech深科技《当大模型开始按Token计价,SSD正在成为AI推理核心》同日刊发,两家头部科技媒体罕见地围绕同一判断发声:决定系统产出有效Token的因素,已不再只是GPU算力,而是模型权重、KV Cache与MoE专家能否在正确的时间到达正确的计算节点。

两个代表性信号:Mooncake与NVIDIA CMX

文章指出,月之暗面的Mooncake与英伟达的CMX构成了这一变化的两个代表:Mooncake从大规模推理软件架构出发,把集群中分散的CPU、DRAM、SSD与NIC组织为可调度的分布式KV Cache池;英伟达则在Vera Rubin基础设施中建立Pod级Flash上下文层(G3.5层)。二者尺度与实现不同,却指向同一趋势:推理状态正在成为AI基础设施中的一级资源,存储开始进入Token生成的实时主链路。

更关键的是评价体系的转变:企业购买的不再是"一块GPU",而是"系统在单位时间内交付的、满足SLO要求的有效Token"。一个Token的成本由GPU、HBM、DRAM、SSD、网络、电力与软件全链路决定——这为KV Cache分层存放(HBM热、DRAM温、SSD冷)提供了经济学上的合理性。

值得关注的原因:

媒体口径的集体转向,往往是产业共识形成的先兆。当"存储进主链路"从厂商叙事变成行业主流叙事,AI SSD、CXL内存池、近存计算这些"存储侧解法"将获得远超预期的资本与订单关注——对于超节点架构从业者,这意味着KV Cache卸载方案不再只是成本优化项,而是SLO达成的核心变量。

三、InfoQ:从GPT-2到Kimi K3,大模型正在建立一套"记忆操作系统"

8月8日,InfoQ刊发长文《从GPT-2到Kimi K3:七年规模扩大2.26万倍,大模型架构主线是在建立一套"记忆操作系统"》,系统梳理了2019至2026年间模型架构与记忆管理的演进:从KV Cache解决"生成效率",到Linear Attention探索"高效长期记忆",再到DeltaNet与Kimi Linear让模型学会"更新、遗忘与管理信息"——七年间模型规模扩大2.26万倍,而架构主线始终围绕"记忆"打转。

关键节点:KV Cache通过缓存键值避免重复计算,是Transformer长上下文推理的基础设施;MoBA(Mixture-of-Block-Attention)以块级稀疏实现95%稀疏度、百万token序列6.5倍加速;Kimi Linear线性注意力架构将KV Cache体积削减最多75%,百万token上下文解码吞吐提升6倍——Kimi K3(2.8万亿参数)正是这套"选择性记忆"体系的集大成者,其推理成本仅为Claude Fable 5的38%,请求容量提升超75%。

值得关注的原因:

这是"另一条战线"上的KV Cache战争:系统层想方设法把KV Cache搬到更远更便宜的地方(CXL/SSD),架构层则试图让KV Cache本身变得更小(稀疏/线性注意力)。两条路线并非替代而是叠加——架构压缩降低单token内存足迹,系统池化摊薄容量成本。对从业者而言,跟踪"记忆操作系统"的架构演进,等于预判未来三年KV Cache容量需求的增速曲线。

四、论文深度分析1:HeteroPanacea——"PDAF四分离"何时真正划算?

论文标题:When Does Disaggregation Pay? Simulating Prefill–Decode–Attention–FFN Specialization for Agentic LLM Inference

作者:Przemyslaw Forys, Haoran Wu, Can Xiao, Jiayi Nie, Tony Liu 等(剑桥大学等,11人)

arXiv编号:2608.03741 | 提交日期:2026年8月4日

关键词:PD分离、AF分离、异构推理、PDAF专业分工、仿真框架

PD分离已是业界标配,但一个更激进的问题浮出水面:既然Prefill与Decode计算特征不同,Attention与FFN的访存/算力特征同样迥异——为什么不把四者彻底拆开,各配一种专用硬件?这正是以英伟达Vera-Rubin(GPU)与Groq LPU(推理专用)为代表的异构平台正在发生的趋势。但"分离到哪一层划算"此前无人系统回答。

核心贡献:三维度PDAF仿真框架

论文提出HeteroPanacea仿真框架,在三个维度上系统模拟异构分离推理:① 分离粒度(Prefill/Decode/Attention/FFN四类阶段独立或组合);② 自动化设备内/设备间并行调度;③ PDAF各自的NPU架构参数(算力、带宽、容量)差异化配置。

关键发现

• 确认PD分离收益:相对传统同构服务,分离后吞吐最高提升75%

• 在自定义NPU假设下,4-way PDAF四分离(Prefill-Decode-Attention-FFN各自独立)是跨模型最一致的吞吐提升方案——即"AF分离"(Attention与FFN拆开部署)在异构硬件上被仿真验证为最优方向;

• 消融实验揭示模型架构与分离收益的量化关系:Attention密集/FFN稀疏的模型(如Agentic长上下文)从四分离中获益最大。

为什么值得关注?这是学界首次为"分离边界"给出可计算的分析框架。AF分离此前更多停留在硬件提案层面(如KARAT让PNM驻留KV Cache执行Attention计算),HeteroPanacea则从系统仿真角度证明:当Attention(带宽密集)与FFN(算力密集)各配其位,异构推理的吞吐曲线能同时被拉高。结合英伟达STX/Vera-Rubin与Groq LPU的商用推进,"PDAF四分离"正在从论文走向部署架构选型的必答题。

五、论文深度分析2:QEvict——给KV驱逐一颗"后悔药",量化降级替代永久删除

论文标题:QEvict: Recoverable Quantized KV Eviction for Attention-Drift-Robust Long-Context Decoding

作者:Ayushman Garg, Akshita Gupta, Shaswata Bhattacharya 等6人

arXiv编号:2608.05326 | 提交日期:2026年8月5日

关键词:KV Cache管理、量化驱逐、注意力漂移、分层缓存

主流KV驱逐策略基于注意力分数把"不重要"的token永久删除,但论文揭示了一个被忽视的前提错误:token与窗口的重要性会随解码过程漂移(Attention Drift)——早期被判定不重要的历史状态,可能在后续生成中重新获得大量注意力。永久驱逐等于"不可逆的错误决定"。

两个新诊断指标 + 三层管理方案

论文提出Future Missed Mass(被丢弃状态在未来获得的注意力质量)与Global LIR(历史不活跃区域的再激活程度)两个诊断指标,量化"驱逐的后悔成本";并据此设计QEvict三层KV管理:高置信窗口以全精度保留,中间窗口存入量化可恢复层,仅最低置信窗口被删除。解码过程中累计注意力实时更新窗口重要性,一旦量化窗口重新变得重要,立即反量化并提升为全精度。

实验验证

• 在长上下文理解、检索与推理基准上,QEvict一致优于代表性驱逐与量化基线

• 固定内存预算下保留更广的历史上下文,显著降低"错杀token"导致的注意力缺失。

为什么值得关注?QEvict的"量化可恢复层"在算法层面复刻了内存池化的分级管理哲学:驱逐不再是二元的"留/删",而是"全精度—量化降级—删除"的渐变光谱——这与KV Cache在HBM→DRAM→CXL→SSD间的物理分层降级完全同构。当Agent推理的注意力漂移成为常态,可恢复的驱逐策略将直接决定长上下文服务的准确率上限,也为"冷KV存放多深"的工程决策提供了理论依据。

六、总结与展望

8月8日的动态拼出一幅完整的产业图景:

存储侧:从"搬得快"到"自己算"。忆芯STAR2000D把8TOPS算力装进盘内,量子位/DeepTech把SSD请进推理主链路——AI SSD正从KV Cache的承载介质升级为近数据处理节点,"GPU+AI SSD"成为新一代基础设施共识;

架构侧:从"存得下"到"记得精"。Kimi K3的线性注意力把KV Cache削减75%,"记忆操作系统"的提法意味着模型开始主动压缩记忆——与系统层的物理池化形成双线夹击;

学术侧:从"搬数据"到"划边界"。HeteroPanacea仿真证明PDAF四分离跨模型最优(AF分离获得仿真支撑),QEvict证明驱逐可以"反悔"(量化降级替代删除)——分离的粒度与缓存的分级,都在走向精细化。

一条主线贯穿始终:KV Cache的管理正在从"容量问题"演变为"数据路径与访问效率问题"——既搬得动(GPU直连/盘内计算)、算得了(PDAF分离/存内计算)、还退得回(可恢复驱逐/量化分层)。对超节点从业者而言,接下来需要同时盯紧三条曲线:AI SSD与CXL池化硬件的量产节奏、稀疏/线性注意力的模型渗透率、以及分离架构的调度软件成熟度——三者的交汇点,就是下一代推理基础设施的成本拐点。

— END —