第一章:KV Cache到底是什么?为什么它是瓶颈?
1.1 一个直觉类比
1.2 具体有多大?
模型 | 每Token的KV Cache | 100K Token对话的总KV Cache | 对比GPU显存 |
LLaMA3-70B (GQA) | 330KB | ~33GB | H100: 80GB |
LLaMA3-70B (Batch=512) | — | 512GB(超过权重的4倍) | 远超单卡 |
DeepSeek R1 (标准MHA) | 4MB | 400GB | 需5张H100 |
DeepSeek R1 (MLA) | 70KB | 7GB | 轻松放入 |
1.3 真正的瓶颈:不是算力,是"搬运速度"
1.4 "队头阻塞":一个长请求拖垮所有人
第二章:架构级解决方案——从根本上缩小KV Cache
2.1 进化谱系:MHA → MQA → GQA → MLA → 跨层共享
架构 | 原理 | 每Token KV Cache | 压缩倍数 | 代表模型 |
MHA(多头注意力) | 每个头独立存储KV | 4MB | 1x(基准) | GPT-3 |
MQA(多查询注意力) | 所有头共享1个KV | 31KB | 128x | 早期Google |
GQA(分组查询注意力) | 每组共享1个KV | 330-500KB | 8x | LLaMA 3 |
MLA(多头潜在注意力) | 投影到潜在空间 | 70KB | 57x | DeepSeek V2/R1 |
跨层共享 | 不同层复用同一KV | 节省~50% | 在GQA基础上再减半 | Gemma 4 |
2.2 DeepSeek MLA:57倍压缩是怎么做到的?
2.3 Gemma 4的跨层共享:更进一步
2.4 这对投资意味着什么?
第三章:系统级解决方案——当架构压缩不够时
3.1 PagedAttention:操作系统思维的回归
3.2 分离式推理:让专业的人做专业的事
阶段 | 特性 | 瓶颈 | 类比 |
Prefill(预填充) | 处理用户输入,生成KV Cache | 计算密集(需要大量FLOPS) | 厨师备菜(大量切配工作) |
Decode(解码) | 逐Token生成回复 | 内存密集(需要反复读KV Cache) | 厨师出菜(一盘一盘端出来) |
3.3 多级缓存卸载:HBM → DRAM → SSD → 远程存储
3.4 FlashAttention:用计算换IO的反直觉策略
3.5 StreamingLLM:无限上下文的巧妙hack
第四章:NVIDIA CMX生态——推理基础设施的"操作系统"
4.1 完整架构栈
4.2 CMX vs CXL:两条路线的竞争
维度 | NVIDIA CMX | CXL内存池 |
本质 | NVIDIA专有的"推理内存层" | 开放的行业互连标准 |
控制者 | NVIDIA(闭源DPU固件) | 行业联盟(开放标准) |
延迟 | ~1-10μs(通过RDMA/GDS) | ~200-300ns(接近本地DRAM) |
部署现状 | 已有生产部署 | 大规模部署预计2027-2028年 |
生态锁定 | 强(绑定NVIDIA硬件) | 弱(多厂商兼容) |
类比 | NVIDIA的"专属物流车队" | 城市的"公共高速公路" |
4.3 Google的另一条路:开源+自研
第五章:KV Cache的"反直觉经济学"——用的人越多越便宜
5.1 缓存命中的经济学
服务商 | 正常输入价格 | 缓存命中价格 | 折扣 |
OpenAI GPT-4o | $1.25/1M tokens | $0.125/1M tokens | 10倍 |
Anthropic Claude | $3.00/1M tokens | $0.30/1M tokens | 10倍 |
5.2 "双重飞轮":算力降价 + 缓存命中
5.3 编程场景:缓存命中率最高的"杀手应用"
5.4 网络效应的精确归属
5.5 对AI Agent/SaaS的终极影响
5.6 缓存命中比想象中难
5.7 KV Cache是"动态的、不可预测的"
5.8 压缩技术在快速进步
第六章:产业链七层拆解与投资机会
6.1 产业链全景图
6.2 各层详细分析
第1层:推理API服务——网络效应的唯一归属地
第2层:推理路由与调度——缓存命中率的"放大器"
第3层:推理引擎与缓存管理——开源的"无主之地"
第4层:高速传输与互连——确定性最强的"高速公路"
第5层:CXL内存扩展——填补"性能断崖"的关键层
第6层:存储基础设施——PB级KV Cache的"大仓库"
第7层:内存与芯片——物理层的"终极约束"
第七章:投资框架与策略
7.1 三维度评估框架
维度 | 最强标的 | 逻辑 |
网络效应最强 | Google (GOOG) / OpenAI(未上市) | 最大推理规模→最强缓存飞轮 |
信息不对称最大 | PENG / Cloudflare (NET) / Tensormesh | 市场尚未price in KV Cache价值 |
确定性最高 | NVIDIA (NVDA) / Broadcom (AVGO) | "无论谁赢都收税"的垄断地位 |
夜雨聆风