夜雨聆风学习资料网

ARTICLE · 1030342

三个 KV 卸载系统,谁的数字能信

三个 KV 卸载系统,谁的数字能信

三个 KV 卸载系统,谁的数字能信

大模型推理最烧钱的,已经不是算力,而是KV Cache。

超长提示、检索上下文、多轮对话前缀,每次请求都要重新 Prefill。这不仅浪费昂贵的 GPU 显存,还推高了首字时延。把 KV Cache 变成跨边界复用的持久资产,成了今年最热的方向。

但三个常被拿来比的系统——Mooncake、LM Cache、FlexKV,根本不在同一层竞争。把它们摆在一起做三选一,这个动作本身就错了。

Mooncake 是平台级重构。它重做整套 serving 架构,把 Prefill 和 Decode 物理分离,靠 RDMA 零拷贝搬运。它来自 Moonshot AI 和清华 MADSys,拿了 FAST'25 最佳论文。

LM Cache 是蹲在引擎和存储之间的记忆层。它不碰 Attention,只把 KV 变成可复用资产。源自芝加哥大学,现由 PyTorch 基金会托管。

FlexKV 是塞进引擎里的库。腾讯云 TACO 和 NVIDIA 合作,直接嵌进各大引擎,是最轻量的那一个。

一句话区分:Mooncake 要你重做平台,LM Cache 给你加记忆,FlexKV 让你几乎无感接入。

更残酷的真相是:以存换算不是免费午餐,它有一条算得清的回本线。越过回本线,收益翻几倍;越不过回本线,你搬的每一字节都在亏钱。

原文三个 KV 卸载系统,谁的数字能信
上海,5分钟前,

相关学习资料

返回首页浏览学习资料