一、AI的变化:从聊天机器人,到长期工作的Agent
二、AI的“短期记忆”:KV Cache
Prefill:模型先把用户输入的内容完整读一遍。 Decode:模型在理解输入之后,一个Token、一个Token地生成答案。
三、为什么KV Cache会成为新瓶颈?
四、AI Memory的新架构:从GPU到SSD的分层记忆
存储层级 | 介质 | 特点 | 办公桌比喻 |
第一层:工作记忆 | GPU HBM | 存放正在运行、马上要读取的热缓存。速度最快,但容量最小、成本最高。 | 手里正在看的材料 |
第二层:短期记忆 | 主机DRAM和CXL内存 | 存放刚刚用过、可能很快再次调用的温热缓存。速度低于HBM,但容量更大。 | 桌面上的文件 |
第三层:扩展记忆 | 本地或共享NVMe SSD | 存放有复用价值、但暂时不需要立即读取的持久化缓存。容量更大、成本更低。 | 办公室文件柜 |
第四层:长期记忆 | 共享存储和对象存储 | 负责长期保存模型权重、RAG资料、推理日志、Agent记忆和冷KV Cache。 | 公司档案室 |
五、vLLM、Dynamo和NIXL分别在干什么?
vLLM:推理引擎vLLM负责真正执行模型推理,并管理推理实例内部的请求和显存。它最著名的技术是PagedAttention。传统KV Cache容易像连续停车位一样产生碎片,PagedAttention把KV Cache切分成很多小块,需要多少就分配多少,让GPU HBM得到更充分的利用。vLLM就像车间主任,主要职责是把一个推理实例或一组工作进程运行得更高效。 NVIDIA Dynamo:GPU集群总调度当GPU从几张扩大到几百张、几千张,仅靠单个推理引擎已经不够了。Dynamo负责站在整个GPU集群上观察:哪个GPU负载较低、哪个GPU已经保存了相同的KV Cache、KV Cache应该放在HBM、DRAM还是SSD。Dynamo更像推理引擎上方的集群控制层,把多台服务器协调成一个整体。如果说vLLM是车间主任,Dynamo就是整座工厂的调度中心。 NIXL:负责搬运数据NIXL不是调度中心,而是数据搬运层。上层系统决定“把这份KV Cache从SSD搬到GPU”,NIXL负责选择和调用对应的数据传输通道。它可以连接GPU HBM、CPU DRAM、本地/远程SSD等。Dynamo决定货物从哪个仓库送到哪台机器,NIXL负责选择道路、车辆并完成运输。
六、从投资角度,如何看这条主线?
VAST Data:提供大规模共享NVMe存储,让GPU集群能够直接读取数据。它更像一个大型共享仓库,目前仍是非上市公司。 Everpure (P):核心产品包括FlashBlade和Pure KVA。Pure KVA负责把KV Cache保存到FlashBlade,并进行索引、复用、生命周期管理和跨服务器共享。它更适合保存“有复用价值但不需要立刻读取”的持久化缓存。 PENG:其MemoryAI KV Cache Server使用DRAM和CXL扩展内存。相比SSD,CXL内存延迟更低;相比GPU HBM,容量更大、成本更低。它更适合保存“可能马上再次调用”的温热KV Cache。
夜雨聆风