乐于分享
好东西不私藏

AI下一场:从抢GPU,到争夺“AI记忆系统”

AI下一场:从抢GPU,到争夺“AI记忆系统”
过去两年,资本市场围绕AI反复交易的是同一件事:如何生产更多Token。
GPU负责计算,HBM负责喂数据,光模块负责连接,先进封装负责把芯片组合起来,电力和液冷保证整个“Token工厂”能够持续运转。
因此,英伟达、HBM、光通信、CoWoS和数据中心电力成为最先被市场定价的环节。
但随着AI逐渐从训练进入推理,从一次性问答走向长上下文、Deep Research、Coding Agent和数字员工,一个新的问题正在浮现:当AI模型越来越大、上下文越来越长、Agent越来越多,未来真正限制AI发展的,可能不再只是计算能力,而是“记忆管理能力”。
AI时代的下一场基础设施战争,正在从计算(Compute)转向记忆(Memory)。

一、AI的变化:从聊天机器人,到长期工作的Agent

早期的大模型更像一个“会回答问题的机器人”。用户问一句,模型回答一句。
但是未来,AI会变成真正的数字员工。例如,一个企业销售Agent每天需要阅读客户资料、回复邮件、跟踪订单、分析市场并制定方案。它不再是一次性的问答,而是连续运行数小时、数天甚至数月。
这带来一个新的问题:AI如何记住过去发生的一切?
人类依靠大脑记忆,而AI依靠 Memory。

二、AI的“短期记忆”:KV Cache

理解AI Memory,要先理解KV Cache。
大模型生成文字时,需要不断回忆之前的信息。
例如用户说“介绍一下英伟达”,模型生成“英伟达是一家……”当生成后面的文字时,需要知道前面已经说过什么。传统方式是每次重新计算,这非常浪费。于是模型会保存之前计算产生的中间状态,这就是 KV Cache。
大模型推理可以简单拆成两个阶段:
  1. Prefill:模型先把用户输入的内容完整读一遍。
  2. Decode:模型在理解输入之后,一个Token、一个Token地生成答案。
模型在Prefill过程中,会为每一层、每个Token计算出一套中间状态。这些中间状态就是KV Cache。可以把它理解为:KV Cache不是原始课本,而是模型读完课本后做出的课堂笔记。
如果这些笔记还在,下次继续讨论同一份材料时,模型可以直接接着思考。如果笔记被删除了,模型就要重新读一遍原文、重新做一遍Prefill。这不仅增加响应时间,也会重复消耗昂贵的GPU算力。

三、为什么KV Cache会成为新瓶颈?

普通聊天时代,这个问题还不算特别严重,因为对话短、任务简单,很多上下文只会使用一次。但Agent时代完全不同。
一个企业数字员工可能需要反复读取同一份公司制度、多次查询相同代码仓库、读取几万甚至几十万Token的合同,或者保存数小时甚至数天的任务状态。这就像一名员工每执行一个步骤,都要把几百页公司手册重新读一遍。
过去上下文只有几千token,现在动辄几十万甚至百万token。上下文越长,KV Cache越大。一个大型模型运行一次长任务可能产生几十GB KV Cache。当并发用户越来越多,KV Cache会快速吞噬GPU HBM。此时AI基础设施面对的不再只是“计算墙”,而是“记忆墙”。

四、AI Memory的新架构:从GPU到SSD的分层记忆

HBM速度最快,但容量有限,而且价格昂贵。不可能把所有用户、所有对话和所有Agent的KV Cache永远保存在GPU HBM中。因此,KV Cache开始像传统计算机内存一样分层:

存储层级

介质

特点

办公桌比喻

第一层:工作记忆

GPU HBM

存放正在运行、马上要读取的热缓存。速度最快,但容量最小、成本最高。

手里正在看的材料

第二层:短期记忆

主机DRAM和CXL内存

存放刚刚用过、可能很快再次调用的温热缓存。速度低于HBM,但容量更大。

桌面上的文件

第三层:扩展记忆

本地或共享NVMe SSD

存放有复用价值、但暂时不需要立即读取的持久化缓存。容量更大、成本更低。

办公室文件柜

第四层:长期记忆

共享存储和对象存储

负责长期保存模型权重、RAG资料、推理日志、Agent记忆和冷KV Cache。

公司档案室

整个过程的核心,就是把不同温度的数据放在不同成本的介质中。真正的难点不是有没有这些介质,而是系统怎么知道缓存应该放在哪里,这就进入了AI Infra的调度层。

五、vLLM、Dynamo和NIXL分别在干什么?

这三个名字经常一起出现,但它们不是同一种软件。
  1. vLLM:推理引擎vLLM负责真正执行模型推理,并管理推理实例内部的请求和显存。它最著名的技术是PagedAttention。传统KV Cache容易像连续停车位一样产生碎片,PagedAttention把KV Cache切分成很多小块,需要多少就分配多少,让GPU HBM得到更充分的利用。vLLM就像车间主任,主要职责是把一个推理实例或一组工作进程运行得更高效。
  2. NVIDIA Dynamo:GPU集群总调度当GPU从几张扩大到几百张、几千张,仅靠单个推理引擎已经不够了。Dynamo负责站在整个GPU集群上观察:哪个GPU负载较低、哪个GPU已经保存了相同的KV Cache、KV Cache应该放在HBM、DRAM还是SSD。Dynamo更像推理引擎上方的集群控制层,把多台服务器协调成一个整体。如果说vLLM是车间主任,Dynamo就是整座工厂的调度中心。
  3. NIXL:负责搬运数据NIXL不是调度中心,而是数据搬运层。上层系统决定“把这份KV Cache从SSD搬到GPU”,NIXL负责选择和调用对应的数据传输通道。它可以连接GPU HBM、CPU DRAM、本地/远程SSD等。Dynamo决定货物从哪个仓库送到哪台机器,NIXL负责选择道路、车辆并完成运输。

六、从投资角度,如何看这条主线?

如果AI进入“Memory时代”,产业链可能重新排序。在这套分层架构中,VAST、Everpure和Penguin Solutions(PENG)分别占据不同位置。
  • VAST Data:提供大规模共享NVMe存储,让GPU集群能够直接读取数据。它更像一个大型共享仓库,目前仍是非上市公司。
  • Everpure (P):核心产品包括FlashBlade和Pure KVA。Pure KVA负责把KV Cache保存到FlashBlade,并进行索引、复用、生命周期管理和跨服务器共享。它更适合保存“有复用价值但不需要立刻读取”的持久化缓存。
  • PENG:其MemoryAI KV Cache Server使用DRAM和CXL扩展内存。相比SSD,CXL内存延迟更低;相比GPU HBM,容量更大、成本更低。它更适合保存“可能马上再次调用”的温热KV Cache。
为什么Everpure市值远高于PENG?截至2026年7月底,Everpure市值约265亿美元,PENG约29亿美元。资本市场真正定价的是两家公司的整体商业质量。Everpure拥有超过14500家客户、约20亿美元订阅ARR和接近70%的综合毛利率,市场给予它的是“成熟存储平台价值+订阅收入+AI存储增量”。而PENG目前仍以传统硬件业务为主,CXL KV Cache服务器刚刚进入商业化阶段,市场给予它的是“传统硬件业务价值+CXL KV Cache看涨期权”。
推理时代会不会真正利好Everpure?答案是会。一方面,AI训练和推理仍然需要保存模型权重、训练数据、RAG文档、Agent运行日志等,这是确定的AI增量。另一方面,当长上下文、Coding Agent和数字员工普及后,越来越多KV Cache可能从HBM下沉到FlashBlade。但前提是:从SSD读取旧KV的成本要小于GPU重新计算Prefill的成本。Everpure不是跟随每一个Token受益,而是跟随“可复用上下文”增长受益。

结语:AI竞争正在从“谁算得快”,走向“谁记得住、调得好、用得起来”

过去两年,AI投资的关键词是算力。未来几年,算力仍然重要,但竞争会逐渐延伸到三个新问题:计算出来的上下文能不能保存?已经完成的计算能不能复用?生产出来的Token能不能转化为真实工作成果?
这就是从GPU、HBM、光模块,逐渐延伸到vLLM、Dynamo、NIXL、CXL、FlashBlade、Agent Harness和数字员工的底层逻辑。
对投资者来说,真正需要寻找的不是下一个热门缩写,而是:谁能抓住AI基础设施的新瓶颈,并把技术必要性转化为订单、收入、利润和现金流。这才是从“好技术”走向“好股票”必须跨过的那一步。