◆ 棱镜聚焦 · 第 003 期

全文约 4000 字,阅读需 8 分钟
一个核心判断
在AI推理端,存储已经成为比算力更致命的瓶颈。算力不够,AI只是慢一点;存储不够,AI会开始遗忘、编造、前后矛盾,答复让人看着冒火。这种情况你在用各个大模型时可能都遇到过:前几分钟还逻辑清晰的对话,突然对方像换了一个人,或者说失忆了。
存储的重要性依然被严重低估。
01
两个“PU”,各管一摊
在聊“AI为什么会失智”之前,有必要先搞清楚大模型推理时CPU和GPU分别扮演什么角色。
CPU:运筹帷幄的“总调度”
CPU像公司里的CEO,逻辑极强能处理各种复杂任务,但一次只能专注解决几件事。在AI推理中,CPU负责理解你的意图、拆解任务步骤、调度GPU去执行矩阵运算、并整合最终结果。如果说GPU是“肌肉”,CPU就是“大脑”——它决定“做什么、按什么顺序做”。在简单对话场景中,CPU主要负责任务调度和数据搬运。但在AI Agent等复杂推理场景中,CPU还要同时处理工具调用、条件判断、循环控制、异常处理等逻辑,角色越来越重要。
GPU:成千上万个“流水线工人”
如果说CPU是一个教授——什么都会但只有2个手——那GPU就是成千上万个流水线工人。每个人只负责一种重复计算,但数量极多,能同时完成海量的并行计算。大模型的推理本质上是海量的矩阵乘法,交给GPU几千个计算核心同时开工,效率快出几十倍。
CPU解决的是“指令对不对、调度顺不顺”,GPU解决的是“算得快不快”,还有一个因素决定“记不记得住”——往下看。
02
推理存储的四层楼
我们先来看一下推理数据在AI服务器里是怎么存放的,这是一个四级分层体系——每一层都在速度、容量和成本之间做取舍。

为什么需要这么多层?因为速度、容量、成本不可兼得。数据从G1到G4逐层变慢、变便宜、容量变大。
HBM快但贵且小——HBM是整机中最昂贵的组件之一,2026年每GB HBM成本是DRAM的5-8倍。NVIDIA H100的HBM就占其制造成本的近一半,而这个占比还在上升。SSD便宜且容量大但慢,比HBM慢接近1000倍。AI推理必须在这几层之间做动态调度,把最热的数据放在最快的介质上。
HBM里放着KV Cache、模型权重和临时计算数据。模型权重是AI的“知识储备”——它决定了模型“知道”什么,模型一旦加载就常驻HBM。KV Cache就是第二层的存储“草稿纸”,随对话变长而动态线性增长。
03
KV Cache——那张被反复读写的“草稿纸”
KV Cache是什么?
大模型是逐字吐出来的。每生成一个新字,它都要“回头看”前面所有内容。如果每次都重新算一遍,速度会慢到让人想砸键盘。所以工程师发明了一个作弊技巧:把前面算好的结果缓存下来,下次直接读,不再重算。
这个缓存就叫 KV Cache。
它的效果有多夸张?在长文本场景下,KV Cache通过大幅减少重复计算,可把推理速度提升数十倍,代价是狂吃显存。
KV Cache就是大模型的“草稿纸”,必须放在HBM显存里,因为只有HBM的速度跟得上逐字生成的节奏。
KV Cache有多大
以采用GQA(分组查询注意力)的典型32B模型为例,跑100万Token上下文(约75万字,相当于3-5部长篇小说),仅KV Cache就需要吃掉约266GB显存——这还是用了GQA压缩后的数字,一张H100(80GB)根本装不下。
而且,每多聊一轮,草稿纸就厚一圈——它不会自动变薄。
04
KV Cache被清空的那一刻
当手边的草稿纸(HBM中的KV Cache)写满时,系统会把暂时不用的部分挪到抽屉(DRAM)或图书馆(SSD)。只要数据还在,下次需要时就能读回来,只是慢一点,用户能接受慢。
真正的“失忆”发生在数据被彻底驱逐的那一刻。当抽屉和图书馆都满了,系统只能把最旧的内容直接扔掉(上下文截断)。它不会通知你,也不会问你要不要保留。下次你再问起时,模型看不到那部分信息了,它只能在残缺的上下文里继续推理——于是就出现了遗忘、前后矛盾、重复提问。这就是用户感受到的“断片”。
也有其他原因会导致AI“记不住”,比如Lost in the Middle——即使显存足够,大模型对输入的开头和结尾记忆最好,对中间最差。这是注意力机制的固有特性,是模型算法解决的问题,不是硬件资源问题。本文不展开讨论。
05
为什么HBM越来越不够用
四个趋势正在把HBM需求推向极限。
趋势一:模型参数的军备竞赛。从10亿到万亿,再到10万亿,大模型的参数一路飙涨,每一代模型的权重都要吃掉更多HBM。
趋势二:上下文长度的需求增加。2023年,128K上下文是前沿。2025年,部分模型标称支持1M Token。上下文每涨10倍,KV Cache就涨10倍,而HBM容量两年才翻一番。
趋势三:AI Agent的多轮交互。Agent不是一问一答,它要自我对话、反思、查资料、调用工具。每多思考一步,草稿纸就多写十页。一次复杂任务消耗的Token可能是普通对话的数十倍甚至上百倍。
趋势四:“慢思考”的存储税。CoT(思维链)让模型“先想再说”,生成大量中间推理Token,瞬间就能把显存占满。这些中间Token的KV Cache,往往比最终答案还占空间。“慢思考”的本质,是用存储换推理质量。
四个趋势叠加,需求正在指数级增长,从大模型公司到AI服务器厂商都希望HBM更大一些能塞进更多的参数权重、配置更大的KV Cache,核心问题还是产能不够——连AI教父黄仁勋都被迫砍掉了最新的Rubin Ultra GPU的一半HBM配置。
06
两个预判,三个方向
需求的涨幅远超存储的产能增速,未来的出路在哪?
两个预判:
预判一:未来评判AI推理服务的标准会变。
不再是“每秒能吐多少Token”,而是看“在多长的对话中还能保持稳定记忆不降智”,相信行业会找到更精准的衡量方式。
预判二:存储的重要性依然被严重低估。
2026年5月,黄仁勋接受彭博社采访时说:“当前AI产业最大的制约因素根本不是GPU算力,而是存储”,原因是“GPU大部分时间都在等待数据”。
在推理端,存储瓶颈比算力瓶颈更致命——算力影响的是等待时间,存储影响的却是答案质量,前者决定你等多久,后者决定你信不信。
用户对“慢”的容忍度其实很高——等3秒和等10秒,虽然有体验差异,但不至于让人放弃,用户真正零容忍的是“错”。
算力不够:你只是多等几秒。答案是对的,只是来得慢。
存储不够:AI开始遗忘你的设定、编造不存在的信息、前后矛盾。你花了十分钟铺垫上下文,最后得到一个牛头不对马嘴的回答——前面全部白费。
用户能等,但不能接受错。
对于这些趋势,存储厂商比我们感知得更早,产业已经在三个方向开始行动。
三个方向:
方向一:SSD进入推理主链路。英伟达正在推动Inference Context Memory Storage(ICMS)架构。以前GPU读SSD要经过CPU中转,英伟达的方案让GPU直接访问SSD,绕开CPU。少了这层中转瓶颈,SSD的延迟从毫秒级降到微秒级,SSD将成为HBM的外挂辅助——“备用草稿纸”。SSD虽然慢,但胜在便宜量大。
方向二:CXL内存池化打破单机上限。新一代内存互联技术CXL允许多个服务器共享一个巨大的内存池,GPU可以直接访问池化内存中的数据。单机HBM放不下的KV Cache,可以“借邻居的草稿纸”。早期系统已经验证,这种架构能让单服务器支持的并发用户数翻倍,同时降低延迟。对于需要百万Token级别超长上下文的Agent推理,内存池化可能是避免“断片”的关键路径。
方向三:HBM的技术演进。HBM4E的量产竞赛已经启动——三星于5月率先交付12层48GB样品,带宽3.6TB/s,性能较HBM4提升超20%;SK海力士于6月跟进,引脚速率16Gbps,能效提升超20%;美光预计2027年量产。远期技术路线上,三星推zHBM架构,宣称功耗降70%、带宽升230%;SK海力士推iHBM冷却技术,热阻降30%以上,将用于HBM5;美光则首次导入EUV的1γ工艺追赶产能差距。
07
个人使用AI小技巧
三个方向是长期的产业解决方案,但用户的问题是当下的、立刻的。下面三个技巧,能帮助大家即时提高AI的使用感受,建议组合使用。
⚠️ 先记住一个关键事实:时间长了,缓存会被刷新
即使你没主动结束会话,云厂商也会定期清理不活跃的KV Cache。隔几小时再回来,之前的记忆很可能已被清除。
技巧一:阶段性的总结(适用于:上下文截断)
让AI总结当前讨论的核心要点,用要点列表或表格输出后保存。后续可以重新发给AI,帮助它回忆,在失忆严重还可以另开一个新对话,把前面的对话总结发给它。
技巧二:重要信息放开头和结尾(适用于:Lost in the Middle)
由于注意力机制的影响,大模型对输入的开头和结尾记忆最好,中间的文字未必它会一个字一个字读,就是推测个大概。在输入提示词时,要把重要指令放最开头,关键问题放最末尾,不重要的背景材料扔中间。
技巧三:长文档先问概览再追细节(适用于:上下文截断,也缓解Lost in the Middle)
长文档需要引导式沟通,先问“这篇文章的核心观点是什么”,获得概览后再追问细节,帮助AI分拆理解,而不是一上来就要求全部读完。
但说实话上面这些技巧都是“治标”,想“治本”只有两条路:
第一条:用付费版模型:免费版会被分配更少的显存资源、更短的上下文窗口,遇到截断的概率更高。付费版不一定解决所有问题,但至少把硬件的底线抬高了。
第二条:用"项目"文件夹管理长对话:越来越多的大模型设置了项目文件夹,所有对话都保存在这个文件夹中,AI在每次对话时会主动读取项目的全部上下文。它确实能解决"断片"问题,因为模型每次都能看到完整的历史记录。但代价是:每次对话都要重新读取大量历史数据,Token消耗极快,成本是普通对话的几倍甚至几十倍。
本质上都是花钱买存储。
08
百万Token上下文? 是真的吗?
各家大模型都在宣称支持百万Token上下文,听起来很厉害,那为什么还是会遇到上下文被截断、记忆丢失的情况?
原因很简单:百万Token是技术上限,不是性能保证。 就像一辆车速度表标到280km/h,不代表你该一直开280——更不代表它在280的时候还能稳稳转弯。厂商宣传的是“能塞进去”,你要的是“能记住”,这两件事并不是一回事。
那怎么知道你花的钱买到的是真百万还是数字游戏?下面这个测试你自己就能做。
“针在草堆”测试,这是业界公认的测试方法:
准备一份对应百Token的长文档(100万Token ≈ 75万汉字) 在文档的开头附近、正中间、结尾附近各插入一个独特且和文章无关的事实(比如“我最喜欢的歌手是XXX”) 提交整个文档,分别提问这三个事实(比如提问“我最喜欢的歌手是谁?”) 如果想测试的更精准,就在文档的1/4和3/4处多插入几个测试事实再提问。
结果怎么看?看AI答对了几个,答全对那大概率就是百万token上下文真的能全部覆盖,否则就不是真的100万!测一次,比看100篇评测文章都管用。
◆
写在最后
存储的重要性被严重低估——这是我们今天最重要的预判。至于什么时候该凑合用免费版大模型,什么时候值得付费,下次我来单独写一篇。
AI动态 · 产业纵深 · 硬核科普
智能棱镜窗
文|沈见微
见微以知著,观澜以明势
棱镜快讯 × 棱镜透视 × 棱镜聚焦

夜雨聆风