每日学习:第243天
播客:硅谷坐标 x Tensormesh 江鋆晨:AI 的记忆-KvCache的三层理解

你觉得AI推理最贵的是什么?输出对吧,一个字一个字往外蹦,看着就费钱。API定价表也印证了这个直觉,输出token的单价通常是输入的好几倍。
而有一个做系统的人说:你被定价表骗了。
江鋆晨是Tensormesh的创始人,芝加哥大学的副教授,清华姚班出来的。他做的事情听起来特别底层,就是管理大模型的"记忆"。模型每读一段文字,会在内部形成一个理解,这个东西就叫KV Cache,你可以把它想成模型读书时在脑子里做的笔记。读完一段,笔记就有了。以前这些笔记用完就扔了,因为模型是无状态的,处理完、输出完,记忆清空。
江鋆晨说了一个事实,按计算量算,处理一个输入token和生成一个输出token,花的算力是同一量级的。
你让AI读一本十万字的小说,和让它写一本十万字的小说,计算量差不多。但前者几秒钟就做完了,因为输入可以并行,GPU把所有文字同时吞进去。后者得一个字一个字往外蹦,占着GPU不放。服务商按"占卡时间"定价,输出占卡更久,定价就更高。这是时间成本的会计处理,跟计算成本的物理事实是两本账。
更关键的在后面。Agent能自己规划步骤、调用工具、反复跟环境交互。它每跑一轮,Memory就长一截,下一次推理全部要重新读进去。输出却不怎么增长。长期来看,输入侧的算力消耗才是结构性成本增长点。整个行业的优化注意力都在输出侧。
这个判断有意思的地方,是他在做一件很少人做的事,换坐标系。江鋆晨没在定价表里找答案,他从"每个字多少钱"切换到了"芯片到底干了多少活"。FLOPS说白了就是实际计算量。坐标系一转,整个画面全变了。
想想也简单。输出慢了,占着灶台不走,所以账单上它贵。输入并行处理,来得快去得快,显得不费事。但实际干的活是一样多的。快不等于少,慢不等于多。定价表收的是排队费,跟活大活小没关系。
他对KV Cache也做了同样的事。
KV Cache现在所有人都知道可以存起来复用。同一个问题问第二遍,直接用之前的笔记,不用重新读一遍书。这是第一层,工业界在做。省的是重复计算的GPU算力,逻辑很直白,用便宜的存储换昂贵的计算。
江鋆晨说,KV Cache不止是可以存的数据。它里面包含了模型的注意力信息,模型读这段文字时重点关注了什么、忽略了什么。你懂了这些信息,就可以压缩它、变换它、甚至在完全不同的文本上复用同一段记忆。这是第二层,学术界在做,工业界很少碰。
但真正让我停下来的,是第三层。
KV Cache的内容,可以被主动编辑。
模型输出什么,取决于两样东西。一个是模型本身的权重,你可以理解成它从训练数据里学到的所有知识和判断习惯。另一个就是它读你的输入时生成的KV Cache,也就是对你这段话的理解笔记。整个行业优化AI只有两条路,换一个更好的模型,或者换一种更好的方式提问。没人认真想过第三条路。模型不变,问题不变,改它的笔记。
但改了笔记,模型对同一个问题的关注点就变了。它可能注意到上次忽略的细节,也可能不再纠结上次过度关注的部分。输出质量会变,一行模型代码不用改,一个字提示词不用调。
他说:"能做第一层的人不懂第二层,能做第二层的人不懂第一层。能接触到KV Cache的人不懂它里面有什么,懂它的人接触不到它。"这解释了为什么一个工业界每天在碰的东西,最前沿的突破反而发生在学术界。工程师看到KV Cache,第一反应是存起来。学者看到同样的数据,问的是"这里面的语义信息是什么"。同一组数字,两套认知框架。
为什么这件事现在才变得重要?放在两三年前,没几个人聊KV Cache。那时候上下文短,你问ChatGPT一个问题,几十个字词进去,KV Cache小到不值得单独建一个系统来管。现在Agent一轮交互几百轮,共享知识库上万字起步,多模态把视频整段扔进上下文,KV Cache的体量膨胀到了不得不专门管它的地步。这跟当年大数据逼出Hadoop和Spark是同一个逻辑。数据量小的时候,手工脚本就够了,大到一定程度,基础设施就成了必需品。
这期对话里还有一个判断,放在这里刚刚好。江鋆晨说大模型的终局不是一家独大。主权AI、数据隐私、企业自托管这些硬需求,让大模型天然走向多玩家共存。
这个判断如果成立,KV Cache管理层的价值就不只是帮一家模型公司省钱了,它会变成跨模型的通用基础设施。不管上层用谁的模型,记忆都得有人管。Tensormesh赌的不是某个模型会赢,赌的是模型会多到谁也赢不了。到那一天,管记忆的人比做模型的人更不可替代。
"第三条路"做成产品意味着什么?江鋆晨给了一个很具体的画面。企业里有很多最佳实践,现在写成文档,每次AI要用的时候重新读一遍、重新理解一遍。但如果把这些最佳实践直接存成KV Cache,模型拿来就能用,不需要重新理解。相当于你把一本中文书翻译成了英文,每次有人要看就现场翻一遍;现在直接存英文版,拿来就能读。
这件事的商业账,没什么好算的。企业里凡是重复用AI读同一批文档的场景,不管是客服读产品手册、法务读合同库还是程序员读代码仓,KV Cache复用都能把推理成本砍掉一大块。省了钱,模型不用重新理解,输出一致性也高了。
什么时候这个"第三条路"会变成产品?
江鋆晨把KV Cache比作汽油。石油刚开采出来的时候,汽油是副产品,很长时间被当废料烧掉,直到内燃机出现,汽油突然成了驱动现代工业的核心动力。KV Cache现在就是那桶汽油,每次推理都在产生,每次推理后都被扔掉。"当一个公司真正把这个价值释放出来的时候,它就从废料变成了宝藏。"
"什么时候是内燃机时刻?"他笑了。"看我们公司的发展。"
夜雨聆风