乐于分享
好东西不私藏

AI 正在发生一场"内存革命":Kimi K3 为什么可能改变整个 GPU 行业?

AI 正在发生一场"内存革命":Kimi K3 为什么可能改变整个 GPU 行业?

很多人觉得,大模型越来越厉害,是因为 GPU 越来越快。

其实,真正拖慢 AI 的,已经不是计算,而是"记忆"。

如果说过去几年 AI 拼的是"算力",那么从 2026 年开始,AI 开始进入一个新的时代:

Memory First(存储优先)时代。

而 Kimi K3 的架构创新,正是这个时代最典型的代表。


一本书,一个学生

先想象这样一个场景。

老师给学生一本100 万页的书。

学生每回答一道题,都必须重新翻一遍整本书。

是不是很慢?

传统 Transformer 就是这样工作的。

每生成一个新 Token,都要不断回头查看之前所有内容。

AI 为此会保存一份叫KV Cache的"工作笔记"。

上下文越长,这份笔记越厚。

到了几十万 Token 时,GPU 花的大部分时间,不是在思考,而是在不停翻笔记。

所以今天的大模型,真正昂贵的不是计算,而是:

搬运这些笔记。


DeepSeek MLA:把整本书压缩成一本笔记

去年 DeepSeek 提出了一个非常聪明的方法——MLA(Multi-head Latent Attention)。

它的思路很像:

学生不是保存整本教材,

而是每看完一章,

自己写一页高质量笔记。

以后需要时,再根据笔记恢复细节。

于是:

原来需要保存100本教材。

现在可能只需要保存10本笔记。

所以:

MLA 并没有改变学生学习方式。

它只是让学生的书包轻了很多。

公开资料显示,MLA 可以将 KV Cache 压缩约 90%,同时仍然保持 Full Attention 的表达能力。


KDA:干脆不保存教材了

Kimi K3 又往前走了一步。

它提出了:

KDA(Kimi Delta Attention)

这属于近年来非常热门的一条技术路线:

Linear Attention(线性注意力)。

这里最大的变化不是压缩。

而是:

不保存。

继续用学生举例。

以前:

学生一直保存完整笔记。

现在:

学生脑子里只保存几个最重要的结论。

例如:

牛顿第二定律

勾股定理

世界大战时间线

至于已经理解的过程,

可以忘掉。

因为真正需要的时候,

再推导出来。

所以 KDA 不再保存越来越大的 KV Cache。

它只维护一个不断更新的小型 Memory State。

无论读一千页,

还是一百万页,

这个"脑容量"几乎不会继续变大。

这就是 Linear Attention 最大的优势。


KDA 最聪明的一点:像人的记忆一样"会遗忘"

真正有意思的是:

KDA 不是简单地记住。

它学会了:

遗忘。

想想人的大脑。

昨天中午吃什么?

很多人已经忘了。

但是小时候第一次骑自行车,

很多人二十年后仍然记得。

为什么?

因为:

重要的信息,

保存得更久。

无关的信息,

很快消失。

KDA 做的事情几乎一样。

以前:

一个 Head 里的所有信息,

统一决定什么时候忘。

现在:

KDA 给每一个 Channel 都配了一套独立的"遗忘速度"。

有的信息,

可以保存很久。

有的信息,

几秒钟就被覆盖。

就像一个图书管理员,

每天都会清理书架。

但不是全部一起扔。

而是:

真正经典的书永久收藏。

过期杂志当天回收。

有限的空间,

装下更多真正重要的信息。


为什么 Kimi 没有完全放弃 Transformer?

很多人会问:

既然 Linear Attention 更省资源,

为什么不用到底?

原因很简单。

人的记忆其实分两种。

第一种:

每天发生的小事。

第二种:

突然把很多事情联系起来。

比如:

多年以后,

看到一张照片,

突然想起整个大学时代。

Transformer 的 Full Attention,

特别擅长这种:

全局联想。

而纯 Linear Attention,

虽然很快,

但在超长距离关联、少样本学习(Few-shot)、上下文学习(In-context Learning)等方面,通常仍略逊于 Full Attention。

所以 Kimi K3 并没有走极端。

它采用了一种混合架构:

3 层 KDA + 1 层 MLA。

大多数时间,

AI 用高效率模式工作。

每隔几层,

再进行一次全局整理。

就像:

平时整理桌面,

每个月做一次大扫除。

这样既快,

又不会忘记整体结构。


这一切真正改变的,其实是 GPU

很多人以为,

Attention 的创新只是算法升级。

其实影响最大的,

可能是硬件。

过去几年,

GPU 一直在拼:

TFLOPS(每秒计算能力)。

但越来越多工程师发现:

GPU 很多时间其实没有在计算。

它在:

等待数据从 HBM(高带宽显存)搬过来。

就像:

世界最快的厨师,

一直站在厨房。

不是不会做菜。

而是在等服务员把食材送来。

所以今天 GPU 最大瓶颈,

越来越像:

物流。

不是厨艺。

而 KDA、MLA 这类架构,本质上就是减少需要频繁搬运的数据量,让 GPU 把更多时间花在真正的计算上,而不是等待内存访问。


AI 正在进入"存储优先"时代

如果把 Attention 的发展画成一条进化路线,大致可以理解为:

Transformer:每个人都带着整套资料。

GQA / MQA:大家开始共享资料。

MLA:把资料压缩成精华笔记。

KDA:不再保存资料,只保留不断更新的长期记忆。

Kimi K3:把两种方法结合起来,需要精确检索时查笔记,需要快速思考时依赖长期记忆。


最后的思考

过去十年,AI 行业一直在追求:

让 GPU 算得更快。

而 Kimi K3 代表的方向告诉我们:

下一代 AI 更重要的问题可能是:

如何让 AI 少搬数据,多思考。

这就像人类学习一样。

真正聪明的人,

不是记住所有知识。

而是知道:

什么值得记住,什么应该忘掉。

或许,这才是下一代大模型真正开始"像人思考"的重要一步。