很多人觉得,大模型越来越厉害,是因为 GPU 越来越快。
其实,真正拖慢 AI 的,已经不是计算,而是"记忆"。
如果说过去几年 AI 拼的是"算力",那么从 2026 年开始,AI 开始进入一个新的时代:
Memory First(存储优先)时代。
而 Kimi K3 的架构创新,正是这个时代最典型的代表。

一本书,一个学生
先想象这样一个场景。
老师给学生一本100 万页的书。
学生每回答一道题,都必须重新翻一遍整本书。
是不是很慢?
传统 Transformer 就是这样工作的。
每生成一个新 Token,都要不断回头查看之前所有内容。
AI 为此会保存一份叫KV Cache的"工作笔记"。
上下文越长,这份笔记越厚。
到了几十万 Token 时,GPU 花的大部分时间,不是在思考,而是在不停翻笔记。
所以今天的大模型,真正昂贵的不是计算,而是:
搬运这些笔记。
DeepSeek MLA:把整本书压缩成一本笔记
去年 DeepSeek 提出了一个非常聪明的方法——MLA(Multi-head Latent Attention)。
它的思路很像:
学生不是保存整本教材,
而是每看完一章,
自己写一页高质量笔记。
以后需要时,再根据笔记恢复细节。
于是:
原来需要保存100本教材。
现在可能只需要保存10本笔记。
所以:
MLA 并没有改变学生学习方式。
它只是让学生的书包轻了很多。
公开资料显示,MLA 可以将 KV Cache 压缩约 90%,同时仍然保持 Full Attention 的表达能力。
KDA:干脆不保存教材了
Kimi K3 又往前走了一步。
它提出了:
KDA(Kimi Delta Attention)
这属于近年来非常热门的一条技术路线:
Linear Attention(线性注意力)。
这里最大的变化不是压缩。
而是:
不保存。
继续用学生举例。
以前:
学生一直保存完整笔记。
现在:
学生脑子里只保存几个最重要的结论。
例如:
牛顿第二定律
勾股定理
世界大战时间线
至于已经理解的过程,
可以忘掉。
因为真正需要的时候,
再推导出来。
所以 KDA 不再保存越来越大的 KV Cache。
它只维护一个不断更新的小型 Memory State。
无论读一千页,
还是一百万页,
这个"脑容量"几乎不会继续变大。
这就是 Linear Attention 最大的优势。
KDA 最聪明的一点:像人的记忆一样"会遗忘"
真正有意思的是:
KDA 不是简单地记住。
它学会了:
遗忘。
想想人的大脑。
昨天中午吃什么?
很多人已经忘了。
但是小时候第一次骑自行车,
很多人二十年后仍然记得。
为什么?
因为:
重要的信息,
保存得更久。
无关的信息,
很快消失。
KDA 做的事情几乎一样。
以前:
一个 Head 里的所有信息,
统一决定什么时候忘。
现在:
KDA 给每一个 Channel 都配了一套独立的"遗忘速度"。
有的信息,
可以保存很久。
有的信息,
几秒钟就被覆盖。
就像一个图书管理员,
每天都会清理书架。
但不是全部一起扔。
而是:
真正经典的书永久收藏。
过期杂志当天回收。
有限的空间,
装下更多真正重要的信息。
为什么 Kimi 没有完全放弃 Transformer?
很多人会问:
既然 Linear Attention 更省资源,
为什么不用到底?
原因很简单。
人的记忆其实分两种。
第一种:
每天发生的小事。
第二种:
突然把很多事情联系起来。
比如:
多年以后,
看到一张照片,
突然想起整个大学时代。
Transformer 的 Full Attention,
特别擅长这种:
全局联想。
而纯 Linear Attention,
虽然很快,
但在超长距离关联、少样本学习(Few-shot)、上下文学习(In-context Learning)等方面,通常仍略逊于 Full Attention。
所以 Kimi K3 并没有走极端。
它采用了一种混合架构:
3 层 KDA + 1 层 MLA。
大多数时间,
AI 用高效率模式工作。
每隔几层,
再进行一次全局整理。
就像:
平时整理桌面,
每个月做一次大扫除。
这样既快,
又不会忘记整体结构。
这一切真正改变的,其实是 GPU
很多人以为,
Attention 的创新只是算法升级。
其实影响最大的,
可能是硬件。
过去几年,
GPU 一直在拼:
TFLOPS(每秒计算能力)。
但越来越多工程师发现:
GPU 很多时间其实没有在计算。
它在:
等待数据从 HBM(高带宽显存)搬过来。
就像:
世界最快的厨师,
一直站在厨房。
不是不会做菜。
而是在等服务员把食材送来。
所以今天 GPU 最大瓶颈,
越来越像:
物流。
不是厨艺。
而 KDA、MLA 这类架构,本质上就是减少需要频繁搬运的数据量,让 GPU 把更多时间花在真正的计算上,而不是等待内存访问。
AI 正在进入"存储优先"时代
如果把 Attention 的发展画成一条进化路线,大致可以理解为:
Transformer:每个人都带着整套资料。
↓
GQA / MQA:大家开始共享资料。
↓
MLA:把资料压缩成精华笔记。
↓
KDA:不再保存资料,只保留不断更新的长期记忆。
↓
Kimi K3:把两种方法结合起来,需要精确检索时查笔记,需要快速思考时依赖长期记忆。
最后的思考
过去十年,AI 行业一直在追求:
让 GPU 算得更快。
而 Kimi K3 代表的方向告诉我们:
下一代 AI 更重要的问题可能是:
如何让 AI 少搬数据,多思考。
这就像人类学习一样。
真正聪明的人,
不是记住所有知识。
而是知道:
什么值得记住,什么应该忘掉。
或许,这才是下一代大模型真正开始"像人思考"的重要一步。
夜雨聆风