夜雨聆风学习资料网

ARTICLE · 1114539

Kimi K3的线性注意力:从源码看懂KDA如何更

Kimi K3的线性注意力:从源码看懂KDA如何更

Kimi K3的线性注意力:从源码看懂KDA如何更

刚顺着源码走完 Kimi K3 的线性注意力,发现它处理长文本根本不是挨个翻旧账。

每个 token 进来,先分出 Q、K、V 三个分身。它们跟附近几个邻居交换完线索,直接去翻一本固定大小的“历史笔记”。

这笔记不会原样记住所有前文。它先按一定比例把旧记忆调淡,接着用新信息去查漏补缺。算出个差值,再按强度写回去。这样相同内容就不会越写越大。

最绝的是,这套机制还顺手解决了 GPU 算不快的问题。为了让 GPU 能成块并行计算,团队给遗忘门加了道边界。单步保留比例被卡在 exp(-5) 到 1 之间。

这直接避免了连乘太小导致数字爆炸。一个小改动,既管住了模型怎么忘事,又让显卡算得飞起。

原文Kimi K3的线性注意力:从源码看懂KDA如何更新记忆
安徽,18小时前,

相关学习资料