乐于分享
好东西不私藏

Kimi K3 论文源码精读:2.8T参数+KDA+896专

Kimi K3 论文源码精读:2.8T参数+KDA+896专

Kimi K3 论文源码精读:2.8T参数+KDA+896专

Kimi K3 证明,开源大模型光靠堆参数不行,得靠架构。

这个 2.8T 参数的巨无霸,把长度、深度和宽度全拉满了。它没硬算,而是靠四个新设计,把训练效率提了 2.5 倍。

长文本不卡:每四层注意力里,三层用 KDA 线性注意力。它像循环状态一样省内存,长文计算不爆炸。剩下那层管全局交流。为了防数据溢出,团队还加了数学下限。
跨层主动找信息:以前各层只能被动接收上一层的总结。现在每层自带“搜索指令”,能直接去前面任意层挑需要的信息。
近千专家稳得住:它有 896 个专家模块,每次挑 16 个干活。为了防止算力分配不均和数据失控,团队加了限幅函数。他们还用统计法自动平衡负载。
视觉从零练:它的看图模块完全从零开始训练。结果不仅训练过程更稳,测试成绩也跟主流方案打平。

目前代码和权重都已开源。不过放出来的主要是推理框架,怎么把它训练出来还是黑盒。

真正拉开差距的,往往不是大方向,而是这些死磕细节。

查看原文,超详细讲解。

名称已清空
微信扫一扫赞赏作者
喜欢作者其它金额
作品
暂无作品
喜欢作者
其它金额
最低赞赏 ¥0
其它金额
赞赏金额
¥
最低赞赏 ¥0
1
2
3
4
5
6
7
8
9
0
.
原文Kimi K3 论文源码精读:2.8T参数+KDA+896专家
北京,1小时前,