夜雨聆风学习资料网

ARTICLE · 978979

GLM-5.3 论文源码精读:DSA稀疏注意力+异步

GLM-5.3 论文源码精读:DSA稀疏注意力+异步

GLM-5.3 论文源码精读:DSA稀疏注意力+异步

智谱 GLM-5 真正厉害的,是把大模型训练成本压下来了。

这模型有7440亿参数,激活才400亿。它专门为“智能体工程”设计:模型自己规划、自己纠错,人只管验收。

DSA 砍掉九成冗余计算:它只看最相关的2048个信息。实测发现长文本里九成注意力都是多余的。这么一搞,处理128K长文只要一半GPU成本。

小改动补齐架构短板:MLA加个“按头拆分正交化”,性能直接追平GQA。多预测几轮时,三层共享一套参数。既保住了效果,又没多占显存。

异步 RL 让显卡别闲着:生成和训练分开跑,攒够一批再更新。为了对齐数据,直接用原始token流。这样连历史概率都不用记,照样稳住训练。

确定性比速度更值钱:检索时用了确定性的筛选算法。虽然慢点,但能保证输出一致。这换来的是强化学习的稳定收敛。

另外,它还适配了七家国产芯片。推理时能按需开关深度思考。说白了,GLM-5 不是单纯堆参数,而是把每个代价都算明白了。

详细内容,请戳源码:

GLM-5.3 论文源码精读:DSA稀疏注意力+异步RL

名称已清空
微信扫一扫赞赏作者
喜欢作者其它金额
作品
暂无作品
喜欢作者
其它金额
最低赞赏 ¥0
其它金额
赞赏金额
¥
最低赞赏 ¥0
1
2
3
4
5
6
7
8
9
0
.
原文GLM-5.3 论文源码精读:DSA稀疏注意力+异步RL
北京,1小时前,

相关学习资料

返回首页浏览学习资料