ARTICLE · 978979
GLM-5.3 论文源码精读:DSA稀疏注意力+异步
GLM-5.3 论文源码精读:DSA稀疏注意力+异步
GLM-5.3 论文源码精读:DSA稀疏注意力+异步
智谱 GLM-5 真正厉害的,是把大模型训练成本压下来了。
这模型有7440亿参数,激活才400亿。它专门为“智能体工程”设计:模型自己规划、自己纠错,人只管验收。
DSA 砍掉九成冗余计算:它只看最相关的2048个信息。实测发现长文本里九成注意力都是多余的。这么一搞,处理128K长文只要一半GPU成本。
小改动补齐架构短板:MLA加个“按头拆分正交化”,性能直接追平GQA。多预测几轮时,三层共享一套参数。既保住了效果,又没多占显存。
异步 RL 让显卡别闲着:生成和训练分开跑,攒够一批再更新。为了对齐数据,直接用原始token流。这样连历史概率都不用记,照样稳住训练。
确定性比速度更值钱:检索时用了确定性的筛选算法。虽然慢点,但能保证输出一致。这换来的是强化学习的稳定收敛。
另外,它还适配了七家国产芯片。推理时能按需开关深度思考。说白了,GLM-5 不是单纯堆参数,而是把每个代价都算明白了。
详细内容,请戳源码:
GLM-5.3 论文源码精读:DSA稀疏注意力+异步RL
其它金额
赞赏金额
¥
最低赞赏 ¥0
1
2
3
4
5
6
7
8
9
0
.
原文GLM-5.3 论文源码精读:DSA稀疏注意力+异步RL
北京,1小时前,