只用了一个月。
6月,清华教授唐杰参与创立的智谱(Z.ai),把 GLM-5.2 推上 Artificial Analysis 开源权重模型第一:51分、百万上下文、MIT许可证,权重直接开放
7月,唐杰曾经的学生、月之暗面创始人杨植麟,带着 2.8万亿参数的Kimi K3 杀了回来:57分,一度冲进全球总榜前三,与GPT-5.5、Claude Opus 4.8进入同一档位
榜单上,两根柱子一前一后。
榜单背后,却是中国AI圈极具戏剧性的一幕:老师刚刚登顶,学生随即超车
但先按住欢呼。这里有一道非常关键的时间差:GLM-5.2已经是可下载的开放权重模型;Kimi K3发布时仍主要通过产品和API使用,官方承诺在7月27日前开放权重
所以,准确的说法是:K3已经在能力分数上完成反超;等权重真正落地,它才会正式接过“开源权重第一”的位置
AI世界的王座,竟然已经开始按“周”计时
一个月,开源第一两次易主
6月中旬,Z.ai宣布开放GLM-5.2权重
这次更新远比“把模型扔到网上”更扎实GLM-5.2支持 100万token上下文,主攻长程编程、软件工程与智能体任务,并采用限制较少的 MIT许可证
在Artificial Analysis Intelligence Index上,它拿到 51分,与Claude Opus 4.8进入相近档位,成为当时得分最高的开放权重模型
在更垂直的竞技场里,它也打得凶猛:Code Arena前端代码盲测全球第二、DesignArena第一、FrontierSWE整体第三



▲ 唐杰宣布GLM-5.2取得AA指数51分,并在多个编程与设计榜单进入前列
关键在于,GLM-5.2的权重已经摆上Hugging Face,开发者可以下载、部署和修改

▲ GLM-5.2模型页标注MIT许可证,支持Transformers、vLLM、SGLang等部署方式
然而,仅仅约一个月后,Kimi K3来了
57分。
相比GLM-5.2,整整高出 6分。在前沿模型已经进入贴身肉搏的今天,这次跳跃足以改变榜单排序


▲ Artificial Analysis称,Kimi K3权重开放后将成为领先的开放权重模型
榜单背后,竟是一对清华师徒
冷冰冰的评测图,因为一段学术关系,突然有了故事
杨植麟本科时期曾在清华跟随唐杰从事科研之后,他赴卡内基梅隆大学攻读博士,导师是著名机器学习学者 Russ Salakhutdinov;再后来,他回国创办月之暗面,做出了Kimi
唐杰则从清华相关研究团队出发,参与创立智谱,推动GLM路线一路走向产业化
两人的交集远超传闻里的“上过课”和“认识”公开材料显示,杨植麟后来仍与唐杰在 GLM、P-Tuning v2、FewNLU 等研究中存在共同署名这些论文勾勒出一条真实可见的技术谱系


▲ Artificial Analysis联合创始人George Cameron转述:杨植麟赴CMU前曾在清华跟随唐杰学习
社交网络很快用一个词概括这段关系:leapfrogging,互相赶超
老师一方先把开放模型推上高位;学生一方再用更大的模型、更激进的架构,把分数线继续向上抬
甚至有人继续往上追溯:Salakhutdinov曾师从“深度学习教父”Geoffrey Hinton于是,Kimi K3背后被拼出了一条有趣的学术链条:
Hinton,Salakhutdinov,杨植麟;另一侧,则是唐杰,杨植麟,Kimi。
这场较量牵连着同一片学术土壤里长出的两棵树,如今它们在产业森林的最高处相遇
2.8万亿参数,究竟是什么概念?
看核心数字:
| 2.8万亿 | ||
| 51 | 57 | |
K3采用的是极稀疏 MoE,混合专家架构
可以把它想成一座拥有 896位专家 的超级研究院,每遇到一个问题,只会激活其中约 16位
因此,模型可以拥有2.8万亿参数的庞大知识容量,却不必在每次推理时把全部参数都跑一遍
K3还加入了 Kimi Delta Attention官方称,在百万上下文解码时,最高可实现约 6.3倍加速;另一项Attention Residuals技术,则试图用不足2%的额外成本,换取约25%的训练效率提升

▲ Kimi K3官方博客展示其架构、百万上下文与长程编程评测
而“100万token上下文”,可以把它想象成一张突然被铺大了几十倍的办公桌
过去,模型只能摊开几页文件;现在,它可以同时读代码库、研究论文、终端记录和长达数百轮的工具调用轨迹这正是长程Agent能够连续工作数小时,甚至更久的基础
57分很猛,价格同样锋利
单看智力,K3尚未击败所有闭源旗舰
根据Artificial Analysis当时的结果,它仍落后于Fable 5、GPT-5.6 Sol等顶配模型但在 “能力,成本”平面 上,它的位置极具攻击性
K3完成一项AA Intelligence Index任务,平均成本约 0.94美元;GPT-5.6 Sol约为1.04美元,Claude Opus 4.8则约为1.80美元
也就是说,K3用接近顶级闭源模型的能力,把部分任务成本压到了Opus 4.8的一半左右
其API标价约为每百万输入token 3美元、输出token 15美元,缓存命中输入低至0.30美元
不过,GLM-5.2依然有自己的锋利位置:它的综合分低一些,但AA单任务成本约0.32美元,而且权重已经开放
这正是两种不同的商业武器:
- GLM-5.2:
更便宜、已开放、可私有化部署; - Kimi K3:
更强、更大,试图把开放模型的能力上限直接推到闭源旗舰腹地。
一个守住可部署性,一个猛攻能力天花板
别误会:“开源第一”不等于你的电脑能跑
这里必须泼一盆冷水。
开放权重,不等于低门槛。
GLM-5.2约0.75万亿参数,普通消费级显卡很难轻松承载;Kimi K3更达到2.8万亿参数,需要大规模集群、专家并行和高性能互联
所以,开放至少有三层含义:
- 权重能否真正下载;
- 许可证是否允许修改、商用与再分发;
- 现实中有没有足够算力把它跑起来。
GLM-5.2在前两项上已经交卷,采用宽松的MIT许可证
因此,K3的“开源第一”当时仍带着一个明确条件:权重按计划发布,并以可用许可证和推理栈完成交付
战场正在转向“替你干活”
这轮较量的重心已经移到 长程Agent,两家公司都在集中火力攻克连续多步的复杂任务
Kimi展示了24小时内核优化、类Triton编译器、芯片设计、科研复现与产业研究报告等任务;GLM-5.2强调FrontierSWE、SWE-Marathon和百万上下文中的长程交付
大模型竞争正在换挡:
模型既要会回答,也要能连续工作。
模型会读仓库、开终端、调试、修改、再测试;面对研究任务,它还要检索资料、建立假设、运行工具,最后交付结果
榜单只是探照灯。竞争落到 Kimi Work、Kimi Code、智谱Coding Plan、API和企业私有化部署,谁能进入程序员、研究员和公司的日常工作流,谁才可能把一次榜单胜利变成收入与生态
第一名的王朝越来越短
这场师徒“交棒”最刺激的地方,是第一名正在迅速贬值
Artificial Analysis在同期总结中提到,仅数周时间,达到51分以上的前沿实验室就从少数几家扩展到六家DeepSeek、Qwen、MiniMax、GLM、Kimi都在逼近同一条前沿线
过去,一个模型可以领先半年。
现在,领先一个月,已经足够写进历史。
GLM-5.2证明,中国公司可以把足够强的旗舰模型直接用MIT许可证开放;Kimi K3则把开放模型推向全球总榜最前排
杨植麟曾表达过一个鲜明判断:开放模型还得足够强
一个月前,老师给出了自己的答案。
一个月后,学生把答案又往前推了6分
而当整个行业还在惊叹这场清华师徒的榜首接力时,下一位挑战者,也许已经在训练集群里亮起了绿灯
夜雨聆风