乐于分享
好东西不私藏

清华师徒杀疯AI榜!老师GLM-5.2刚拿开源第一,学生Kimi K3一个月后57分反超:2.8万亿参数要掀翻闭源帝国?

清华师徒杀疯AI榜!老师GLM-5.2刚拿开源第一,学生Kimi K3一个月后57分反超:2.8万亿参数要掀翻闭源帝国?

只用了一个月。

6月,清华教授唐杰参与创立的智谱(Z.ai),把 GLM-5.2 推上 Artificial Analysis 开源权重模型第一:51分、百万上下文、MIT许可证,权重直接开放

7月,唐杰曾经的学生、月之暗面创始人杨植麟,带着 2.8万亿参数的Kimi K3 杀了回来:57分,一度冲进全球总榜前三,与GPT-5.5、Claude Opus 4.8进入同一档位

榜单上,两根柱子一前一后。

榜单背后,却是中国AI圈极具戏剧性的一幕:老师刚刚登顶,学生随即超车

但先按住欢呼。这里有一道非常关键的时间差:GLM-5.2已经是可下载的开放权重模型;Kimi K3发布时仍主要通过产品和API使用,官方承诺在7月27日前开放权重

所以,准确的说法是:K3已经在能力分数上完成反超;等权重真正落地,它才会正式接过“开源权重第一”的位置

AI世界的王座,竟然已经开始按“周”计时

一个月,开源第一两次易主

6月中旬,Z.ai宣布开放GLM-5.2权重

这次更新远比“把模型扔到网上”更扎实GLM-5.2支持 100万token上下文,主攻长程编程、软件工程与智能体任务,并采用限制较少的 MIT许可证

在Artificial Analysis Intelligence Index上,它拿到 51分,与Claude Opus 4.8进入相近档位,成为当时得分最高的开放权重模型

在更垂直的竞技场里,它也打得凶猛:Code Arena前端代码盲测全球第二、DesignArena第一、FrontierSWE整体第三

▲ 唐杰宣布GLM-5.2取得AA指数51分,并在多个编程与设计榜单进入前列

关键在于,GLM-5.2的权重已经摆上Hugging Face,开发者可以下载、部署和修改

▲ GLM-5.2模型页标注MIT许可证,支持Transformers、vLLM、SGLang等部署方式

然而,仅仅约一个月后,Kimi K3来了

57分。

相比GLM-5.2,整整高出 6分在前沿模型已经进入贴身肉搏的今天,这次跳跃足以改变榜单排序

▲ Artificial Analysis称,Kimi K3权重开放后将成为领先的开放权重模型

榜单背后,竟是一对清华师徒

冷冰冰的评测图,因为一段学术关系,突然有了故事

杨植麟本科时期曾在清华跟随唐杰从事科研之后,他赴卡内基梅隆大学攻读博士,导师是著名机器学习学者 Russ Salakhutdinov再后来,他回国创办月之暗面,做出了Kimi

唐杰则从清华相关研究团队出发,参与创立智谱,推动GLM路线一路走向产业化

两人的交集远超传闻里的“上过课”和“认识”公开材料显示,杨植麟后来仍与唐杰在 GLM、P-Tuning v2、FewNLU 等研究中存在共同署名这些论文勾勒出一条真实可见的技术谱系

▲ Artificial Analysis联合创始人George Cameron转述:杨植麟赴CMU前曾在清华跟随唐杰学习

社交网络很快用一个词概括这段关系:leapfrogging,互相赶超

老师一方先把开放模型推上高位;学生一方再用更大的模型、更激进的架构,把分数线继续向上抬

甚至有人继续往上追溯:Salakhutdinov曾师从“深度学习教父”Geoffrey Hinton于是,Kimi K3背后被拼出了一条有趣的学术链条:

Hinton,Salakhutdinov,杨植麟;另一侧,则是唐杰,杨植麟,Kimi。

这场较量牵连着同一片学术土壤里长出的两棵树,如今它们在产业森林的最高处相遇

2.8万亿参数,究竟是什么概念?

看核心数字:

维度
GLM-5.2
Kimi K3
总参数规模
约0.75万亿级
2.8万亿
上下文
100万token
100万token
AA智能指数
5157
权重状态
MIT,已经开放
发布时承诺7月27日前开放
AA单任务成本
约0.32美元
约0.94美元

K3采用的是极稀疏 MoE,混合专家架构

可以把它想成一座拥有 896位专家 的超级研究院,每遇到一个问题,只会激活其中约 16位

因此,模型可以拥有2.8万亿参数的庞大知识容量,却不必在每次推理时把全部参数都跑一遍

K3还加入了 Kimi Delta Attention官方称,在百万上下文解码时,最高可实现约 6.3倍加速另一项Attention Residuals技术,则试图用不足2%的额外成本,换取约25%的训练效率提升

▲ Kimi K3官方博客展示其架构、百万上下文与长程编程评测

而“100万token上下文”,可以把它想象成一张突然被铺大了几十倍的办公桌

过去,模型只能摊开几页文件;现在,它可以同时读代码库、研究论文、终端记录和长达数百轮的工具调用轨迹这正是长程Agent能够连续工作数小时,甚至更久的基础

57分很猛,价格同样锋利

单看智力,K3尚未击败所有闭源旗舰

根据Artificial Analysis当时的结果,它仍落后于Fable 5、GPT-5.6 Sol等顶配模型但在 “能力,成本”平面 上,它的位置极具攻击性

K3完成一项AA Intelligence Index任务,平均成本约 0.94美元GPT-5.6 Sol约为1.04美元,Claude Opus 4.8则约为1.80美元

也就是说,K3用接近顶级闭源模型的能力,把部分任务成本压到了Opus 4.8的一半左右

其API标价约为每百万输入token 3美元、输出token 15美元,缓存命中输入低至0.30美元

不过,GLM-5.2依然有自己的锋利位置:它的综合分低一些,但AA单任务成本约0.32美元,而且权重已经开放

这正是两种不同的商业武器:

  • GLM-5.2:
    更便宜、已开放、可私有化部署;
  • Kimi K3:
    更强、更大,试图把开放模型的能力上限直接推到闭源旗舰腹地。

一个守住可部署性,一个猛攻能力天花板

别误会:“开源第一”不等于你的电脑能跑

这里必须泼一盆冷水。

开放权重,不等于低门槛。

GLM-5.2约0.75万亿参数,普通消费级显卡很难轻松承载;Kimi K3更达到2.8万亿参数,需要大规模集群、专家并行和高性能互联

所以,开放至少有三层含义:

  1. 权重能否真正下载;
  2. 许可证是否允许修改、商用与再分发;
  3. 现实中有没有足够算力把它跑起来。

GLM-5.2在前两项上已经交卷,采用宽松的MIT许可证

因此,K3的“开源第一”当时仍带着一个明确条件:权重按计划发布,并以可用许可证和推理栈完成交付

战场正在转向“替你干活”

这轮较量的重心已经移到 长程Agent,两家公司都在集中火力攻克连续多步的复杂任务

Kimi展示了24小时内核优化、类Triton编译器、芯片设计、科研复现与产业研究报告等任务;GLM-5.2强调FrontierSWE、SWE-Marathon和百万上下文中的长程交付

大模型竞争正在换挡:

模型既要会回答,也要能连续工作。

模型会读仓库、开终端、调试、修改、再测试;面对研究任务,它还要检索资料、建立假设、运行工具,最后交付结果

榜单只是探照灯。竞争落到 Kimi Work、Kimi Code、智谱Coding Plan、API和企业私有化部署,谁能进入程序员、研究员和公司的日常工作流,谁才可能把一次榜单胜利变成收入与生态

第一名的王朝越来越短

这场师徒“交棒”最刺激的地方,是第一名正在迅速贬值

Artificial Analysis在同期总结中提到,仅数周时间,达到51分以上的前沿实验室就从少数几家扩展到六家DeepSeek、Qwen、MiniMax、GLM、Kimi都在逼近同一条前沿线

过去,一个模型可以领先半年。

现在,领先一个月,已经足够写进历史。

GLM-5.2证明,中国公司可以把足够强的旗舰模型直接用MIT许可证开放;Kimi K3则把开放模型推向全球总榜最前排

杨植麟曾表达过一个鲜明判断:开放模型还得足够强

一个月前,老师给出了自己的答案。

一个月后,学生把答案又往前推了6分

而当整个行业还在惊叹这场清华师徒的榜首接力时,下一位挑战者,也许已经在训练集群里亮起了绿灯