昨天刷 Hacker News,我发现一件很有趣的事。
排行第四的那条消息,标题平淡无奇——"GLM-5.2 成为 Artificial Analysis 智能指数上排名第一的开源模型"。翻译过来就是:有一个叫 GLM-5.2 的中国模型,刚拿了个世界第一。
底下 689 个 upvote,354 条评论。外国程序员在评论区吵得不可开交。
说实话,我第一反应是——又是哪个刷榜的?过去两年,"中国 AI 超越 GPT"的标题我看得够多了。每次点进去,要么是某个特定任务比 GPT 高了 0.3 分,要么是中文能力吊打外国模型。
但这次不太一样。
Artificial Analysis 不是某个野榜。它是现在全球最受认可的 AI 基准测试平台之一,评测维度覆盖了推理、编程、科学、数学、代理能力等多个方面。而在这个榜单上,GLM-5.2 得分 51,把 MiniMax-M3(44)、DeepSeek V4 Pro(44)、Kimi K2.6(43)全部甩在了身后。
51 分是什么概念?
榜单上排第二的开源模型,才 44 分。7 分的差距,在 AI 评测领域,用"断层领先"来形容一点不夸张。上一个让我有这种感觉的,还是 2025 年初 DeepSeek V3 刚出来的时候。
更让我吃惊的是另一个维度——GDPval-AA v2,这是一个专门衡量 AI "干活"能力的测试。不是让你做选择题,不是让你写一首漂亮的诗,而是让你真正去完成一个任务:查资料、写代码、调整方案、最终交付。
GLM-5.2 在这个测试上拿了 1524 分。作为对比,MiniMax-M3 是 1418 分,DeepSeek V4 Pro(max)是 1328 分。而 GPT-5.5(xhigh reasoning 模式)是 1514 分。
你没看错——这个中国开源模型在干活能力上,和 GPT-5.5 基本持平。
我一个做 AI 投资的朋友昨晚给我发消息说:"你看到了吗?GLM 又杀回来了。"
"又"这个字,用得特别准确。
如果你是从 2023 年开始关注 AI 的人,应该记得智谱(Z.ai)这个名字。那时候他们的 ChatGLM 系列是国内最早一批能打的对话模型,跟百度的文心一言、阿里的通义千问一起,被戏称为"国产大模型三剑客"。
但后来呢?
2024 年 Kimi 杀出来了,长上下文能力让所有人闭嘴。2025 年 DeepSeek 杀出来了,V3 和 R1 直接把开源社区炸翻了天。MiniMax 也开始发力,M3 在编程和数学上的表现让人印象深刻。
智谱呢?智谱好像……没声音了。
至少普通用户是这么觉得的。
但你去看技术圈,智谱从来没停过。GLM-4、GLM-4V、GLM-5、GLM-5.1……他们的版本号一直在往前滚。只是这些版本在发布时的声量,远不如 DeepSeek 和 Kimi 那么炸裂。
直到 GLM-5.2。
这次他们憋了个大的。
先说几个硬数据。GLM-5.2 是 7440 亿总参数、400 亿活跃参数的 MoE 架构,跟 GLM-5.1 一样大。但评分从 40 涨到了 51,涨了 11 分——同样的参数规模,能力跳了一大截。
科学推理方面:GPQA Diamond 从 86% 涨到 89%,HLE 从 28% 涨到 40%。不要小看这 12 个百分点的提升,HLE(Humanity's Last Exam)是这个星球上最难的 AI 测试之一,每提一个点都意味着模型在"真·推理"上往前拱了一大步。
编程能力方面:SciCode 从 43% 涨到 50%,TerminalBench v2.1 涨了 16 个点。这已经不是"能帮你写点脚本"的水平了,这是在朝着"能独立完成科研级别的编程任务"走。
上下文窗口从 20 万 token 扩展到了 100 万。100 万 token 意味着什么?你可以把整本《三体》三部曲扔进去,然后问它"叶文洁在第二部里总共出现过几次",它能给你精确答案。
还有一个细节让我特别在意。
MIT 协议。
开源模型有很多种"开源"。有的是"开源但禁止商用",有的是"开源但限制用途",有的是"开放权重但协议一长串"。但 MIT 协议是最宽松的那种——你可以拿它去做任何事,包括商用、改改再发布、甚至把它塞进自己的产品卖钱,只要保留版权声明就行。
一个拿了世界第一的中国模型,用 MIT 协议开源。
这意味着什么?
意味着全球任何一个开发者、任何一家创业公司,都可以免费拿到这个跟 GPT-5.5 差不多能打的模型,部署在自己的服务器上,做自己的应用。你不用给智谱付一分钱,也不用担心哪天许可证被收回。
我在 DeepInfra、Novita、Nebius、Parasail、SiliconFlow、GMI Cloud、Baseten、Fireworks 这些第三方平台都看到 GLM-5.2 上线了。一个模型刚发布,这么多平台同时支持——这说明什么?说明开源社区对这个模型的需求是真金白银的,不是 PR 出来的。
当然,GLM-5.2 不是完美的。
它一个比较大的槽点是 token 效率。每个任务平均要用 43000 个输出 token,比 GLM-5.1 的 26000 多了不少,也比 MiniMax-M3 的 24000 高了快一倍。翻译成人话就是:它有点啰嗦,喜欢"写小作文"。
不过考虑到它的定价——输入 4.4/百万 token——一个任务大概花 $0.46。对于个人开发者来说可能要考虑一下成本,但对于企业级应用,这个价格跟它提供的能力比起来,性价比相当高了。
而且如果你不想花钱,你可以自己部署。MIT 协议,随便搞。
说到这儿,我想聊聊一个更大的话题。
去年 5 月 30 日,我写了一篇文章叫"AI 新王登基",讲的是 Anthropic 融资 650 亿美元、估值冲到 9650 亿的事。那时候所有人都在讨论一个问题:闭源是不是比开源更有前途?
OpenAI 闭源,Anthropic 部分闭源,Google 闭源——这些闭源模型确实在很长一段时间里霸榜了各种评测。
但现在你再看 Artificial Analysis 的排行榜,开源模型的排名是:GLM-5.2(51)、MiniMax-M3(44)、DeepSeek V4 Pro(44)、Kimi K2.6(43)——全是中国的。
中国的开源 AI,正在把"开源 vs 闭源"这个争论变成"中国开源 vs 美国闭源"。
这不是一句口号。这是正在发生的事情。
智谱这家公司的背景,可能有人不知道。它的核心团队来自清华大学知识工程实验室(KEG),就是那个从 2016 年开始就在搞大规模预训练模型的地方。ChatGLM、CogView、CogVideo、AutoGLM——这些听起来耳熟的名字,背后都是同一群人在推。
跟 DeepSeek 那种"从量化基金杀出来"的故事不同,智谱走的是更传统的学院派路线。清华出身,教授带队,产学研结合。这种路线在早期 AI 圈不被看好——投资人喜欢的是"几个天才辍学创业"的剧本,不是"大学教授做公司"。
但 GLM-5.2 证明了,学院派的稳扎稳打,在 AI 这个领域可能是被低估的策略。
DeepSeek 像个天才少年,每次出手都石破天惊。智谱像个沉默的工程师,不声不响地打磨,然后突然掏出一个让全世界都闭嘴的东西。
Hacker News 上有一个评论我印象很深。一个老外说:"I remember when people said China was 2 years behind in AI. That was 18 months ago."
我记得人们说中国 AI 落后两年的时候——那是 18 个月前的事。
18 个月。
从"落后两年"到"开源第一",中国 AI 用了 18 个月。
我记得很清楚,2025 年 1 月 DeepSeek R1 发布的时候,整个硅谷都慌了。OpenAI 的 Sam Altman 连夜发推,说"我们会加快发布节奏"。华尔街的 AI 概念股暴跌。英伟达一天蒸发了差不多 6000 亿美元市值。
那时候人们说,这是一次"珍珠港事件"。
现在 GLM-5.2 又来了。这次没那么大动静了——不是因为它不够强,而是因为"中国 AI 很强"这件事,大家已经开始习惯了。
这才是我觉得最厉害的地方。
当一个国家的 AI 实力不再让人惊讶的时候,说明它已经是一种常态了。
我写这篇文章的时候,GLM-5.2 已经在十几个平台上可以被调用了。如果你想试试,最简单的办法是去 chat.z.ai,直接用。或者如果你是开发者,去 DeepInfra、SiliconFlow 这些平台调用 API,价格很便宜。
当然,要不要试试是你的事。我写这篇文章的目的,不是推销模型,而是想记录下来——2026 年 6 月的某一天,一个叫 GLM-5.2 的中国模型,在全球最权威的评测榜单上,拿了开源模型的第一名。
跟 GPT-5.5 差不多能打,MIT 协议,完全免费。
这件事本身就值得被记住。
参考链接:
Artificial Analysis: GLM-5.2 评测报告 - https://artificialanalysis.ai/articles/glm-5-2-is-the-new-leading-open-weights-model-on-the-artificial-analysis-intelligence-index[1] Z.ai 官方 - https://chat.z.ai/[2] GLM-5.2 模型对比 - https://artificialanalysis.ai/models/glm-5-2[3] HuggingFace zai-org - https://huggingface.co/zai-org[4]
📝 觉得有意思的话,点个 「推荐」 和 「赞」 ,转发给对 AI 感兴趣的朋友。你的支持是我继续写的动力。
还没关注的朋友,点下面的卡片关注 xxDays,我们下期见。
引用链接
[1]https://artificialanalysis.ai/articles/glm-5-2-is-the-new-leading-open-weights-model-on-the-artificial-analysis-intelligence-index
[2]https://chat.z.ai/
[3]https://artificialanalysis.ai/models/glm-5-2
[4]https://huggingface.co/zai-org
夜雨聆风