上周四,智谱发布了一个叫GLM-5.3的新模型。按理说,现在各家发布新模型已经不算什么大新闻了——大模型迭代快得跟手机换代似的,大家早就麻了。
但GLM-5.3有点不一样。
它在网络安全基准测试CyberGym上拿了84.5分,超过了Mythos 5的83.8分和GPT-5.6 Sol的83.6分。一个开放权重模型,在网安能力上干翻了两个全世界最强的闭源模型。
这本身已经够让人意外了。但让我真正坐不住的,是智谱自己在发布文档里说的一句话:"网安能力的发展速度超出了我们的预期。"
你品品这句话。一个AI公司发布新模型,不说"我们在XX领域取得了突破",而是说"这个能力自己长出来了,比我们预想的快"。这不是谦虚,这是在描述一种他们自己也没完全搞清楚的现象。
什么意思?就是说,他们并没有刻意去训练GLM-5.3的网络安全能力。他们做的只是加大后训练(post-training)的力度,结果模型在这个过程中自己长出了远超预期的网安技能。
这就是我今天想聊的事情:AI的涌现能力,正在变得越来越不可预测。
从4.6%到84.5%:一个没有预设目标的跃升
先说几个关键数据,不然光说"超出预期"太抽象了。我仔细对比了GLM-5.2和GLM-5.3的差异,发现一个很有意思的结构:基座完全没动,所有变化都来自后训练。这在模型迭代史上其实不多见——大多数时候,新版本都是预训练和后训练同时改。智谱这次是纯粹在后训练上加码。
GLM-5.3的基座模型和GLM-5.2完全一样,都是744B参数、40B激活参数。唯一的变化是后训练的规模和方式。智谱引入了一套叫"slime"的异步强化学习基础设施,让模型在受控沙箱里大量练习网络安全任务。
结果呢?在终端操作基准Terminal Bench 3.0上,GLM-5.3从GLM-5.2的4.6%跳到了28.3%。在CyberGym上,从77.2%涨到84.5%。在ExploitBench上,从24.4%直接翻倍到54.4%。
我特别注意到一个细节:ExploitBench测的是更深层的漏洞利用,而不只是发现漏洞。GLM-5.3在这个更难的基准上进步最大——虽然54.4%的绝对分还是比Mythos 5的78%和GPT-5.6 Sol的76.5%差不少,但它从0.24到0.54的跳升幅度,比任何一个基准都要猛。
换句话说,模型不只是"更会找bug了",它开始学着怎么把bug变成完整的攻击链。这个进步曲线,确实值得琢磨。

2436个真实漏洞:数字背后是什么
智谱还做了一件让我觉得挺有诚意的事:他们没有光吹分数,而是直接把GLM-5.3放出去找真实世界的漏洞。
结果?269个开源项目里,找到了2436个漏洞。其中1097个是高危或严重级别(107个严重、990个高危)。这些漏洞涉及的项目范围很广——Linux内核、WebKit、FreeBSD、GStreamer、Suricata,基本上都是基础设施层面的东西。
更让我印象深刻的是这些漏洞的年龄数据:平均存活了26.6年。最老的一个漏洞可以追溯到1981年。
我看到这个数字的时候愣了一下。1981年,我还没出生呢。一个在代码里躺了四十多年的漏洞,被一个刚发布几天的AI模型给挖出来了。这到底说明了什么?
说明两件事。第一,我们整个数字基础设施的安全债务比我们想象的要沉重得多。你想想,一个漏洞能在代码里存活26年不被发现,这中间经过了多少轮代码审计、多少个安全团队的review、多少次自动化扫描?全都没发现。这说明传统安全审计方法有系统性的盲区。
第二,AI在发现人类长期忽略的模式这件事上,可能已经比大多数人想的要强了。人类审计员看代码,注意力会被自己的经验、偏见和疲劳所限制。AI不会。它可以不知疲倦地扫描每一行代码,不受"这段代码肯定没问题"这种思维定势的干扰。
智谱还专门建了一个公开的漏洞披露账本(Security Disclosure Ledger),实时追踪每个发现的披露状态。截至目前,53个已经公开披露并分配了CVE编号,2383个还在保密处理中——这是负责任的做法,毕竟一下子把两千多个漏洞信息放出去,那不是做安全,那是给黑客送弹药。
一个模型在Cursor里找到了"严重漏洞"
还有一条消息让我觉得这件事离我们很近。这件事可能比CyberGym的分数更值得关注,因为它发生在真实世界里。
智谱的开发者布道师在社交平台上透露,GLM-5.3在测试过程中,在Cursor里发现了一个"可能严重的漏洞"。Cursor就是那个被SpaceX收购的AI编程工具,现在全球几百万开发者每天都在用。
这个消息目前还没有得到Cursor官方的确认。但如果属实,这意味着什么?
意味着一个AI模型,在日常使用场景中,顺手就发现了另一个AI产品里的安全问题。
我现在每天用AI写代码,说实话,我从来没想过AI本身可能成为代码安全的"扫描仪"。我们讨论AI对编程的影响时,聊的都是效率提升、代码补全、自动调试。但AI模型能不能在你写代码的同时帮你找安全漏洞?GLM-5.3给出的答案似乎是:能,而且比你预期的要好。
当然,这也有另一面。如果开放权重模型能轻松找到漏洞,那恶意行为者也能用它来找。网安领域一直有这个"攻防对称"的问题,AI的到来可能让这个对称性变得更极端。
后训练才是真正的战场
我觉得GLM-5.3这件事真正值得思考的,不是某个模型在某个基准上多拿了1分——基准分数这种东西,过两周就会被刷新。
真正值得注意的是:后训练(post-training)正在成为决定模型能力的关键变量。
过去两年,行业把大部分注意力放在了预训练上——更大的数据集、更多的参数、更好的架构。但从GLM-5到GLM-5.3,基座模型没变,所有进步都来自后训练。智谱说他们用了"slime"异步强化学习系统,在受控环境里让模型反复练习。
这让我想到了一个有点反直觉的结论:也许我们已经进入了"后训练红利期"。预训练阶段能榨的汁已经差不多了,但后训练的方法论还有很大的探索空间。你用什么方式训练、在什么环境里训练、训练多长时间,这些变量的组合方式几乎是无限的。
智谱的做法是让模型在安全沙箱里反复"实战演练"。这不是什么新概念——AlphaGo当年也是在自我对弈中超越人类的。但把这套方法用在网络安全上,而且效果这么明显,确实让行业里不少人重新审视了后训练的潜力。
开源模型和闭源模型的差距,正在以一种奇怪的方式缩小
最后说一个我觉得容易被忽略的趋势。
过去一年,开源模型追赶闭源模型的叙事一直是"在通用能力上逐步缩小差距"。但GLM-5.3展示的是一种不同的追赶方式:在特定垂直领域实现超越。
在CyberGym上,GLM-5.3是第一名。但在ExploitBench上,它只有54.4%,Mythos 5有78%。在通用编程能力上,它和GPT-5.6 Sol、Claude Opus 4.8各有胜负。这不是全面碾压,而是在特定任务上实现了局部突破。
我觉得这个模式可能比"全面赶超"更有现实意义。大部分开发者用AI,其实并不需要一个什么都能干的通用模型。他们需要的是在自己的具体工作场景里表现最好的那个。如果你是安全工程师,GLM-5.3可能就是目前最好的选择。如果你做的是前端开发,那可能是另一个模型。
这给行业带来的变化是:模型选择不再是"选最强的",而是"选最适合的"。这对开源生态来说是个好消息,因为开源模型在特定领域的定制化能力天然更强。智谱说GLM-5.3的权重会在两周后公开发布,到时候社区可以在此基础上继续优化。
我挺期待看到安全社区拿到这个模型之后会做出什么。安全社区的创造力一直被低估了——给他们一个趁手的工具,他们能做出你想象不到的东西。两年前大家还在用AI写钓鱼邮件,现在AI开始帮人找漏洞了。这个转变的速度,说实话比我预期的要快。
我的判断
GLM-5.3不是一款革命性的模型。它的通用能力有提升但没有质变,在最难的ExploitBench上还落后闭源模型二十多个百分点。
但它让我关注的是两件事:第一,AI的涌现能力正在变得越来越不可预测,"我们没打算让它擅长这个但它偏偏就擅长了"这种事以后会越来越多;第二,后训练方法论可能是接下来一两年模型竞争的核心战场,谁在后训练上跑得快,谁就能在特定领域实现局部超越。
至于安全行业怎么应对一个"AI找漏洞比人快"的时代,说实话我也没想清楚。但有一件事我比较确定:把头埋在沙子里假装这一切不会改变安全工作的本质,大概是最糟糕的选择。
夜雨聆风