不到一个月,五家头部厂商轮番上阵。把这一轮放在一起看,焦点已经不在分数上。竞争转到了另一个维度:AI 能不能真正交付工程工作。
这一轮的模型激战
Gemini 3.7 Flash(8 月 13 日,Google)。基于 Gemini 3.6 Flash 的迭代,1M context、64K output。算法层改进核心推理,支持可配置思考档位。Google 把它放进 GitHub Copilot,同日上线。

Grok 4.6(8 月 12 日,SpaceXAI 与 Cursor 联合发布)。比 Grok 4.5 加长补充训练,重点放在 long-running agents 和视觉/交互工作。在 Artificial Analysis Intelligence Index 上匹配 GPT-5.6 Sol。Cursor 给了一周双倍额度。

DeepSeek V4 Pro 0813(8 月 13 日,DeepSeek)。1.6T 总参数 MoE,每 token 激活约 49B。1M context,MIT 协议开源。HuggingFace 上 deepseek-ai/DeepSeek-V4-Pro-0813 仓可查。

Kimi K3(7 月 17 日,Moonshot)。2.8T 参数,原生视觉,1M context。世界首个 3T 级开源模型。基于 Kimi Delta Attention 和 Attention Residuals,激活 16/896 experts,整体 scaling 效率比 K2 高 2.5 倍。

GLM-5.3(8 月 14 日,智谱)。7430 亿参数,基座和 GLM-5.2 完全相同。所有能力跃升来自后训练阶段的 Scaling。官方原话:"Scaling post-training is all we did for GLM-5.3."

GLM-5.3 的几组数据
Z.ai 官方博客的完整 benchmark 表(z.ai/blog/glm-5.3):
几个观察。
GLM-5.3 在 Terminal Bench 2.1 上 88.2 分,和 Kimi K3、GPT-5.6 Sol 站在同一水平线,超过 Opus 4.8。但在 Terminal Bench 3.0 上 28.3,明显落后于 GPT-5.6 Sol(34.6)和 Fable 5(33.7)。DeepSWE 上同样落后于 Fable 5 和 GPT-5.6 Sol。
智能体方向,AutomationBench 上 GLM-5.3 是当前最高分(48.2),超过所有对手。
Token 效率。Z.ai Code Bench 高档位思考下,GLM-5.3 在 50K 输出 token 时达到 31.4%,Opus 4.8 在 120K 输出时才达到 29.5%。一半的 token,更高的准确率。Fable 5 在 Max effort 下 39.5%,仍领先。
安全:这次发布最特殊的位置
GLM-5.3 在三个安全 benchmark 上呈现出一个清晰的趋势。越靠近漏洞链前端,提升越明显。越深入完整利用环节,和闭源前沿的差距越大。
CyberGym(白盒代码审查)GLM-5.3 超过 Mythos 5 和 GPT-5.6 Sol,是当前最高分。ExploitBench(深度推理并完成利用)54.4,不到 Mythos 5(78.0)和 GPT-5.6 Sol(76.5)的 3/4。ExploitGym(限定时间内的漏洞利用任务量)2 小时 105 项、6 小时 130 项,Mythos 5 是 181 / 247。
为什么一个编程模型要在安全上投入这么多。编程智能体已经开始真实在现实世界里干活。以前的模型写代码片段给你拿去用,现在的智能体直接读整个代码仓库、改文件、调终端、装依赖、跑测试、参与部署。能力越强,接触的系统越多,权限越高。一次判断失误的后果被同步放大。
安全从编程流程的末端往前移动。过去是写代码、测试、上线前再做安全审计。现在接近写代码、运行测试、发现风险、修复、重新验证的紧密闭环。
红队测试与披露账本
发布前两周,智谱联合清华、南开和国内多家安全团队做密集红队测试。Z.ai 官方博客给的数字(截至 8 月 14 日):

受影响范围包括 Android、Windows、macOS,以及一款国民级通讯软件。公开市场价值约 3000 万元。智谱建立了 Z.ai Security Disclosure Ledger 公开记录漏洞从发现到修复的全过程。
几个具体案例
Hugging Face 事件。自主智能体发起攻击,留下超过 17000 条攻击相关操作。商业模型 API 的安全机制直接阻断分析请求。Hugging Face 把 GLM-5.2 部署到本地基础设施做取证。智能体以机器速度写代码,安全防护必须跟上机器速度。
巴西服务器。2026 年 7 月,GLM-5.3 在 FOFA 追踪引擎 Ferret 的监测里发现一台临时文件服务器异常。深挖之后浮出一个叫 Neo 的 AI 智能体,目标是某国会计师事务所、税务服务公司和记账机构。两个月内管理 4 台服务器、7 个域名、6 万邮箱、100 多个脚本,发出 18567 封钓鱼邮件。人工几乎不可能从数千个开放目录和数万份日志里发现关联,GLM-5.3 提取关键线索还原了整条攻击链。
Cursor。VentureBeat 报道标题是"GLM-5.3 reportedly already found a serious vulnerability in Cursor"。智谱开发者布道师 Lou 在 X 上披露。清华 NASP 实验室分析了 Cursor 的 Rust+Electron 混合架构和权限校验逻辑,发现潜在任意文件写入风险,可能窃取敏感信息或接管开发环境。已联系 Cursor 推进修复。
国民级通讯软件。数亿日活的通讯软件存在远程无感知触发漏洞,深藏在自研私有协议、内容处理逻辑和内存管理机制里。触发条件涉及复杂状态机管理和极难复现的时序问题。从海量二进制代码中定位异常,逐步完成路径验证。
DNS 协议。清华 NISL 实验室和云起无垠团队在 1983 年诞生的 DNS 协议里发现一类潜伏 40 余年的协议级漏洞。攻击者发少量特殊请求就能把服务器计算压力最高放大近 8 万倍。可能影响全球 90% 以上主流 DNS 系统,涉及超过 1000 万个公网 DNS 服务。
具身智能机器人。DARKNAVY 旗下 deepsec 在一家全球顶级具身智能机器人厂商系统里发现致命漏洞,攻击者可能同时远程劫持上千台机器人控制执行恶意动作。从公开文档出发完成信息收集、静态分析、漏洞挖掘、风险验证,最终定位并修复。
权重暂缓
按原计划,GLM-5.3 应该开放权重。8 月 14 日发布当天,官方博客说"两周内开源"。但 Reuters 同日报道,Z.ai 引入"trusted access"控制,对部分敏感能力采取受限访问。VentureBeat 和 Axios 都把这件事解读为"权重暂缓"。
原因和数据放在一起就看清楚了。一个具备强大安全攻防能力的编程模型,如果完全开放权重,会拉高整个行业的安全水位。同时不可避免地降低恶意使用者的技术门槛。智谱选择先做"开源的盾":对重点开源项目免费审计,向开源社区免费提供模型额度,在 ZCode 里嵌入代码审计。
闭源模式正在把前沿安全能力异化为少数机构的特权。Anthropic 向约 150 家大型机构提供 Mythos 模型及安全服务。更广泛的企业和开源项目很难获得同等支持,甚至在遭遇攻击最需要帮助时被闭源模型拒之门外。智谱的话是,没有开源反而是这个时代最不安全的事情。
反过来的逻辑也成立。当盾被开源,矛也会同步扩散。
这一轮在告诉我们什么
DeepSeek V4 Pro 进入全球竞争范围。Gemini 3.7 Flash 把轻量级能力快速拉高一档。Grok 4.6 匹配 GPT-5.6 Sol,冲到智能体第一梯队。Kimi K3 把开源模型推到 3T 级别。GLM-5.3 把编程和安全深度绑定。
当 AI 真正接手工程工作,写代码只是第一步。能交付、能验证、知道自己的边界、能补自己写出来的漏洞,才是生产级编程的起点。
Hugging Face 那次事件是前沿模型逃逸发起攻击,GLM-5.2 部署到本地帮助取证。巴西服务器这次是 AI 智能体作为攻击方,GLM-5.3 帮助防守方还原攻击链。同样是模型,站在哪一边取决于掌握它的人。
矛与盾的故事不会结束。
夜雨聆风