乐于分享
好东西不私藏

2026 年 8 月 AI 模型速览

2026 年 8 月 AI 模型速览

不到一个月,五家头部厂商轮番上阵。把这一轮放在一起看,焦点已经不在分数上。竞争转到了另一个维度:AI 能不能真正交付工程工作。

这一轮的模型激战

Gemini 3.7 Flash(8 月 13 日,Google)。基于 Gemini 3.6 Flash 的迭代,1M context、64K output。算法层改进核心推理,支持可配置思考档位。Google 把它放进 GitHub Copilot,同日上线。

图 1:Gemini 3.7 Flash 官方 Model Card

Grok 4.6(8 月 12 日,SpaceXAI 与 Cursor 联合发布)。比 Grok 4.5 加长补充训练,重点放在 long-running agents 和视觉/交互工作。在 Artificial Analysis Intelligence Index 上匹配 GPT-5.6 Sol。Cursor 给了一周双倍额度。

图 2:Grok 4.6 发布博客(Cursor)

DeepSeek V4 Pro 0813(8 月 13 日,DeepSeek)。1.6T 总参数 MoE,每 token 激活约 49B。1M context,MIT 协议开源。HuggingFace 上 deepseek-ai/DeepSeek-V4-Pro-0813 仓可查。

图 3:DeepSeek-V4-Pro-0813

Kimi K3(7 月 17 日,Moonshot)。2.8T 参数,原生视觉,1M context。世界首个 3T 级开源模型。基于 Kimi Delta Attention 和 Attention Residuals,激活 16/896 experts,整体 scaling 效率比 K2 高 2.5 倍。

图 4:Kimi K3 发布博客(Moonshot)

GLM-5.3(8 月 14 日,智谱)。7430 亿参数,基座和 GLM-5.2 完全相同。所有能力跃升来自后训练阶段的 Scaling。官方原话:"Scaling post-training is all we did for GLM-5.3."

图 5:GLM-5.3 发布博客(Z.ai)

GLM-5.3 的几组数据

Z.ai 官方博客的完整 benchmark 表(z.ai/blog/glm-5.3):

Benchmark
GLM-5.3
GLM-5.2
Kimi K3
DeepSeek V4 Pro
Qwen3.8-Max
Opus 4.8
Fable 5
GPT-5.6 Sol
Terminal Bench 2.1
88.2
81.0
88.3
87.9
86.6
85.0
88.0
88.8
Terminal Bench 3.0
28.3
4.6
17.4
21.1
33.7
34.6
DeepSWE v1.1
66.9
46.2
67.5
62.7
56.6
58.0
69.7
72.7
CyberGym
84.5
77.2
80.0
83.3
78.5
78.1
83.8
83.6
ExploitBench
54.4
24.4
32.2
28.8
40.0
78.0
76.5
ExploitGym 2h / 6h
105 / 130
29 / 39
36 / 70
14 / 26
80 / 120
181 / 247
216 / 293
AutomationBench v1.0.6
48.2
26.2
46.7
43.2
39.8
41.0
46.2
45.8

几个观察。

GLM-5.3 在 Terminal Bench 2.1 上 88.2 分,和 Kimi K3、GPT-5.6 Sol 站在同一水平线,超过 Opus 4.8。但在 Terminal Bench 3.0 上 28.3,明显落后于 GPT-5.6 Sol(34.6)和 Fable 5(33.7)。DeepSWE 上同样落后于 Fable 5 和 GPT-5.6 Sol。

智能体方向,AutomationBench 上 GLM-5.3 是当前最高分(48.2),超过所有对手。

Token 效率。Z.ai Code Bench 高档位思考下,GLM-5.3 在 50K 输出 token 时达到 31.4%,Opus 4.8 在 120K 输出时才达到 29.5%。一半的 token,更高的准确率。Fable 5 在 Max effort 下 39.5%,仍领先。

安全:这次发布最特殊的位置

GLM-5.3 在三个安全 benchmark 上呈现出一个清晰的趋势。越靠近漏洞链前端,提升越明显。越深入完整利用环节,和闭源前沿的差距越大。

CyberGym(白盒代码审查)GLM-5.3 超过 Mythos 5 和 GPT-5.6 Sol,是当前最高分。ExploitBench(深度推理并完成利用)54.4,不到 Mythos 5(78.0)和 GPT-5.6 Sol(76.5)的 3/4。ExploitGym(限定时间内的漏洞利用任务量)2 小时 105 项、6 小时 130 项,Mythos 5 是 181 / 247。

为什么一个编程模型要在安全上投入这么多。编程智能体已经开始真实在现实世界里干活。以前的模型写代码片段给你拿去用,现在的智能体直接读整个代码仓库、改文件、调终端、装依赖、跑测试、参与部署。能力越强,接触的系统越多,权限越高。一次判断失误的后果被同步放大。

安全从编程流程的末端往前移动。过去是写代码、测试、上线前再做安全审计。现在接近写代码、运行测试、发现风险、修复、重新验证的紧密闭环。

红队测试与披露账本

发布前两周,智谱联合清华、南开和国内多家安全团队做密集红队测试。Z.ai 官方博客给的数字(截至 8 月 14 日):

图 6:Z.ai Security Disclosure Ledger 数字概览
指标
数字
累计发现漏洞
2,436
已公开披露
53
仍处于 embargo
2,383
中危以上
1,097
覆盖开源项目
269
受影响年份跨度
45 年(最早的 1981 年)
平均潜伏年限
26.6 年

受影响范围包括 Android、Windows、macOS,以及一款国民级通讯软件。公开市场价值约 3000 万元。智谱建立了 Z.ai Security Disclosure Ledger 公开记录漏洞从发现到修复的全过程。

几个具体案例

Hugging Face 事件。自主智能体发起攻击,留下超过 17000 条攻击相关操作。商业模型 API 的安全机制直接阻断分析请求。Hugging Face 把 GLM-5.2 部署到本地基础设施做取证。智能体以机器速度写代码,安全防护必须跟上机器速度。

巴西服务器。2026 年 7 月,GLM-5.3 在 FOFA 追踪引擎 Ferret 的监测里发现一台临时文件服务器异常。深挖之后浮出一个叫 Neo 的 AI 智能体,目标是某国会计师事务所、税务服务公司和记账机构。两个月内管理 4 台服务器、7 个域名、6 万邮箱、100 多个脚本,发出 18567 封钓鱼邮件。人工几乎不可能从数千个开放目录和数万份日志里发现关联,GLM-5.3 提取关键线索还原了整条攻击链。

Cursor。VentureBeat 报道标题是"GLM-5.3 reportedly already found a serious vulnerability in Cursor"。智谱开发者布道师 Lou 在 X 上披露。清华 NASP 实验室分析了 Cursor 的 Rust+Electron 混合架构和权限校验逻辑,发现潜在任意文件写入风险,可能窃取敏感信息或接管开发环境。已联系 Cursor 推进修复。

国民级通讯软件。数亿日活的通讯软件存在远程无感知触发漏洞,深藏在自研私有协议、内容处理逻辑和内存管理机制里。触发条件涉及复杂状态机管理和极难复现的时序问题。从海量二进制代码中定位异常,逐步完成路径验证。

DNS 协议。清华 NISL 实验室和云起无垠团队在 1983 年诞生的 DNS 协议里发现一类潜伏 40 余年的协议级漏洞。攻击者发少量特殊请求就能把服务器计算压力最高放大近 8 万倍。可能影响全球 90% 以上主流 DNS 系统,涉及超过 1000 万个公网 DNS 服务。

具身智能机器人。DARKNAVY 旗下 deepsec 在一家全球顶级具身智能机器人厂商系统里发现致命漏洞,攻击者可能同时远程劫持上千台机器人控制执行恶意动作。从公开文档出发完成信息收集、静态分析、漏洞挖掘、风险验证,最终定位并修复。

权重暂缓

按原计划,GLM-5.3 应该开放权重。8 月 14 日发布当天,官方博客说"两周内开源"。但 Reuters 同日报道,Z.ai 引入"trusted access"控制,对部分敏感能力采取受限访问。VentureBeat 和 Axios 都把这件事解读为"权重暂缓"。

原因和数据放在一起就看清楚了。一个具备强大安全攻防能力的编程模型,如果完全开放权重,会拉高整个行业的安全水位。同时不可避免地降低恶意使用者的技术门槛。智谱选择先做"开源的盾":对重点开源项目免费审计,向开源社区免费提供模型额度,在 ZCode 里嵌入代码审计。

闭源模式正在把前沿安全能力异化为少数机构的特权。Anthropic 向约 150 家大型机构提供 Mythos 模型及安全服务。更广泛的企业和开源项目很难获得同等支持,甚至在遭遇攻击最需要帮助时被闭源模型拒之门外。智谱的话是,没有开源反而是这个时代最不安全的事情。

反过来的逻辑也成立。当盾被开源,矛也会同步扩散。

这一轮在告诉我们什么

DeepSeek V4 Pro 进入全球竞争范围。Gemini 3.7 Flash 把轻量级能力快速拉高一档。Grok 4.6 匹配 GPT-5.6 Sol,冲到智能体第一梯队。Kimi K3 把开源模型推到 3T 级别。GLM-5.3 把编程和安全深度绑定。

当 AI 真正接手工程工作,写代码只是第一步。能交付、能验证、知道自己的边界、能补自己写出来的漏洞,才是生产级编程的起点。

Hugging Face 那次事件是前沿模型逃逸发起攻击,GLM-5.2 部署到本地帮助取证。巴西服务器这次是 AI 智能体作为攻击方,GLM-5.3 帮助防守方还原攻击链。同样是模型,站在哪一边取决于掌握它的人。

矛与盾的故事不会结束。