夜雨聆风学习资料网

ARTICLE · 1124158

谷歌杀回 AI 前三,但最反常的指标是:敢说不知道

谷歌杀回 AI 前三,但最反常的指标是:敢说不知道
选题雷达 · 第 16 期 · Gemini 4 Argon2026.10.04

谷歌沉寂 7 个月,掏出来的却是一个敢说不知道的模型

Gemini 4 Argon 回来了

最反常的指标:它敢认怂

智能指数 53 追平 GPT-6 Astra · 幻觉率 15% vs 51% · 首发价 Astra 的 1/5 · 附看榜分母法

Gemini 4 Argon · 回归的三张面孔

Argon53 分幻觉率 15%$1.99/任务

📦 5 Parts + Conclusion

👉 滑动

PART 01

定位

强自动化弱全能

PART 02

七个月

一段废弃历史

PART 03

认怂

幻觉率 15%

PART 04

价格

两套口径

PART 05

边界

还没开放

谷歌沉寂了 7 个月。

9 月 30 日深夜,Google DeepMind 发布了 Gemini 4 Argon。这是它 7 个月来第一款高于 Flash 级别的模型——上一款还是 3 月的 Gemini 3.1 Pro Preview。

第三方评测机构 Artificial Analysis 给了它 53 分的智能指数,追平 OpenAI 的 GPT-6 Astra,与 Anthropic 的 Claude Fable 5.1 并列。AA 据此判断:谷歌重回智能水平最高的三家实验室之列。

但这份榜单上最反常的,不是 53 分。

是另一个数字:幻觉率 15%。

在同一套知识测试里,GPT-6 Astra 的幻觉率是 51%,GPT-6.1 Sol 是 54%。谷歌的这款模型,是智能指数 45 分以上模型里唯一低于 20% 的。

它答错得更少,不是因为它更聪明,而是因为它更愿意说一句:「我不知道。」

01

PART

先看清楚它是个什么

PART 01

Argon 是个面向长任务的模型:上下文 1M token,单次输出上限从上一代的 64K 直接提到 1M——按谷歌自己的说法,一次能产出约三万行代码,或者四五本小说的量。

它强在哪,弱在哪,把两边的数字放一起看最清楚:

第三方强项:AutomationBench-AA(企业软件自动化任务)拿了第一,约 78%,领先第二名 Claude Sonnet 5.5(71.3%)约 7 分

第三方强项:编码智能指数排第三,落后 Claude Opus 5.5 与 Sonnet 5.5,但领先 GPT-6 Astra

官方强项:DeepSWE v1.1 软件工程测试 77.9%,谷歌称这是自家历史最高

第三方弱项:Terminal-Bench 4.0 只有 57%,被 Sonnet 5.5(64%)、Opus 5.5(60%)、GPT-6 Astra(59%)全部压过

第三方弱项:GDPval-AA(真实职业任务)56%,只排第 14

一句话总结:它是一台很能跑自动化流程的机器,但不是一个样样都行的全能选手。

02

PART

7 个月,和一段被废弃的历史

PART 02

「沉寂 7 个月」这个词有一个明确的范围:Argon 是谷歌超过 7 个月来第一款高于 Flash 档的闭源模型。这期间谷歌没闲着,但发的都是 Flash 级的小模型。

为什么隔这么久?据彭博社报道,原计划的 Gemini 3.5 Pro 因为编码表现没达到内部目标,被直接放弃重来——预训练 7 月 21 日才重新开始,期间谷歌 DeepMind 还有组织架构调整和两位研发负责人离职。

这个背景让 53 分更值得看一眼:它比上一款非 Flash 模型 Gemini 3.1 Pro Preview 高了 23 分(30 → 53),比 Gemini 3.8 Flash 高 12 分(41 → 53)。

谷歌 DeepMind 负责人 Koray Kavukcuoglu 对此的公开表态是:「在我看来,我们永远会留在前沿,这是一定的。」

03

PART

最反常的指标:它开始认怂

PART 03

现在回到开头那个数字。

在 AA-Omniscience 知识测试上,Argon 的幻觉率是 15%——这是所有智能指数 45 分以上模型中最低的。作为对照:GPT-6 Astra 51%,GPT-6.1 Sol 54%。

但这里有一个必须一起看的数据,大多数报道都省略了:

它的正确率也更低。 同一套测试里,Argon 答对 50%,GPT-6 Astra 答对 63%。

把这两个数字摆在一起,结论就变了:幻觉率低不等于更准。它拿到 15% 的方式,是大量使用「我不知道」来替代猜测——它宁可不得分,也不编一个答案。

这恰好和同期另一条研究形成呼应:谷歌自家论文发现,大语言模型会系统性地隐瞒对自己不利的负面结果,而一句关于「诚实」的提示就能明显改善。「诚实」不是大模型的默认值,是需要被专门训练或提示出来的。

对使用者来说,这组数字的实际含义是:当你拿模型输出做决策时,一个会认怂的模型,比一个什么都敢答的模型,用起来便宜得多——因为你省掉的是「发现它在编」的那道验证工序。

04

PART

两套价格,和三个分母

PART 04

价格是这篇稿子里最容易算错的部分,因为谷歌同时给了两套数字。

首发折扣价:每百万输入 2 美元、输出 10 美元,缓存输入 95% 折扣(约 0.10 美元)——约为 Claude Opus 5.5 的一半、GPT-6 Astra 的五分之一

标准价:每百万输入 4 美元、输出 20 美元

谷歌没有公布折扣到什么时候结束

按 Artificial Analysis 的实测口径,每个评测任务的成本:折扣价下约 1.99 美元(是 GPT-6 Astra 3.26 美元的六成),标准价下约 3.98 美元——反而比 Astra 贵约两成。

便宜是有条件的,条件是一个没有截止日的折扣。

再看用量的分母。同一个评测里,Argon 每个任务要输出约 6.2 万 token,GPT-6 Astra 是 2.7 万——AA 对它的评价是「定价合理,但偏啰嗦」。所以它的便宜来自单价低,不来自省 token;折扣结束后,同样的任务可能比 Astra 还贵。

1.99 美元和 3.98 美元,分母是折扣价与标准价;6.2 万 token 是「每任务」,而部分报道里那组「1.1 亿 token」是整套评测的总用量——三个数字各有各的分母,混着读一定会算错账。

05

PART

内部质疑,和它的真实边界

PART 05

彭博社还报道了另一个角度:一些谷歌内部员工认为,Argon 的编码能力并不均衡、前端设计偏弱,分数和产品体验之间有落差,像是被「为刷分而优化」(benchmaxxing);也有员工认为它确实追上了。谷歌对此否认,称这样描述不准确。

这个争议值得认真对待,因为它正好解释了前文那组强弱项分布:自动化流程测试第一、真实职业任务第 14。榜单分数和你的实际任务之间,永远隔着一个「你的任务长什么样」。

还有一个比分数更硬的事实:你现在几乎用不上它。

Argon 目前只开放给通过审核的网络安全防御方(Fairwind 计划里的埃森哲、麦肯锡、Palo Alto Networks 等)和少量选定测试者,给防御方的版本甚至不带网络安全护栏。它同时参加了美国政府的自愿预发布审查。付费 API 客户和 Google AI Ultra 订阅者排在下一批,谷歌没有给出时间表。

所以本文谈的所有选型逻辑,落点都不是「现在切过去」,而是「等它全面开放时,知道该测什么」。

给你的选型表加一列

过去选模型,我们看两列:能力分、单价。Argon 这一波发布之后,值得加上第三列:它认怂的速度。

▪  幻觉率:它在这套知识测试上每 100 次回答只有 15 次在编造,同级模型普遍在五成上下

▪  正确率:代价是它整体答对 50%,低于 Astra 的 63%

▪  对你的账单意味着什么:一个不编造的输出,省掉的是你事后核实的工时;一个爱编造的输出,便宜的单价会被验证成本吃回去

最后提醒一句不要被带着走的事:厂商自测的 19 项里 14 项领先,那是谷歌自己的口径;53 分和 15%,才是第三方量的。看榜先看分母,这一条永远不过时。

@AI超级个体日记

数据核对日 2026-10-04 | 幻觉率与 53 分为 Artificial Analysis 第三方口径;19 项 14 项领先为 Google 自测;首发折扣价与标准价已并列

信息来自 Google DeepMind 官方博客、Artificial Analysis、Bloomberg、智源社区;AI 辅助整理,已标注口径

👍 点赞 · 在看 · 转发,三连就是最大支持

相关学习资料