ARTICLE · 1113033
谷歌新AI一口气拿下14项"世界第一",发布当天,自家员工先拆了台

有个场景这两年反复上演,但今天这一版,反差特别大。
10月1日凌晨,谷歌发布了新一代旗舰模型Gemini 4 Argon。在官方晒出的成绩单上,它和GPT-6 Astra、Claude Opus 5.5等顶级模型正面比了18项测试,一口气拿下14项第一——软件工程刷新世界纪录,金融、法律专业能力领先,网络安全并列第一。
按照惯例,这又是一个"史上最强"。
可就在同一份报道的下半段,藏着三条怎么看都别扭的信息:在另一个业内常用的第三方综合智能榜上,这个模型只排第三,排在两款Claude后面;谷歌自己没敢马上把它交给普通用户,只先开放给一小批网络安全团队;更尴尬的是,彭博社当天援引谷歌内部员工的说法——它在真实任务里"并不总能达到跑分的水平",尤其编程比较吃力。
14项第一,和"没你想的那么强",同时出现在一天。
我今天不想纠结"到底谁是第一"。我更想聊一件事:我们用来衡量AI的那把尺子,可能正在失灵。
一、先承认,这份成绩单是真的能打
免得说我为了反转而反转,先把谷歌这次的硬货摆清楚。
Gemini 4 Argon,名字来自元素周期表第18号元素"氩",一种惰性气体,跟Chrome(铬)正好凑成一对。它定位很明确:专攻那些复杂、长周期的活儿——大型软件工程、金融法律这类专业知识工作,以及网络安全防御。
最受关注的一个升级,是它把单次能输出的内容上限,从上一代的6.4万个token,直接拉到了100万。注意,这是"一次能生成多少",不是"能记住多少上下文",两个不同的指标。100万是什么概念?只要你愿意等、愿意付费,它理论上能一口气吐出大约70万到100万个汉字,中间不用停。
这意味着什么?它可以在一条不被打断的思路里,去啃那些以前要拆成几十步的硬任务,比如把一个庞大的旧系统整体迁移、做一份极深的研究报告。
具体跑分也确实亮眼:在衡量真实世界长周期软件工程能力的DeepSWE v1.1上,它拿到77.9%,而GPT-6 Astra是74.1%,Claude Opus 5.5是74.2%;在金融分析、真实律师工作的测试上,有媒体形容它领先对手"两档";长视频理解91.7%;在另一个第三方测试里,它的幻觉率只有15%,是所有前沿模型里最低的——拿不准时,它更倾向于说"不知道",而不是瞎编。
价格也下了狠手。推广期每百万token输入2美元、输出10美元,命中缓存的部分再打0.5折。有测算说,按折扣价它完成单个任务的成本,比GPT-6 Astra低大约40%。
所以你看,谷歌不是搞了个噱头。这是真刀真枪的一次回归——距离它上一代旗舰,已经隔了将近七个半月。

二、可是同一天,三盆冷水依次浇下
矛盾就从这里开始。
第一盆:换一张榜,名次就变了。
谷歌自己晒的成绩总表,14项第一。但在业内很多人会参考的第三方平台Artificial Analysis的综合智能指数上,Gemini 4 Argon得分53,不仅没拿第一,还排在Claude Opus 5.5和Claude Sonnet 5.5两款模型后面,只跟GPT-6 Astra、Claude Fable 5.1打平。
同一个模型,一张榜断层领先,另一张榜屈居第三。你信哪个?
第二盆:谷歌自己的"谨慎"。
这次发布没有像过去那样,普通用户马上就能在App里用上。它先走一个叫"Fairwind(顺风)"的计划,只开放给650多家经过筛选的网络安全防御方——政府机构、关键基础设施运营者这类,而且拿到的是拆掉网络安全护栏、能完整攻防的版本。之后才轮到付费API用户和高价订阅者,最后才是普通消费者,时间表都没给死。
一家公司如果真确信自己的产品"史上最强、最安全",最自然的动作是赶紧铺给十几亿用户;而谷歌的选择是,先关起门,让一小撮专业人士试。
第三盆,也是最直接的一盆:自家人的怀疑。
据彭博社报道,有谷歌员工认为,Gemini 4虽然在基准测试里很亮眼,但在实际工作中并不总能达到同等水平,尤其是一些编程任务比较吃力。当然,谷歌方面很快反驳,也有员工出来说产品其实不错。
也就是说,"跑分惊艳"和"实战打折"这两种声音,是在同一家公司内部同时存在的。而这一说法来自匿名知情人士,你可以把它当成一个重要信号,但不必当成定论。

三、为什么两张榜能给出两个"事实"
到这儿,问题就有意思了:难道有人在说谎?
未必。更可能的情况是——跑分这东西,从怎么选、怎么考、到怎么算,处处都有讲究。
先说"考什么"。AI的能力不是一维的,不是"谁分高谁就强",而是几十种技能的组合:写代码、长程规划、操作电脑、数学、长文本、法律、金融、看视频……一个模型完全可能在"真实世界软件工程"上世界第一,同时在"从零独立搭一个项目"上输给对手。谷歌没拿到第一的那几项,就包括从零构建项目的FrontierSWE和终端操作测试,第一分别归了GPT-6 Astra和Claude Opus 5.5。
所以各家开发布会,本质上都在做同一件事:从几十项测试里,挑出自己赢得最多的那张组合,做成海报。谷歌挑了18项里赢14项的版本;Artificial Analysis用的是另一套加权方法,结论自然不同。没有谁造假,但每张榜都在"选择性地说真话"。
再说"怎么考"。谷歌在成绩说明里很坦诚:这些分数是在**最高思考档位、单次作答(pass@1)**下测的,不多次投票、不并行采样;而对比模型的分数,很多直接取自对方公司自己公布的数字。
这句话信息量很大。同一个模型,开不开"深度思考"、给不给它重试机会,分数能差出一大截。拿自己"火力全开"的成绩,去比别人发布会上"口径未必相同"的数字,严谨地说,更像是一场各穿各的跑鞋、各报各的计时的比赛。

四、真正的麻烦:尺子本身在"通货膨胀"
如果只是厂商营销挑好的说,那问题还简单。但更让人担心的,是一种正在蔓延的现象——跑分通胀。
你可以这样理解:基准测试就像一张考卷。当所有考生都提前拿到过类似的题、反复练过,分数会集体往上涨。可一张人人都考98分的卷子,就再也分不出谁真的懂、谁只是背了答案。
AI的很多公开测试题,模型在训练时可能早就"见过"或见过高度相似的内容。于是出现了一个让人不安的规律:新模型在榜单上的分数越来越高、进步越来越像神迹,可真用到没见过的现实任务里,提升往往没那么夸张。
前面提到的彭博社"实际不如跑分",说的就是这道裂缝。而爱范儿在报道里提得更直接:谷歌此前的Gemini 3.8 Flash就出现过"跑分和实测落差很大"的情况,外界因此怀疑厂商做了一些针对榜单的"特殊优化"。这属于媒体和行业的分析、质疑,不是被证实的指控,但它点破了一个公开的秘密——当分数直接关系到发布会的声势、融资的估值,就有人有动力去"应试"。
谷歌这次其实也意识到了信任问题,所以它一边晒分,一边主动强调自己在真实漏洞扫描、医院系统渗透测试里的成绩,呼吁同行把模型的思考过程保持透明,好让外界能核查。这多少是在说:光看榜,你们可能不信,那给你们看实战。

五、那普通人到底该信什么
聊到最后,对你我这种每天真要用AI干活、要为订阅掏钱的人,难道只能在一堆互相打架的榜单里抓阄?
也不是。这几件事,比"谁拿了几项第一"靠谱得多。
一看真实任务,别看总分。你需要它写代码,就直接拿你手头一个真实、有点麻烦的项目去试,看它能不能不跑偏地做完;你要它处理文档,就把你最难的一份丢给它。一个在你自己场景里反复可靠的模型,比任何榜单都更值得续费。
二看它敢不敢说"不知道"。跑分里有个特别朴素的指标——幻觉率。一个拿不准就承认、而不是一本正经编答案的模型,长期用下来会帮你少踩很多坑。Gemini 4这次最低15%的幻觉率,反而是我觉得比14个第一更有价值的数字。
三看厂商敢不敢马上给你用、给你控制权。是急着铺给所有人,还是像谷歌这次这样先小规模试、把哪些动作能自动、哪些必须问你讲清楚?后者往往说明它对边界还有敬畏。
尺子会骗人,但你自己的手不会。AI不是不能信,是别只信那张谁都能挑、也都能刷的榜。
写在最后
我得说清楚,这篇文章里"跑分通胀""厂商应试""实际不如榜单"这些,主要来自彭博社、爱范儿等援引匿名员工或行业观察的说法,我都标了出处,没有当成板上钉钉的事实。Gemini 4那份成绩单本身,是谷歌正式公布的。
但有一件事我越来越确定:当"世界第一"变成一场几乎每个月、每家公司都要宣布一次的例行仪式,这个词本身就在快速贬值。上个月还是OpenAI,这个月轮到谷歌,下个月也许就是Anthropic。第一越来越多,反而越来越不重要。
衡量一件工具最诚实的方式,从来不是它在考卷上拿了多少分,而是它在你最棘手、最具体的那件事上,到底靠不靠谱;是它犯错时,会不会老实告诉你。
所以下次再看到"史上最强""碾压全场""14项第一",别急着心动,也别急着质疑——把它拉进你自己的活儿里,真刀真枪试一把。
那场只有你一个考官的考试,分数才算数。