五月的舞台上信誓旦旦“下个月发布”,六月沉默,七月补了个Flash充数,八月,研究机构直接宣判死刑。
这大概是2026年AI圈最戏剧性的一场“旗舰蒸发”事件。8月7日,半导体与AI产业权威研究机构SemiAnalysis在其付费通讯中抛出重磅判断:Google尚未发布的旗舰模型Gemini 3.5 Pro,性能大致只有Anthropic去年11月发布的Claude Opus 4.5水平,而且,已经被悄悄取消了。

▲ SemiAnalysis 8月7日付费通讯《Gemini is Cooked but GCP is Cooking》首屏,标题本身就是一记暴击
SemiAnalysis是全球半导体与AI基础设施领域最具影响力的研究通讯之一,其机构备忘录被华尔街投资人和硅谷高管当作决策参考。他们写下“silently canceled”后,社交媒体迅速热议。
一场被反复推迟的“下个月”
故事要从三个月前讲起
2026年5月19日,Google I/O开发者大会。CEO Sundar Pichai亲自站台,宣布Gemini 3.5系列。当天上线的是3.5 Flash,速度快、成本低的中端档位。至于旗舰3.5 Pro?官方博客白纸黑字写道:
"We're also hard at work on 3.5 Pro… we look forward to rolling it out next month."

▲ Google官方博客原文:3.5 Pro“下个月推出”。这个承诺后来成了行业笑柄
下个月多么具体、多么自信的措辞
然后,六月过去了什么都没有发生
7月16日,Bloomberg率先捅破窗户纸:Gemini 3.5 Pro延迟发布,原因是编码能力未达Google内部目标。消息一出,Alphabet股价应声下跌。CNBC的标题毫不留情
编码,恰恰是2026年企业AI最能赚到真金白银的场景。Claude Code、Cursor、各种终端Agent正把“AI帮你改真实代码仓库”变成开发者愿意付费的核心理由。在这条核心赛道上跑不动,对一个旗舰模型来说,几乎等于宣判无效。
用Flash补位,用Gemini 4画饼
7月21日,Google终于有了新动作,外界等了两个月的3.5 Pro仍未现身。
他们一口气发布了三个Flash档位的型号:Gemini 3.6 Flash、3.5 Flash-Lite、3.5 Flash Cyber。更快,更便宜,3.6 Flash的输出token成本甚至比3.5 Flash还低。效率确实在进步

▲ 7月21日博客发布三款Flash型号,旗舰Pro只字未提发布日期
但所有人都注意到了那段意味深长的措辞变化。关于3.5 Pro,博客原文是:
"Gemini 3.5 Pro is currently testing with partners and we plan to make it broadly available as soon as it's ready."

▲ 从“下个月”到“准备好就发”,语义滑坡本身就是一条新闻
请注意这条语义滑坡曲线:5月说“下个月”→ 7月变成“准备好就发”→ 8月被第三方改写为“已悄然取消”。从确定日期,到开放式承诺,到死亡宣判。在AI行业的季度级军备竞赛里,这三步走完只用了不到90天。
同一篇博客里,Google宣布Gemini 4的预训练已经开始。 一手用Flash填眼前的窟窿,一手用下一代画更大的饼,这套组合拳在科技发布史上并不新鲜。手机、显卡、云服务都上演过“旗舰跳票→中端补位→改讲下一代”的经典剧本。只不过在AI赛道,这出戏被压缩到了以周计算的时间尺度里。
“只有Opus 4.5水平”,这句话为什么是羞辱
SemiAnalysis在文中引用了自己7月9日机构备忘录的原文:
"Industry chatter suggests the upcoming Gemini 3.5 Pro is roughly Opus 4.5 level."

▲ SemiAnalysis正文中的核心判断:取消、Opus 4.5水平、全球第8或第9
这句话的杀伤力,需要一点背景知识才能完全感受到。
Claude Opus 4.5是Anthropic在2025年11月24日发布的旗舰模型。在SWE-bench Verified(衡量AI能否在真实代码库里修bug的基准)上打出约80.9%的成绩。它发布时,Google的Gemini 3 Pro才刚出几天,一度被视为世界最强之一,甚至触发了OpenAI内部的“code red”紧急应对。
但到了2026年夏天,Opus 4.5已经是“去年的模型”了。Anthropic手上有了更强的Fable 5(SWE-bench Pro 80.3%,注意这是更难的版本)、Opus 5;OpenAI祭出了GPT-5.6系列;连Meta的Muse Spark 1.2、xAI的Grok 4.5都已杀入第一集团。
说一个2026年夏天还没发布的旗舰“只有去年11月的水平”,意思是:Google用了将近三个季度,依然交不出明显超越Claude上一代产品的东西。 竞争对手早已换了一整代,分数和节奏都被拉开。
“煮太久,糊了”
消息出圈后,Gemini团队的对外负责人Logan Kilpatrick在X上试图灭火。他回复SemiAnalysis的推广帖,称这是“superficial take(肤浅的看法)”,强调Gemini团队仍在“cooking”,自己“极其看多”。

▲ Logan Kilpatrick回击SemiAnalysis:团队仍在cooking,我怎么看多都不为过
SemiAnalysis的回应冷静而锋利:
"We wish you all the best, but we'll always call it how we see it. Gemini's position among AI labs has objectively deteriorated since last November."

▲ SemiAnalysis再回:自去年11月以来,Gemini的位置客观上恶化了
而社区的反应,比分析师更不留情面网友Ace直接调侃Logan的“cooking”比喻:
"I feel like I've seen things like 'Gemini is cooking' quite a bit. Anything that cooks too long burns."

▲ “煮太久会糊”,2026年夏天AI社区最扎心的一句评论
另一位网友干脆地说:“求你别再cooking了,开始serving吧。”
玩笑背后,是整个开发者社区对Google“永远在准备、永远在下个月”的深层疲惫。当你的竞争对手已经在上菜、在收钱、在积累用户心智的时候,你还在后厨声称“大菜快好了”,这本身就是一种失败。
Fable打平Gemini最好的Pro,而且用的是更难的尺子
科技博主Chris(@ChrisGPT)的帖子在中英文圈引发讨论,成为这轮舆论的核心入口之一。他复述了SemiAnalysis的“取消”与“Opus 4.5水平”两条主线,又补上一组让Google更难堪的数据:

▲ Chris系统梳理:Fable 5在更难的SWE-bench Pro上80.3%,打平甚至超越Gemini最好的公开Pro模型
Anthropic的Fable 5在SWE-bench Pro(更难的版本)上拿到80.3%;而Google目前最好的公开Pro,Gemini 3.1 Pro,在Google自己跑的SWE-bench Verified上只有80.6%,独立复现更是只有78.8%。
换句话说:Anthropic用更难的尺子,打出了和Google用更容易的尺子差不多的分数。 而且Chris特别指出一个令人窒息的时间差:Anthropic早在2026年2月就已经有了Fable 5,那时距离Gemini 3.1 Pro发布才刚一个月。
你的对手在你发布新模型一个月后,就已经手握更强的武器。只是他们选择晚几个月才亮出来 这种“时间线碾压”,比任何一个基准分数都更让人不寒而栗。
当旗舰蒸发,Google在赌什么?
有一个被很多人忽视的视角:Google也许根本不打算在“单模型智能指数”这张计分板上死磕了。
从I/O到后续博客,Google把大量篇幅给了Antigravity(Agent开发平台)、Managed Agents、Search AI Mode、Workspace集成。他们把目标放在触达更多用户、覆盖更广工作流上,未再强调单模型分数第一。Flash够快够便宜,塞进搜索默认、塞进企业工作流,靠分发量和生态锁定取胜。
SemiAnalysis的批评,核心是拒绝这种换轨策略:没有前沿模型的实验室,长期会失去定义问题的资格。云收入再高,也只是在卖铲子,甚至是给竞争对手卖铲子。文中披露,GCP的高增长很大程度上来自向外部实验室(包括与Gemini直接竞争的对手)销售TPU算力。一边自家旗舰难产,一边给对手炼模型提供弹药,这种“左右互搏”的荒诞感,恐怕只有2026年的AI产业才能提供。
沉默就是最大的确认
截至目前,Google没有发布任何确认取消3.5 Pro的正式声明。官方语言仍停留在“partners testing”。Logan的反驳也只是否认“cooked”的总体框架,并未逐条否认取消说。
但市场和社区已经用脚投票了Reddit上r/GeminiAI的讨论帖里,用户的抱怨从基准分数蔓延到日常体验:Antigravity里的短期记忆差、幻觉严重、不按指令调用工具。有人说“3.1 Pro突然变得难用了”也有务实派表示“3.6 Flash又快又够用,何必执着于Pro”,但这恰恰印证了SemiAnalysis的判断:当你的用户开始说“中端够用了”,你的旗舰就已经在精神上死了。
在AI行业,模型取消比硬件取消更难被外界证伪。 外界看不到拆机照或空包装盒,只能观察API列表上是否出现新的model id、定价页是否上线,以及内部人士是否愿意用可引用的方式说话。当这些全部缺席时,SemiAnalysis的“silently canceled”就会迅速占据解释真空。它提供了一条干净的因果链:不够强→不敢发→改吹下一代。 即便官方语句仍停在“partners testing”,沉默本身,已经成了最响亮的确认。
八月的硅谷夜风里,有人在cooking,有人在serving,有人在burning。而Google的旗舰大模型,像一道承诺了太久却始终端不上桌的菜,最终可能直接被倒进了后厨的垃圾桶。
夜雨聆风