夜雨聆风学习资料网

ARTICLE · 1067009

AI 三巨头集体更新,用户却开始怀念旧模型了

AI 三巨头集体更新,用户却开始怀念旧模型了
9 月 21 日,xAI 发布 Grok 4.7;
9 月 22 日,OpenAI 推出 GPT-6 Sol 和 GPT-6 Luna;
9 月 23 日,Anthropic 跟上 Claude Opus 5.5。
三天,三家,几乎没给市场留喘气的空隙。按照过去的剧本,接下来的剧情应该很标准:benchmark 更高、coding 更强、价格更低,然后大家继续讨论谁又赢了。但这一次,社区里出现了一个有意思的反差:模型在往前走,用户却开始回头看。

GPT-6 Sol

模型发布后,Hacker News 上有人说自己过去一直觉得 GPT-5.6 Sol 是一个很难替代的 "sweet spot",它的表达方式、工程直觉和自己的工作习惯很合拍,甚至有人直接把它称作 "workhorse"。明明已经可以用更新的模型,却还是愿意在日常工作里继续用 5.6 Sol。(https://news.ycombinator.com/item?id=49805509)

Claude Opus 5.5

Anthropic 这边的反应甚至更直接。Claude Opus 5.5 发布后,Reddit 上很快出现了一篇标题叫 "Claude is BACK!" 的帖子,有用户说,新模型让自己重新找回了过去使用 Claude 时那种 "collaborator" 的感觉。类似的讨论还有不少:有人觉得模型终于又变得自然了,有人开始重新考虑此前因为体验变化而放弃的使用习惯。(https://www.reddit.com/r/ClaudeAI/comments/1wnpit2/claude_is_back/

Grok 4.7

有人拿 4.6 和 4.7 做实际任务比较,关注的已经不只是 benchmark,而是同一个任务到底用了多少 token、花了多长时间,以及最终是不是更容易完成;也有人直接讨论自己更喜欢哪一代 Grok 的写作和聊天风格。(https://www.reddit.com/r/grok/comments/1wmguoy/grok_47_is_out/

如果把这些讨论放在一起看,会发现大家怀念的未必是某个具体版本的参数或者 benchmark,而是一种已经熟悉的工作感觉。

01 我怀念的,是无话不说

模型用久了,人会形成一种"肌肉记忆":什么任务交给它、该怎么描述,它什么时候容易跑偏,什么时候该放手让它自己做。于是一个模型真正让人舍不得换掉的地方,是你已经知道怎么和它一起工作了。
开头那三场讨论,说法各不相同,指向的却是同一件事:用户开始在意模型的"工作性格"
更有意思的是,关于这种"新模型不合拍"的感受,在跑分上其实找不到依据——按 benchmark,新一代全面更强。但先站出来说"跑分说明不了问题"的,恰恰是厂商自己。

Anthropic 在 Opus 5.5 的发布材料里明确提到,到了这个能力水平,跑分上的细小差距已经越来越难直接代表真实工作中的差异——按官方自己的说法,内部实际用下来,Opus 5.5 和旗舰 Fable 5.1 的差距,比分数显示的更小。(https://www.anthropic.com/claude-opus-5-5

Hacker News 上关于 Grok 4.7 的讨论也出现了类似观点:真实工作中的任务表现,并不一定和榜单上的模型排序完全一致。(https://news.ycombinator.com/item?id=49788838)

02 我需要的,是各有所长

GPT-6 Sol、Claude Opus 5.5 和 Grok 4.7 都在能力、成本或者 Agent 工作能力上继续向前推进,社区里的怀念也只是特定用户、特定任务下的体验,不能据此推出上一代模型整体更强。
更现实的情况可能是,未来我们根本不会只用一个模型。复杂任务用能力更强的新模型,日常 coding 用自己最熟悉的版本,写作又换成另一个,甚至让几个模型分别负责规划、执行和检查。模型更新是厂商的节奏,具体用哪个,越来越取决于个人的工作方式。
所以这轮三家集体更新之后,社区里出现"想念旧模型"的声音,其实挺值得注意。它提醒我们当模型越来越强之后,"好用"开始变成一个比 benchmark 更私人、更具体的问题。
详细排名大家可以点击进入查看

相关学习资料