前天晚上,准确说是两个小时之内,两个模型先后落地。
一个叫 DeepSeek V4 Pro,正式版。另一个叫 Grok 4.6,马斯克那边的。
两个都是 1.6T、1.5T 这个量级的大家伙,两个都说自己逼近了 Claude Fable 5 的体验。新智元的标题写得很直白,梁文锋突袭马斯克,DeepSeek V4 Pro 对战 Grok 4.6,首测夯爆了。
一场中美之间的正面撞线,就这么在普通人的睡梦里,打完了。
但我想聊的,不是这两个模型又高了多少分。
真的,跑分这件事,我已经有点看麻了。
斩杀线这个词,这两年中文 AI 圈一直在讲。大意是,一条及格线,低于这条线的模型,没资格上桌。
上一次大家集体讨论这个词,还是 DeepSeek 用极低的价格,把这条线狠狠往下砸了一截的时候。当时全网都在说,完了,这条线被 DeepSeek 焊死在墙角了,谁过不了谁死。
现在好了。一夜之间,两个模型同时宣布,自己把这条线,又往上顶了一截。
你如果只是盯着分看,你会得出一个很无聊的结论,又有两个模型,逼近天花板了。
但我觉得,真正有意思的地方,藏在两个模型各自的宣传词里。

Grok 4.6:把「长时运行智能体」写在最前面
先说 Grok 4.6。
马斯克那边的团队,现在叫 SpaceXAI 了,xAI 被并进了更大的盘子里,这是题外话,我们回头有空再聊。
Grok 4.6 官方给它的定位,我一个字都没改,是这么说的,重点强化长时运行智能体,以及更复杂的交互式和视觉工作能力。
看到没有,长时运行智能体。这个词,是排在最前面的。
再看数据。The Decoder 拆解了 Artificial Analysis 那个榜单,Grok 4.6 拿了 61 分,追平了 GPT-5.6 Sol,前面只剩 Claude Opus 5 的 63 和 Fable 5 的 62。
也就是说,在纯粹的聪明程度上,它已经站到了第一梯队,但也没拉开谁。
真正让它跳出来的是另一个榜,GDPval-AA v2,一个专门测真实世界知识工作的榜。它在里面排第二,仅次于 Opus 5。
这里头有个数字,我看到的时候愣了一秒。
复杂任务,Grok 4.6 平均用 53 步完成。而 Claude Opus 5,要 103 步。

同样的活,一个 53 步干完,一个 103 步干完。
53 步和 103 步的差距,是什么差距?
不是谁更聪明。是它更清楚自己要干嘛。
你想想看,一个新手,接到一个活,会怎么做。每一步都停下来想一遍,我这一步对不对,我是不是走偏了,我要不要回去重新确认一下。103 步里,有一大半是在原地打转,在自我怀疑,在反复验证。
一个老手呢。他知道这事就该这么干,先做什么,后做什么,中间哪一步出了问题该往哪儿拐。53 步,几乎每一步都踩在点上。
这就是「长时运行智能体」真正的意思。不是让你聊两句就跑,而是让它在一个任务里待得住,知道自己下一手棋落在哪儿。
DeepSeek:下一条斩杀线,藏在 Agent 里
再看 DeepSeek 这边。
V4 Pro 正式版,1.6T 参数,多模态,逼近 Fable 5。这些是标配了,大家已经习以为常。
真正让我在意的一句话,是爱范儿实测完写的那句。他们说,模型之外,DeepSeek 还有一张牌。下一条斩杀线,可能藏在它的 Agent 里。
注意这个措辞,藏在 Agent 里。
它不是说明天 DeepSeek 要发个 Agent 产品。它是说,DeepSeek 这套模型,真正的杀手锏,还没亮出来,而那个杀手锏的方向,指向 Agent。
一东一西,两个当天的对手,一个把「长时运行智能体」写在宣传词最前面,一个被评测方点破「下一条斩杀线藏在 Agent 里」。
你跟我说这是巧合?
我不信。
不止这两家:全都在往 Agent 使劲
所以你看,这场仗的表象,是分。
但这场仗真正的战场,双方都已经提前选好了。
选在 Agent 上。
而且不止这两家。你把视野再拉开一点点。
这一周,阿里刚把 Qwen3.8-2.4T-A95B 开源了,2.4T 的 MoE,激活 95B,原生 256K 上下文,这是 Qwen-Max 级别第一次开源。Meta 那边,也把 Muse Glimmer 放了出来,30B,Apache-2.0,官方原话是,围绕 Agent 循环端到端训练。
• 开源阵营,闭源阵营 • 中国的,美国的
全都在往同一个地方使劲。
那个地方叫 Agent。

这就很有意思了。
模型,到底卷到头了没有?
我想先问一个听着有点蠢的问题。
模型,到底卷到头了没有?
从数据上看,好像卷到头了。61 分,62 分,63 分,第一梯队的几个模型,挤在一条线上,谁也不比谁强出一截。纯粹的聪明程度,进入了一个平台期,这是所有人都承认的事实。
那如果聪明程度已经卷不动了,下一场仗,还能打什么?
答案就摆在那,打「能把事办完」的能力。
这是两个完全不同的东西。
• 一个是,你问它一个问题,它给你一个漂亮的回答。 • 另一个是,你丢给它一个活,它自己拆,自己干,中间遇到坑自己填,最后把成品给你。
前者,从今天起,已经白菜价了。
后者,才刚刚开始有人能做。
跑分是马力,Agent 是整车
说到这,我脑子里冒出来一个特别土的比喻,但我觉得挺准的。
跑分,是发动机的马力。Agent,是整辆车。

一台发动机,马力再大,哪怕一千匹,它也没有方向盘,没有变速箱,没有一个能跑长途的油箱。
马力数据可以印在宣传册上让人兴奋,但真正把你从 A 点送到 B 点的,是那辆能自己认路、自己加油、爆胎了自己换备胎的车。
这两年,大家全在比谁的马力大。
现在马力都到顶了,大家突然回过神来,哦,原来得先造车。
DeepSeek 和 Grok 4.6,说到底,就是两家宣布,我们不光有发动机,我们开始造车了。
「斩杀线」这个词,被改了意思
还有一个角度,我越想越觉得有点唏嘘。
就是「斩杀线」这个词本身,被改了意思。
以前,斩杀线是一条跑分的线。谁的 benchmark 高,谁活下来,谁低,谁被斩杀。那时候 AI 圈的内卷,就是一场很纯粹的数字军备竞赛。
但这两天过后,这条线的性质,悄悄变了。
它不再问「你聪明不聪明」。
它开始问「你能不能把一件事,从头到尾,办完」。
聪明的模型,满大街都是了。能把事闭环的模型,一只手数得过来。
你如果把视角再拉到我们自己身上,这件事就更清楚。
我们招人的时候,最贵的,从来不是那个最聪明的。
是那个能把事闭环的人。
聪明的实习生,一抓一大把,让他写个方案,能给你洋洋洒洒写三千字。但那个能把一个项目从头跟到尾、遇到问题不甩锅、卡住了自己想办法、最后把东西交付出来的人,是稀缺的。
聪明,解决的是「想不想得明白」。
靠谱,解决的是「做不做得到」。
AI 行业绕了一个大圈,最后发现,想得明白这件事,已经被彻底卷成白菜价了。接下来要拼的,是「做得完」。
新一轮洗牌,已经开始
我还没上手这两个模型。真的,发布会刚过去一天,我还没找到整块的时间去把两个都跑一遍。
但光是把这些信息拼在一起,我已经有点兴奋了。
因为这条线一旦划出来,很多东西都要重新洗牌。
那些只会答问题、不会干活的产品,会开始批量掉队。那些能把 Agent 跑起来的框架、那些能让模型在一个任务里「待得住」的基础设施,会变成新的香饽饽。
前几天我还看到 Grok Bot,一个月 120 美元,把 Agent 包装成一个「持久化的数字同事」,直接可以操作你的应用。你看,连卖法都开始变了。
不卖聪明了。
卖「它能替你把这摊事办完」。
新的斩杀线
回到开头那句话。
一夜之间,两个模型,把斩杀线又往上顶了一截。
但我想更正一下我自己。被顶上去的,不是一条跑分的线。
被顶上去的,是一条新的线,它划在「想得明白」和「做得完」之间。
从今往后,光会想,不够了。
你得,把事办完。
这条线,才是新的斩杀线。
以上,既然看到这里了,如果觉得不错,随手点个赞、在看、转发三连吧⭐~
谢谢你看我的文章,我们,下次再见。
夜雨聆风