
昨天深夜,AI圈发生了一件特别"DeepSeek"的事。
没有发布会,没有预告视频,官方账号连一条推文都没发。DeepSeek只是悄悄把API文档里的模型版本号,改成了0813。
V4 Pro正式版,就这么上线了。
Django框架的联合创造者Simon Willison——AI圈有名的较真博主——专门发文指出:这次升级唯一的"官宣",就是API文档本身的更新。
你品,你细品。别家发模型恨不得租个体育场办晚会,DeepSeek发模型,像程序员半夜顺手改了行配置。
但就是这么一行改动,把一个关键基准的分数,从12.8干到了62.7。
先说分数,数字比我有说服力
DeepSWE,一个专门测AI工程能力的硬核基准。V4 Pro预览版的得分是12.8——说实话,这个分数基本等于"不会做"。
正式版:62.7。
接近5倍的涨幅。有开发者在Reddit上感叹,这个分数从7.3到12.8再到62.7,只用了两次发布,"有点离谱"。
再看Terminal Bench 2.1,测的是AI在真实终端里干活的能力。V4 Pro拿了87.9分。
Anthropic的旗舰Fable 5是多少?88.0。
差0.1分。我刷到这个数字的时候愣了一下——这不是"逼近",这是贴着脸了。
更狠的是CyberGym和AutomationBench两项,V4 Pro直接反超了Fable 5。编程榜LiveCodeBench拿了93.5分登顶,Codeforces评分3206,大概是人类竞赛选手里的顶级水平。
最反常识的地方来了
按理说,分数涨这么猛,模型架构肯定大改了吧?
没有。
架构一行没动。1.6万亿总参数、490亿激活、100万token上下文,跟预览版一模一样。所有提升,全部来自后训练。
翻译成人话:车还是那辆车,发动机没换,就是重新调了调——然后速度快了5倍。
我身边有个做模型的朋友看到这儿直接沉默了。他原话是:"后训练要是还能榨出这么多油,说明之前大家调的都不算到位。"
昨晚出手的,不止DeepSeek一家
这事的戏剧性,在于时间。
DeepSeek转正后不到两小时,xAI的Grok 4.6来了——1.5万亿参数,重点强化长时运行的智能体能力,在Artificial Analysis综合指数上直接追平GPT-5.6 Sol。Cursor第一时间接入了,写代码的人今天打开编辑器就能用。
同一天,阿里把Qwen3.8那款2.4万亿参数的旗舰权重开源了。Max级别的模型,第一次开源。
还是同一天,微软上线了自己第一个从零构建的推理模型MAI-Thinking-1。
一天之内,四颗炸弹。有人直接用了"斩杀线"这个词:全球大模型的及格线,一夜之间被重画了。
还有一刀,是捅向英伟达的
半导体分析机构SemiAnalysis昨晚的点评,相当不客气。
他们说,DeepSeek V4 Pro在智能体任务上大幅超越英伟达的Nemotron3 Ultra。要知道,英伟达这颗模型是堆足了资源和人才做出来的。
SemiAnalysis的原话更扎心:Nemotron团队有很多优秀的人才,但委员会式的模型前沿开发,根本行不通。
这话表面是夸DeepSeek,实际上是把英伟达的组织方式按在地上摩擦。一个靠精干团队加极致工程的中国实验室,反超了芯片巨头亲自下场堆料的模型——搁一年前,很多人想都不敢想。
价格,才是真正的杀招
V4 Pro的定价:输入每百万token缓存未命中3块钱,输出6块。
重点在缓存命中价——只要0.025元。实测里重度使用的缓存命中率能到88%以上,加权算下来,真实输入成本大概是标价的八分之一。
有开发者晒了账单:跑了一整天的重度Agent任务,交通模拟器加分布式物理引擎,一共花了12.5美元。
这个级别的能力,一年前想都不敢想这个价。
但有两个坑,得说清楚
第一,DeepSeek官方已经预告:近期整体涨价,而且"涨幅较大"。想用的,趁早。
第二,V4 Pro没有视觉能力。看图、读截图,都不行。社区为这事吵翻了——有人说是硬伤,有人觉得这价格要啥自行车。
我自己倒是觉得,这个取舍挺诚实的。把一件事做到极致,总比什么都会一点、什么都不精强。
最后说点跟你有关系的
可能你会说,这些基准分数跟我有啥关系?
关系在于:当准前沿的AI能力卖到白菜价,Agent这种东西就真的要变成水电煤了。前天我们还在聊Gemini和ChatGPT双双破10亿用户,昨天DeepSeek就把顶级能力的价格又往下砍了一刀。
能力在涨,价格在跌。这两条线交叉的地方,就是普通人真正用得起AI的起点。
夜雨聆风