8 月 12 日深夜 11 点,多数人已经洗完澡躺床上了。
DeepSeek 的工程师大概也是——他们把 API 文档里的 V4-Pro 从「Preview」改成了正式版,版本号更新为 DeepSeek-V4-Pro-0813,然后……就没有然后了。没有发布会,没有 CEO 演讲,没有媒体矩阵推送,连一条朋友圈都没发。
对比一下同行:OpenAI 发 GPT 要提前预热一周,Anthropic 发 Fable 5 要搞直播,Meta 发 Llama 要扎克伯格亲自录视频。DeepSeek 发旗舰?改个文档,睡觉。
别人发旗舰要开发布会,DeepSeek 发旗舰改了个 API 文档就睡了。
但别被这份低调骗了。第二天跑分数据一出来,整个 AI 圈都醒了。
先看 V4 Pro 正式版相比预览版的进步幅度——这组数据本身就很离谱:
| 基准测试 | 预览版 | 正式版 | 涨幅 |
|---|---|---|---|
| Terminal Bench 2.1 | 72.1 | 87.9 | +15.8 |
| Cybergym | 52.7 | 83.3 | +30.6 |
| DeepSWE | 12.8 | 62.7 | +49.9 |
| AutomationBench | 12.8 | 31.8 | +19.0 |
| Agents' Last Exam | 16.5 | 25.7 | +9.2 |
DeepSWE 从 12.8 干到 62.7,涨了将近 50 分。这不是迭代,这是换了个模型——但它偏偏没换。
再看跟竞品的对标,这才是真正刺激的地方:
| 基准测试 | V4 Pro 0813 | Opus 4.8 | Fable 5 |
|---|---|---|---|
| Terminal Bench 2.1 | 87.9 | 85.0 | 88.0 |
| Cybergym | 83.3 🔥 | 被反超 | 83.1 |
| DeepSWE | 62.7 | 58.0 | — |
| Agents' Last Exam | 25.7 | 25.7 | — |
Terminal Bench 87.9,仅差 Fable 5 的 88.0——0.1 分。Cybergym 83.3,直接反超 Fable 5 的 83.1,登顶该榜单。DeepSWE 碾压 Opus 4.8。Agents' Last Exam 追平 Opus 4.8。
新浪财经的原话是:「Agent 能力几乎全方位碾压 Opus 4.8,无限逼近 Fable 5,甚至有些榜单都反超了。」
小载翻译一下:Claude 的两个旗舰,被一个深夜改文档的追着打。
(来源:码力闲聊公众号、新浪财经 2026-08-13)
这里有个容易被忽略但极其关键的细节:V4 Pro 的模型架构,一个参数都没变。
还是 1.6T 总参数,还是 49B 激活的 MoE 架构,还是那个底座。Terminal Bench 从 72.1 飙到 87.9,Cybergym 从 52.7 暴涨到 83.3,DeepSWE 从 12.8 干到 62.7——全是后训练(post-training)的功劳。
打个比方:就像同一辆车,发动机没换、排量没变,但 DeepSeek 把底盘、悬挂、ECU、空气动力学套件全重新调了一遍,硬是跑出了超跑的圈速。
不换发动机,只调底盘——DeepSeek 证明了后训练才是真正的护城河。
这件事的行业意义比跑分本身更大。它说明「堆参数」的时代真的结束了。万亿参数的底座谁都能训,但同样的底座,谁的后训练做得好,谁就赢。DeepSeek 把这条路走到了极致——别人还在卷参数表,它已经把后训练玩成了玄学。
现在来看最扎心的数字。
V4 Pro 输出价格:6 元/百万 Token(约 $0.84)
Claude Opus 4.8 输出价格:$75/百万 Token
价格差近 90 倍,Terminal Bench 差 0.1 分
价格只有人家的零头,跑分就差 0.1 分——这 0.1 分,值 90 倍的差价?
这不是性价比,这是降维打击。用 1/90 的价格买到 99.9% 的性能,任何 CTO 看到这笔账都会开始重新评估技术栈。
V4 系列内部的产品线逻辑也很清晰:Flash 主打成本和并发(输出 2 元,并发 2500),Pro 主打规格和质量(输出 6 元,并发 500)。有意思的是,7 月 31 日 Flash 正式版上线时,Agent 能力(Terminal Bench 82.7)一度超过了 Pro 预览版(72.1)——便宜的先把贵的干翻了。现在 Pro 正式版终于「夺回王座」,V4 家族的内斗暂时告一段落。
但故事到这里还没完。
DeepSeek 官方定价页的价格表下方,挂着一句不起眼但分量极重的话:
「计划近期整体上调 DeepSeek API 服务的定价,预计涨幅较大,请合理安排您的使用,具体方案以正式通知为准。」
「涨幅较大」——四个字,给所有白嫖党打了一针预防针。
这事儿有迹可循。8 月 1 日,V4-Flash 单日处理 8 万亿 Token,服务器直接过载。8 月 6 日,DeepSeek 发布涨价公告。现在 V4 Pro 转正,定价页又挂出「涨幅较大」的预警。
逻辑链条很清楚:便宜到扛不住了。 8 万亿 Token 的单日负载,服务器烧得冒烟,算力撑不住了。DeepSeek 正在从「极致低价」走向「理性定价」——便宜从来不是目的,活着才是。
所以,现在用 DeepSeek API 的朋友们,且用且珍惜。
V4 Pro 正式版上线,跑分逼近 Fable 5,价格碾压全场,后训练封神。但这不是终点。
涨价预警说明 DeepSeek 的算力已经紧绷到极限。500 亿融资到账了,梁文锋的钱不是拿来烧服务器的——下一代模型,才是真正的牌。
V4 Pro 转正了,那 V5 呢?
以前 DeepSeek 的打法是「便宜到让对手难受」。接下来,可能就是「强到让对手绝望」。
当一家公司连发布会都懒得开的时候,你要担心的不是它够不够强——而是它下一步要干什么,你根本来不及反应。
夜雨聆风