乐于分享
好东西不私藏

DeepSeek深夜改了一行文档:跑分暴涨5倍追平Fable 5,但3天后涨价4.5倍

DeepSeek深夜改了一行文档:跑分暴涨5倍追平Fable 5,但3天后涨价4.5倍

DeepSeek不声不响发了个正式版,然后默默涨价

8月12号半夜,DeepSeek的API文档里,模型版本号从“预览版”悄悄变成了“DeepSeek-V4-Pro-0813”。
没开发布会,没发推,博客也没更——就是一行字的改动。这家之前能让英伟达股价跟着抖三抖的公司,正式版上线就这排面?
但比这更值得聊的,是另外两件事。

跑分涨了近5倍,跟Fable 5肩并肩了

先说模型本身。
V4 Pro的底子跟4月预览版没区别:1.6万亿总参数、MoE结构、每次激活490亿参数、100万上下文窗口、最大输出38.4万token。架构没变、算力没扩,但跑分变化大得离谱:
  • DeepSWE(软件工程Agent):12.8 → 62.7,涨了差不多390%
  • Terminal Bench 2.1:72.1 → 87.9
  • DSBench-FullStack:41.8 → 71.1
  • NL2Repo:38.5 → 61.5
12.8分的DeepSWE基本等于没法用,62.7分就直接挤进了主流编程Agent的牌桌。这个跳跃不是靠堆参数堆出来的——架构原地没动,全靠后训练阶段在Agent数据和策略上重新搞了一遍。
跟Claude Fable 5比就更刺眼了。
Terminal Bench 2.1上V4 Pro是87.9,Fable 5是88.0,差0.1。九个智能体基准综合下来,Fable 5平均领先5.3%,但把“人类终极考试”这个异常样本去掉之后,差距缩到了2.8%。在CyberGym(网络安全攻防)和AutomationBench(Agent自动化)两项上,V4 Pro还反超了。
这已经不是“又一个国产模型”能概括的事了。全球顶级闭源模型跟高性价比开源模型之间的差距,肉眼可见地在消失。

上线当天其实翻了个车

话说回来,这次上线过程不算顺。
12号半夜版本号一改,社区就开始有人反馈不对劲:该长推理的任务,思考时间经常不到十秒就草草收尾;长流程任务老提前结束;同一个任务隔几个小时测一次,结果差得挺大。
13号白天,官网首页通知和开放平台公告一度被撤回,到晚上才重新官宣,同时放了调价方案出来。
版本号和官方跑分都没动,说明权重没换,大概率是部署配置出了岔子。官方到现在也没解释中间到底发生了什么。这也侧面说明一件事:官方跑分跟社区实测是两码事,V4 Pro到底提升了多少,还得等第三方大规模复测。
美国Artificial Analysis的独立评测给V4 Pro 0813的智能指数打了53分,比V4 Flash的50分只高了3分。社区里也有人反馈“复杂任务确实有提升,但跟Flash的差距没有想象中大,有些编程任务甚至还不如Flash”。

“价格屠夫”要涨价了

如果故事只到这儿,那还是“中国AI又赢了”的爽文套路。
但DeepSeek同时扔了另一颗炸弹:8月17号零点起,API全面执行峰谷定价——涨价。
V4 Pro高峰时段(工作日9:00-12:00、14:00-18:00):
  • 输出:6元→27元/百万token,涨350%
  • 缓存未命中输入:3元→9元,涨200%
  • 缓存命中输入:0.025元→0.30元,涨1100%(12倍)
空闲时段半价:输出13.5元,输入4.5元。
V4 Flash也跟着涨,高峰输出从2元涨到9元。
你肯定在想:涨了这么多,总比Fable 5贵吧?
算一笔。Fable 5的定价是输入10美元/百万token、输出50美元,综合折算大概30美元。V4 Pro涨价后高峰输出约3.8美元,就算按最高价算,也还是Fable 5的十几分之一。Hugging Face的CEO Clem算过:基准测试里Fable 5每项任务成本超过31美元,DeepSeek V4 Flash只要0.04美元——差了将近800倍。
但问题在于,“白菜价”的心理预期被打破了。
4月V4 Pro首发定价12元/百万输入、24元输出,被吐槽之后第二天直接打了2.5折,第三天缓存命中价再砍到十分之一。当时所有人都觉得DeepSeek要把低价路线走到底。结果正式版上线没几天,涨幅最高的直接翻了12倍。

为什么涨?三个现实原因

第一,用量太猛了。V4 Flash单日处理token量已经到了8万亿级别。Agent场景跟聊天不一样,一个任务要反复思考、调工具、多轮推理,token消耗是传统对话的好几倍。
第二,算力不是大风刮来的。DeepSeek正在建GW级自建算力中心,刚跟华为拿了16000张昇腾950,全是真金白银。
第三,补贴换用户的阶段结束了。不只是DeepSeek,腾讯云混元部分接口涨幅超过460%,整个行业都在从“烧钱抢用户”转向“涨价回本”。

同一天,Harness开源

跟V4 Pro正式版一起发的,还有DeepSeek Harness v0.1——一个MIT协议开源的智能体框架,核心理念是“一切皆插件”。
模型、工具、技能、会话,全是可替换的独立插件,通过Cordis框架组合。四种运行模式:Standard、PTC、Minimalist、Creative。还带完整的轨迹视图——Agent在哪一步调了什么工具、想了什么、跑偏到哪去了,全部可看、可审、可回放。
这东西直接对标OpenAI Codex和Anthropic Claude Cowork,但它是开源的。国家超算互联网已经上了完整代码和10万卡算力资源池,开发者可以下载、私有部署、二次开发。
有媒体实测:翻译一份88页论文耗时22分钟,首Token启动1.4秒、缓存命中率98%,任务中自动派了10个子代理协同;写一个贪吃蛇游戏,极简模式50秒搞定。最大的感受是透明——每一步工具调用、每个子代理派发都在轨迹里摊开,这是绝大多数闭源Agent产品给不了的。
模型权重也还是MIT协议。正式版权重什么时候放还没说,但按V4 Flash“API先跑、权重随后”的节奏,应该只是时间问题。第三方已经在国产昇腾910C集群上完成了V4 Pro的全参数后训练,DeepSeek自己也拿了16000张昇腾950做生态验证。

同一周,硅谷三家的反应很有意思

V4 Pro上线的同一天,xAI发了Grok 4.6,定价输入2美元、输出6美元,马斯克在X上置顶推广还搞了首周双倍额度促销。谷歌这边,布林被曝对Gemini进展不满,直接换了AI部门高管。
一个没出声,一个很亢奋,一个很焦躁。
更值得看的是客户在用脚投票。Uber头四个月就烧光了2026年全年的Claude Code和Cursor预算;AI创业公司Lindy把100%流量从Claude切到了DeepSeek,说省了几百万美元;智谱GLM-5.2在Vercel上线首周日均token用量涨了27倍。
当性能差距只有2.8%、价格差几十倍的时候,选哪个根本不用犹豫。

说三个判断

第一,“后训练Scaling”正在成为新的竞争主线。V4 Pro架构没变、参数没变,光靠后训练就让DeepSWE涨了5倍。智谱GLM-5.3同样是7430亿参数基座不动,靠后训练让编程能力提升了50%。大模型竞争正在从“谁的参数多”转向“谁的后训练数据和策略好”——对算力有限的团队来说,这是个好消息。
第二,AI API的“电价时代”来了。DeepSeek是国内第一个搞峰谷定价的大模型厂商,本质上跟电力系统的分时电价一个逻辑:高峰期贵、空闲期便宜,用价格杠杆调算力。以后开发者做架构设计,不光要选模型,还得选时段——批处理任务挪到晚上和周末,实时交互留在高峰。这不是临时促销,是商业模式的结构性变化。
第三,便宜不再是新闻,“又便宜又好”才是。去年DeepSeek靠低价一鸣惊人,今年V4 Pro在性能追平顶级闭源模型的同时还能保持十几倍的价格优势——就算涨了价。这才是让硅谷真正紧张的地方。当开源模型的性能跟闭源模型之间只剩下2.8%的差距,整个AI行业的定价体系都得重写。
8月17号,下周一,新价格正式生效。
该错峰的错峰,该优化缓存的优化缓存,该对比备选模型的对比备选。白菜价结束了,但好消息是:即使涨了价,它依然是这个星球上性价比最高的前沿模型之一。
你怎么看DeepSeek这次涨价?是算力成本撑不住了,还是“价格屠夫”开始收网了?评论区聊聊。
点赞关注mhmcAI,每天与你分享最新AI动态