事情是这样的。
7月31号下午,DeepSeek干了一件很离谱的事。
他们没有开发布会。没有发PR稿。没有录一个CEO对着镜头讲PPT的视频。甚至连一条正式的推特都没发。
他们就是在API文档的更新日志里,加了一行字。
大概意思是,V4-Flash正式版上线了,你们可以用了。
就一行字。
然后整个AI圈炸了。
Hacker News上最热的帖子标题叫「Intelligence is now so cheap you stop metering it.」,翻译过来大概就是,智能现在便宜到你不用再掐着表算了。知乎上当晚就冲到了热榜第一,讨论量过千万。OpenRouter上DeepSeek的token调用量直接飙到全平台第一,占了16.7%的流量。
我那天晚上刷着这些帖子,脑子里就一个想法。
不是哥们,你这是什么操作???
V4 Flash 0731,到底是个什么东西
今年4月DeepSeek发过V4 Flash的预览版。当时那个版本的规格是284B总参数、13B激活、MoE架构、100万token上下文窗口。这次正式版的代号是deepseek-v4-flash-0731,架构一点没变,参数一个没加。
唯一的变化是,DeepSeek把整个后训练流程重新跑了一遍。
就这一个变化。
先说这个后训练到底怎么做的。DeepSeek用的是一套两阶段的流程。第一阶段,把编程、工具调用、终端操作这些不同的能力领域拆开,每个方向单独训练一个专家模型,用的方法是SFT加GRPO强化学习,GRPO全名叫Group Relative Policy Optimization,你可以理解成让模型在每一组回答里自己跟自己比,好的往上拉,差的往下压,比我当年被老板PUA还狠。
第二阶段就更有意思了。把这些各自训练好的领域专家,通过一种叫在线蒸馏的方法融合成一个统一模型。这个在线蒸馏的关键在于,不是拿一个外部的老师模型当标准答案去抄,而是让模型用自己的输出当教材,自己教自己。这样能避免一种特别恶心的情况,就是每融合一个新能力,旧的能力就忘掉一批,跟狗熊掰棒子似的。
这套方法论的威力,你看看benchmark就知道了。
Terminal Bench 2.1,这是一个评测模型能不能像真人一样在终端里操作电脑、写代码、调试的测试,从61.8跳到82.7,已经逼近Claude Opus 4.8的85分了。
DeepSWE,这个是测模型能不能像真正的软件工程师一样去修bug、改代码、提PR的,从7.3直接跳到54.4。翻了七倍多。
七倍。
Cybergym从38.7跳到76.7。DSBench-FullStack从37.0跳到68.7。Agents' Last Exam,这个算得上是Agent能力的大考,V4 Flash 0731拿了25.2分,Claude Opus 4.8是25.7分。差了0.5分。
0.5分。
坦率的讲,这个差距基本可以忽略不计了。
而且你知道最有意思的是什么吗。在DeepSeek官方公布的9个Agent和编程benchmark上,这个284B的Flash版本,全部超过了DeepSeek自己那个V4 Pro预览版。
V4 Pro预览版多大呢。1.6万亿参数,49B激活。
Flash用了它不到六分之一的总参数,不到四分之一的激活参数,反过来把它干翻了。
Artificial Analysis给的智能指数评分是50分,跟Gemini 3.6 Flash打平,只比GPT-5.6 Luna低1分。在开放权重模型里排进前三,仅次于Kimi K3和GLM-5.2。但在编程能力上,它已经超过了GLM-5.2,要知道GLM-5.2的体量可是它的三倍。
三个DeepSeek时刻,和一条斩杀线
我是真的觉得,这次发布最让人震撼的地方,不是性能数字本身。
是它传递出来的一个信号。
在我这行待了三年,我见过太多模型发布。大部分发布都在讲同一件事,我们参数更多了,我们算力更大了,我们训练更久了。2026年上半年尤其如此,Kimi K3 2.8万亿参数,Qwen 3.8 Max 2.4万亿参数,所有人都在往万亿参数这个方向死卷,好像谁参数少了谁就输了。
然后DeepSeek跳出来,在API文档里写了一行字,说,我这有个284B的小模型,重新训练了一下,比我自己1.6T的大模型还强。
我跟你说,这个消息对整个行业的冲击,比任何一个benchmark分数都大。因为它直接挑战了2026年这波万亿参数军备竞赛的底层逻辑。大家拼了命堆参数的时候,DeepSeek在旁边默默证明了另一件事,后训练才是真正的胜负手。
这已经是DeepSeek第三次干这种事了。
2025年1月,R1出来,全世界的AI定价体系被推倒重来,英伟达一天蒸发5890亿美元市值。那是第一个DeepSeek时刻。今年Kimi K3那一波,把开源和闭源的格局又洗了一遍,那是第二个。
现在这个是第三个。
前OpenAI研究员Jenny Xiao提出了一个概念,在国内AI圈已经传疯了,叫「斩杀线」。大概意思是,DeepSeek在AI模型市场上画了一条线,你去看开发者社区里流传的那些散点图,横轴是价格,纵轴是性能。V4 Flash 0731就蹲在左下角那个最要命的位置。所有模型公司,要么比它快,要么比它强,如果你既不比它快也不比它强,你的价值就是零。它右下方的所有模型,全被「斩杀」了。
就在V4 Flash发布的前一天,OpenAI紧急把GPT-5.6 Luna的API价格砍了80%以上。
你品品这个时间点。
不是巧合。
社区里有一句话我特别认同。梁文锋好像站在了市场上所有模型玩家的对面,DeepSeek变成了一台永不停止的收割机,所有AI公司必须跑得比DeepSeek快才能活下来。
这话听着有点残酷,但我觉得他说的是事实。
百分之一的成本,到底有多恐怖
回到价格这块。
V4 Flash 0731的API定价是,输入每百万token 0.14美元,缓存命中0.0028美元,输出0.28美元。
我帮你算一下这个账。跟Claude Opus 4.8比,输入便宜36倍,缓存便宜179倍,输出便宜89倍。有人算过,按同样的编程任务量算,V4 Flash的成本大概是Opus 4.8的百分之一。
百分之一。
这不是便宜了一点点,这是便宜到了让定价这个词本身失去了意义。Hacker News上那句intelligence is now so cheap you stop metering it,我翻译一下就是,当智能便宜到这个程度,你确实不需要再掐着表用了。
当然我也要说句实话。有一些第三方的测试发现了一个很有意思的问题,Ramp在SWE-Bench上实际跑了一遍,发现虽然单token价格确实便宜,但V4 Flash在agent任务上输出的token特别多,比Luna多了好几倍,最终每个任务的实际成本反而比Luna贵了三倍。
这个现象其实好理解。V4 Flash有个挺明显的毛病,话多。Artificial Analysis给了它一个啰嗦程度的满分评价,评测期间生成了2.1亿个输出token,是同类模型中位数的两倍。简单说就是它很能聊,但有时候该收住的地方没收住,跟喝了咖啡的我一样。
不过这不影响整体的性价比判断。DeepSeek的缓存命中率能做到98%以上,你想想看,在大部分高频使用场景里,你实际付的就是那个0.0028美元的缓存价。这才是真正的杀手锏。
输出贵,但输入基本不要钱。对于编程这种大量上下文、少量输出的场景来说,这个定价结构简直是量身定做的。
最让我兴奋的,是那个MIT
然后说一个最让我兴奋的点。
MIT许可证。
DeepSeek把V4 Flash 0731的权重完整放出来了,用的MIT协议。MIT意味着什么,你可以随便用,商用也行,改也行,自己部署也行,没有任何限制。167GB的文件,FP4和FP8混合精度,直接扔到了Hugging Face上。
几个小时之内就冲上了Hugging Face热门榜第二。vLLM、Ollama、Cline、Unsloth这些推理框架几乎同步就接入了。社区很快搞出了各种量化版本,Unsloth放出了一整套GGUF文件,从87GB的2-bit版本到162GB的8-bit无损版本都有。用128GB内存的MacBook Pro M3 Max,本地能跑到每秒26个token。
antirez,就是那个搞Redis的大佬,专门写了一个叫ds4的本地推理引擎出来,就为了在自己的MacBook上跑V4 Flash。他说了一句话我觉得特别能概括这件事,this model is too important to be locked behind an API。
我跟你说,开源和闭源这件事,DeepSeek走了一条跟所有人都不一样的路。
Meta的Llama挂着开源的牌子,但使用条款里藏着各种限制,超过7亿月活就要单独谈商业授权。开源促进会已经两次说Llama不是真正的开源了。OpenAI去年搞了个gpt-oss,也只放了权重,训练代码和数据一概没有。Anthropic到现在一个开源模型都没放过。
DeepSeek不仅放了完整权重,还另外开源了DSpark这个推理加速框架和DeepSpec训练评估工具链。全是MIT协议。你要用你就拿去用,不用问我。
梁文锋有句话我在36氪那篇稿子里看到过。他说,在颠覆性的技术面前,闭源形成的护城河是短暂的,开源更像一个文化行为,而非商业行为。
今年4月DeepSeek融了大概510亿人民币,估值4000亿。梁文锋自己掏了200亿,把直接持股从不到1%拉到了34%,外部投资者全部锁定5年、没有任何投票权。他给投资人说了一句话,把突破性研究放在赚钱之前,继续做开源,奔向AGI。
我不知道你看到这段话什么感觉。我当时的感受是,这个人tm是真的信。
不是说在发布会上讲我们相信开源的力量那种信,是真金白银砸进去、把公司控制权攥在自己手里、确保没有任何人能逼他走向闭源的那种信。
在资本圈待久了,这种人是真的罕见。
让后训练说话
如果要从这次发布里只提炼一个关键词,我觉得是后训练。
你有没有发现一个很有意思的变化。过去两年大家聊模型,聊的都是预训练,多少tokens、多少张卡、训了多久。参数规模就是最硬的通货,谁的参数大谁牛逼。
今年开始,大家聊的东西慢慢变了。Claude聊的是怎么让模型更会用工具,OpenAI聊的是怎么让模型在agent场景里不跑偏,Kimi聊的是怎么在同等参数下把编程能力拉上去。
而DeepSeek这次的发布,等于是把这个趋势直接拉满了。架构不变,参数不加,只重跑后训练,结果性能翻了好几倍。而且最夸张的是,他们把后训练的方法和加速推理的框架全都开源了。
这才是真正应该让整个行业睡不着觉的地方。
不是某一个benchmark的分数,而是有人证明了一件事,在给定同等算力和数据的前提下,后训练的方法论才是最终的胜负手。而且DeepSeek看起来在这条路上跑得比所有人都快。
站在一个内容创作者的角度,我觉得这件事对普通用户来说,其实只有一个结果。AI会越来越便宜,越来越强,而且会越来越快。
你不需要关心MoE路由到底选几个专家、CSA和HCA压缩KV Cache的时候怎么处理RoPE的维度、GRPO的KL散度约束怎么设。但你的生活会因为这些技术的变化而实实在在地变好。
就像你不用理解4G和5G的协议栈区别,但你现在在地铁上刷视频不卡了。
回到7月31号下午那个画面。
DeepSeek在API文档的更新日志里加了一行字。没有发布会。没有PR稿。没有CEO视频。
一行字。
然后全世界开发者开始疯狂跑测试,Hacker News炸了,知乎炸了,OpenRouter的调用量冲到第一,中国开源模型包揽前五名中的四个。
行业管这叫第三个DeepSeek时刻。
我倒是觉得,这更像个信号。一个告诉你「参数规模不再是唯一答案」的信号。一个告诉你「后训练和工程效率,才是接下来五年真正的战场」的信号。
以及一个告诉你「最厉害的人,往往连话都懒得跟你说」的信号。
就这些。
夜雨聆风