LIGHTYEAR
光年Tech

从“卷模型”到“卷Agent”:DeepSeek Harness团队的隐秘布局
作者 | 何思远
编辑 | 陈立峰
DeepSeek又放了一颗核弹,模型参数一点没变,Agent能力却翻了6倍。
七月三十一号这天,DeepSeek的API更新日志里多出了一行字,写的是DeepSeek-V4-Flash正式版API上线公测。
没有发布会做铺垫,没有直播烘托气氛,更没有PPT来展示亮点,就只是孤零零的一行更新日志,连公众号都没有推送过。
但这行字还是把DeepSeek顶上了知乎热搜的第一名,开发者社区也跟着炸了锅。
大家之所以反应这么大,是因为这次更新藏着一个让整个AI行业都坐不住的细节,V4-Flash正式版的模型结构和参数规模跟三个月前的预览版完全一致,仍旧是那个两千八百四十亿总参数、一百三十亿激活参数的MoE模型,骨架上一丁点都没动过。
唯一做出改变的地方,就是重新进行了一次后训练。
正是这一项变化,让它的Agent能力在多项基准测试里面反超了自家的V4-Pro预览版。
DeepSWE的得分从七点三猛涨到了五十四点四,涨幅超过了六倍之多。
Terminal Bench二点一这一项从六十一点八冲到了八十二点七。
在Artificial Analysis发布的智能指数上面,它也拿下了五十分,只比OpenAI的GPT-5.6 Luna低了一分。
但它的价格却只有GPT-5.6 Luna的九十分之一。
这可不是一次普普通通的性能提升,而是对整个AI行业那种堆参数、堆算力、堆GPU的信仰发起了一次系统性的质疑。

比参数更值钱的是经验
先得搞清楚这次升级到底做了些什么。
大模型的训练大体上可以分成两个阶段。
第一个阶段叫预训练,模型要从海量文本里面学习语言和世界知识,这就相当于上学读书的阶段。
第二个阶段叫后训练,模型要针对具体的使用场景做专项强化,学会怎么回答问题、怎么调用工具、怎么处理那些复杂的任务,这个阶段相当于参加工作培训。
过去两年里头,整个行业都在第一个阶段上面拼命加码。
从GPT-4到GPT-5,参数翻了多少倍没人说得清楚,但算力投入从几亿美元一路涨到几十亿美元,这可是公开的数据。
Anthropic从Claude 3做到Claude 4又做到Opus 4.8,烧掉的钱足够建起来好几个AlphaFold团队。
所有人都在赌同一件事情,就是更大的模型一定会带来更强的能力。
DeepSeek这次做的事情正好反了过来。
它没有去动上学阶段里面的任何东西,骨架没变,参数没变,知识储备也没变,就只是把工作培训这个环节重新做了一遍,也就是调整了一下模型的权重,让它更擅长拆解任务,更会调用工具,失败了知道怎么重新尝试,做完了也清楚什么时候该收手。
结果是什么呢?
一个两千八百四十亿参数但只激活一百三十亿的轻量级模型,在Agent基准测试上面把自家那个大得多的Pro预览版按在地上摩擦。
这背后的含义已经再清楚不过了,对于让AI动手干活这件事来说,工作培训比学历要重要得多。
给一个博士生多上三年课,还真不如给他三个月的真实项目经验来得实在。
而整个硅谷在过去两年里面制定的AI战略,偏偏就是建立在这个多上课就等于更聪明的假设上面的。

比GPT-5.6 Luna只差1分
价格却低了60倍
再来看看具体的数据。
Artificial Analysis的智能指数是一个综合评估模型实际工作能力的指标,它不去做传统的问答测试,而是专门考察模型在真实任务场景中的表现。
GPT-5.6 Luna在这个指标上拿了五十一分,V4-Flash-0731拿了五十分。
一分之差在统计学意义上几乎可以忽略不计。
但成本上面的差距可就大了去了。
OpenAI前几周刚把GPT-5.6 Luna的价格砍掉了百分之八十,明摆着是在应付竞争压力。
可就算砍掉了百分之八十,Luna的API价格仍然高出V4-Flash几十倍之多。
用Artificial Analysis的原话来说,即便OpenAI把GPT-5.6 Luna的价格下调了百分之八十,DeepSeek-V4-Flash正式版在其自有API上面的单任务成本还是要比GPT-5.6 Luna低了大约百分之六十。
换一个更直观的说法可能更好理解。
有位开发者贴出了一组对比数据,用V4-Flash执行一次本地文件阅读加全网信息检索汇总的任务,消耗了五十一万个tokens,花费只有五毛三分钱人民币。
同样的任务要是换成GPT-5.6 Sol来做,成本得翻上几十倍。
当然你可以说GPT-5.6在那些极端复杂的场景下上限更高。
可问题在于,大家需要的只是一个在合理成本下面能够稳定完成任务的Agent,而不是一台核反应堆。
DeepSeek赌的就是这个市场需求,它用一个够用的产品把价格压到了几乎为零的地步,然后逼着所有竞争对手面临一个两难的选择,要是跟进来降价,利润就得归零,要是不跟,客户就会全部跑光。
Arena.ai的评测报告里有句话说得挺微妙,V4-Flash以一千五百八十六分的成绩重塑了Frontend Code Arena的跑分榜单,每百万token的价格是零点一四美元和零点二八美元,在同类产品里性价比是最高的。
注意它用的是重塑榜单这个词,而不是简简单单的上榜,因为按照旧的性价比公式来算,这个价位的模型根本就不该拿到这样的成绩。

奥特曼和哈萨比斯的赌注
被一行更新日志动摇了
DeepSeek这次更新实质上是在挑战一个行业共识。
Sam Altman在过去三年里反反复复强调着一个逻辑,AGI需要前所未有的算力规模,所以OpenAI也需要前所未有的融资规模。
这个逻辑支撑起了OpenAI八千五百二十亿美元的估值,还有星门计划里面那几千亿美元的数据中心投资。
Demis Hassabis在解释为什么要解散AlphaFold团队的时候,说的也是同一套话术,所有资源都应该集中到更通用的系统上面去,因为通用能力最终会覆盖掉专用能力。
这两个人底层的假设完全一样,更大的通用模型就等于更强的AI,也就等于更值钱的公司。
DeepSeek用一行更新日志在这个等式的第一个环节上面打了一个问号。
如果后训练优化能够在完全不增加参数的前提下,让模型的Agent能力暴涨六倍,那更大这个变量是不是被高估了?
当然也不能说参数规模就完全不重要,预训练阶段的知识储备确实决定了模型的上限。
但DeepSeek这次的实验至少证明了两件事。
第一件事是对于绝大多数实际的工作场景来说,当前参数规模所储备的知识已经足够用了,瓶颈并不在于知道什么,而在于能不能动手去干。
第二件事是后训练优化的空间比行业普遍认知的要大得多,大到可能让OpenAI和Anthropic过去两年在参数扩张上的那些巨额投入显得效率低下。
摩根士丹利在苹果财报后面写了一句被广泛引用的话,AI目前还没有给苹果的产品或服务带来任何可以衡量的推动力。
其实这句话完全可以改一改用到AI行业自己身上,三年烧掉了万亿美元级别的资本开支,却还没有诞生出一个真正能证明参数规模就等于商业价值的商业闭环。
DeepSeek用九十分之一的成本逼近了旗舰模型的Agent能力,这等于在说你们花掉的那些钱,大部分可能都花错了地方。

Agent时代的权力转移
从模型大小到工作流效率
还有一个更隐蔽的信号藏在DeepSeek的这次更新里面。
就在V4-Flash上线前几天,DeepSeek破天荒地公开提到了DeepSeek Harness这个东西。
这是一套包裹在AI模型外面的工作套件,负责给模型准备上下文、调用工具、追踪任务状态、管理反馈、设定边界。
说白了就是把AI从能聊天的状态变成能干活的状态所需要的基础设施。
中信证券在研报里面把这件事的价值讲得很透彻,Harness解决的是长程任务带来的痛点,能把模型能力转化成稳定的端到端交付。
谁先建立起成熟的Harness体系,谁就能把模型层的成本优势转化成应用层的生态优势。
这句话里面藏着的信息量很大。
过去两年AI行业的话语权完全捏在模型厂商的手里,OpenAI、Anthropic、Google这几家说了算,它们决定什么模型最好、什么能力最重要。
应用层公司只能跟在后面跑,每出一个新版本就得重新适配一遍。
但Agent时代把这个格局给改写了。
当模型能力趋近同质化,V4-Flash和GPT-5.6 Luna在Agent任务上只差了一分,竞争的焦点就从谁的模型更聪明转向了谁的工作流更顺畅。
而在这一维度上面,Harness的重要性开始超过模型本身。
DeepSeek显然看到了这个转向,它在模型层用极致的性价比撕开了一个缺口,同时在Harness层悄悄做着布局,试图建立起一个从模型到交付的完整闭环。
这个闭环一旦跑通了,OpenAI的API就不再是必选项,开发者完全可以选择DeepSeek的模型再加上DeepSeek的Harness,用十分之一的成本完成同样的工作。
这才是DeepSeek真正的野心,它要做的不是一个更便宜的模型,而是要重新定义AI工作流的标准。

峰谷定价背后的算力调度野心
在V4-Flash上线的同时,DeepSeek还悄悄升级了API的定价机制,引入了峰谷定价的模式。
V4-Pro在低谷时段的价格被压到了极低的水平,输入缓存命中的情况下只要零点零二五元每百万tokens。
但Flash正式版在部分高峰时段的定价反而比预览版翻了一倍。
这个定价机制的真实目的并不是为了赚钱,以DeepSeek现在的定价水平,赚也赚不了几个钱。
它真正想做的事情是算力调度,通过价格信号引导开发者在低谷时段批量跑任务,在高峰时段避开拥堵,从而把已有的GPU集群利用率最大化。
在所有人都在拼命买更多GPU的时候,DeepSeek想的是怎么把现有的GPU利用率提到最高。
这个思路跟它不扩参数只优化训练的逻辑是一脉相承的,都是用工程效率来换取规模投入。
还有一个容易被忽略的数据,OpenRouter的最新统计显示中国AI大模型的周调用量已经领跑全球了。
前五名依次是小米MiMo-V2.5、DeepSeek V4-Flash、腾讯HY3、智谱GLM-5.2,还有DeepSeek V4-Pro。
DeepSeek两个模型挤进了前五,中国模型整体的市场份额大约占了百分之六十三点五。
硅谷的朋友们花了几千亿美元去建数据中心,结果全球调用量最大的五个模型里有四个来自中国,其中三个还几乎是免费的。
这笔账Sam Altman和黄仁勋在下次开董事会的时候应该不太好算。

最后
模型参数没变,Agent能力翻了六倍,价格不到竞品的九十分之一,没有发布会,就只是一行日志。
DeepSeek这一仗打的到底是什么呢?
它并不是要去跟OpenAI在参数规模上面硬碰硬,以DeepSeek的资源和融资规模来看,那根本就不可能。
它打的是一场不对称的战争,用工程效率去撬动规模上的劣势,用后训练优化去抵消算力上的差距,再用极致的性价比去蚕食竞争对手的市场份额。
过去两年AI行业一直沉溺在这样一个叙事里面,更大的算力投入会带来更大的模型,更大的模型会带来更强的AI,更强的AI会带来碾压一切的商业优势。
这个叙事养出来了一个万亿美元级别的产业链,英伟达的GPU、台积电的先进制程、云厂商的数据中心,全都绑在了这条链子上面。
DeepSeek用一行更新日志在这条链子的第一个环节上面打进了一根楔子。
它证明了一件事情,在Agent时代聪明比强壮更重要。
而这个结论要是成立的话,越来越多的证据也表明它确实在成立,那整个AI行业的估值逻辑都得重写一遍。
不,DeepSeek并不是要打败OpenAI。
它要做的是重新定义赢了到底是什么意思。
夜雨聆风