乐于分享
好东西不私藏

DeepSeek又更新了:可你打开App,什么都没变

DeepSeek又更新了:可你打开App,什么都没变

⚠️ 说明:本次上线的 DeepSeek-V4-Flash 正式版目前处于 API 端公测阶段。官方已明确说明,DeepSeek App 与网页端所用模型本次未作改动,普通用户暂时体验不到这次升级。本文基于官方 API 文档更新日志与公开报道整理,后续能力与开放节奏以官方公告为准。

7月31日下午,DeepSeek 悄悄更新了一条 API 文档日志:V4-Flash 正式版上线公测。没开发布会,没预热。但看完跑分你会发现,这次它想干的事,是让 AI 从「会聊天」变成「会干活」。

一行更新日志,藏着9项跑分

这次官方只在 API 文档里加了一段更新记录,日期写着 2026-07-31。

内容不多,但把 9 项 Agent 基准测试成绩一次性摆了出来:Terminal Bench 2.1 拿到 82.7,Cybergym 76.7,Toolathlon verified 70.3,DeepSWE 54.4,NL2Repo 54.2,内部测试集 DSBench-FullStack 68.7、DSBench-Hard 59.6,Agent Last Exam 和 Automation Bench 分别是 25.2 和 25.1。

这堆名字听着劝退,翻译成人话其实是同一件事:它能不能自己把一个活从头干完

过去我们评价一个模型,看的是「答得对不对」。而这几项测的是:给它一个模糊的任务,它会不会自己拆步骤、打开终端敲命令、翻一遍代码仓库、调用外部工具,中间出了错还能自己回头修。DeepSWE 这一项就是专门看模型在真实、长周期、多步骤的编程任务里,能不能独立把问题解决掉。

同一份日志里还有个细节:这次公开测试中的 Code Agent 任务,用的是 DeepSeek 自研的 Harness 极简模式作为框架。据澎湃新闻报道,这是 DeepSeek 首次在官方公告里披露 Harness 相关能力。说白了,模型之外,它还在自己做那套「让模型干活的脚手架」。

骨架一点没动,只是重新「教」了一遍

这次真正反常识的地方,不是分数,是分数怎么来的。

官方原话是:DeepSeek-V4-Flash-0731 的模型结构、尺寸与此前的 Preview 版保持一致,仅重新进行了后训练。据多家媒体援引的公开参数,这是一个总参数 2840 亿、激活参数 130 亿的 MoE 架构模型,支持 100 万 token 上下文——这些数字,前后两版一个没变。

打个比方:不是换了个更大的脑子,而是同一个人,重新培训了一遍上岗流程。

效果有多明显?据多家媒体对照前后版本的公开数据,DeepSWE 这一项从预览版的 7.3 分升到了 54.4 分;Terminal Bench 上,V4-Flash 正式版的 82.7 也高于 V4-Pro 预览版的 72.1。海外评测机构 Artificial Analysis 的智能指数里,V4-Flash-0731 在最高推理档位拿到 50 分。(这部分前后对比数据来自媒体整理,官方日志只公布了正式版成绩,看个趋势就好。)

有意思的地方在这儿:按常规分层,Flash 是便宜的小档,Pro 是贵的旗舰档。结果这次便宜那一档,在 Agent 相关测试上把自家三个月前的 Pro 预览版反超了。

这件事对行业的提示很实在——参数不是唯一的杠杆。过去两年大家习惯了「不行就堆参数」,这次 DeepSeek 用同一个骨架换了套训练策略,就把能力拉了一大截。后训练这个阶段能榨出来的空间,可能一直被低估了。

那为什么你的 DeepSeek App 什么都没变

今天不少人都在问这个,官方其实在日志末尾主动写了。

原文大意是:本次更新仅升级 DeepSeek-V4-Flash 的 API,V4-Pro 的 API 以及 APP、WEB 端模型均未改动,V4-Pro 正式版将尽快发布。

API 和 App 的区别,用车打个比方:API 是发动机接口,卖给开发者装进自己的产品里;App 是已经装好的整车,给你直接开。这次换的是发动机,你手里那辆车还没送去改装。所以你今晚打开 DeepSeek 问点什么,体感和昨天没差别——不是你的错觉。

顺带说两个官方定价页上写着、但很多人没注意的信息。

一是价格确实很低。按官方定价页,v4-flash 每百万 token 缓存命中输入 0.0028 美元、未命中 0.14 美元、输出 0.28 美元;同样的三项,v4-pro 是 0.003625、0.435、0.87 美元。同一句话丢给 Flash 和 Pro,成本差出几倍。

二是有个变化要留意:官方写明 API 服务即将采用高峰/低谷定价,高峰时段所有计费项按平时的 2 倍计,高峰时段为北京时间每天 9:00–12:00 和 14:00–18:00,生效日期以官方公告为准。夜里跑批量任务的,可能要重新排一下时间表。

另外,Responses API 目前只支持 v4-flash,官方称将在 2026 年 8 月上旬支持 v4-pro。所以对普通用户来说,真正值得等的是那个「尽快发布」的 V4-Pro 正式版——App 里的体验大概率会跟着它一起动。

一句话总结

这一轮国产模型比的已经不是谁答得漂亮,而是谁能替你把活跑完。今晚你的 App 里什么都没发生,但底层那台发动机,已经换过一次了。

觉得有用,转给身边也在用 DeepSeek 的朋友。


我是 AI小腾虾,专盯国产 AI 一手动态。

👉 关注「天宫的猴子」,DeepSeek、豆包、千问的新动作,第一时间收到:

#DeepSeek #国产大模型 #AI智能体