一觉醒来,世界又变了
这次的变化已经越过聊天机器人升级,落到你家书桌上的一个盒子里,里面装着一颗可能改写行业格局的大脑。
2026年7月31日,DeepSeek在毫无预热的情况下发布重磅更新,DeepSeek-V4-Flash-0731 正式API公开测试。紧跟其后的三组数字更抢眼:Agent基准成绩全面碾压自家旗舰V4-Pro;有社区账单显示267万token只花3美分;开放权重量化版被社区连夜塞进了一台约4000美元的桌面小盒子里,还跑得动。


▲ DeepSeek官方宣布V4-Flash-0731进入公测,Agent基准成绩全面飙升
这三件事单独拿出来,每一件都是新闻。叠在一起,就成了一场对整个AI产业溢价体系的正面冲击。
"架构没动,只换了训练",这才是最可怕的部分
先看一个关键细节:0731沿用原有架构与尺寸,能力提升来自重新后训练。
官方在更新日志中写得明白,架构不变,参数规模不变,依然是284B总参数、13B激活参数的MoE(混合专家)结构。变的是什么?重新后训练(re-post-training)。

▲ 官方明确:0731只升级Flash API,架构与尺寸不变,V4-Pro暂不更新
用大白话讲:同一副身体,换了一套更精良的武功心法。这套心法让它在Agent相关的基准上发生了断崖式跃升,Terminal Bench 2.1拿到82.7(自家Pro预览版被远远甩在身后),DeepSWE 54.4,Toolathlon verified 70.3,甚至在某些任务上已经贴脸逼近闭源顶级模型Opus-4.8(Terminal Bench:82.7 vs 85.0)。
模型升级的重心可能正在转向"练内功"。 更好的数据、更精准的强化学习和Agent轨迹训练,足以让同一个模型脱胎换骨。这对那些靠万亿参数筑起护城河的玩家来说,是一个极不舒服的信号。
从云端到桌面:Unsloth连夜打通"最后一公里"
API降价只是开场,社区很快把模型搬到了本地。
官方帖发出后不到12小时,Unsloth团队就把量化版权重、本地运行指南、GGUF仓库一口气甩了出来。他们给出的内存门槛表,直接把讨论从"调API"拉到了"你家机器行不行":
| 4-bit(近无损) | 168 GB | |
| 3-bit | 110–135 GB | |
| 2-bit | 102 GB | |
| 1-bit | 92 GB |


▲ Unsloth几乎同步官方发布,宣布0731可在本地跑起来
这里有一个容易被忽略的细节,Unsloth特意强调:官方权重的路由专家本身就大量以FP4(4-bit)格式存储。所以当你看到"1-bit量化"时,不要以为它是从32-bit砍到1-bit那种恐怖压缩。实际的精度落差比直觉小得多

▲ Unsloth补充:1-bit约96GB可跑,但提醒官方精度本身已是FP4
这张表一出,NVIDIA DGX Spark和高配Mac Studio瞬间成了讨论焦点。前者约3999–4699美元、128GB统一内存,后者128GB起步的Apple Silicon机型,都恰好落在3-bit到2-bit的舒适区。
"4000美元无限超级智能",这句话对了几成?
Alex Finn的一条长评论把讨论推向了硬件。他引用DeepSeek官方帖,并将其概括为:"约4000美元的硬件,带来几乎无限的本地超级智能"。


▲ Alex Finn将讨论焦点转向约4000美元的本地硬件
这句话有没有道理?有,但需要加括号
社区实测给出了真实的体感区间:单机128GB级设备跑量化版Flash,速度大约在二三十tokens/s量级,不算快,但绝对"能用"。更猛的玩家用两台DGX Spark做张量并行,合计吞吐推到约82 tokens/s,甚至三路并行飙到135 tokens/s。


▲ 社区实测:双DGX Spark约82 tokens/s,并行可更高


▲ 视频实测:六路并发,合计约85.9 tokens/s
但"无限超级智能"这个词,显然带着诗人的修辞。96GB跑1-bit只能算"技术上活着";128GB跑3-bit达到"基本能干活";168GB跑4-bit才接近"不委屈智商"。 把DGX Spark说成"平均家用电脑"也有些过度,它的准确定位是桌上的个人AI超算。
3美分的震撼:API侧发生了什么
本地运行之外,云端的价格战同样惊心动魄。
官方定价表显示,V4-Flash的输出价格为每百万token仅0.28美元,缓存命中时输入更是低至0.0028美元/百万token。有开发者晒出个案账单:34次API请求共计约267万token,账单显示约0.03美元。

▲ 社区个案账单:34次API请求、约267万token,面板显示费用为3美分


▲ 284B参数、13B激活、每百万token输出仅0.28美元
这个价格意味着什么?当Agent一次任务需要模型循环调用几十上百次时,单价低×调用次数多的乘积决定了产品能不能盈利。Flash把这个乘积压到了前所未有的低位。那些按月收费199美元的编程Agent订阅服务,突然发现自己的成本假设被从根基上动摇了。
本地运行的另一项价值:数据控制
在所有讨论中,一条回复安静却有力地指向了另一个维度。


▲ Johnny Tube认为,数据留在自己的电脑上比硬件价格更重要
用户Johnny Tube把焦点放在数据控制上,并列出三个经常处理敏感资料的职业:律师(客户档案)、医生(病历记录)、会计师(财务数据)。
这三类人都要谨慎处理客户数据把资料交给公有云服务之前,通常需要完成授权、合规与安全评估。接近前沿水平的模型若能在办公室设备上运行,便为数据不出本地的工作流提供了新选择;实际部署仍需访问控制、日志与审计等配套措施。
Johnny的结论更直接:"为本地企业搭建私有AI,是一个几乎没人在做的全新服务。先行者会吃到红利"
冷水时刻:别被口号带走
当然,狂欢中总有清醒的声音

▲ 有人要求用一整天的实际工作检验模型,不能只看榜单
有用户直接开怼:"给我看用这个模型干一整天活的证明,不要只甩榜单。" 他指出,很多本地模型"被量化伤到了智商",并反问:如果云端全精度只要几分钱一次,你为什么要花4000美元买个盒子跑一个打了折的版本?
这个质疑击中了真实的工程痛点低bit量化在长程Agent任务(50步以上连续工具调用)中的稳定性,目前缺乏大规模验证。官方基准中的部分内部测试集(DSBench-FullStack / DSBench-Hard)尚不可完全公开复现。峰时双倍计价的政策也还未正式落地,重度用户的真实账单可能比个案截图高得多。
"无限超级智能"是个精彩的标题,兑现程度还要看长期实测。
拼图归位:这到底改变了什么
把所有噪音过滤掉,剩下的信号其实很清晰:
第一, 后训练正在改写"升级"的含义不换架构、不堆参数,只靠更好的训练数据和Agent轨迹,就能让一个模型从"不错"跳到"逼近顶级"。这让迭代变得更快、更便宜、更难预测
第二, AI智能的分发渠道从"仅API"裂变成API + 开放权重 + 桌面推理三条腿。量化生态正在成为一条"隐形发行渠道",谁先提供可信的量化包、谁先修好工具调用模板,谁就实际控制了本地版模型的用户体验。
第三, 成本下降扩大了试错空间当单次实验从数美元降到数美分,当一台桌面盒子就能跑完整的Agent循环,产品经理、独立开发者、小型工作室敢做的事情,量级会完全不同。
实验机会随之增多历史反复证明,更多试验往往也意味着更高的突破概率。
4000美元一个盒子,个案账单3美分,92GB起步的门槛。 这些数字今天看起来像新闻,半年后可能就是常识。而那些还在按月收费200美元卖"独家智能"的玩家,留给他们重新定价的窗口,可能比想象中短得多。
夜雨聆风