五月下旬以来,大模型圈迎来史诗级密集轰炸:DeepSeek V4-Pro 永久降价 75%、小米 MiMo 万亿参数首破 1000 tokens/s、MiniMax M3 五折上线首发 1M 超长上下文、Claude Fable 5 发布 72 小时即被美国禁止非美籍用户访问、智谱 GLM-5.2 全量开源股价暴涨 48%、OpenRouter Fusion 用多模型拼团逼近 Fable 5 且成本仅一半。这不止是技术迭代,更是一场定价体系、地缘政治和产业格局的深度重构。
DeepSeek降价、小米MiMo破速度纪录、MiniMax M3五折全能力上线、Claude Fable 5被封杀、智谱GLM-5.2开源、OpenRouter Fusion拼盘逆袭 — 六个大事件在不到一个月内密集砸下来,信息密度堪比季度总结。
下面我们一个个聊。

▲ 五月下旬以来六大模型事件全景
DeepSeek V4-Pro:直接掀桌子,降价划斩杀线
5月23日,DeepSeek扔了颗炸弹出来。

V4-Pro的API价格,在5月31日限时2.5折活动结束后 — 不会恢复原价,而是永久锁定为原价的四分之一。
每百万tokens输入成本:2.5分钱。
什么概念?GPT-5.5价格的三十四分之一。不是促销,不是限时,是永久砍掉75%。
这事儿狠在哪?
DeepSeek不是在打价格战,是在重写定价规则。当一个模型在SWE-bench这些硬核评测上已经进了全球第一梯队,同时价格只有对手的几十分之一,你整个行业的成本叙事就被推翻了。
对开发者当然是利好 — 你的AI应用成本直线下降。但对竞争对手来说,这是暴击:降价75%还能活,要么说明你的成本结构有问题,要么说明你的利润预期该降了。
一句话总结这事的核心:DeepSeek把"高性能大模型是稀缺资源"这个默认设定,彻底打碎了。
但DeepSeek靠什么赚钱?这是整个行业最想知道的答案。
高瓴创投的一位合伙人在朋友圈说了句很直白的话:"DeepSeek的定价不是在算利润,是在算边际成本加一点覆盖。它的策略很清晰 — 用价格把所有人的利润空间压到零,然后靠生态位赚钱。当全中国一半的AI应用都跑在DeepSeek上,它就成了水电煤。水电煤不需要高毛利,需要规模。"
这个判断我觉得七成对。DeepSeek确实在走"规模压倒利润"的路线,但有个前提常被忽略 — 它的成本结构必须真的比别人低一个量级。幻方量化有自建算力集群,训练成本的分摊方式跟纯AI公司不一样。这是结构性优势,但能维持多久,取决于算力硬件迭代速度和集群利用率。如果H200/B300大规模铺开后算力不再是稀缺资源,DeepSeek的"便宜"就不那么有护城河了。
红杉中国的一位技术投资人提过另一个角度 — 在B端市场,"太便宜"有时候不是优势而是疑虑。企业客户选模型,价格只是因素之一,稳定性、SLA承诺、长期服务保障同样重要。DeepSeek用低价冲量没问题,但从"便宜的好模型"到"企业信赖的基础设施",还需要时间。
MiniMax M3:三张牌一次出完,还永久五折
6月1号,MiniMax发布了新一代旗舰M3。

这模型可能是国内第一个同时攥着三张牌的选手:
- 1M上下文
— 三体三部曲一次性塞进去还有余量,长文档分析、知识库问答直接受益 - 原生多模态
— 不是先识别再处理的拼接方案,端到端理解图文 - 前沿编程能力
— SWE-bench等编程评测跑到国际第一梯队
最狠的是定价:永久五折,上线就这价,不是限时优惠。
MiniMax的策略很明确:不跟DeepSeek拼地板价,打的是"全能牌"。用1M上下文+多模态+编程的组合拳,配合一个让竞品难受的价格,卡住"综合性价比最优"这个位子。
但"全能牌"最大的风险是每一项都不够极致
独立开发者、AI工具矩阵作者"老麦"测完M3后写了一段话:"1M上下文确实能塞,但塞满之后的检索精度我开始打问号 — 80万token以上的文档里做精准定位,M3没有宣传页那么自信。多模态同理,图片理解没问题,复杂图表推理还差点意思。M3是六边形战士没错,但六边形的面积够不够大,要看你用哪个角。"
全能型选手的通病:单拎一项出来,总有专精选手比你强。1M上下文?Gemini早有了。编程?DeepSeek更便宜。多模态?GPT-5.5理解力更稳。M3的优势在于"三项加一起"的综合体验 — 但这个优势能维持多久,取决于竞品补齐短板的速度。
小米 MiMo UltraSpeed:万亿参数,千token/秒,真的假的?
6月8日晚上,小米MiMo团队上线了V2.5-Pro-UltraSpeed模式。

直接上数字:通用GPU上,万亿参数模型首次突破1000 tokens/s输出速度。
懂行的人知道这意味着什么。万亿参数级别的模型推理速度,一直是行业里那堵看不见的墙 — 模型越大越慢,想快就得堆定制芯片。小米选了另一条路:模型和系统协同优化,全链路硬抠,在不降能力的前提下把速度拉爆。
目前UltraSpeed模式限时申请开放,API定价是普通V2.5-Pro的3倍,但速度提升约10倍。算一算这笔账:
实时对话的延迟从"等几秒"变成"即问即答" 代码补全、Agent推理这些对响应敏感的场景,天花板被抬高了 万亿参数模型从"实验室玩具"正式有资格谈"上生产"
雷军亲自发微博带流量。你可以说这是营销,但技术数字摆在那儿 — 2025年初,万亿参数跑出1000 tokens/s,没人敢认真想这事儿。
小米做模型的真正战略意图,技术突破只是表象,真正值得琢磨的是战略意图。
前华为智能汽车CTO、现独立技术顾问徐昕私下说了个观点让我印象很深:"小米做模型的逻辑,跟华为做鸿蒙一模一样 — 不是为了卖模型赚钱,是为了让硬件生态有自己的'大脑'。手机、汽车、智能家居,所有入口都需要AI,如果AI是别人的,小米就永远是个组装厂。有了自己的模型,它才是生态的拥有者。"
换句话说,MiMo不是产品,是小米从"硬件公司"变成"智能生态公司"的入场券。1000 tokens/s的意义不只是快,而是让万亿参数模型第一次能在手机端、车机端这种资源受限的场景里跑起来,这才是小米真正在乎的事。
不过也得泼冷水:MiMo在通用能力上跟DeepSeek、GLM还有差距。速度是长板,但深度推理、复杂编程这些硬指标,公开评测里还没看到让人信服的数据。先打速度差异化,再慢慢补能力短板 — 这是清晰路径,但补短板的速度,决定MiMo到底是"特定场景利器"还是"真正的通用选手"。
Anthropic的 Fable 5:72小时,从“最强AI”到“外国人禁用”
这一段可能是整段时期最魔幻的。

6月13日,Anthropic发布Claude Fable 5,号称"史上最强AI",编程、推理、Agent多个维度被认为实现了代际跃迁。圈内一片赞叹,开发者们排队等着用。
然后,仅仅72小时后,美国政府以国家安全为由,援引出口管制权力,全面禁止所有非美国公民访问Fable 5和Mythos 5。
禁令的范围,比大多数人预想的要狠得多:
不分人在美国境内还是境外 只要不是美国国籍,绿卡持有者、H1B签证 holders,全部中招 Anthropic自己公司的外籍员工,一样不让用
中国、印度、欧洲……所有非美籍的开发者、研究者、企业用户,一夜之间被踢出访问名单。
看到这个消息的时候,我的第一反应是:芯片禁令的剧本,正在AI领域重演。
特朗普政府援引的是出口管制权力,本质上跟封锁高端芯片是同一套逻辑 — 美国政府正在把"最先进AI模型"当战略物资管了。
有人管这叫AI领域的"新铁幕"。这个比喻你爱用不用,但事实摆在那儿:全球AI技术正在加速分裂成两条轨道。
封杀刺激了紧迫感,但国产模型还不等于完全替代
出海SaaS创业者、前字节跳动技术总监李洋的处境很典型:他的产品一半用户在东南亚,之前整个推理链路跑在Claude上。封杀令出来后72小时内做了决策,全部切换到DeepSeek+GLM的组合。"切换过程比我想象的痛,"他在朋友圈写道,"Claude的Agent推理能力确实强一截,尤其是多步工具调用和长链路规划。国产模型在简单任务上几乎无感切换,但复杂Agent场景,你真的能感觉到差距。我现在是80%国产+20%想办法绕墙用Claude,不是不想全换,是有些场景换不了。"
这段话说明一个关键事实:差距在缩小,但缩小的速度取决于你怎么定义"替代",简单聊天和编程,差距已经很小;复杂自主Agent,差距依然存在。
还有一个容易被忽略的连锁反应,封杀可能加速全球AI开源生态的碎片化。前Meta AI研究员、现Hugging Face技术顾问王哲的分析值得深思:"当最先进的模型被政治边界切割,开发者会本能地转向开源 — 因为开源没法被封锁。但同时意味着,全球AI社区可能从'围绕几个闭源巨头'的格局,变成'按政治阵营分裂的开源联盟'。这不是开源的胜利,是开源的悲剧。"
对中国AI产业来说,Claude把门关了,国产模型的市场空间和紧迫感同时被拉满。智谱GLM-5.2发布当天股价暴涨48%,不是巧合,是市场的集体投票。
智谱 GLM-5.2:卡着封杀的时间点开源,时机绝了
6月13号 — 对,就是Anthropic发禁令的同一天,智谱发布了GLM-5.2。

核心卖点:1M上下文、全球评测第三、MIT协议开源。
这个发布时机的选择,说是教科书级别的卡位不过分。Claude关了门,智谱开了窗。不是收费开窗,是直接开源 — MIT协议,商用无限制,接入零门槛。
技术面 :1M上下文追平国际一梯队,长程任务保持领先商业面:MIT开源 = 开发者随便用、商用没限制,降低到零门槛资本面:智谱港股发布后盘中暴涨47.68%,市场用真金白银投票
"MIT协议"这个选择的杀伤力,很多人没看透
前阿里云智能副总裁、现云启资本合伙人陈亮有个判断:"开源协议的选择是竞争武器。Apache 2.0和MIT的区别,大部分开发者不在乎,但企业法务来说意义重大 — MIT是最宽松的开源协议,没有任何传染性条款,意味着企业可以直接拿去用、改、卖,完全不需要开源自己的代码。智谱选MIT而不是更严格的GPL,就是在说:我不怕你白嫖,我怕你不用。"
当然,智谱正在推进A股IPO,7月初还要面对首次大规模解禁。这个节骨眼上发布有竞争力的开源模型,既是技术实力的肌肉秀,也是用"技术确定性"对冲"资本不确定性"的精妙操作。
开源不等于可持续
国内某头部量化私募的技术负责人私下跟我说:"MIT开源意味着所有人都可以fork,所有人都可以二次分发。短期看是拉生态,长期看是稀释品牌。智谱必须想清楚:开源模型的商业闭环到底是什么?卖服务?卖定制?还是纯粹做生态引流?如果只是引流,引完流之后呢?"
开源的中国大模型公司目前还没有跑通"开源→盈利"的完整路径。Hugging Face靠社区+企业服务做了,但它是平台不是模型厂商;Meta开源LLaMA是为了卖广告生态,逻辑完全不同。智谱的MIT开源是漂亮的战术动作,但战略闭环还缺一环。
不过跟Claude封杀、DeepSeek降价放在一起看,GLM-5.2开源释放的信号更值得关注:中国大模型不是只有一家能打,多极竞争的生态已经成型了。
OpenRouter Fusion:当"拼盘模型"打平了最强单模型
这一段,可能是这段时期最具想象力的事件。

Claude Fable 5被封杀的那个周末,AI模型聚合平台OpenRouter做了一个大胆的实验:既然最强的模型不让用,把几个好模型拼在一起,效果能不能接近甚至打平?
答案是:可以。
6月14日,OpenRouter发布了Fusion API,一个多模型并行推理系统。工作方式说起来简单:并行推理 → 裁决分析 → 综合输出
同一个问题,同时扔给一组模型 → 每个模型独立回答 → 裁决模型分析所有输出(找共识、找矛盾、找遗漏)→ 综合模型生成最终答案。
来看最炸裂的数据,Perplexity AI的DRACO深度研究基准(100个任务 × 39个评分维度 × 10个领域):
| 65.3% | ||
三个不算最顶的模型拼在一起,64.7%,比GPT-5.5高出近5个百分点,比Opus 4.8高出近6个百分点。只落后Fable 5不到1个点。成本只要一半。
更炸的是双模型组合:Fable 5 + GPT-5.5,得分69.0%,超越了任何单一模型,包括Fable 5自己(65.3%)。即使是最强的单模型,跟另一个模型搭配还能再进一步。单模型崇拜,真的该翻篇了。
核心问题:什么时候用、什么时候别用
局限得说清楚:
- 延迟是硬伤,并行等所有面板模型完成,实际延迟是单模型的2-3倍,实时场景不合适
- 编码场景还没验证,Fusion更适合深度研究和分析型任务,写代码目前还是单模型的天下
- 裁决模型本身可能有偏见,这会影响合成质量
超长深度推理场景,Fable 5仍有明显优势
前Google Brain研究员、现独立AI架构师陈默在技术博客里拆解了Fusion的工程可行性:"多模型裁决的原理并不新鲜,Ensemble方法在机器学习里用了十几年。Fusion的创新不在算法,在工程,它把'选模型→问问题→比较答案→综合'产品化了。但这里有个根本性的trade-off:裁决模型本身就是个模型,它的偏见和盲点会直接传导到最终输出。如果三个面板模型都犯了同一个系统性错误,裁决模型几乎不可能发现,因为它不知道什么是'对'的,只知道什么是'多数人说的'。"
这个缺陷在事实性任务中尤为危险。三个模型对某个历史事件产生了同样幻觉,裁决模型看到的不是"三个人都错了",而是"三个人意见一致,可信度很高",结果把幻觉加固了。
我的判断:Fusion的甜点区是"主观性强的分析任务",多个视角碰撞能产生增量信息;它的毒药区是"需要精确事实的任务",多数人的共识不等于事实。
方向是对的,但别把它当银弹。多模型编排这条路,正在从"高端玩家的手艺活"变成"每个开发者的标准工具箱"。

▲ 四条暗线:价格重构 · 地缘分裂 · 多极崛起 · 单模型崇拜终结
这段时间背后的四条暗线
六件事单看是新闻,放在一起看是趋势。四条线越来越清晰:
1. 价格体系在崩,而且不可逆
DeepSeek砍75% + MiniMax永久五折 + Fusion半价组合,大模型API的定价逻辑正在从"对标竞品"变成"贴近成本"。
但这里有个因果链条值得理清:降价的真正驱动力不是竞争,是技术进步。过去两年,模型训练效率的提升速度远超预期,同样的算力能训练更强的模型,同样的模型推理成本更低。DeepSeek和MiniMax只是把这个技术现实"翻译"成了商业价格。
反事实推演:如果DeepSeek没有降价75%,会怎样?竞争对手会继续维持高毛利定价,应用层的成本天花板不会打破,大量AI应用创业公司继续在"模型太贵、用户付费意愿不够"的死循环里挣扎。DeepSeek的降价不是做慈善,但客观上提前引爆了整个应用层的繁荣周期 — 这是蝴蝶效应,不是简单的价格战。
2. 地缘政治正在给AI画红线
Claude Fable 5的出口管制不是孤例。芯片禁令、模型封锁、数据本地化要求……AI正在被纳入跟半导体一样的地缘政治博弈框架。
但地缘政治切割的后果,可能比预想的更深远。短期看,封锁刺激了国产替代的需求和投资,是好事。长期看,如果AI技术生态真的分裂成两个互不相通的体系,最大的输家不是被封锁的一方,而是全球AI研究社区——因为进步的速度会慢下来。AI的核心驱动力是数据多样性和问题多样性,封闭体系里的迭代天然比开放体系慢。这不是价值判断,是系统动力学。
3. 国内AI百家争鸣
DeepSeek拼性价比、智谱走开源、小米打工程优化、MiniMax做全能旗舰 — 多层次、多维度的竞争生态已经成型。
但"多极竞争"有个隐患:资源分散。每家都走差异化路线,单点突破的力度可能不如集中攻坚。如果未来两年内无法在某个关键维度上建立绝对领先,"多极"就可能变成"各干各的、谁都不够强"。美国那边,OpenAI、Google、Anthropic虽在竞争,但共享同一个顶级人才池、同一个资本生态、同一套学术体系,竞争效率天然更高。中国AI的多极竞争能否真正形成合力,取决于开源社区的活跃度、跨公司的人才流动、统一的技术标准,这些才是决定"多极"是优势还是劣势的关键。
4. 单模型崇拜正在终结
OpenRouter Fusion和Claude封杀,从两个相反的方向指向同一个结论:押注"唯一最强模型"的时代正在过去。
但"终结"不等于"替代完成"。多模型编排目前还处于早期,Fusion是第一个产品化的平台,适用场景有限,工程成熟度远远不够。如果6-12个月内出现了针对编码场景的多模型编排方案,"单模型崇拜"的终结会加速;如果1-2年内Fusion类方案的适用场景仍局限在研究和分析领域,"终结"就还只是趋势判断,不是现实。
未来的AI应用架构,大概率是多模型、多供应商、可切换的。这不是预言,这是正在发生的事。
聊两句心里话
五月下旬以来的AI圈,确实用"震荡"来形容毫不夸张。
有人掀桌子降价,有人卡点开源,有人把万亿参数跑到千token每秒,有人被封杀得猝不及防,有人用拼团打平了最强单模型。这些事看起来各自独立,但拼在一起,指向一个判断:
AI产业正在从"技术军备竞赛"进入"格局重构"的新阶段。定价体系在重写,地缘政治在画红线,技术路线在分叉,应用范式在迁移。
作为观察者,最强烈的感受是:不要试图预测谁能赢,要确保自己不被淘汰。技术迭代的加速度没有降,地缘政治的不可预测性反而在上升,唯一确定的是:等所有人反应过来的时候,牌桌上可能已经换了人。

▲ 大模型混战时代:在混乱中找准方向
夜雨聆风