乐于分享
好东西不私藏

日本大模型要超过中美?“河豚AI”干翻GPT-5.5比肩Fable5,到底隐藏着什么秘密?

日本大模型要超过中美?“河豚AI”干翻GPT-5.5比肩Fable5,到底隐藏着什么秘密?
2026 年 6 月 22 日,日本 AI 独角兽 Sakana AI 扔下了一枚炸弹:新模型“河豚(Fugu Ultra)”正式发布。
开场就是一张让人倒吸凉气的成绩单——在目前难度最高、水分最少的真实代码修复榜单 SWE-Bench Pro 上,Fugu Ultra 拿下 73.7 分。
作为对比,OpenAI 的 GPT-5.5 只有 58.6,Anthropic 的 Claude Opus 4.8 是 69.2。Sakana 甚至公开宣称:Fugu 已经和刚被美国出口管制“一夜下架”的顶级模型 Claude Fable 5 旗鼓相当。

日本 AI 踩在 GPT-5.5 的肩膀上,炼出了新一代的神级大模型?

真正自以为看懂的人,立即从震惊变成群嘲:这哪是大模型,它分明是个“包工头”!核心只是一个 7B 参数小模型的“指挥家”,参数不大,自己不干活,把任务拆给池子里的 GPT-5.5、Opus、Gemini,最后汇总交卷。
“高级 API 路由器”“套壳的”“大厂一断供它明天就死”……骂声一片。
但深入调研分析后重新审视了这家公司极其反常的底层逻辑。
结论:可能大家都看错了。
Sakana AI 与 OpenAI 的差异,根本不是技术路线,而是两种截然不同的“第一性原理”与“世界观”的碰撞。
这条估值高达 26.5 亿美元的日本“河豚”身上,藏着三个比跑分更性感、也更残酷的真相。今天,我们连同它底裤里的秘密,一个个拆给你看。

真相一:你以为它是套壳?这是“进化论”的降维打击

Fugu 不亲自解题,只干 3 件事,全部用自然语言完成,不用人类写代码配置:
  1. 拆任务
    :拿到用户问题,自动拆成好几步细分小活;
  2. 选人派活
    :判断每一步交给哪个 AI 最合适,比如规划交给 Gemini、写代码交给 GPT5、校对交给 Claude;
  3. 定信息权限
    :规定每个 AI 能看到前面哪些步骤的结果(有的只看原始问题,有的能看所有人的答案)。

举个例子:用户要写复杂算法题Conductor 自动安排:

  • 第一步:Gemini 做解题思路规划(看不到别的结果)
  • 第二步:GPT5 按思路写代码(只看 Gemini 的规划)
  • 第三步:Claude 检查代码 bug(看前面两个人全部输出)

简单选择题它就偷懒:直接派 1 个 AI 一步出答案,不浪费算力。

Fugu 只是个“做编排的包工头”?
Anthropic、OpenAI 笃信“Scaling Law(规模法则)”,这是一种“神创论”暴力美学:烧几百亿美金、建几个核电站,试图炼出一个全知全能的超级大脑。
而 Sakana(日语“河豚”)的哲学,是“演化论”与群体智慧。大自然从不靠算力设计完美的生物,而是靠“组合与变异”让适应力最强的基因活下来。
Fugu并不是简单编排API组合 ,它有深入骨髓的硬件级优化: 
Sakana 和全球算力霸主英伟达联合发布了 TwELL 稀疏数据架构,直接改写了 CUDA 底层内核的计算逻辑,硬生生把大模型的真实推理速度拔高了 20%。
零成本造血的“AI 科学家”: 他们做出了能自己写代码、自己发《Nature》论文的 The AI Scientist 系统,把单篇顶级论文的产出成本压到了 15 美元。
加上能修改自己底层代码的 DGM(达尔文-哥德尔机),Sakana 拥有了一座成本趋零、7x24 小时自我迭代的超级研发中心。
用最底层的 CUDA 榨干硬件性能,用演化算法“白嫖”并融合全球开源小模型,再用强化学习做 Fugu 的顶层调度。这不叫套壳,这叫生态系统对单体怪兽的“全栈工程压制”。

真相二:跑分“吊打”是人造神话,这其实是一台昂贵的“逆熵引擎”

来自知名开发者 Julian Goldie 对 Sakana AI 的三个模型 和 Fusion(一个基于 OpenRouter 的多模型路由器/编排系统) 的真实视觉构建测试对比
已关注
关注
重播 分享
测试对象
  • Fugu Ultra:Sakana 的顶级旗舰模型
  • Fugu Mini:Sakana 的轻量快速版
  • Fusion:第三方路由器方案(把提示同时发给 3~5 个不同大模型并行运行 → 一个“裁判模型”(Judge)融合输出)

最终排名1. Fugu Ultra(视觉质量王者)2. Fusion(稳定第二,性价比高)3. Fugu Mini(速度快,但质量和 Bug 较多

但是一个常规的复杂任务,Fugu 能拖拖拉拉跑上 30 分钟。输入 $5/M,输出高达 $30/M。由于多层循环编排,实际花销可能是单调大模型的好几倍。代价如此高昂,企业为什么还要用它?
随着大模型算力越来越便宜,制造“幻觉”和垃圾信息的成本趋近于零(算力熵增)。
Fugu 系统里的 7B 指挥家,为了挑战模型的不确定性,通过打回重写、交叉验证,不断将大模型输出中的“混乱”剔除,强行提取出“绝对正确的代码”。
未来Token 价格会越来越便宜,而“在混乱信息中建立确定性秩序”的能力,才是宇宙中最昂贵的能力。
Fugu 卖的根本不是模型,而是一台能抵抗幻觉的“逆熵引擎”。

真相三:“主权AI”崛起,日本财阀的真金白银投入

为什么 Fugu 偏偏选在 6 月 22 日发布?
因为 10 天前的 6 月 12 日,美国商务部一纸出口管制,逼迫 Anthropic 把顶级模型对全球非美客户一键下架。无数海外企业的业务一夜停摆。
这就是企业级客户最深的恐惧:“单一供应商锁定(Vendor Lock-in)”。
日本最大的券商大和证券、金融巨头三井住友银行(SMBC),甚至涉足军工的三菱重工,早就用真金白银买单,把 Sakana 的系统深度嵌入了资产管理和情报处理的血脉里。
一个带着美国西海岸价值观的单体大模型,永远无法映射日本金融业的保守规则,也无法对齐严苛的数据隐私法。
因此,金融业永远不会依赖于一家模型提供商,因此谁掌握了这个网络的“路由编排”,谁就掌握了主权。
为了收割这波“主权红利”,Sakana 打出了一套完美的 B端双钳攻势:
底层用 Fugu 的编排层提供了鲁棒性,不会因为个别模型断供而停止服务。
应用层则直接推出了核心产品 Marlin(自治研究代理) ,它是一款针对企业决策和深度研究设计的自治研究代理(Autonomous Research Agent)
Marlin 专注于长时间的深度推理与长周期任务,无需人工干预即可自主进行长达 8 小时以上的假设验证、网页检索和信息整合。
直接生成 100 页带严格引用的投行级研报。它对企业的 Team 版定价,直接卖到 $2495/月(近2万人民币/月)。
当普通套壳应用还在 C 端为 20 美金的月费卷生卷死时,Sakana 已经用轻资产撬动了极高客单价的政企订阅。这才是风投眼里的印钞机。

终局推演:硅基知识发现的奇点,与悬在头顶的开源之剑

算清了这笔账,你就会明白为什么 Sakana 能在不到两年内,估值狂飙到 26.5 亿美元。
看看它股东名单:
NVIDIA 给算力底座,Google 给全球生态,日本三大银行给巨额订单,甚至连美国情报局背景的 IQT 基金都入局为其安全背书。
加上精准榨取了日本政府的 GENIAC 补贴计划(免费白嫖国家级超算集群),这哪里是一家创业公司?这分明是跨国资本巨头在日本布下的“主权 AI 联合舰队”。
但悬在它头顶的达摩克利斯之剑,真的不存在吗?
有的。但真正的死穴,绝不是 OpenAI 封它的 API 接口,而是“开源生态的反噬”。
Sakana 的高资本效率,高度依赖于 Llama、Mistral 等开源模型权重的无偿开放。一旦美国以国家安全为由收紧开源协议,失去免费“原材料”的 Sakana,其“演化融合”的魔法就会瞬间失效,被拉回烧钱炼大模型的无底洞。
最后,送给所有 AI 创业者的终极启示:
  1. 小团队别碰底座大模型,ALL IN 编排: 连估值 26 亿美金的独角兽都不去死磕底层参数了。把大模型当成极其廉价的水电煤,去建你自己的“Agent OS”(智能体操作系统),在单一前沿模型与多智能体调度之间自由切换,这才是未来的核心资产。
  2. 寻找大厂进不去的行业盲区: 去解决真实行业里因为断供、合规、数据隐私而产生的具体痛点。大厂模型再聪明,也跨不过金融和军工的政企安检门。
跑分超越 GPT 只是营销手段。商业的本质,永远是回答三个问题:
  1. 你的系统是不是一台合格的逆熵引擎?
  2. 你的命根子是不是攥在开源巨头手里?
  3. 以及,谁愿意为你的不可替代性,每月支付 2495 美金?
附:本文核心数据与论据核实来源(参考引用表)
为了保证一级市场研判的严谨性,本文所有核心数据、论文背景及商业案例均来源于以下公开或权威尽调渠道,非营销杜撰:
1. 核心技术报告与顶会论文背书: Fugu 系统的核心架构方法论基于其被国际表征学习大会(ICLR 2026)接收的两篇论文,分别为负责角色分配的 TRINITY 模型和负责强化学习协同的 Conductor 架构。相关论文与数据集详见技术报告 arXiv:2606.21228v1 及 arXiv:2512.04388 / arXiv:2512.04695。
2. 跑分数据与成本定价源:
SWE-Bench Pro 的 73.7 分、超越 Claude Opus 4.8 和 GPT-5.5 的对比数据,以及输入 $5/M、输出 $30/M 的定价,均截取自 Sakana AI 官方于 2026 年 6 月 22 日发布的 Fugu 产品发布基准测试表及 Pricing 官网页面。
3. 底层执行技术与自动化科研突破:
与 NVIDIA 联合开发的 TwELL (Tile-wise ELLPACK) 稀疏架构带来 20% 加速的论文发表于 ICML 2026。(出处:Sakana AI & NVIDIA 联合发布报告,Sparser, Faster, Lighter Transformer Language Models)
将单篇顶会论文生成成本压至 15 美元的自动化系统 The AI Scientist 发表在顶级学术期刊《Nature》主刊上。(出处:The AI Scientist: Towards Fully Automated Open-Ended Scientific Discovery)
代码自演化系统 DGM (Darwin Gödel Machine) 技术详情亦来自官方发布。
4. B端商业化订单与定价实锤:
政企绑定案例: Sakana AI 深度绑定大和证券(Daiwa Securities Group)用于资产管理咨询平台,绑定三井住友银行(SMBC)自动生成提案,以及深度参与日本防务生态(如三菱重工等)的信息均来自其官方企业级案例通报与日本媒体的公开报道。
Marlin 产品定价: Sakana Marlin(深度研究代理)针对企业级客户的高昂 Team 版定价($2495/月)及其边际成本收敛逻辑,源于其 SaaS 订阅页面及第三方数据调研机构(如 Tech Jacks Solutions)的商业分析。
5. 融资、估值与股东结构:
公司在 2025 年 11 月完成 1.35 亿美元 B 轮融资、投后估值达到 26.5 亿美元的数据由官方披露,并经 Crunchbase 及 GetLatka 等创投数据平台确认。
包括 NVIDIA、Google(Alphabet)、花旗集团(Citi)、三菱 UFJ、KDDI,以及 In-Q-Tel (IQT) 等极其豪华的地缘与产业资本入局,均可追溯至相应投融资新闻公报(如 Citi Makes Strategic Investment in Sakana AI)。
6. 政府补贴与宏观红利: 其利用日本政府 GENIAC 计划(725 亿日元规模)免费获取国家级超级计算 GPU 集群的事实,由日本经济产业省(METI)与 NEDO 官方公示确认。
7. 开发者实测反馈与开源局限:
部分开源代码框架可见于官方 GitHub:⁠https://github.com/SakanaAI/fugu⁠(核心权重未开源)。
关于 Fugu 在复杂任务上高达 30 分钟的延迟以及成本过高的批评,汇总自知名 AI 学者 Ethan Mollick、开发者 Julian Goldie 等在 X (Twitter) 及 Hacker News 上的真实测试反馈。