夜雨聆风学习资料网

ARTICLE · 1121563

78B权重公开下载,189页报告里空着的那栏

78B权重公开下载,189页报告里空着的那栏

10 月 3 日是德国统一日。海德堡的 Aleph Alpha 选这天把 78B 参数的模型权重传上了 Hugging Face。

Apache 2.0 许可。不需要申请,不需要联系销售,可以商用,可以改,可以拿去部署在自己的服务器上。

这家公司此前的定位是"主权 AI"——卖给德国政府和受监管行业,让客户在自己机房里跑。这一次受众换成了开发者,交付物实打实地摆在那儿:FP8 权重,约 78GB,下载得到。

先说清楚它好在哪,再说那块空着的地方。

78B 里只点亮 3.46B 是什么意思

Kolibri 是德语蜂鸟的意思。这个名字挺贴切:总参数很大,扇翅膀的部分很小。

具体数字是 78,103,074,560 个总参数,每个 token 只激活 3,457,573,120 个,大约 4.4%。

做法是混合专家(MoE)。50 层,每层挂 384 个路由专家,外加一个所有 token 都过的共享专家。每个 token 只被送进其中 6 个专家。隐藏层宽度 2,560,词表 128,000。

打个比方:这不是一个什么都懂的巨型大脑,而是一栋楼里 384 个专科诊室。来一个病人,前台只把他分给 6 个医生,加一位全体都见的全科。楼很大,但每个病人只占 6 个诊室的时间。

代价在这里。激活 3.5B 参数不等于只要 3.5B 显存——78B 全都要装进去。权重是 FP8(e4m3),128×128 分块,KV 缓存也是 FP8,但 embedding、LM head、norm 和路由器仍保留 BF16。跑起来需要两张 H100、两张 A100 80GB,或者单张 H200、B200、B300。

有个在单卡 RTX Pro 6000 上跑过的人测到大约每秒 170 个 token 的解码速度,他把这个速度直接归功于激活参数少。跑起来确实快,装起来确实重。

一百万的上下文,和它为什么被建议砍到二十六万

模型卡上写的上下文窗口是 1,048,576 个 token,验证也做到了这个长度。但同一张卡上建议:为了服务效率和复杂任务,最好停在 262,144。

原因藏在层结构里。50 层中只有 10 层做全注意力,剩下 40 层用的是 512 token 的滑动窗口。

也就是说,"一百万上下文"这个能力是真的被验证过的,但它的大部分长度是由一层薄薄的全注意力支撑的。文档没有藏这件事,反而是官方自己建议你回到四分之一的长度去用。这种"给一个更大的数、再建议你别用满"的表述方式,在所有长上下文模型上都出现过。区别只在于,这家把机制写出来了。

训练账本:768 张 B200,21 天,392,000 GPU 小时

训练跑在 768 张英伟达 B200 上,机房分别在德国和芬兰,预训练 21 天,用掉 2 万亿 token;算上后续阶段,模型卡给出的总量约 23.6 万亿。

GPU 小时数是 392,000。按 10 月 3 日 B200 的租用报价每卡每小时 7.81 美元算,这批算力大约对应 306 万美元的租金。这个数字是租金指数算术,不是 Aleph Alpha 的电费账单。

数据配比是这件事的核心。预训练里英文 62.5%、德文 23.9%、代码 13.6%(官方博客给的德文比例是 21.3%,约 4.3 万亿 token,两个口径略有出入)。Aleph Alpha 特别解释了一句:德文部分主要来自"有机的德文网页和德文改写",因为用翻译过来的英文去训,模型会用德语讲一个美国世界。

配了 128,000 词的双语句表,专门照顾德语复合词。效果可以量化:德国基本法这段文本,Kolibri 切成 35,190 个 token;GPT-4o 和 GPT-5 用的分词器需要 41,482 个。同样的字,少切掉六千多个 token,就是更低的成本和更多留给上下文的余量。

模型卡还写了一句少见的话:Kolibri 被训练成在文档里找不到答案时回答"我不知道",而不是猜。知识截止日期是 2026 年 6 月 18 日。

"主权"这个卖点,实际买的是什么

Aleph Alpha 给 Kolibri 定的客户画像很明确:公共行政、航空航天、制造业这类受监管领域,要的是"文档不出去"。客户不想把材料发给外部 API,要在自己的机房里、按德国和欧洲的法律跑。

这个需求跟模型强不强几乎没有关系。一个能力只有七成的模型,只要它能装进客户的机柜,就比一个能力九成但必须联网调用的模型更可用。主权买的是部署的自由,不是排行榜的位置。

公开的数字里还有一句很实在的话:Aleph Alpha 考虑过做 123B 版本,最后选了 78B,理由是服务成本。

免费的边界也写在明处。权重本身 Apache 2.0,可以下载、商用、修改;但企业级部署和针对客户数据的定制,仍然通过 Aleph Alpha 售卖。这不是藏起来的小字,是这套商业模式的常规结构——开放权重负责让模型被用起来,付费服务负责让模型被用对。

那张分数表,和它缺的那一栏

官方放出的对比数据是这样的:综合得分英文 75.5、德文 70.8。对照的三个开放模型,Nemotron 3 Super 是 73.0 / 67.9,Qwen3.6-35B 是 71.4 / 67.3,Mistral Small 4 是 63.1 / 61.4。上一代 Kolibri Origin 只有 54.1 / 46.4。

单项上更亮眼:AIME 2025 是 96.9,AIME 2026 是 96.0,GPQA Diamond 84.3,LiveCodeBench v6 85.9。

也有输的地方。HumanEval+ 92.7,输给 Nemotron 3 Super 的 94.7。工具调用基准 BFCL v4 是 61.4,输给 Qwen3.6 的 67.2。长文本基准 LongBench Pro 是 64.5,也输给 Qwen3.6 的 70.8。

后两项值得停一下:长上下文和工具调用,恰好是这套架构最想服务的两个领域。

真正的问题不在哪一项输赢,而在这张表是谁做的。

所有分数都出自 Aleph Alpha 自己的评测框架。对手是官方挑的,测试工具是官方选的,参数是官方设的。截至 10 月 3 日,没有任何独立实验室发布过 Kolibri 的复核分数。

Aleph Alpha 为此做了一件远超常规的事:出具了一份 189 页的技术报告,比大多数闭源实验室为一条发布新闻给的披露都多。但报告解决的是"我们知道我们怎么做",不是"别人确认了它确实这样"。披露和验证,是两件事。

第三方综合指数里,Kolibri 被拿去对比的对手,是已经上市半年的开放权重模型——而这个领域是按周走的。

开放这件事,有两栏要填

上面说的每一条都可以在模型卡和技术报告里找到出处,没有暗指谁藏了什么。恰恰相反,这家公司把该摊的都摊了:权重、训练地点、数据配比、GPU 小时、硬件门槛、甚至"部署需要我们的 vLLM 插件"这种不利信息,都写在明面上。

问题不在于这一家,而在于所有开放权重发布都共用的那套结构。

Apache 2.0 给的是使用的自由,不是可信度的保证。发布者同时是训练者和评测者。等 78GB 权重拉到你本地、装进显存、跑出第一段德文的时候,你用来判断它行不行的依据,仍然是那张厂商自己做的表。

所以评估任何一件标着"开放"的东西,可以拆成两栏看。

第一栏是交付物:下载得到吗,需要许可吗,能商用吗,权重是真的吗。Kolibri 这一栏填得满。

第二栏是核验:谁复核过,怎么复核的,复核结果和你看到的表一致吗。这一栏今天是空的。

两栏不是一回事,而且只有第一栏会自动成立。第二栏得有人去做,而在独立复现出来之前,它就一直空着。


参考来源

  • Aleph Alpha 官方发布与技术报告、Kolibri-1 Hugging Face 模型卡(2026-10-03)
  • Startup Fortune、Trending Topics、TestingCatalog、RuntimeWire、temperature2 等对该发布的跟进、细节披露与质疑
  • Ornn Data 提供的 GPU 租用报价(2026-10-03)
  • Artificial Analysis Intelligence Index 开放权重模型对比

相关学习资料