乐于分享
好东西不私藏

Kimi K3 开源:免费下载,运行却要一座机房

Kimi K3 开源:免费下载,运行却要一座机房

01一个「免费米其林」从天而降

2026 年 7 月 27 日,月之暗面在 K3 开放日把完整模型权重正式向全世界开放:免费下载、允许大部分商用(达到一定收入或用户规模的对外模型服务需遵守额外条款)。据官方披露,K3 是 2.8 万亿参数的 MoE 模型,多项国际权威评测冲到全球第三,前端编程单项一度登顶世界第一,原生支持视觉理解,并拥有 100 万 token 上下文窗口——这是全球首个开源的 3 万亿级别模型。

这个分量不轻。K3 发布后的首个交易日,美股芯片股和 AI 板块出现大幅震荡;马斯克在相关评测下留言「令人印象深刻」,还透露 xAI 正在训练一款 2 万亿参数的新模型来竞争。一家中国公司放出一个免费模型,半个硅谷都坐不住了。

开源模型到底「开源」了个什么?

图纸 vs 大脑。 以前我们说的开源软件,开放的是「源代码」——人写的、人能读懂的说明书,可以逐行阅读、找问题、改功能。但开源模型开放的是另一样东西:权重。权重是大模型这个「人工大脑」里,几万亿个神经元连接的强度数值。K3 有 2.8 万亿个参数,打包起来约 1.4TB。而且权重文件不是普通文档,即使用专门工具解析,你看到的也只是一层层巨大的数字矩阵——你能微调、量化、训练衍生版本,却很难像读源代码那样,逐行看懂某个数字代表什么。一句话:开源软件给你的是能看懂的图纸,开源模型给你的是一颗已经造好的大脑。 

02K3 的架构骨架:一份逐字模型卡

先别管「能不能跑」,单看这份来自官方 GitHub README 的模型卡,就能明白为什么它被称为「米其林三星」——它不是把参数堆大那么简单,而是一套为万亿规模专门设计的架构。

参数
Kimi K3
总参数 / 激活参数
2.8T/ 104B
层数
93(含 1 个稠密层)
注意力层构成
69 KDA + 24 Gated MLA
专家数 / 每 token 激活
896 / 16(+ 2 共享专家)
上下文长度
1048576(100 万 token)
激活函数 / 词表
SiTU-GLU / 160K
视觉编码器
MoonViT-V2(401M 参数)
量化
MXFP4 权重 / MXFP8 激活(量化感知训练)
模态
文本 + 图像(原生多模态)

几个值得 Agent 架构师记住的数字:激活参数 104B、激活比例约 3.7%,这和「896 个专家每 token 只激活 16 个」完全一致——它本质是个极稀疏的 MoE。100 万 token 上下文意味着它能把整部《三体》三部曲一次吞下;MoonViT-V2 视觉编码器从零用 next-token prediction 训练、无需对比预训练,说明它是真·原生多模态,不是后期接个视觉塔。

能力定位上,官方评测显示 K3(max)在多项指标逼近甚至局部超过顶级闭源:GPQA Diamond 93.5(Fable 5 为 92.6)、BrowseComp 91.2、Terminal-Bench 2.1 88.3、SWE-Marathon 42.0。整体仍落后 Claude Fable 5 与 GPT-5.6 Sol,但已稳定超过榜单上其他所有模型。

03三个让「稀疏」站得住的招

把参数堆到 2.8T 不难,难的是在这么极端的稀疏度下还能稳定训练、高效推理。官方技术报告和开放日披露了三套关键设计。

第一招:KDA 混合线性注意力 + 注意力残差。 Kimi Delta Attention(KDA)是一种混合线性注意力机制,为注意力扩展提供高效基础;Attention Residuals(AttnRes)不是在各层均匀累积表示,而是有选择地跨深度检索表示。二者以 3:1 比例混合(即 69 层 KDA + 24 层 Gated MLA),共同构成架构骨架,让信息在更长序列和更深模型里流动得更顺。顺便提一句:KDA 给传统 prefix caching 带来了新挑战,月之暗面已向 vLLM 社区贡献了对应实现。

第二招:Stable LatentMoE + Quantile Balancing。 896 个专家只激活 16 个,路由和优化是核心难题。Quantile Balancing 直接根据路由分数的分位数分配专家,避免启发式更新和敏感的均衡超参数;再配合 SiTU(Sigmoid Tanh Unit)和 Gated MLA 增强激活控制与注意力选择性。这些改进让 K3 相比 K2 的整体规模化效率提升约 2.5 倍——也就是单位算力产出的智能约为原来的 2.5 倍。

第三招:MXFP4 量化感知训练。 K3 从 SFT 阶段起就采用量化感知训练,用 MXFP4 权重 + MXFP8 激活,以适配更广泛的硬件。这决定了它不是一个「训练用高精度、部署再量化」的模型,而是生来就为低精度硬件友好——这直接降低了后面机房账里的落地门槛。

04MoE 的反常识:只激活 16,不代表只装 16

K3 内部有 896 个专家子网络,每次推理只激活其中 16 个。很多人一听就乐观了:每次只用 16 个,那我不需要把 896 个都装下吧?

不行。

这就像一所拥有 896 个专科的超级医院。每位病人确实只需要其中 16 个科室会诊,但你不知道下一位病人需要哪 16 个科室。你不能只开 16 个、把其他 880 个锁了——整所医院的科室都得在那里随时待命,需要时能迅速调度。K3 也一样:每次计算只调用一小部分专家,但完整的 2.8 万亿参数仍然需要被系统保存,并且随时能够访问。而真正要做到响应够快、多人同时使用,就得把这些权重分布在大量高速显存里。

所以,我非常支持软件和 AI 模型开源。但开源可不是没有了门槛,而是把门槛从法律世界搬到了物理世界:以前闭源模型的门槛,是对方让不让你用、收你多少钱;现在开源模型 K3 把门打开了,但想进门,前提是你得有一个机房。

05部署:官方钦定三引擎 + 一个被忽视的坑

如果你决定要部署,官方在 GitHub 明确推荐了三个推理引擎:vLLM(官方 recipes)、SGLang(官方 cookbook)、TokenSpeed。建议运行在 64 个或更多加速器组成的 supernode 上——因为推理效率受益于更大的高带宽通信域。看到 SGLang 没?这正是咱们之前文章《SGLang vs vLLM 选型》的主角,官方钦定意味着它的 RadixAttention 前缀缓存路径已经为 K3 的 KDA 做过适配。

不想自建机房?官方 API(OpenAI / Anthropic 兼容)是更省的路。价格按官方披露:输入命中缓存 2 元/百万、未命中 20 元/百万,输出 100 元/百万。借助 Mooncake 分离式推理架构,K3 编程场景的缓存率超过 90%,实际输入价格仅为标准输入价的 1/4。对一个 Agent 跑长上下文、反复复用系统提示的场景,这条缓存率就是真金白银。

一个被忽视的部署坑:保留思考历史模式。 K3 在后训练阶段全程使用「思考历史保留」模式。官方明确警告:如果你的 Agent 框架没有按要求回传完整的助手消息(包括 reasoning_content 和 tool_calls,而不只是 content),或从别的模型正在进行的会话中途切换到 K3,就可能引发上下文干扰,导致生成质量不稳定。Context Engineering 的核心——你控制不了模型「想什么」,但必须保证历史推理 token 完整回流,否则 Agent 跑到第 N 步就开始摆烂。 

import openai

def chat_with_preserved_thinking(client, model_name):

    # 必须把上一轮 assistant 的完整消息原样回传

    messages = [

        {

            "role": "user",

            "content": "告诉我三个随机数。"

        },

        {

            "role": "assistant",

            "reasoning_content": (

                "我先列五个:473, 921, 235, 215, 222,"

                "告诉你前三个。"

            ),

            "content": "473, 921, 235"

        },

        {

            "role": "user",

            "content": "你刚才还想到的另外两个是多少?"

        },

    ]

    resp = client.chat.completions.create(

        model=model_name,

        messages=messages,

        stream=False,

        max_tokens=4096,

        reasoning_effort="max",

    )

    return resp.choices[0].message.content

06Infra 三件套开源:不止开放权重,还开放「造模型的能力」

这次开放日不只对模型权重开放,还开源了支撑 K3 训练的三项 Infra 技术,覆盖通信、算子、分布式 RL 环境的关键链路。

MoonEP:为超大细粒度 MoE 打造的高性能通信库,让专家并行(expert-parallel)的通信在负载不均衡时仍实现极致效率——这是 896 专家规模下吞吐的命门。

FlashKDA:KDA 的高性能算子(kernel)。官方数据:在英伟达 H20 上,相比 flash-linear-attention 基线,prefill 速度提升 1.72–2.22 倍,可直接作为 flash-linear-attention 的替换后端。对长上下文 prefill 场景,这是实打实的优化。

AgentEnv:与 KVCache.ai 合作开发的沙箱系统,为 K3 后训练提供高保真、强隔离的 Agent 环境,支持快速快照、恢复与分叉(fork),应对大规模并行的 Agent 工作流与 RL 训练。注意,这是一个专为 Agent 后训练设计的基建——月之暗面把「怎么训练出一个会干活的 Agent」这件事本身也开源了。

07机房账:这个厨房买不起

米其林三星把招牌菜谱免费公开了,配料克数、火候时间、每个步骤都写得清清楚楚。你能照着做吗?看起来能——直到你翻到第一页厨房要求:需要 64 口专业灶台同时开火,供电要达到小型工厂水平,光买齐设备就要花掉近两千万。菜谱是真免费,厨房是真买不起。

K3 的「厨房」有多大?你能买到的最顶级游戏显卡,显存 32GB;而 K3 权重超过 1400GB。一张顶配游戏卡,只装得下这个模型极小的一部分。月之暗面官方建议:使用 64 张以上加速卡组成的超节点,按同类硬件估算采购成本超过 240 万美元(约 ¥1700 万+)。更别提 64 张显卡满载功耗接近 45 千瓦——而普通家庭入户电力只有 8 到 12 千瓦,就算白送你设备,电表和电线也带不动。

两套经济学。 传统软件:开发很贵,复制和运行几乎免费。大模型:开发极贵,复制免费,但每一次运行都在真金白银地烧电、烧显卡。免费下载只解决「复制」,真正昂贵的「运行」一分钱省不下来。 

对照一下:官方 API 每月几十到几百元就能用上;而自己完整部署,社区估算至少需要 16 张 H200 才装得进权重(装得进 ≠ 跑得高效),硬件开销几百万元人民币,还不算电费、机房和运维。一边是月费几千到几万,一边是几百万元一次性投入——这就是「顺利使用」和「绝对拥有」之间的距离。参照上一代 Kimi K2(1 万亿参数),达人用极限压缩版在一台顶配 Mac Studio 勉强能跑;K3 涨到 2.8 万亿,单机可部署这条路基本被堵死

08对 Agent 架构师意味着什么

把 K3 放进本系列主线看,它的价值不只是「又大又免费」。2.8 万亿参数 + 100 万 token 上下文 + 可本地持有三件事叠在一起,正好是长程 Agent 的燃料:之前文章讲过,Agent 跑到第 20 步开始摆烂,根因往往是上下文被淹没、被污染;而一个你能私有持有、上下文长到能吞下整部《三体》的模型,让「长文档理解 + 多步推理」的 Agent 第一次有了不依赖外部 API、数据不出本机的落地可能。

当这种量级的 MoE 也能被社区用 SGLang 类引擎跑起来、用前缀缓存和量化把成本压下来,「旗舰能力」和「可控成本」第一次不再互斥。开源权重把天花板打下来,推理引擎和量化把地板抬上去,中间那块就是 Agent 架构师真正能施展的空间。对大多数团队,用官方 API 验证场景,远比先砸几百万元自建机房更理性——除非你有强合规需求,才值得走私有化部署。

09商业嗅觉

 注意:这一节是我基于上面事实的推断,请结合自身业务验证。 

1. MoE + 开源权重 = 「把后厨连锅带灶送你」,本质是用开源换生态锁定。 训练一个 2.8 万亿模型的成本是天文数字,月之暗面把它免费放出,等于把训练成本一次性沉没、用开源换生态:越多人基于 K3 建应用,配套工具、微调生态、社区惯性就越强,最终变成事实标准。

2. 免费权重 ≠ 免费算力,但「所有权」是真正的护城河转移。 上面那笔账说明:权重免费,跑起来的算力仍要钱(或时间)。真正的价值不在「省了授权费」,而在「谁也夺不走」——闭源随时涨价、限流、停服,本地权重不会。对数据敏感、怕被卡脖子的企业,这份「不可剥夺」比每 token 便宜几厘更值钱。

3. 黄仁勋的「卖铲子」逻辑,是看懂这一轮的最佳望远镜。 模型越免费,想跑的人越多,高端 GPU 越好卖。开源烧掉的是闭源模型的护城河,喂肥的是算力供给方。所以保护开源的公开信,半个硅谷肯签——利益高度一致。

4. 护城河从「谁的模型强」转向「谁的权重你能永久持有 + 谁的工程能力更省」。 当顶级模型权重人人可下,差异就不在模型本身,而在你周边的工程能力:量化方案、推理引擎、上下文管理、以及是否真能把低成本跑通成生产系统。连训练系统的 Infra(MoonEP / FlashKDA / AgentEnv)都开源了,意味着「造模型的能力」也在去中心化。

5. 风险也要看清。 开源不等于无约束:商用免费有规模阈值条款;自建机房是几百万元级投入且运维沉重;API 路线则把可靠性交给供应商。把 K3 当生产基座前,先想清楚约束边界在哪。

10写在最后

Agent 时代的成本与可靠性,藏在每一层 infra 的选型与调度里。runtime 被 AI 重写(Bun)、训练摆脱单一硬件(DeepSeek on AMD)、推理引擎为 Agent 重构(SGLang)、成本被并发与前缀重塑、上下文成为调度层——而 Kimi K3 的开源,把「旗舰级权重」也塞进了这个可以被你私有持有的清单。

所以,以后再看到新闻说某某大模型开源了,先别急着兴奋地喊「免费了」,先问自己一个问题:跑它需要多少电、多少卡? 这个问题能帮你一秒看清,这个「免费」到底有多高的门槛。特别是一些老板,如果只是看了新闻,说 Kimi 很强大而且免费开源,就让你赶紧自己部署一个——你可以把这篇文章转给他,然后补一句:「老板,这个模型下载是免费,但要运行起来,还得花这么多钱。你看看,真的要装吗?」

我相信,这个账单只要一摆出来,大部分人都会放弃自己部署。