月之暗面 7 月 16 日发布 Kimi K3,2.8 万亿参数,全球首个开源 3T 级别模型,参数规模超过此前最大的 DeepSeek 1.6T。
在 BrowseComp 上它拿到 91.2 分,压过 GPT-5.6 Sol 的 90.4 和 Claude Fable 5 的 88.0,是发布时的 SOTA。Arena.ai 前端代码榜第一。Artificial Analysis 的 Intelligence Index 给它 57 分,189 个模型里排进前四,身前只有 Fable 5 和两档 GPT-5.6 Sol,身后是 Claude Opus 4.8。
它的输出定价是每百万 token 15 美元,和 Claude Sonnet 5 持平,中国 AI 实验室至今没有发布过更贵的模型。它的幻觉率从上一代的 39% 涨到了 51%。

❀01 2.8 万亿参数,但只激活 16 个专家
K3 是一个高稀疏的混合专家模型:896 个专家模块,每次推理只激活其中 16 个。参数规模冲到 2.8 万亿,单次推理的计算量却被控制住——模型容量和推理成本在这里解耦了。月之暗面公开了专家数和激活数,但没有公开每个 token 激活多少参数。
架构上有两个自研的东西。
KDA(Kimi Delta Attention) 是一种混合线性注意力机制,收益落在长上下文:100 万 token 的上下文里,解码速度最高快 6.3 倍。
AttnRes(注意力残差) 沿深度轴选择性地检索表示,而不是均匀累积。月之暗面给的账是训练效率提升约 25%,代价不到 2%。
其余规格:100 万 token 上下文(精确值 1,048,576),图像和视频原生支持,推理模式常开。
❀02 跑分:赢的地方很硬,输的地方也很清楚
K3 领先的项目集中在检索和长程任务。BrowseComp 91.2 分是 SOTA。SWE Marathon 42.0,高于 Opus 4.8 的 40.0、GPT-5.6 Sol 的 39.0、Fable 5 的 35.0。Terminal-Bench 2.1 拿到 88.3,赢过 Fable 5 和 Opus 4.8 的 84.6,略输 GPT-5.6 Sol 的 88.8。GPQA Diamond 93.5%。Arena.ai 前端代码榜 1679 分排第一。
落后的地方同样清楚。FrontierSWE 上 K3 是 81.2,Fable 5 是 86.6,差了 5 分多(GPT-5.6 Sol 只有 71.3)。JobBench 52.9,低于 Fable 5 的 57.4。月之暗面自己的评测里,K3 在 35 项测试中约 7 项拿第一,其余多数是第二或第三。
在 Artificial Analysis 的私有长程知识工作评测 AA-Briefcase 上,K3 拿到 1547 Elo,仅次于 Fable 5,比上一代 K2.6 涨了 732 分。
GDPval-AA v2 这项覆盖 44 种职业、9 大行业的真实任务评测,K3 排第三,位置在 Fable 5 和 GPT-5.6 Sol 之后、Opus 4.8 之前。各家转述的具体分数并不一致,K3 有 1687 和 1668 两个版本在流传,对手分数也随口径浮动,拿来做精确比较并不可靠。
中文媒体标题里的「全球第三强」是媒体口径,不是官方结论。

❀03 两个代价:不再便宜,也更爱编
K3 的定价是缓存命中输入每百万 token 0.30 美元,未缓存输入 3 美元,输出(含推理 token)15 美元。上一代 K2.6 的缓存输入是 0.16 美元。
今天的输出价格横向排下来:DeepSeek V4 是 0.87 美元,GLM-5.2 是 4.40 美元,K3 是 15 美元,Fable 5 是 50 美元。K3 比 Fable 5 便宜三倍多,但已经和 Claude Sonnet 5 持平,是中国 AI 实验室迄今发布过的最贵模型。「中国模型 = 白菜价」这个叙事,在 K3 这里断了。
K3 比 K2.6 少用 21% 的输出 token。但 Artificial Analysis 跑完整个 Intelligence Index 在它身上烧掉 1.3 亿 token,同类模型的中位数是 6300 万。
幻觉是另一个代价。在 Artificial Analysis 的 AA-Omniscience 评测里,K3 的准确率从上一代的 33% 提升到 46%,幻觉率同时从 39% 涨到 51%。答对的题更多了,编出来的答案也更多了。超过一半的错误回答不是「我不知道」,而是一个像模像样的错答案——拿它跑长程 agent 任务时,这个数比跑分榜的名次更要紧。

❀04 权重还没放出来
月之暗面承诺 7 月 27 日放出 K3 的完整权重。按目前公开信息,权重尚未放出,许可证条款官方也还没明确,K2 系列此前采用的是 Modified MIT。在那之前,K3 是一个 API 可用、权重承诺开源的模型,全球最大开源模型这个头衔要等权重落地才算兑现。
月之暗面今年 5 月完成 20 亿美元融资,估值超过 200 亿美元,年经常性收入超过 2 亿美元,投资方包括阿里巴巴、腾讯、美团。K3 发布的时点卡在上海世界人工智能大会之前。
❀来源
Moonshot 官方 API 文档:Kimi K3 Quickstart(platform.kimi.com) Artificial Analysis:Kimi K3 — Intelligence, Performance & Price Analysis VentureBeat:China's Moonshot AI releases Kimi K3, the largest open-source model ever(2026-07-16) SiliconANGLE:China's Moonshot throws down the gauntlet with Kimi K3(2026-07-16) The Decoder:Kimi's open model K3 nears GPT-5.6 Sol and Fable 5(2026-07-16) Simon Willison:Kimi K3, and what we can still learn from the pelican benchmark(2026-07-16) MarkTechPost:Moonshot AI Releases Kimi K3 — KDA / AttnRes 技术细节(2026-07-16) Fortune:Moonshot's Kimi K3 pushes Chinese AI into Fable-level territory(2026-07-16) OfficeChai:Kimi K3 Beats Fable 5, GPT 5.6 On Some Benchmarks OpenRouter:moonshotai/kimi-k3
夜雨聆风