乐于分享
好东西不私藏

AI造反了!Kimi K3熬夜15小时自写GPU底层内核,速度暴涨2.48倍,还顺手设计了一颗芯片!

AI造反了!Kimi K3熬夜15小时自写GPU底层内核,速度暴涨2.48倍,还顺手设计了一颗芯片!

七月的一个深夜,服务器机房里,一个叫做 Kimi K3 的人工智能盯上了一段让顶尖 GPU 工程师都头疼的底层代码,开始了长达 15 小时 的不眠不休。

当天亮的时候,那段代码跑完一次,从 283.6 毫秒,变成了 114.4 毫秒。

速度提升 2.48 倍
数值结果分毫不差

"这是我见过最干净的炫技"

先把这件事放到真实语境里

训练一个超大模型,本质上就是在烧钱,每一毫秒、每一个 GPU 小时都是真实账单。
Kimi K3 这次优化的目标,是一个叫做 AttnRes(Attention Residuals,注意力残差) 的新型算子。
这是 K3 自己架构里的核心组件之一,相当于模型的"记忆回路",它让深层网络能选择性地检索更早层的信息,摆脱机械的层层传递。

问题是:新算子得配一套新底层程序
这段底层代码在 GPU 芯片上并行执行,行话叫 kernel(内核)
它要同时照顾并行划分、共享内存、寄存器压力、访存合并……每一项都考验多年的经验积累。

换做人类专家,可能要调个好几周

▲ Kimi官方发文详述K3自主优化内核的全过程

而 K3 的做法是:把自己关进一个沙箱,给一个生产规模的测试设定(96层、8192维、序列长度8192),目标是在不改变数值结果的前提下,把这个 kernel 跑得尽可能快。

然后,它开始了

15小时,一场没有人围观的马拉松

全程无人指导,也没有工程师帮它 debug。

根据官方技术报告与博客,K3 在这 15 小时内做了什么:

  • 持续 分析性能瓶颈(profiling)
  • 提出新的算法假设,设计出一种"两阶段"全新内核算法
  • 将多个原本分开的 GPU 操作融合(fused)成一个,减少内存来回搬运
  • 在每次改写后立刻跑基准测试验证数值是否对齐
  • 不断迭代,每轮迭代的提升幅度比竞争对手更快

最终结果:前向与反向计算耗时从 283.6 ms 压缩至 114.4 ms,节省了整整 169.2 毫秒。

一位推特开发者这样评价这个数字:

▲ "15小时在单个内核里找出169.2ms,分量十足"

169.2 毫秒
 乘以每次训练的迭代步数,乘以整个训练周期,这是数以万计的 GPU 小时,是真实发票上消失的那几个零。

优化一段代码之后

如果故事到这里结束,已经足够惊人
但官方技术报告里,还藏着两个更令人坐不住的细节。

第一个细节:Kimi K3 接连优化了多个任务。

官方设置了四个 kernel 竞技场,让 K3 与当今最强的编程模型同台较量,每场最多 24 小时,独立沙箱,自行 profiling、改写、验证:

任务
K3 表现
AttnRes 优化
提升 59.7%(≈ Fable-5 的 57.1%)
DSA 优化(百万 token 训练)
提升 55.1%
从零写 MLA-512
517.8 TFLOPS
(超过 Fable-5 的 492.7)
另一家厂商 GPGPU 上的 KDA
时间削减 73.6%

GPT-5.6 Sol 在 AttnRes 上只提升了约 17.3%。
K3 提升了 59.7%

第二个细节,更让人脊背发凉

官方报告里有一段话,藏在技术说明的深处,却被社区截出来反复传阅:

"在 Kimi K3 开发的后期阶段,早期版本的 Kimi K3 承担了团队大部分 kernel 优化工作。"

换句话说:K3 是用自己写的 kernel 训练出来的。

这件事发生在研发流水线里:模型已经进入优化自身训练基础设施的循环。

▲ 早期K3承担了团队大部分kernel优化工作,这段原文被社区反复引用

自己造编译器,顺带设计了一颗芯片

故事还没完

在那份技术报告里,K3 同期还完成了另外两件事,社区把它们串联起来看:

MiniTriton
 K3 从零构建了一个类 Triton 的编译器,完整的 DSL 前端、基于 MLIR 的优化层、PTX 代码生成、类 PyTorch 的张量接口,然后用它在 NVIDIA L20 上跑基准测试,在部分核心任务上性能可比甚至超过 Triton 本体和 torch.compile

4mm² 芯片原型
 在约 48 小时 的自主运行中,K3 使用开源 EDA 工具,为基于自身架构的 nano 模型设计并验证了一颗芯片原型,走完了时序闭合、仿真 decode 吞吐、标准单元与 SRAM/MAC 阵列的完整流程。

▲ 社区对这三件事的精炼总结:内核、编译器、芯片,模型在构建自己脚下的栈

一位推特用户把这三件事并排放在一起,写下了迄今为止对这个技术时刻最精准的描述:

"我们正在目睹:软件在构建自己的硬件。"

2.5倍,背后藏着两个不同的故事

这里有一个值得辨析的地方,因为很多人把两件事混在了一起。

第一个"2.5倍",是上面说的 kernel 加速:283.6 ms → 114.4 ms,实测约 2.48 倍,对象是 GPU 上的一段训练程序,是真实的毫秒数。

第二个"2.5倍",是官方宣称的相对于上一代 Kimi K2 的 约 2.5 倍 scaling efficiency(单位算力的智能转化效率)
这是架构主张,涉及 KDA、AttnRes、更稀疏的 Stable LatentMoE 与训练数据配方的整体升级。

数字凑巧相近,所指的指标完全不同

那个支付 GPU 账单的人 更在意这组实测数:283.6 变成了 114.4,节省的时间会直接写进发票。

▲ "这比又一张雷达图更有说服力,至少对那些真的付GPU小时费的人来说"

这件事究竟意味着什么

退一步看,它触及了 GPU 工程门槛这个问题。

过去,写高性能 GPU kernel 是 AI 基础设施里最稀缺的专家技艺之一。
它依赖多年积累的硬件直觉,代码还得同时在正确性、数值稳定、性能可解释和可集成四个维度上过关。

现在,一个模型在 15 小时内越过了这道高门槛。

当然,有几件事需要冷静看待:Kimi 的评测设定由 Kimi 自己定义,独立第三方的完整复现尚未发生;
Fable-5 的 fallback 策略可能影响排名;
单任务、长时、清晰 scoreboard 的设定与真实生产里的多机多卡混沌环境仍有距离。

但即便打了这些折扣,剩下的依然是一个非常清晰的信号:长程 agentic coding,开始触碰 AI 系统栈最底层、最吃专家经验的那一层。

社区里有条评论把目光投向持续工作的过程:

"整夜维持连贯的假设、保持数值一致,并在取得改进时留下可复现的痕迹,这种能力比单个性能数字更关键。"

这场测试考察的是模型能否像工程师一样持续推进工作,连贯地提出假设、验证结果并保留记录。

尾声:权重已经开放

2026 年 7 月 27 日,Kimi K3 的模型权重与技术报告同步开放。
2.8 万亿参数,原生多模态,百万 token 上下文,连同高性能 attention kernel 代码、MoE 通信库和 agent 环境基础设施,一并交给了社区。

vLLM 团队在五天前就开始了生产级适配预览,为 KDA、AttnRes 融合、SiTU 激活函数、MXFP4 量化路径一一补齐实现。

▲ vLLM团队在权重开放前就开始了生产适配,新架构算子一一补齐

模型在改写自己的训练栈
社区在连夜为推理引擎补算子

这两件事发生在同一周

有时候,重要的技术转折点悄悄发生在深夜的服务器机房里。
一条逐渐上扬的曲线,留下了从 283.6 跳到 114.4 的数字。

那条曲线还在往上爬