七月的一个深夜,服务器机房里,一个叫做 Kimi K3 的人工智能盯上了一段让顶尖 GPU 工程师都头疼的底层代码,开始了长达 15 小时 的不眠不休。
当天亮的时候,那段代码跑完一次,从 283.6 毫秒,变成了 114.4 毫秒。
速度提升 2.48 倍
数值结果分毫不差
"这是我见过最干净的炫技"
先把这件事放到真实语境里
训练一个超大模型,本质上就是在烧钱,每一毫秒、每一个 GPU 小时都是真实账单。
Kimi K3 这次优化的目标,是一个叫做 AttnRes(Attention Residuals,注意力残差) 的新型算子。
这是 K3 自己架构里的核心组件之一,相当于模型的"记忆回路",它让深层网络能选择性地检索更早层的信息,摆脱机械的层层传递。
问题是:新算子得配一套新底层程序
这段底层代码在 GPU 芯片上并行执行,行话叫 kernel(内核)。
它要同时照顾并行划分、共享内存、寄存器压力、访存合并……每一项都考验多年的经验积累。
换做人类专家,可能要调个好几周


▲ Kimi官方发文详述K3自主优化内核的全过程
而 K3 的做法是:把自己关进一个沙箱,给一个生产规模的测试设定(96层、8192维、序列长度8192),目标是在不改变数值结果的前提下,把这个 kernel 跑得尽可能快。
然后,它开始了
15小时,一场没有人围观的马拉松
全程无人指导,也没有工程师帮它 debug。
根据官方技术报告与博客,K3 在这 15 小时内做了什么:
持续 分析性能瓶颈(profiling) 提出新的算法假设,设计出一种"两阶段"全新内核算法 将多个原本分开的 GPU 操作融合(fused)成一个,减少内存来回搬运 在每次改写后立刻跑基准测试验证数值是否对齐 不断迭代,每轮迭代的提升幅度比竞争对手更快
最终结果:前向与反向计算耗时从 283.6 ms 压缩至 114.4 ms,节省了整整 169.2 毫秒。
一位推特开发者这样评价这个数字:

▲ "15小时在单个内核里找出169.2ms,分量十足"
169.2 毫秒
乘以每次训练的迭代步数,乘以整个训练周期,这是数以万计的 GPU 小时,是真实发票上消失的那几个零。
优化一段代码之后
如果故事到这里结束,已经足够惊人
但官方技术报告里,还藏着两个更令人坐不住的细节。
第一个细节:Kimi K3 接连优化了多个任务。
官方设置了四个 kernel 竞技场,让 K3 与当今最强的编程模型同台较量,每场最多 24 小时,独立沙箱,自行 profiling、改写、验证:
| 517.8 TFLOPS | |
GPT-5.6 Sol 在 AttnRes 上只提升了约 17.3%。
K3 提升了 59.7%
第二个细节,更让人脊背发凉
官方报告里有一段话,藏在技术说明的深处,却被社区截出来反复传阅:
"在 Kimi K3 开发的后期阶段,早期版本的 Kimi K3 承担了团队大部分 kernel 优化工作。"
换句话说:K3 是用自己写的 kernel 训练出来的。
这件事发生在研发流水线里:模型已经进入优化自身训练基础设施的循环。

▲ 早期K3承担了团队大部分kernel优化工作,这段原文被社区反复引用
自己造编译器,顺带设计了一颗芯片
故事还没完
在那份技术报告里,K3 同期还完成了另外两件事,社区把它们串联起来看:
MiniTriton
K3 从零构建了一个类 Triton 的编译器,完整的 DSL 前端、基于 MLIR 的优化层、PTX 代码生成、类 PyTorch 的张量接口,然后用它在 NVIDIA L20 上跑基准测试,在部分核心任务上性能可比甚至超过 Triton 本体和 torch.compile。
4mm² 芯片原型
在约 48 小时 的自主运行中,K3 使用开源 EDA 工具,为基于自身架构的 nano 模型设计并验证了一颗芯片原型,走完了时序闭合、仿真 decode 吞吐、标准单元与 SRAM/MAC 阵列的完整流程。

▲ 社区对这三件事的精炼总结:内核、编译器、芯片,模型在构建自己脚下的栈
一位推特用户把这三件事并排放在一起,写下了迄今为止对这个技术时刻最精准的描述:
"我们正在目睹:软件在构建自己的硬件。"
2.5倍,背后藏着两个不同的故事
这里有一个值得辨析的地方,因为很多人把两件事混在了一起。
第一个"2.5倍",是上面说的 kernel 加速:283.6 ms → 114.4 ms,实测约 2.48 倍,对象是 GPU 上的一段训练程序,是真实的毫秒数。
第二个"2.5倍",是官方宣称的相对于上一代 Kimi K2 的 约 2.5 倍 scaling efficiency(单位算力的智能转化效率)。
这是架构主张,涉及 KDA、AttnRes、更稀疏的 Stable LatentMoE 与训练数据配方的整体升级。
数字凑巧相近,所指的指标完全不同
那个支付 GPU 账单的人 更在意这组实测数:283.6 变成了 114.4,节省的时间会直接写进发票。

▲ "这比又一张雷达图更有说服力,至少对那些真的付GPU小时费的人来说"
这件事究竟意味着什么
退一步看,它触及了 GPU 工程门槛这个问题。
过去,写高性能 GPU kernel 是 AI 基础设施里最稀缺的专家技艺之一。
它依赖多年积累的硬件直觉,代码还得同时在正确性、数值稳定、性能可解释和可集成四个维度上过关。
现在,一个模型在 15 小时内越过了这道高门槛。
当然,有几件事需要冷静看待:Kimi 的评测设定由 Kimi 自己定义,独立第三方的完整复现尚未发生;
Fable-5 的 fallback 策略可能影响排名;
单任务、长时、清晰 scoreboard 的设定与真实生产里的多机多卡混沌环境仍有距离。
但即便打了这些折扣,剩下的依然是一个非常清晰的信号:长程 agentic coding,开始触碰 AI 系统栈最底层、最吃专家经验的那一层。
社区里有条评论把目光投向持续工作的过程:
"整夜维持连贯的假设、保持数值一致,并在取得改进时留下可复现的痕迹,这种能力比单个性能数字更关键。"
这场测试考察的是模型能否像工程师一样持续推进工作,连贯地提出假设、验证结果并保留记录。
尾声:权重已经开放
2026 年 7 月 27 日,Kimi K3 的模型权重与技术报告同步开放。
2.8 万亿参数,原生多模态,百万 token 上下文,连同高性能 attention kernel 代码、MoE 通信库和 agent 环境基础设施,一并交给了社区。
vLLM 团队在五天前就开始了生产级适配预览,为 KDA、AttnRes 融合、SiTU 激活函数、MXFP4 量化路径一一补齐实现。

▲ vLLM团队在权重开放前就开始了生产适配,新架构算子一一补齐
模型在改写自己的训练栈
社区在连夜为推理引擎补算子
这两件事发生在同一周
有时候,重要的技术转折点悄悄发生在深夜的服务器机房里。
一条逐渐上扬的曲线,留下了从 283.6 跳到 114.4 的数字。
那条曲线还在往上爬
夜雨聆风