凌晨三点,一段代码还在跑。
屏幕前不见工程师,调参也交给了自动流程一个AI模型正在反复拆解、重写、测速、再重写自己训练时用到的GPU内核函数,连续跑了15个小时,一刻没停
等它停下来的时候,同一块显卡上,同一个算子的前向+反向总耗时,从283.6毫秒被压到了114.4毫秒
端到端提速约2.48倍。
这组结果来自月之暗面(Moonshot AI)发布旗舰模型Kimi K3时公开的技术博客博客还写道:"在K3后期开发阶段,早期版本的K3承担了团队大部分kernel优化工作"
模型在改写让自己变强的那段代码。


▲ 官方发布:2.8万亿参数、百万token上下文、原生多模态,并披露多项工程实验
一个外行也能听懂的故事
先把"GPU kernel"翻译成人话
你可以把大模型训练想象成一座超级工厂的流水线PyTorch写的是设计图纸,规定"要做什么";在GPU芯片上飞速运转的,则是一段段极短、极底层、极讲究内存排布和并行策略的小程序,叫做kernel(内核函数)
矩阵乘法、注意力计算、归一化、专家路由……训练中的每个数学步骤,最终都要落成kernel
kernel写得好,同样一块卡,同样一轮训练,时间更短,电费更低,集群吞吐更高写得差,显存带宽被白白浪费,算力利用率上不去,再贵的H200也在"空转"
历史上,这种活儿高度依赖少数会写CUDA和Triton的顶级工程师,迭代周期以人天甚至人周计全球能干这活的人,可能比顶级基金经理还少
而现在,K3在沙箱里完成了一整套闭环:
读baseline → 用profiler找瓶颈 → 提出新的两阶段算法 → 融合kernel → 校验数值一致性 → 自动测速 → 留下更好版本
这套流程已经触及高性能计算工程师的日常工作


▲ 官方AttnRes优化线程:红线K3,蓝线Claude Fable 5,15小时内两者几乎打平
283.6 → 114.4:这169毫秒里藏着什么?
具体来说,K3要优化的对象是Attention Residuals(AttnRes),一种K3自家架构里新引入的训练算子,基于FLA Triton实现生产级形状:96层、模型维度8192、序列长度8192
目标只有一个:在不改变数值结果(numerics)的前提下,把训练侧前向+反向的总耗时压到最低
"preserving numerics"构成整件事最严苛的约束高性能计算社区对"只报加速比"已经过敏到极点斯坦福的KernelBench评测揭示过,大量AI生成kernel存在功能不正确或微妙的reward hacking快但错,不算数。
K3花了15小时。它设计出一种全新的两阶段(two-phase)kernel算法,完成kernel融合,最终交出283.6ms → 114.4ms的成绩单
社区开发者@tinybluedev看到这个数字后写下了一段冷静到近乎苛刻的评论:
"15小时循环本身更适合作为基准:模型能否整夜维持连贯假设、保持数值,并在改进有效时留下可复现痕迹。标题不该只剩283.6→114.4。"

▲ 一则冷静的提醒:别只看毫秒数,还要考察15小时内模型能否保持连贯
而@silasburke则直接算了笔账:15小时在一个kernel上抠出169.2毫秒,对于任何写过CUDA的人来说,这个数字已经很多了
不止一个kernel:四项擂台赛的全景
官方把这场"自我进化"包装成了一场四项kernel擂台赛在相同沙箱中,K3与Claude Fable 5、GPT-5.6 Sol、GPT-5.5等模型独立工作,最长24小时,覆盖四个不同任务:
| AttnRes优化 | ||
| DSA kernel优化 | ||
| MLA-512从零编写 | ~517.8 TFLOPS | |
| KDA跨平台GPGPU |
结论是:K3在四场中多数场景与最强闭源模型同台竞争,部分场次领先官方也坦诚承认,在综合表现上K3仍落后于Claude Fable 5和GPT-5.6 Sol,但在其评测套件中持续优于其余模型
这种"主动亮短板"的姿态,反而让kernel故事的可信度加了分
从kernel到编译器到芯片:一条让人心跳加速的链
如果说kernel优化是第一声惊雷,接下来的两件事便是连续两道闪电
第一道闪电:MiniTriton。 K3从零搭建了一个紧凑的Triton类GPU编译器,包含tile-level IR(基于MLIR)、优化pass与PTX代码生成关键验证:它不仅能吐出孤立的kernel片段,还能支撑nanoGPT端到端训练,收敛曲线接近参考实现前端、IR、codegen、runtime,全链路打通
第二道闪电:48小时设计一颗芯片。 作为概念验证,K3用开源EDA工具和Nangate 45nm标准单元库,在48小时自主运行中,为自家架构上的nano模型设计了一颗专用芯片,约4mm²面积,100MHz时序收敛,仿真解码超过8700 tokens/s,集成约146万标准单元

▲ @thealexker的概括:kernels → compiler → silicon,软件在改写自己运行的每一层
必须泼一盆冷水:45nm工艺、4mm²面积,在半导体工程语境下属于教学/概念验证尺度Hacker News上已有人反推,对应的模型规模必然极小,仿真tokens/s不能外推为数据中心推理性能
这项概念验证展示的是端到端工具使用、长时自主、时序与仿真闭环,可用于观察48小时级别的agentic工程能力,不代表量产承诺
@Blum_OG把这套循环概括为:
"一个AI让自己在正被用来构建自己的同一硬件上跑得更快,这像是一个全新的循环。"

▲ "新的闭环",kernel优化的自我加速回路
冷静三秒钟:边界在哪里?
精彩归精彩,但有几条线必须划清:
第一,两个"2.5倍"度量的是不同对象。 一组是AttnRes kernel的283.6→114.4ms(约2.48倍墙钟提速);另一组是K3相对上一代K2的整体扩展效率约2.5倍提升,来源于架构稀疏、注意力机制、优化器与数据配方的系统组合二者证据来源与度量对象完全不同。
第二,kernel优化是AI较易切入的工程任务之一 社区冷静派指出:kernel有清晰的损失信号、受限的搜索空间、即时的编译与profiling反馈,因此很适合自动化至于定义模型命运的架构决策和数据配方,远不在这条推文能覆盖的范围内
第三,所有数字目前仍属厂商评测。 权重计划7月27日开放,届时第三方才有机会复现或质疑在复现之前,保持审慎的好奇比盲目惊叹更合适
我们站在哪里?
从斯坦福KernelBench将"LLM能否写高效GPU kernel"形式化为基准,到PyTorch博客上KernelFalcon展示深度agent的kernel生成架构,再到2025至2026年间涌现的TritonRL、Dr. Kernel、Kernel-Smith等一系列强化学习+专用后训练路线,模型自动生成并优化GPU代码已经汇成一条加速流动的技术河流
K3的kernel故事,是这条河上溅起的最大一朵浪花
这个故事最终抛出一个让所有基础设施工程师都要正视的问题:
当模型能改写让自己变快的代码,甚至设计运行自己的硬件,"谁在训练谁"这个问题的答案,是否正在悄悄翻转?
夜雨聆风