夜雨聆风学习资料网

ARTICLE · 1114709

AI 自己榨干硬件算力!Kimi K3 动手写「超级算子」,推理速度直接提升 3 倍

AI 自己榨干硬件算力!Kimi K3 动手写「超级算子」,推理速度直接提升 3 倍
引言:一场改写AI产业格局的底层革命

当所有人还在疯狂堆显卡、比拼芯片 PFlops 算力,砸钱买更多 HBM 显存的时候。 一场安静但足以改写 AI 产业格局的革命,正在底层悄然爆发。

不用训练新模型,不用升级芯片硬件,不改 Kimi K3 的任何一行模型代码,仅仅重构底层算子,就能把推理速度提升 3 倍。 更震撼的是:负责写这套底层优化代码的,不是资深人类工程师,而是 Kimi K3 本身。

重构底层算子,推理速度提升3倍,而写代码的,是模型自己。

同一周,硅谷和国内几乎同时亮出答卷,瞄准同一个难题:拆掉算子之间的墙,把被白白浪费的算力全部榨干。

一、误区:大模型输出慢,根本不是算力不够

绝大多数人对大模型的认知,停留在一个错误的公式:显卡越多、芯片越强,模型跑的越快。 但行业一线工程师都清楚一个残酷真相:绝大多数场景下,芯片算力是闲置的,它大部分时间,都在空等数据搬运。

大模型每吐出一个 Token,都要反复从 HBM 显存读取海量模型参数。计算单元运算速度很快,但数据来回搬运,才是拖慢速度的最大瓶颈。 而瓶颈的根源,就是「算子」。

什么是算子:理解瓶颈的关键

你可以把算子理解成一个个独立的微型小程序:矩阵乘法、归一化、激活函数,每一项计算任务,都由单独算子负责。 传统推理框架运行 Kimi K3,单一步推理,要调用数千次算子。 每启动一次算子,就要走一遍「读取数据→运算→写回显存」完整流程。

这里用一个很形象的比喻:

传统算子的运行模式,就像绿皮火车,从北京开往广州,沿途几百个小站,每一站都要停车、卸货、装货、重新启动。停车的这段时间,整条轨道是空置的。

映射到 AI 芯片,就是算子切换间隙,宝贵的显存带宽被白白浪费。单个算子停顿的损耗不起眼,数千次叠加之后,就形成了理论算力与真实落地性能之间巨大鸿沟。

治标与治本:从 CUDA Graphs 到算子融合

英伟达很早就意识到这个问题,CUDA Graphs、PDL 等技术,都是用来缩短算子切换的停顿时间。 但治标不治本 —— 站点依然存在,列车就必须减速停靠。

真正的终极解法,就是算子融合:拆掉一个个独立小算子之间的边界,合并成一个巨大的整体算子,取消中间停靠站,直达终点。

二、硅谷硬核方案:Megakernels 巨型算子,硬件参数更低,照样碾压 GB200

vLLM 原班团队出走创立的 Inferact,近期开源了 TPU Megakernels 巨型算子,直接把 Kimi K3 全部 92 层 MoE 层打包,写进同一个程序内核。

这套巨型算子,会根据当前层自动选择 KDA 或者 MLA 注意力机制。最精妙的流水线设计:上一层计算还没结束,下一层权重已经提前搬运到片上内存。轮到计算时,数据已经就位,无需临时从显存调取。

硬件优势:TPU v7 的独特设计

这个方案能够落地,得益于 TPU v7 独特硬件设计:每个核心自带 64MiB 片上高速 VMEM 内存,开发者可以自主管控数据存放与释放。 对比 GPU,片上内存需要分给上百个计算单元,每个单元仅有几百 KB,根本没有空间提前缓存大量数据。

实测数据:性能的全面碾压

硬件弱一档,依靠底层代码写法,实现反超。

实测数据足够震撼: 16 颗 TPU v7 运行 Kimi K3,开启投机解码,单用户输出可达 709 tokens/s; 同等数量 16 张英伟达 GB200,用 vLLM 原生框架,仅 452 tokens/s。

哪怕关闭投机解码,在 18 并发场景,TPU 这套巨型算子性能,依旧是 GB200 的 1.42 倍。 要知道纸面硬件参数上,TPU v7 显存带宽 7380GB/s,还低于 GB200 的 8000GB/s。硬件弱一档,依靠底层代码写法,实现反超。

另外一个惊喜:整套巨型算子完整编译,只需要不到 90 秒。过去同规模模型在 TPU 编译,动辄半小时起步。

当然,这份巨型算子目前依旧是顶尖推理工程师手工编写,门槛极高。 但 Inferact 在文档中留下一句预示未来的判断:未来这类巨型内核,将交给编程智能体(Coding Agent)自动生成。

这句话,不是宣传话术,而是已经在发生的现实。

三、写算子的工程师,正在被 AI 智能体逐步替代

底层算子开发,是 AI 行业金字塔顶端的手艺活,需要精通 CUDA、PTX、硬件指令集,常年和芯片底层逻辑打交道。而如今,这项高门槛技术工作,正在被大模型接手。

从业者的切身体会

我写算子的技术越强,模型推理速度越快,我被替代的速度也就越快。

— 刘胜与

DeepSeek 核心算子工程师刘胜与,曾亲手完成 DeepSeek V4.1 主注意力算子开发。不久前他发文,宣告手写算子时代即将落幕。 他给出判断:半年到一年之内,AI 生成的算子性能,就能够追上甚至超越顶尖人类工程师。

一年前,他的 AI 助手只能辅助排查代码 Bug;现在大模型已经可以读懂底层硬件汇编代码,自主完成算子编写、调优。 他那句感慨,值得所有技术从业者深思:我写算子的技术越强,模型推理速度越快,我被替代的速度也就越快。

全球范围内的技术推进

大洋彼岸同样在推进这条路线。今年 4 月 Cursor 联合英伟达,依托多智能体系统,一次性优化 235 个 CUDA 算子,三周迭代,平均提速 38%。

为什么算子优化成了AI率先攻克的岗位?

为什么算子优化,会成为 AI 率先拿下的硬核技术岗位? 答案很简单:这个任务拥有清晰客观标准答案。代码是否正确,运行即可验证;提速多少,延迟、吞吐数据直接量化。 AI 智能体可以 7×24 小时不间断循环:写代码、编译、跑测试、采集性能数据、迭代优化。人类工程师,根本无法在这种高强度循环迭代上竞争。

浪潮信息更进一步,不再只用 AI 辅助调优,直接让Kimi K3 给自己写超级算子。

一场围绕Kimi K3的全球推理竞速,正在改写AI算力的游戏规则。浪潮元脑SD200 Ultra用对称内存打通芯片数据墙,以通算融合将成百上千小算子熔铸为超级算子,更让Kimi K3自己驱动"生成—验证—测量—迭代"的闭环,像工匠打磨刀刃般持续优化自身推理引擎。单机承载2.8万亿参数,Token时延压至5.85毫秒。当Agent时代来临,真正决定胜负的不再是卡的数量,而是每一个Token跑得有多快。

!!国内 AICC 重磅成果:算力效率革命开启 AI 下半场
四、国内 AICC 重磅成果:元脑 SD200 Ultra,K3 自主迭代超级算子

在 AICC2026 大会上,浪潮发布元脑 SD200 Ultra 超节点 AI 服务器,面向 Kimi K3 这类超大 MoE 模型,走出一套国产算力系统级解决方案。

Inferact 是把完整模型融合为单一巨型算子;浪潮的超级算子思路,聚焦 KDA、Gated MLA、MoE 核心模块做算子融合。二者底层逻辑一致:消除算子边界,减少数据反复读写,只是融合粒度不同。

元脑 SD200 Ultra 采用 3D Hyper Mesh 架构,把 128 颗本土 AI 芯片组成协同计算集群,提供 8TB 统一编址显存,搭配 64TB 内存,承载模型权重和持续增长的 KV Cache。单机硬件底座,最高可以支撑 10 万亿参数大模型部署,本次测试,跑的是 2.8 万亿参数 Kimi K3。

这套服务器的核心突破,分为三层。

第一层:对称内存,显存直接互通,拆掉跨芯片通信中介

传统 AI 集群,不同芯片之间交换数据,需要 CPU 充当中间调度中介,层层转发,损耗巨大。好比小区邻居串门,每次都要跑到物业办理手续,来回折腾。

芯片之间点对点直连,省去中间调度环节

SD200 Ultra 依靠对称内存技术,实现统一编址,芯片之间可以点对点直接访问远端显存,省去中间调度环节。跨卡通信时延压低至 0.69 微秒,AllReduce 通信耗时直接下降 3.5 倍。打通芯片之间的数据墙,是所有优化的基础。

第二层:通算融合,小算子合并超级算子,流水线并行

通信链路打通之后,进入算子优化环节。把 KDA、Gated MLA、MoE 模块中成百上千细小算子,融合为超级算子,算子总量缩减至原来十分之一。

优化思路是把中间计算结果保存在片上缓存与寄存器,计算完成直接交给下一段流程,不用反复写入 HBM 显存再读取。同时启用异步数据搬运 + 多缓冲流水线,计算、预加载数据、回写结果同步并行。一块数据在运算,下一块数据提前搬入缓存,芯片全程减少等待空闲。

第三层:Kimi K3 自主迭代,超级算子智能体闭环(最核心亮点)

人工手写深度融合 Kernel,难度极高,开发周期漫长,模型版本一旦更新,整套算子几乎要重新开发,成本极高。

浪潮的方案,直接搭建超级算子智能体,由 Kimi K3 作为核心,运行「生成 — 验证 — 测量 — 迭代」的完整闭环:

1

K3 读取模型运行日志,定位性能瓶颈:哪一步长时间等待数据、缓存利用率不足;

2

自动设计算子合并策略,规划数据分块、流水线调度方案,批量生成候选超级算子代码;

3

自动校验代码正确性,在真实硬件负载中跑基准测试,采集延迟、显存带宽、硬件占用指标;

4

把实测数据反馈回 Kimi,作为下一轮迭代优化依据;

5

只有功能正确、性能提升的算子版本,才会正式上线部署。

依靠这套 AI 自我优化闭环,算子性能完成正向循环拉升,最终综合推理效能提升 3 倍以上。

最终实测成绩单,足够亮眼:单机承载完整 2.8 万亿参数 Kimi K3,Token 生成时延低至 5.85 毫秒,单用户吞吐突破 170 tokens/s,性能达到业界平均水平 5 倍。

五、行业逻辑彻底反转:Agent 时代,不再比拼卡的数量,比拼 Token 时延

不再比拼卡的数量,比拼 Token 时延

在此之前,算力采购的沟通方式非常直接。客户开口询问:需要多少张卡,多少 P 算力,多大存储。而现在,越来越多落地项目客户,第一句话变成:这个大模型跑起来,每一个 Token 生成时延多少,每秒吞吐多少?

这个转变,本质是 AI 应用形态切换带来的。普通对话聊天,延迟多一两秒,用户感知不强。但 AI 智能体 Agent 完全不一样。一次完整 Agent 任务,需要上百轮循环:推理、调用工具、读取返回结果、重新规划。每一轮推理的微小延迟,层层叠加,最终会导致整个任务耗时拉长数分钟。

对于 Agent 产品,Token 时延、吞吐能力,直接决定业务能不能跑通,而不是纸面峰值算力。 浪潮把这个方向定义为「能力型智算」:目标不只是把超大模型装在服务器上,而是让大模型跑得足够快,支撑复杂长周期自主任务。

SD200 Ultra 已经预留充足硬件冗余,能够承载 10 万亿参数大模型。按照浪潮首席 AI 战略官刘军的判断,1~2 年内顶尖大模型参数规模,就会抵达这个量级。Kimi K3,仅仅是第一个验证案例。

这里也给所有做 AI 落地、选型算力设备的人一个建议:以后再有人向你推销 AI 服务器,不再只看芯片数量、算力参数。优先问一句:前沿大模型在这套硬件上,真实 Token 生成速度是多少?

算力竞争主战场,已经从芯片硬件,转移到系统架构 + 算子软件

六、AI 下半场:算力效率革命,墙正在一层层拆掉

这场围绕 Kimi K3 的全球推理竞速,揭示整个 AI 产业正在发生的底层变革:算力竞争主战场,已经从芯片硬件,转移到系统架构 + 算子软件。

过去两年的推理优化,集中在模型本身:量化、KV Cache 压缩、投机解码。而这一轮的突破,完全不动模型,仅仅依靠底层系统与算子优化,就能拿到几倍性能提升。Inferact 使用更低带宽 TPU,性能打赢 GB200;浪潮在国产芯片底座上,依靠超级算子,实现 Kimi K3 推理提速 3 倍。同样的硬件,系统与算子优化做得好坏,性能差距可以达到数倍。

整个优化过程,本质就是不断拆除一层层壁垒:

算子与算子之间的墙 → 算子融合

计算任务和数据搬运之间的墙 → 通算融合

芯片与芯片之间的墙 → 统一显存编址,跨卡直连

而写算子这项核心底层工作,正在交给 AI 智能体。人工定制算子成本昂贵,模型更新就要重写,只能做通用化浅层优化。当 AI 可以自动为特定模型、特定硬件生成专属算子,定制优化成本会大幅下降。 未来,一个新大模型发布,可以自动启动智能体,针对目标硬件,生成整套专属算子,持续迭代调优。形成漂亮的正向循环:模型越强,写出的算子越好;推理速度越快,模型迭代训练、部署测试效率越高。

大模型上半场,所有人比拼对话效果、模型参数规模、跑分榜单;进入 Agent 主导的 AI 生产力下半场,比拼的是持续执行复杂任务的稳定执行力。

每一轮 Agent 任务拆解、工具调用、长链条自我反思,都会源源不断消耗 Token。推理延迟、吞吐性能,不再只是体验指标,直接决定智能体能不能在真实世界完成闭环。

硅谷 Megakernels 巨型算子,国内超级算子,两条路线殊途同归,解决同一个核心命题:如何把有限硬件算力,尽可能全部转化成可用的智能。

硬件迭代周期漫长,芯片工艺进步缓慢。但是软件、算子、系统架构的优化,空间巨大,迭代速度极快。算力效率革命,才刚刚拉开序幕。 谁能榨干硬件每一分算力,谁就能在 Agent 时代抢占先机。

相关学习资料