ARTICLE · 1114709
AI 自己榨干硬件算力!Kimi K3 动手写「超级算子」,推理速度直接提升 3 倍

当所有人还在疯狂堆显卡、比拼芯片 PFlops 算力,砸钱买更多 HBM 显存的时候。 一场安静但足以改写 AI 产业格局的革命,正在底层悄然爆发。
不用训练新模型,不用升级芯片硬件,不改 Kimi K3 的任何一行模型代码,仅仅重构底层算子,就能把推理速度提升 3 倍。 更震撼的是:负责写这套底层优化代码的,不是资深人类工程师,而是 Kimi K3 本身。
重构底层算子,推理速度提升3倍,而写代码的,是模型自己。
同一周,硅谷和国内几乎同时亮出答卷,瞄准同一个难题:拆掉算子之间的墙,把被白白浪费的算力全部榨干。
绝大多数人对大模型的认知,停留在一个错误的公式:显卡越多、芯片越强,模型跑的越快。 但行业一线工程师都清楚一个残酷真相:绝大多数场景下,芯片算力是闲置的,它大部分时间,都在空等数据搬运。
大模型每吐出一个 Token,都要反复从 HBM 显存读取海量模型参数。计算单元运算速度很快,但数据来回搬运,才是拖慢速度的最大瓶颈。 而瓶颈的根源,就是「算子」。
你可以把算子理解成一个个独立的微型小程序:矩阵乘法、归一化、激活函数,每一项计算任务,都由单独算子负责。 传统推理框架运行 Kimi K3,单一步推理,要调用数千次算子。 每启动一次算子,就要走一遍「读取数据→运算→写回显存」完整流程。
这里用一个很形象的比喻:
传统算子的运行模式,就像绿皮火车,从北京开往广州,沿途几百个小站,每一站都要停车、卸货、装货、重新启动。停车的这段时间,整条轨道是空置的。
映射到 AI 芯片,就是算子切换间隙,宝贵的显存带宽被白白浪费。单个算子停顿的损耗不起眼,数千次叠加之后,就形成了理论算力与真实落地性能之间巨大鸿沟。
英伟达很早就意识到这个问题,CUDA Graphs、PDL 等技术,都是用来缩短算子切换的停顿时间。 但治标不治本 —— 站点依然存在,列车就必须减速停靠。
真正的终极解法,就是算子融合:拆掉一个个独立小算子之间的边界,合并成一个巨大的整体算子,取消中间停靠站,直达终点。
vLLM 原班团队出走创立的 Inferact,近期开源了 TPU Megakernels 巨型算子,直接把 Kimi K3 全部 92 层 MoE 层打包,写进同一个程序内核。
这套巨型算子,会根据当前层自动选择 KDA 或者 MLA 注意力机制。最精妙的流水线设计:上一层计算还没结束,下一层权重已经提前搬运到片上内存。轮到计算时,数据已经就位,无需临时从显存调取。
这个方案能够落地,得益于 TPU v7 独特硬件设计:每个核心自带 64MiB 片上高速 VMEM 内存,开发者可以自主管控数据存放与释放。 对比 GPU,片上内存需要分给上百个计算单元,每个单元仅有几百 KB,根本没有空间提前缓存大量数据。
硬件弱一档,依靠底层代码写法,实现反超。
实测数据足够震撼: 16 颗 TPU v7 运行 Kimi K3,开启投机解码,单用户输出可达 709 tokens/s; 同等数量 16 张英伟达 GB200,用 vLLM 原生框架,仅 452 tokens/s。
哪怕关闭投机解码,在 18 并发场景,TPU 这套巨型算子性能,依旧是 GB200 的 1.42 倍。 要知道纸面硬件参数上,TPU v7 显存带宽 7380GB/s,还低于 GB200 的 8000GB/s。硬件弱一档,依靠底层代码写法,实现反超。
另外一个惊喜:整套巨型算子完整编译,只需要不到 90 秒。过去同规模模型在 TPU 编译,动辄半小时起步。
当然,这份巨型算子目前依旧是顶尖推理工程师手工编写,门槛极高。 但 Inferact 在文档中留下一句预示未来的判断:未来这类巨型内核,将交给编程智能体(Coding Agent)自动生成。
这句话,不是宣传话术,而是已经在发生的现实。
底层算子开发,是 AI 行业金字塔顶端的手艺活,需要精通 CUDA、PTX、硬件指令集,常年和芯片底层逻辑打交道。而如今,这项高门槛技术工作,正在被大模型接手。
我写算子的技术越强,模型推理速度越快,我被替代的速度也就越快。
— 刘胜与
DeepSeek 核心算子工程师刘胜与,曾亲手完成 DeepSeek V4.1 主注意力算子开发。不久前他发文,宣告手写算子时代即将落幕。 他给出判断:半年到一年之内,AI 生成的算子性能,就能够追上甚至超越顶尖人类工程师。
一年前,他的 AI 助手只能辅助排查代码 Bug;现在大模型已经可以读懂底层硬件汇编代码,自主完成算子编写、调优。 他那句感慨,值得所有技术从业者深思:我写算子的技术越强,模型推理速度越快,我被替代的速度也就越快。

大洋彼岸同样在推进这条路线。今年 4 月 Cursor 联合英伟达,依托多智能体系统,一次性优化 235 个 CUDA 算子,三周迭代,平均提速 38%。
为什么算子优化,会成为 AI 率先拿下的硬核技术岗位? 答案很简单:这个任务拥有清晰客观标准答案。代码是否正确,运行即可验证;提速多少,延迟、吞吐数据直接量化。 AI 智能体可以 7×24 小时不间断循环:写代码、编译、跑测试、采集性能数据、迭代优化。人类工程师,根本无法在这种高强度循环迭代上竞争。
浪潮信息更进一步,不再只用 AI 辅助调优,直接让Kimi K3 给自己写超级算子。
一场围绕Kimi K3的全球推理竞速,正在改写AI算力的游戏规则。浪潮元脑SD200 Ultra用对称内存打通芯片数据墙,以通算融合将成百上千小算子熔铸为超级算子,更让Kimi K3自己驱动"生成—验证—测量—迭代"的闭环,像工匠打磨刀刃般持续优化自身推理引擎。单机承载2.8万亿参数,Token时延压至5.85毫秒。当Agent时代来临,真正决定胜负的不再是卡的数量,而是每一个Token跑得有多快。

在 AICC2026 大会上,浪潮发布元脑 SD200 Ultra 超节点 AI 服务器,面向 Kimi K3 这类超大 MoE 模型,走出一套国产算力系统级解决方案。
Inferact 是把完整模型融合为单一巨型算子;浪潮的超级算子思路,聚焦 KDA、Gated MLA、MoE 核心模块做算子融合。二者底层逻辑一致:消除算子边界,减少数据反复读写,只是融合粒度不同。
元脑 SD200 Ultra 采用 3D Hyper Mesh 架构,把 128 颗本土 AI 芯片组成协同计算集群,提供 8TB 统一编址显存,搭配 64TB 内存,承载模型权重和持续增长的 KV Cache。单机硬件底座,最高可以支撑 10 万亿参数大模型部署,本次测试,跑的是 2.8 万亿参数 Kimi K3。

这套服务器的核心突破,分为三层。
传统 AI 集群,不同芯片之间交换数据,需要 CPU 充当中间调度中介,层层转发,损耗巨大。好比小区邻居串门,每次都要跑到物业办理手续,来回折腾。
芯片之间点对点直连,省去中间调度环节
SD200 Ultra 依靠对称内存技术,实现统一编址,芯片之间可以点对点直接访问远端显存,省去中间调度环节。跨卡通信时延压低至 0.69 微秒,AllReduce 通信耗时直接下降 3.5 倍。打通芯片之间的数据墙,是所有优化的基础。
通信链路打通之后,进入算子优化环节。把 KDA、Gated MLA、MoE 模块中成百上千细小算子,融合为超级算子,算子总量缩减至原来十分之一。
优化思路是把中间计算结果保存在片上缓存与寄存器,计算完成直接交给下一段流程,不用反复写入 HBM 显存再读取。同时启用异步数据搬运 + 多缓冲流水线,计算、预加载数据、回写结果同步并行。一块数据在运算,下一块数据提前搬入缓存,芯片全程减少等待空闲。
人工手写深度融合 Kernel,难度极高,开发周期漫长,模型版本一旦更新,整套算子几乎要重新开发,成本极高。

浪潮的方案,直接搭建超级算子智能体,由 Kimi K3 作为核心,运行「生成 — 验证 — 测量 — 迭代」的完整闭环:
K3 读取模型运行日志,定位性能瓶颈:哪一步长时间等待数据、缓存利用率不足;
自动设计算子合并策略,规划数据分块、流水线调度方案,批量生成候选超级算子代码;
自动校验代码正确性,在真实硬件负载中跑基准测试,采集延迟、显存带宽、硬件占用指标;
把实测数据反馈回 Kimi,作为下一轮迭代优化依据;
只有功能正确、性能提升的算子版本,才会正式上线部署。
依靠这套 AI 自我优化闭环,算子性能完成正向循环拉升,最终综合推理效能提升 3 倍以上。
最终实测成绩单,足够亮眼:单机承载完整 2.8 万亿参数 Kimi K3,Token 生成时延低至 5.85 毫秒,单用户吞吐突破 170 tokens/s,性能达到业界平均水平 5 倍。
不再比拼卡的数量,比拼 Token 时延
在此之前,算力采购的沟通方式非常直接。客户开口询问:需要多少张卡,多少 P 算力,多大存储。而现在,越来越多落地项目客户,第一句话变成:这个大模型跑起来,每一个 Token 生成时延多少,每秒吞吐多少?
这个转变,本质是 AI 应用形态切换带来的。普通对话聊天,延迟多一两秒,用户感知不强。但 AI 智能体 Agent 完全不一样。一次完整 Agent 任务,需要上百轮循环:推理、调用工具、读取返回结果、重新规划。每一轮推理的微小延迟,层层叠加,最终会导致整个任务耗时拉长数分钟。
对于 Agent 产品,Token 时延、吞吐能力,直接决定业务能不能跑通,而不是纸面峰值算力。 浪潮把这个方向定义为「能力型智算」:目标不只是把超大模型装在服务器上,而是让大模型跑得足够快,支撑复杂长周期自主任务。
SD200 Ultra 已经预留充足硬件冗余,能够承载 10 万亿参数大模型。按照浪潮首席 AI 战略官刘军的判断,1~2 年内顶尖大模型参数规模,就会抵达这个量级。Kimi K3,仅仅是第一个验证案例。
这里也给所有做 AI 落地、选型算力设备的人一个建议:以后再有人向你推销 AI 服务器,不再只看芯片数量、算力参数。优先问一句:前沿大模型在这套硬件上,真实 Token 生成速度是多少?
算力竞争主战场,已经从芯片硬件,转移到系统架构 + 算子软件
这场围绕 Kimi K3 的全球推理竞速,揭示整个 AI 产业正在发生的底层变革:算力竞争主战场,已经从芯片硬件,转移到系统架构 + 算子软件。
过去两年的推理优化,集中在模型本身:量化、KV Cache 压缩、投机解码。而这一轮的突破,完全不动模型,仅仅依靠底层系统与算子优化,就能拿到几倍性能提升。Inferact 使用更低带宽 TPU,性能打赢 GB200;浪潮在国产芯片底座上,依靠超级算子,实现 Kimi K3 推理提速 3 倍。同样的硬件,系统与算子优化做得好坏,性能差距可以达到数倍。

整个优化过程,本质就是不断拆除一层层壁垒:
算子与算子之间的墙 → 算子融合
计算任务和数据搬运之间的墙 → 通算融合
芯片与芯片之间的墙 → 统一显存编址,跨卡直连
而写算子这项核心底层工作,正在交给 AI 智能体。人工定制算子成本昂贵,模型更新就要重写,只能做通用化浅层优化。当 AI 可以自动为特定模型、特定硬件生成专属算子,定制优化成本会大幅下降。 未来,一个新大模型发布,可以自动启动智能体,针对目标硬件,生成整套专属算子,持续迭代调优。形成漂亮的正向循环:模型越强,写出的算子越好;推理速度越快,模型迭代训练、部署测试效率越高。
大模型上半场,所有人比拼对话效果、模型参数规模、跑分榜单;进入 Agent 主导的 AI 生产力下半场,比拼的是持续执行复杂任务的稳定执行力。
每一轮 Agent 任务拆解、工具调用、长链条自我反思,都会源源不断消耗 Token。推理延迟、吞吐性能,不再只是体验指标,直接决定智能体能不能在真实世界完成闭环。
硅谷 Megakernels 巨型算子,国内超级算子,两条路线殊途同归,解决同一个核心命题:如何把有限硬件算力,尽可能全部转化成可用的智能。
硬件迭代周期漫长,芯片工艺进步缓慢。但是软件、算子、系统架构的优化,空间巨大,迭代速度极快。算力效率革命,才刚刚拉开序幕。 谁能榨干硬件每一分算力,谁就能在 Agent 时代抢占先机。