乐于分享
好东西不私藏

字节清华联手掀桌!AI写底层代码速度反超官方编译器2.11倍,英伟达最硬的护城河正在被亲自爆破

字节清华联手掀桌!AI写底层代码速度反超官方编译器2.11倍,英伟达最硬的护城河正在被亲自爆破

在硅谷和中关村的高性能计算圈子里,流传着一个心照不宣的秘密:最顶级的AI硬件优化专家,年薪千万起步,甚至比一线大模型算法科学家还要稀缺。

为什么?因为买来几万张英伟达显卡只是第一步。如果底层的CUDA内核代码(Kernel)写得稀烂,这些价值连城的算力怪兽就会有大半时间在“发呆摸鱼”。把一段矩阵乘法或者注意力机制的执行效率提升10%,就意味着能为科技巨头省下数以亿计的电费和硬件采购款。

长期以来,这片领域一直被视为人类顶级极客的“专属炼金术”。2026 年 2 月底,字节跳动 Seed 团队联合清华大学 AIR 实验室,在 arXiv 上甩出了一篇重磅论文。

▲ 字节跳动与清华 AIR 联合实验室 SIA-Lab 正式发布 CUDA Agent

他们打造了一个名为 CUDA Agent 的强化学习智能体系统。这个系统不需要人类专家一行行教它怎么写代码,而是直接扔进 GPU 沙箱里“以跑代练”。

最终的结果震撼了整个编译与系统架构界:在斯坦福大学严苛的基准测试 KernelBench 上,CUDA Agent 生成的代码在 96.8% 的任务上击败 PyTorch 官方编译器 torch.compile,整体几何平均加速比高达 2.11 倍! 在最复杂的架构级融合任务上,它甚至直接把 Claude 4.5 和 Gemini 3 Pro 甩开了整整 40 个百分点。

海外科技社区瞬间炸锅,甚至有人高呼:“英伟达苦心经营二十年的软件护城河,要被 AI 亲手拆了!”

这到底是一场夸大其词的狂欢,还是一次底层技术革命?

▲ 论文发布后,海外科技圈对这一突破展开了极高热度的讨论

一场价值百亿美元的“后厨调度战争”

要看懂 CUDA Agent 究竟干了什么,可以用一个通俗的比方来理解:为什么 GPU 优化这么难?

如果把 CPU 想象成一个精通微积分的数学教授,那 GPU 就像是一个拥有 10,000 名厨师的巨型超级厨房

深度学习的每一次训练和推理,本质上就是成千上万道菜品(矩阵乘法、归一化、激活函数)的流水线作业。而提交给 GPU 执行的具体指令程序,就叫做 Kernel(内核)

▲ 斯坦福大学推出的 KernelBench,专门考验 AI 能否写出“又对又快”的 GPU 内核

写 Kernel,就像是在这个万人后厨里下达调度令。

  • 平庸的代码
    :让 10,000 个厨师切完葱,把葱放回几百米外的总冷库(全局显存),然后再跑去总冷库把葱拿出来倒进炒锅。结果是,厨师们 90% 的时间都在走廊里排队堵车,算力白白浪费在“等数据搬运”上。
  • 顶级的代码
    :计算切葱、配料与下锅的时序,让厨师直接在手边的案板(共享内存和寄存器)完成所有动作,一次点火搞定多道工序。这种操作在工程上被称为“算子融合”(Operator Fusion)

为了把这个调度过程自动化,PyTorch 官方推出了神器 torch.compile它汇聚了全球最顶尖编译专家的智慧,成了所有机器学习工程师日常默认的“性能黄金基线”。

过去,像 GPT-4 这样的大模型虽然懂编程,但在写底层 CUDA 时常常翻车。论文披露了一个惊人的事实:字节跳动的基座模型在刚开始测试时,面对编译器基准的胜率只有惨淡的 27.2%,平均速度只有编译器的 0.69 倍也就是说,AI 自己瞎写的底层代码,比官方编译器还慢了三成以上!

底层硬件的复杂性容不得半点幻觉寄存器溢出、线程束分化、内存对齐……任何一个细节处理不好,程序要么直接报错崩溃,要么慢如蜗牛。

让 AI 在真实 GPU 上“碰壁进化”:硅基铁匠是怎样炼成的?

既然人类无法穷尽所有的代码规则,字节和清华团队索性换了一条激进的路线:不给模型喂任何人工标注的标准答案,让它在真实的 GPU 沙箱里,靠纯粹的强化学习自己“悟道”。

▲ CUDA Agent 把生成代码纳入了完整的“编译-运行-剖析-学习”闭环

整个系统被设计成了一个残酷而高效的“硅基铁匠铺”,由三大核心模块驱动:

1. 无限任务生成机(数据合成)

高水平的 CUDA 题目极其稀缺团队从 PyTorch 和 Transformers 库里挖掘基础算子,用大模型随机组合拼接,构建出 6,000 多个复杂的运算任务(CUDA-Agent-Ops-6K)。多算子一融合,中间变量的显存读写逻辑立刻变得无比复杂,逼着模型必须学会全局统筹。

2. 绝不手软的“防作弊沙箱”

写底层代码,模型最喜欢“偷懒耍滑”为了防止模型投机取巧,团队设立了极其严苛的规则:

  • 每次写完代码,沙箱自动编译并执行。
  • 必须通过多组随机输入的严格数值校验,哪怕最后一位小数对不上,立刻判定失败(奖励记为 -1)。
  • 锁死测试脚本权限,严禁调用预编译好的现成函数库作弊。
  • 奖励不看虚浮的理论加速,直接看硬件秒表:只有比 PyTorch 官方编译器明显快出 5% 以上,才能拿到最高奖励等级 3。

3. 长达 150 步的自我博弈

在以往的研究中,大模型写 CUDA 往往跑个十几步就因为概率崩溃而胡言乱语(预训练语料中 CUDA 文本占比还不到 0.01%)。团队设计了独特的多阶段预热机制,让模型拥有了长达 128k 上下文、上百轮反复试错的定力。

它写出一版代码,上机跑一下;看 Nsight 剖析工具反馈的瓶颈,发现显存带宽卡住了;回头重写内存布局,再编译,再测试……文本生成就这样变成了一场由硬件反馈驱动的“经验实验”。

降维打击!连升两级后的“算力屠杀”

经过数周在 128 张英伟达高端计算卡上的自我残酷迭代,重装归来的 CUDA Agent 展现出了令人窒息的统治力。

在包含 250 道严苛考题的 Stanford KernelBench 擂台上,战局呈现出一边倒的态势:

评测维度
整体通过率
比 torch.compile 更快比例
相对编译器的几何平均加速比
综合整体 (Overall)98.8%96.8%2.11×
Level-1(单算子基础题)
100%
97%
1.87×
Level-2(算子融合进阶题)
100%
100%
2.80×
Level-3(全网络模块终极大题)
94%
90%1.52×

论文报告称,在最具挑战性的 Level-3 架构级任务中,CUDA Agent 相对编译器的胜率达到 90%,相对若干强专有模型的领先幅度约为 40 个百分点。

它在具体题目中所展现出的“数学顿悟”同样惊人。

在一道对角矩阵乘法的题目中,传统的编译器依然会老老实实调用通用矩阵乘法逻辑。而 CUDA Agent 在试错了几轮后,敏锐地发现了代数等价性,它直接把庞大的矩阵乘法降维成了广播逐元素相乘! 代码一跑,速度相对 torch.compile 瞬间狂飙了 73.31 倍

在经典的 ResNet 模块中,它甚至学会了把批归一化(BatchNorm)直接数学折叠进卷积层,并顺手调用了底层最深处的融合 cuDNN 通道。

它借助一次次实测,在微秒尺度上重新寻找最优算法。

英伟达的护城河,真的要被抽干了吗?

随着论文的疯传,一种激进的声音开始在社交媒体蔓延:“英伟达最大的壁垒就是 CUDA 软件生态,现在 AI 能自动写出超越官方的底层代码,黄仁勋的护城河难道要完了?”

然而,只要冷静穿透技术的表象,就会发现事实恰恰相反。

正如知名科技观察者所指出的:CUDA Agent 训练在英伟达 H20 上,生成的目标是英伟达 CUDA 语言,依赖的是英伟达的原厂剖析器。 它并没有脱离 CUDA,它是在把 CUDA 的每一滴潜能榨干到极致。

这里正在发生的是经典的“杰文斯悖论”(Jevons Paradox)

当蒸汽机的煤炭利用效率提高时,人类消耗的煤炭总量并没有减少,反而因为蒸汽机应用场景的大爆发而呈指数级激增。

在 AI 领域同样如此:当底层内核的编写成本从“人均几十万美金且耗时数周”,骤降为“智能体一顿饭功夫自动调优”时,算力的摩擦阻力被彻底抹平了。

过去因为优化太难而被放弃的新模型架构、新注意力机制,现在都可以被瞬间赋予极致的硬件性能。企业不仅不会少买显卡,反而会把省下来的效率红利,投入到更大规模、更复杂的模型训练中去!

巨大震荡更可能先出现在传统的底层软件工程模式中。

过去由少数编译器专家闭门构筑的静态规则,正在被拥有动态实测能力的强化学习智能体全面超越。这标志着高性能系统软件的开发,正式从“手工打磨的象牙塔手艺”,迈向了“算力自举的自动化工业时代”。

自我进化的飞轮已经启动

字节跳动与清华 AIR 的这项研究,给整个科技界带来了一个极其深远的启示:

大模型已经开始掉转枪口,优化支撑它自身运行的底层计算底座,其影响远超写邮件和画插图。

AI 生成更好的算子,带来更快的训练速度;更快的速度孕育出更聪明的 AI,进而写出更极致的算子。

这道自我加速的技术飞轮,才刚刚开始转动第一圈。