乐于分享
好东西不私藏

8小时追平、2天反超英伟达:这个完全由AI"写"出来的训练框架,藏着怎样的野心?

8小时追平、2天反超英伟达:这个完全由AI"写"出来的训练框架,藏着怎样的野心?

导语

当一个训练框架的每一行代码都由AI编写、零人类干预,却在8小时内追平了英伟达苦心经营多年的Megatron-LM——这件事的意义,远不止"跑分好看"那么简单。

一场没有人类工程师参与的"造轮子"

2026年7月3日,面壁智能在公众号披露了一组让业界震动的数据:其自研预训练框架ForgeTrain,在基准测试中8小时追平NVIDIA Megatron-LM的性能,1.5至2天内实现稳定反超,MFU(模型算力利用率)提升约8%~10%

听起来像是又一个"国产框架性能突破"的故事?别急,真正炸裂的点在后面——

ForgeTrain的每一行代码,都是由AI Agent自主编写的,零人类代码介入。

没错,这不是"AI辅助开发",不是"AI补全代码",而是AI在一个闭环环境里,自己读基线、自己写实现、自己起作业、自己看日志、自己定位问题、自己改代码、自己跑门控测试、自己提交。人类只做了一件事:在最后验收。

这意味着,英伟达用十几年时间和无数工程师积累出来的训练框架护城河,被一个AI Agent Loop在8小时内追平了。

技术拆解:AI是怎么"锻造"出一个框架的

ForgeTrain的诞生,靠的不是某种神奇的单次生成,而是一套精心设计的四阶段"锻造"流程:

第一阶段Anchor(锚定):AI首先锁定二进制不变量,做到与参考实现逐位一致,max_abs_diff = 0。简单说,就是先证明"我能写出一模一样的东西"。

第二阶段Bit-for-Bit(逐位对齐):在保证二进制一致的前提下,快速生成支持checkpoint等基础功能的代码版本。

第三阶段Surpass(超越):解除二进制约束,让AI自主枚举算子路径、图捕获和调度组合,追求更长训练稳定性和多项指标优化。这就是反超Megatron-LM的关键阶段。

第四阶段Per-Op(逐算子定制):针对GEMM、FlashAttention等核心算子逐项深度定制,结合科学融合,最大化单算子MFU。

整个过程单调递进——前阶段锁定的正确性属性不会被后续回滚,全程自动判定,无人工干预。

最终成绩单:在64×H100上,MiniCPM4-0.5B预训练达到 44.13% MFU(Megatron-LM约40%)MiniCPM4-8B单机8卡达到 50.9% MFU部分算子最高MFU甚至冲到 90%

AI自研的FlashAttention性能超越了NVIDIA官方的Transformer Engine和FA3,对标FA4。

更值得关注的是,这套框架不挑食——它已经在华为昇腾芯片上完成了MiniCPM5-1B的预训练,训练出的模型在AA榜单2B规模以下拿下Top 1。"AI写的框架→在国产芯片上运行→训出领先的AI模型"这条完整闭环,被跑通了。

和Megatron-LM掰手腕:通用vs定制的终局之争

一个绕不开的问题是:凭什么AI写的框架能比英伟达工程师团队打磨多年的Megatron-LM更快?

答案藏在两个字里:定制

Megatron-LM是一个通用框架,它需要支持Llama、Qwen、DeepSeek、MiniCPM、MoE等大量模型结构,覆盖不同参数规模、不同并行策略。通用性意味着妥协——必须在各种场景间做平衡,不可能为某一种模型做到极致。

而ForgeTrain的逻辑完全不同。它不是要写一个"更好的Megatron",而是为每一个具体模型、每一种具体芯片、每一个具体训练任务,现场锻造一套量身定制的框架。MiniCPM4-0.5B有一套,MiniCPM4-8B有另一套;H100上跑有一套,华为昇腾上跑又有一套。

面壁智能AI Infra负责人李宇轩把这叫做"Forge Engineering(锻造工程)"。他的判断是:当AI写代码的成本趋近于零,软件工程就不必再把所有需求塞进一个大而全的通用系统里。就像工业革命从"用机器带动体力"走到"用机器制造机器",智能革命也正从"用AI替代脑力"迈向"AI制造AI"。

这个逻辑一旦成立,英伟达CUDA生态十几年积累的护城河,就从"不可逾越的壁垒"变成了"一个可以被AI自动解构和重构的工程问题"。人类工程师再多,也不如AI不知疲倦地打磨每一个细节。

更大的棋局:AI制造AI的L1到L5

面壁智能的野心不止于一个训练框架。李宇轩提出了一套"AI制造AI"的能力分级体系:

  • L1 提示建议级
    :AI就AI研究提供建议,人类执行
  • L2 辅助研发级
    :AI辅助编码、调试、数据清洗
  • L3 闭环交付级
    :AI在既定范式内端到端交付模型
  • L4 递归改进级
    :AI具备科研判断力,能提出新架构、新范式
  • L5 协同演化级
    :AI自主设定议程,成为问题的提出者

目前行业整体在L2站稳,L3仅有Anthropic等极少数团队能做到且效果不稳定。面壁智能瞄准的,是跨越L3,直接向L4发起冲击。ForgeTrain就是这一跃迁的"单点实证"。

结尾:当每个人都能"锻造"自己的模型

ForgeTrain的意义,不在于它今天比Megatron-LM快了10%,而在于它证明了一件事:当代码生产成本趋近于零,定制化就不再是奢侈,而是默认选项。

想象一下不远的未来:你需要训练一个模型,不用去适配某个通用框架的各种限制,而是把需求告诉系统,系统直接为你"锻造"出一套最合适的训练软件栈。模型不再是千人一面的标准品,而是每个人深度定制的智能助手。

面壁智能说,到年底要把头部国产算力软件用AI重写一遍。这话听着狂,但如果你理解了Forge Engineering的逻辑,就会明白——这不是口号,而是一个已经跑通的方法论的自然延伸。

工业革命用两百年走完的路,智能革命可能用两年就走完。而这一切的起点,或许就是那个8小时内追平Megatron-LM的AI Agent Loop。

当AI开始制造AI,游戏规则就彻底变了。

—— 极客趋势 ——

长按关注,追踪科技前沿