导语
当一个训练框架的每一行代码都由AI编写、零人类干预,却在8小时内追平了英伟达苦心经营多年的Megatron-LM——这件事的意义,远不止"跑分好看"那么简单。
一场没有人类工程师参与的"造轮子"
2026年7月3日,面壁智能在公众号披露了一组让业界震动的数据:其自研预训练框架ForgeTrain,在基准测试中8小时追平NVIDIA Megatron-LM的性能,1.5至2天内实现稳定反超,MFU(模型算力利用率)提升约8%~10%。

听起来像是又一个"国产框架性能突破"的故事?别急,真正炸裂的点在后面——
ForgeTrain的每一行代码,都是由AI Agent自主编写的,零人类代码介入。
没错,这不是"AI辅助开发",不是"AI补全代码",而是AI在一个闭环环境里,自己读基线、自己写实现、自己起作业、自己看日志、自己定位问题、自己改代码、自己跑门控测试、自己提交。人类只做了一件事:在最后验收。
这意味着,英伟达用十几年时间和无数工程师积累出来的训练框架护城河,被一个AI Agent Loop在8小时内追平了。
技术拆解:AI是怎么"锻造"出一个框架的
ForgeTrain的诞生,靠的不是某种神奇的单次生成,而是一套精心设计的四阶段"锻造"流程:
第一阶段Anchor(锚定):AI首先锁定二进制不变量,做到与参考实现逐位一致,max_abs_diff = 0。简单说,就是先证明"我能写出一模一样的东西"。
第二阶段Bit-for-Bit(逐位对齐):在保证二进制一致的前提下,快速生成支持checkpoint等基础功能的代码版本。
第三阶段Surpass(超越):解除二进制约束,让AI自主枚举算子路径、图捕获和调度组合,追求更长训练稳定性和多项指标优化。这就是反超Megatron-LM的关键阶段。
第四阶段Per-Op(逐算子定制):针对GEMM、FlashAttention等核心算子逐项深度定制,结合科学融合,最大化单算子MFU。
整个过程单调递进——前阶段锁定的正确性属性不会被后续回滚,全程自动判定,无人工干预。
最终成绩单:在64×H100上,MiniCPM4-0.5B预训练达到 44.13% MFU(Megatron-LM约40%)MiniCPM4-8B单机8卡达到 50.9% MFU部分算子最高MFU甚至冲到 90%
AI自研的FlashAttention性能超越了NVIDIA官方的Transformer Engine和FA3,对标FA4。
更值得关注的是,这套框架不挑食——它已经在华为昇腾芯片上完成了MiniCPM5-1B的预训练,训练出的模型在AA榜单2B规模以下拿下Top 1。"AI写的框架→在国产芯片上运行→训出领先的AI模型"这条完整闭环,被跑通了。
和Megatron-LM掰手腕:通用vs定制的终局之争
一个绕不开的问题是:凭什么AI写的框架能比英伟达工程师团队打磨多年的Megatron-LM更快?
答案藏在两个字里:定制。

Megatron-LM是一个通用框架,它需要支持Llama、Qwen、DeepSeek、MiniCPM、MoE等大量模型结构,覆盖不同参数规模、不同并行策略。通用性意味着妥协——必须在各种场景间做平衡,不可能为某一种模型做到极致。
而ForgeTrain的逻辑完全不同。它不是要写一个"更好的Megatron",而是为每一个具体模型、每一种具体芯片、每一个具体训练任务,现场锻造一套量身定制的框架。MiniCPM4-0.5B有一套,MiniCPM4-8B有另一套;H100上跑有一套,华为昇腾上跑又有一套。
面壁智能AI Infra负责人李宇轩把这叫做"Forge Engineering(锻造工程)"。他的判断是:当AI写代码的成本趋近于零,软件工程就不必再把所有需求塞进一个大而全的通用系统里。就像工业革命从"用机器带动体力"走到"用机器制造机器",智能革命也正从"用AI替代脑力"迈向"AI制造AI"。
这个逻辑一旦成立,英伟达CUDA生态十几年积累的护城河,就从"不可逾越的壁垒"变成了"一个可以被AI自动解构和重构的工程问题"。人类工程师再多,也不如AI不知疲倦地打磨每一个细节。

更大的棋局:AI制造AI的L1到L5
面壁智能的野心不止于一个训练框架。李宇轩提出了一套"AI制造AI"的能力分级体系:
- L1 提示建议级
:AI就AI研究提供建议,人类执行 - L2 辅助研发级
:AI辅助编码、调试、数据清洗 - L3 闭环交付级
:AI在既定范式内端到端交付模型 - L4 递归改进级
:AI具备科研判断力,能提出新架构、新范式 - L5 协同演化级
:AI自主设定议程,成为问题的提出者
目前行业整体在L2站稳,L3仅有Anthropic等极少数团队能做到且效果不稳定。面壁智能瞄准的,是跨越L3,直接向L4发起冲击。ForgeTrain就是这一跃迁的"单点实证"。
结尾:当每个人都能"锻造"自己的模型
ForgeTrain的意义,不在于它今天比Megatron-LM快了10%,而在于它证明了一件事:当代码生产成本趋近于零,定制化就不再是奢侈,而是默认选项。

想象一下不远的未来:你需要训练一个模型,不用去适配某个通用框架的各种限制,而是把需求告诉系统,系统直接为你"锻造"出一套最合适的训练软件栈。模型不再是千人一面的标准品,而是每个人深度定制的智能助手。
面壁智能说,到年底要把头部国产算力软件用AI重写一遍。这话听着狂,但如果你理解了Forge Engineering的逻辑,就会明白——这不是口号,而是一个已经跑通的方法论的自然延伸。
工业革命用两百年走完的路,智能革命可能用两年就走完。而这一切的起点,或许就是那个8小时内追平Megatron-LM的AI Agent Loop。
当AI开始制造AI,游戏规则就彻底变了。
—— 极客趋势 ——
长按关注,追踪科技前沿
夜雨聆风