AI 亲手锻出训练框架:8 小时追平、2 天反超英伟达 Megatron-LM

小岛AI 2026 / 07 / 03

一个训练框架,从第一行代码到追平英伟达的旗舰方案,全程没有一个人类工程师碰过键盘。

8 小时追平,1 天半反超。

这是面壁智能刚开源的 ForgeTrain,官方那篇技术分享里说得很平静,我看的时候可一点没平静。因为被反超的那个对手,叫 Megatron-LM,英伟达自己攒了好几年、几乎是行业里训练大模型的标准脚手架。现在一个 AI 从零写出来的框架,两天就把它 MFU 顶上去了 8% 到 10%。

先把黑话拆一下,不然后面看不下去。

MFU 全称 Model FLOPs Utilization,你可以理解成算力的有效利用率。GPU 标称能跑多少浮点运算是一回事,训练时真正用在刀刃上的又是另一回事,中间漏掉的全是钱。MFU 从 40% 提到 48%,翻译成人话就是同样一堆卡、同样的电费,多榨出快五分之一的活。在动辄几千张 H100 的训练集群上,这几个点就是几百万人民币的差别。

而 Megatron-LM 这东西,是英伟达工程师一行一行手写、社区一起磨了好几年的通用训练框架。ForgeTrain 干的事,是让 AI 针对某个具体模型、某块具体的卡,现场重新锻一套专用的出来。不是改改配置,是从空文件夹开始写。

好家伙。我盯着这句看了半天。

我平时的活儿,其实就是给大模型搭脚手架,让它能在生产环境里真跑起来那层工程,工具链、评测、调度、上下文这些。所以看到「AI 自己把训练框架写了」这种事,我的第一反应不是兴奋,是那种很微妙的、后颈有点发紧的感觉。这活儿我熟,我知道它有多脏多难,也正因为熟,我清楚让 AI 独立干成它是多硬的一件事。

咱们一层层往下聊。

面壁这次没有光甩一个 demo,他们先给「AI 制造 AI」这件事画了把尺子,从 L1 到 L5。我觉得这把尺子比框架本身还值得说。

L1 是提示建议级,AI 就在旁边动动嘴,你要不要试试换个优化器,活全是人干。L2 是辅助研发级,AI 能接一段具体的活了,帮你写代码、调 bug、洗数据,现在大部分人用 Claude Code、Cursor 就停在这一层。L3 是端到端交付级,AI 在你定好的技术路子里把一个模型整个交付出来,架构调整、改损失函数、调超参、跑评测,一条龙自己走完。L4 就开始不一样了,叫递归改进级,AI 有科研判断力了,能自己提新架构、新的训练范式,还能顺手给自己现场造一套专用的基础设施。L5 更玄,协同演化级,AI 自己定研究议程,成了提问题的人,而不只是解题的人。

面壁的判断是,「AI 制造 AI」这条垂直线上,L2 已经站稳,L3 目前只有 Anthropic 这种极少数团队勉强能做到、还不太稳。而他们想干的,是直接跳过 L3 这个台阶,一步冲 L4。

听着挺狂对吧。我一开始也觉得是 PPT 话术。但 ForgeTrain 恰恰是他们摆出来的那个实证。你说我 L4 是吹的,行,我让 AI 现场给你锻一个训练框架出来,还比英伟达的快,你自己看。

四个阶段像一级一级锻好的台阶,往山顶爬,前一级焊死才准上下一级

那它到底怎么锻的?这块我最感兴趣,因为它用的方法论,跟我天天打交道的那套东西是同一个词,Harness。

Harness 这个词圈外朋友大概率没听过,你就理解成给 AI 圈的一个「考场加改卷系统」。你不能光让模型瞎写代码,你得给它一个能自动判对错、能打分、能让它反复重做的环境。写得对不对、快不快,环境自己判,不用人盯着。ForgeTrain 就是把这套考场搭在了「写训练框架」这件事上,然后分了四个阶段,一阶一阶往上爬。

第一阶段叫 Anchor,锚定。AI 先写一版代码,死磕一件事,跟参考实现逐比特一致。注意是逐比特,不是「结果差不多」,是 max_abs_diff 等于 0,一个数都不能差。这一步慢、笨、没性能可言,但它把「正确」这根桩子先钉死了。我看到这儿其实松了口气,因为搞训练最怕的就是跑得飞快结果算错了,错得还很隐蔽,等你发现模型不收敛已经烧掉几十万。先锚正确性,这个顺序是对的。

第二阶段 Bit-for-Bit,在保证逐比特一致的前提下,把 checkpoint 这些基础功能快速补齐,让它先是个能用的框架。

第三阶段叫 Surpass,反超。到这儿才把逐比特的紧箍咒解开,允许 AI 自己去枚举各种算子路径、各种图捕获和调度的组合,怎么快怎么来,追求更长的训练稳定性和更好的指标。这一步是它开始甩开 Megatron 的地方。

第四阶段 Per-Op,逐算子。针对 GEMM、FlashAttention 这些最吃算力的核心算子,一个一个深度定制,把每个算子的 MFU 榨到极限。

整个过程有个我特别欣赏的设计,单调递进,前一阶段锁死的正确性,后面再怎么优化都不许回滚。它不是那种「跑通了但我也不知道为啥对」的黑箱,是一层一层往上垒,每层的地基都焊死了。全程自动判定,没有一个人类去 review 那些 commit。

厉害了。这套流程设计得比很多人类团队还有纪律。

而且它不挑食。同一套能力,MiniCPM4 的 0.5B 和 8B 都能迁,H100 能跑,华为昇腾的 NPU 也能跑。这点我觉得比性能数字更要命,后面说。

面壁给这套打法起了个名字,Forge Engineering,锻造工程。核心就一句大白话,生产便宜,高效定制。

过去的思路是维护一套大而全的通用框架,去适配各种硬件,一个框架包打天下。听着很工程、很负责。但问题是现在模型和芯片的迭代速度,已经远远甩开底层软件了。你这边通用框架还没适配完上一代卡,下一代模型又出来了,这套通用框架就越来越重、越来越跟不上。Forge Engineering 反过来想,既然 AI 写代码的成本已经趋近于零,那我干嘛还维护通用的?我根据你这个具体模型、这块具体的卡,即时给你现锻一套量身定做的,用完这套就是这套的。

这思路我越琢磨越觉得有点子牛逼。它等于是把「定制」这件过去很奢侈的事,变成了默认选项。

同一套能力,在两块不同的芯片之间现锻一座桥,H100 能过,昇腾也能过

聊到这儿就绕不开那个大家都在想的问题了,英伟达的护城河怎么办。

现场有人也这么问,面壁的李宇轩回答得挺实在。他说 CUDA 的护城河是三样东西垒起来的,代码积累、生态惯性,还有数值信任。Coding Agent 能拆掉的主要是迁移成本这一块,过去把一个框架移植到新芯片要几个月,现在能压到几天。但他特别强调,生态信任不会自动消失,用户得亲眼验证 AI 锻出来的代码确实是对的,才敢用。

他有句话我抄下来了,护城河正在从「代码受信」变成「智能受信」。

我反复品这句。过去英伟达的壁垒是,全世界的训练代码都是围着 CUDA 写的,几百万行、几年积累,你换不动。但如果 AI 能几天之内、逐比特正确地、把这些代码在新硬件上重新锻一遍,那「代码换不动」这个前提就松了。壁垒没消失,它变了个位置,从「谁攒的代码多」变成「谁的 AI 更让人敢信」。竞争的维度整个换了。

对国产芯片来说,这里面的分量不用我多讲。高端卡受限的背景下,能靠算法和工程把算力效率成倍提上去,能让 AI 几天就把软件栈迁到昇腾上,这已经不只是一个技术追求,是实打实的产业战略。当然李宇轩自己也承认,国产厂商现在还是倾向于守着大而全的通用框架,改变需要时间,也需要模型能力再往上跳一跳、把定制的收益证明得足够诱人,才倒逼得动。这话我信,工程圈的惯性从来不是靠一篇 demo 就能推动的。

所以你要问我 ForgeTrain 是不是就无敌了,倒也不是。面壁自己在演讲最后也摆了一堆没解决的开放问题,怎么让 AI 跳出局部优化去提真正范式级的创新、怎么在几乎没硬件的条件下就构建超大规模并行的基础设施、怎么合成能持续喂养模型智能的数据。每一个都还是硬骨头。我挺喜欢他们这种坦诚的,没把话说满。

但那个最朴素的画面还是一直在我脑子里转。

一个 AI,对着一块它从没跑过的芯片,从空文件夹开始,先逐比特把正确性焊死,再一层层把性能顶上去,两天之后交出一个比人类攒了几年的旗舰框架还快的东西。全程没人插手。

我搞了这么久给 AI 搭脚手架的活,一直觉得脚手架是我搭的、AI 是在我搭的架子上干活的。ForgeTrain 这事最让我恍神的地方在于,它是 AI 自己给自己搭脚手架,还搭得比标准件更贴合。工业革命是从用机器带动体力,走到了用机器制造机器。这一回轮到智能自己了。

想看细节的,面壁那篇原文值得一读,MiniCPM 和 OpenBMB 的开源仓库也能顺着摸进去看看。

说真的,模型自己写下一代模型的代码这句话,几个月前听还像科幻,现在它已经在 GitHub 上、能 git clone 了。我们这些搭脚手架的,得重新想想自己站在哪儿了。