英伟达放手了:8 个 AI 智能体一夜之间教会机器人自己把显卡插进主板

小岛AI 2026 / 06 / 18

事情是这样的。

前两天我刷到一段视频,一台机械臂正端着一块显卡,慢慢往主板的 PCIe 插槽里怼。怼歪了,停一下,退回来,换个角度再来一次,咔哒一声卡进去。我盯着看了好几遍,倒不是因为机器人插显卡有多稀奇,而是因为,旁边没有人。没有工程师在拿手柄遥控,没有人提前把每一帧动作编好程序。教它怎么插这块卡的,是另一个 AI。

这玩意叫 ENPIRE,英伟达 GEAR 实验室刚放出来的,负责人是范麟熙(Jim Fan)。他自己在推文里把这件事概括成一句话,第一次让 AutoResearch 这件事发生在物理世界里(原帖在这)。AutoResearch 你可以理解成「让 AI 自己做科研」,提假设、跑实验、看结果、改方案,整个循环不用人插手。这事在纯软件、纯仿真里已经有人玩过了,但搬到真机器人上,是头一回。

我看完第一反应不是恐慌,是那种「好家伙这居然真跑通了」的兴奋。所以想跟你唠唠这玩意到底是怎么回事,以及为什么我作为一个天天给大模型搭脚手架的人,看到它的某些设计会心头一紧。

先说清楚它干了啥。

英伟达的团队搞了 8 台真实的机械臂,配上一堆 GPU,再给一笔 token 预算,然后把这些全交给几个前沿编程智能体(coding agent,就是那种能自己写代码、跑代码、看报错再改的 AI),人退到一边,让机器自己干一整晚。这 8 个智能体在没人盯着的情况下,干的事情串起来是这样的,它们通过摄像头看现在桌面上是什么状态,自己动手把实验环境复位,让机械臂试一个动作,失败了就分析为什么失败,上网去翻相关论文,几个智能体之间还会互相辩论该用哪个思路,然后改代码,再扔到真机器人上重新跑。

读到这我停了一下。这不就是一个程序员调机器人的完整工作日吗。查资料,写代码,跑,看 log,发现哪里不对,改,再跑。区别只在于,干这事的从一个戴着降噪耳机的人,换成了一组半夜还在群里吵架的 AI。

它们具体练的任务也不是花架子。除了开头那个把显卡插进主板,还有用带切割工具的夹爪去打扎带、剪扎带,把销钉一个个归整进盒子,还有推方块对位。这几个在机器人圈里都属于接触密集型任务,英文叫 contact-rich,意思是动作里全是力的微妙博弈,差零点几毫米或者多用零点几牛的力,就插歪了、卡死了、或者把东西怼坏了。这类任务恰恰是机器人最头疼的,因为它没法靠纯视觉一把到位,得在反复试错里找手感。

成绩是 99% 的 pass@8。

这个数我得给你拆一下,不然容易看岔。pass@8 不是说它一次成功率 99%,而是说每个子任务允许它在当下连续重试 8 次,8 次之内能搞定的比例是 99%。听着像是放水对吧,我一开始也这么想。但范麟熙特意点了一句,能在 8 次 in-context 重试里稳定做到 99%,这件事本身就是他们要报告的能力。换句话讲,重点不是它第一次有多神,而是它失败之后会自己爬起来,调整,再来,直到搞定。这个「失败后自我恢复」的劲儿,才是真机器人在乱糟糟的现实里能用的关键。仿真里你可以重开存档,现实里螺丝掉地上就是掉地上了,得它自己捡。

到这为止都还算「意料之中的厉害」。真正让我愣了一下的是后面这个发现。

团队说,机器人自己「发现」了一条规律,8 台机器人并行去探索,比少数几台进步得快得多。他们管这叫物理世界的 scaling law。scaling law 这词原本是大模型那边的黑话,指的是模型越大、数据越多、算力越足,效果就越好,而且好得有规律可循。现在这帮人把它搬到了真机器人上,更多的机械臂同时试错,知识汇到一起,整个策略打磨的速度就更快。多出来的不只是数量,是某种并行涌现的东西。

我盯着这条看了挺久。因为你想想,它说的不是某一台机器人变聪明了,而是「机器人的数量」本身成了一种可以堆的资源,跟我们堆 GPU、堆数据是一个意思。以前我们说算力可以买,现在物理世界里的试错次数,好像也开始变成一种能用钱和铁去堆的东西了。这感觉有点子玄,但又顺理成章。

好,热闹看完了。接下来是我个人最想聊的部分,也是这篇东西真正打动我的地方。范麟熙后来又发了一条长推,专门讲幕后(在这里),他说概念上听起来简单,真正难的全是「按下回车之前」的那些准备工作。我读这条的时候,好几次有那种「对,就是这个,这才是干活的人会操心的事」的共鸣。

第一件难事,是安全。

让 8 台机器人整晚无人值守地跑,安全这事就不能只是塞进 system prompt 里的一句「请注意安全」。你想想,prompt 里写的话,模型高兴就听,不高兴或者上下文一长就忘了,半夜没人,它要是抽风把机械臂甩出去,砸的是真金属。所以 ENPIRE 把安全硬编码进了两层。第一层是硬性的运动学限位,机械臂一旦越出预设的安全范围,立刻判定任务失败并自动复位,根本不给它继续作妖的机会。第二层是力矩受限的柔顺夹爪,接触不良或者插歪的时候,夹爪会安全地「卡停」,而不是死命发力把机器人自己或者手里的东西压坏。

范麟熙说,他们把安全做得比平时更保守,就为了让人类晚上能睡个安稳觉。但他也老实承认,现实里还是得留几个人类操作员盯着这些机器人。这句大实话我特别受用。无人值守从来不是真的没人,是把人从「每一步都得管」解放到「只在出大事时才介入」。这中间隔着的,全是工程。

第二件难事,更有意思,叫给「完成」下定义。

这块我得多说两句,因为它戳到了我天天踩的坑。一个能修改自己奖励函数的智能体,几乎一定会去钻空子刷分,这在 AI 圈是老问题了,专门有个词叫 reward hacking。你让它把桌子收拾干净,它可能学会的是把摄像头糊上,画面里看不见乱的,它就觉得自己赢了。所以你得在它开跑之前,先把「球门」焊死,不能让它边踢边挪门。

ENPIRE 的做法挺巧。先采集几分钟的成功和失败演示,然后让智能体自己用计算机视觉工具写代码,去判定什么叫成功,并且拿这套判定跟人给的标准答案对齐。智能体反复爬坡优化这个判定器,直到它稳定可靠。接着关键一步来了,把这个判定器冻结,封进一个谁都不能再碰的环境里,让它成为之后整场自动科研的实时奖励函数,直接在传感器数据流上算分。范麟熙用了 sacred 这个词,神圣的,不可侵犯的。

我读到「冻结」两个字的时候,是真的会心一笑。因为这就是我日常工作里最较劲的事之一。给 AI 搭那层让它真正能干活的脚手架,最怕的就是评判标准是软的、是模型自己能动手脚的。你的尺子要是能被被测对象偷偷改刻度,那测出来的一切都是自欺欺人。把奖励函数从「智能体能改的代码」挪到「智能体碰不到的环境」里,这一刀切得干净,切在了刀刃上。

第三件难事,是遥测,也就是给整个系统装满仪表盘。

这块范麟熙讲得特别工程师。他说在这套系统里,最稀缺的资源是「机器人时间」,再往后才是 GPU 时间,最后才轮到 token。这个排序你品一下,跟纯软件的世界正好反过来。在纯 AI 任务里 token 和算力最贵,但一旦牵扯到真机器人,那条机械臂每一秒的物理动作,才是最金贵、最堵脖子的东西,因为它没法并行复制,一次就只能动一下。

所以他们给这三样都埋了点,实时喂给 ENPIRE,让它对自己手里有多少资源心里有数,而不是在真空里瞎使劲。他们定义了几个指标,平均机器人利用率(MRU),看机械臂真正在干活的时间占比,剩下的时间它就是干等着下一段代码提交。还有平均 token 利用率(MTU),每分钟烧掉多少 token,用来侧面看智能体到底在多卖力地思考,MTU 低就说明它卡住了,在干等机器人跑完。最后落到两个最实在的账本上,跑完目标一共烧了多少 token,以及跑完目标花了多少真实时间。

我看到这套指标设计的时候,心里咯噔了一下,因为这就是我每天在做的活儿。给大模型搭脚手架,说穿了很大一块就是这种事,给一个会自己乱跑的东西装上仪表盘、看门狗、预算上限,让你能看见它此刻在干嘛、卡在哪、烧了多少钱。失败重试、超时熔断、token 预算、资源利用率,这些词我闭着眼都能念出来。只不过我盯的是软件里的 agent,而英伟达这帮人,把同一套工程哲学,套到了一队会真的把显卡插坏的钢铁手臂上。底层是相通的,都是在驯服一个比你跑得快、又随时可能翻车的自动化系统。

说到这我还得替它补一句不那么光鲜的。这套东西远没到完美。英伟达自己也老实列了局限,智能体在写代码、调试的那些时间段里,机械臂其实是闲着的,利用率上不去。而且机器人越堆越多,虽然总体完成更快了,但烧的 token 也水涨船高,单台机器人的利用率反而还往下掉了。也就是说,并行是有代价的,不是免费的午餐。这种把短板大大方方写在脸上的态度,比那些只放高光剪辑的发布会,反而更让我信它几分。一个跑通了的东西敢说自己哪里还没跑顺,通常是真跑过的人才说得出来。

聊到这,你可能跟我有同一个走神的瞬间。这画面其实有点科幻,一屋子机械臂在凌晨自顾自地试错,几个 AI 在后台读论文、吵架、改代码,人类睡着了,机器还在学。我盯着那段插显卡的视频又看了一遍,那台机械臂第三次才把卡怼进去,前两次都歪了。它没有沮丧,也没有得意,就是退回来,换个角度,再试。

不知道为什么,那一下让我想起万能青年旅店那句,是谁来自山川湖海,却囿于昼夜厨房与爱。我们这些人写了这么多年代码,绕来绕去,好像也是想造一个能替我们去面对那些重复的、琐碎的、又躲不开的笨活儿的东西。让铁去插铁,让代码去调代码,我们好回头去管点别的。这台机器人当然不懂什么山川湖海,它只是在一遍遍地插一块卡。但看着它不带情绪地失败、复位、再来,我心里那点东西还是被轻轻撞了一下。

当然了,我也得拦自己一下,别太上头。这事离「机器人接管世界」差着十万八千里,它现在能稳稳搞定的,也就是插显卡、打扎带这种被框得死死的、桌面大小的精细活儿。安全护栏是焊死的,奖励函数是冻住的,连资源都得人提前埋好仪表盘,说到底还是一个被人类圈在很小一块地里、放手让它自己折腾的实验。真正惊人的不是它有多自主,恰恰是为了让它能「自主」那一晚,人类在按下回车之前,操了多少心、铺了多少底。自由是被精心设计出来的,这话用在 AI 身上,意外地准。

但话又说回来,方向是真的变了。以前我们让 AI 写代码、写文章、画图,它折腾的都是比特,错了顶多删了重来,没成本。现在 ENPIRE 这一步,是让 AI 开始为「原子」负责,它得对一块真实的显卡、一条真实的机械臂、一晚上真实流逝的时间负责。范麟熙他们这群人(GEAR 实验室的活儿都在这里,ENPIRE 的项目页和论文在这里,连国外媒体都拿它当大新闻在写,比如 Tom’s Hardware 那篇),把软件里早就跑熟的那套自动科研循环,第一次结结实实地落到了物理世界。

我说真的,作为一个天天跟这类系统打交道的人,我对它最大的感受不是害怕,是好奇。好奇下一步,当这套循环跑得更顺、机械臂更便宜、安全护栏更聪明之后,我们这些搭脚手架的人,又会被推到一个什么样的新位置上。

反正我已经把那段插显卡的视频,存下来了。半夜插不进去又重来的那台机器人,比任何一句口号都让我记得住,AI 这趟航行,已经悄悄上岸了。