一块 4090 就能跑的机器人大脑,蚂蚁开源了

小岛AI 2026 / 07 / 09

七月九号下午,IT 之家前后脚挂出两条新闻,蚂蚁灵波开源 LingBot-Video蚂蚁灵波开源 LingBot-World 2.0。我往前一翻,好家伙,前一天晚上他们刚把 LingBot-VLA 2.0 放出来。二十四小时,三个模型,视频基模、世界模型、机器人大脑,全开源。

一般大厂开源是挤牙膏式的,一次放一个,热度吃满一周再放下一个。一天倒出来三个的,要么是市场部排期失误,要么是憋了个大的。我把三份材料摊开对着看,越看越觉得是后者。这不是三次孤立的发布,是一整条流水线,拆成三份只是卖相更好。

先从最不起眼的那个说起。

LingBot-VLA 2.0,6B 参数,做的是机器人圈叫 VLA 的东西,Vision-Language-Action,看摄像头画面、听人话指令、直接输出机器人动作,相当于机器人的大脑加小脑。6B 放在 2026 年的模型圈约等于小不点,但它有个账面数据我第一眼没反应过来,又倒回去看了一遍,在一块 RTX 4090D 上跑一次推理只要 130 毫秒。不是 H100,不是 B200,是你隔壁搞游戏的兄弟机箱里那块卡。机器人大脑的部署门槛,这一下被压到了消费级显卡的档位。

底子也扎实。骨干网络用的是 Qwen3-VL-4B,对,蚂蚁用了隔壁阿里通义的开源模型当地基,这年头开源生态就是这么套娃的。训练数据 6 万小时,5 万小时真机器人轨迹加 1 万小时第一视角人类视频,覆盖 20 种机器人形态,单臂的、双臂的、带灵巧手的人形机全都有,宇树 G1、傅利叶 GR-2 这些名字都在支持列表里。而且这 6 万小时是筛过的精华,原始池子有 9 万小时机器人数据,他们搭了一条自动化管线,算加速度和抖动的统计指标,把轨迹不平滑的、画面遮挡掉帧的、多视角对不上的全扔了,才剩下这些。

这里有个我觉得全场最妙的设计,55 维规范向量。不同机器人的关节数量天差地别,它硬是定义了一套 55 维的统一格式,手臂关节 14 维、末端位姿 14 维、夹爪 2 维、灵巧手 12 维、腰 4 维、头 2 维、移动底盘 3 维,剩 4 维留着扩展。你的机器人没有腰?对应维度填零就行。一个模型控制 20 种硬件,靠的就是这层统一接口。

写过驱动的兄弟应该已经反应过来了,这玩意就是机器人界的 HAL,硬件抽象层。这个伏笔先放在这,后面要用。

还有个设计我个人很喜欢。真实世界里干活,光看着当前画面做反应是不够的,你伸手接一个正在倒的杯子,靠的是对半秒之后的预判。VLA 2.0 在输入里加了两个可学习的查询向量,一个盯着当前帧,一个专门负责预测未来那一帧,然后请了两位老师来教,一个深度估计模型教它空间几何,一个视频理解模型教它时间上的变化规律,用蒸馏的方式把两位老师的判断力压进这个 6B 的小身板里。蒸馏,distillation,就是让小模型学大模型的输出而不是从头学原始数据,相当于直接抄学霸的解题思路。机器人从「看到什么做什么」变成「猜到接下来会发生什么再动手」,这一步挺关键的。

然后是 LingBot-Video。30B 参数的视频生成基础模型,用了 MoE 架构,Mixture of Experts,混合专家,可以理解成模型内部养了一群各有所长的专家,每次推理只叫醒最相关的那几个。所以 30B 的总参数,生成时只激活 3B,推理效率大约是同规模普通稠密模型的三倍。

但它跟你平时刷到的那些 AI 视频模型压根不是一个赛道。官方这次把话讲得挺直白,视频生成正在分岔,一条路通向影院,服务内容创作,另一条通向机器人,服务物理世界的预测。给人看的视频,好看就够了,物理规律穿帮无所谓,观众不较真。给机器人看的视频不行,机械臂抓杯子的下一帧如果违反物理,机器人照着学,杯子就真碎了。所以它往训练里塞了 7 万小时机器人相关数据,还专门用强化学习对齐物理合理性和任务完成度,在北大和字节联合发布的机器人视频基准 RBench 上跑出 0.620,压过 Wan2.6 的 0.607 和 Seedance 1.5 Pro 的 0.584,在专测物理直觉的 Physics-IQ Verified 上也是第一。

LingBot-Video 在 RBench 机器人视频基准上的得分,红色是它,前面几名全是闭源模型

到这里,我的情绪还停留在「还行,有点意思」。最后这个是真让我从椅子上坐直了。

LingBot-World 2.0,实时交互世界模型。你可以把世界模型理解成一个用神经网络现算的游戏引擎,没有建模,没有贴图,没有预渲染,每一帧画面都是模型当场生成的,你按键盘控制角色移动转视角,它实时算出下一帧给你。这个方向去年起 demo 就不少,但全都有一个致命伤,叫长时漂移,误差逐帧累积,跑几分钟画面就开始融化,纹理糊掉,几何变形,整个世界慢慢崩坏。

这次的版本号后缀叫 Infinity。官方压力测试连续跑了一个小时,画面不崩,纹理锐利,720p,60 帧。一个小时。???

而且不只是逛地图。施法、攻击、射箭、跳跃、滑翔,这些动作都由模型根据当前场景实时生成对应的视觉变化。你还可以用文字直接改世界,打一行字召唤一场暴风雪,从城市切到森林,让天上飞过一群鸟,模型自己判断合理的时空插入点,把变化无缝融进正在运行的世界。系统里还内置了两个 agent,一个替角色规划行为,一个当导演往场景里持续扔新事件,世界不再是静止的背景板,会自己演化。再加上支持多人进同一个世界一起探索。跑分先放一边,就冲这个产品形态,有点子牛逼。

官方给的世界模型横向对比,生成时长一列里,其它家都是分钟级,它写着小时级(无限)

三个模型单独看是三条新闻,摆在一起看,是一条完整的生产线。

具身智能这几年最卡脖子的不是算法,是数据。文本模型可以把整个互联网当饲料,机器人模型的饲料是真机上采集的轨迹,一台机器人一小时只能采一小时,还得雇人盯着,采完还要洗。蚂蚁那 9 万小时的原始数据池,光收集成本就足够劝退绝大多数创业公司。这是行业公认的死结。

现在你再看这盘棋。LingBot-Video 是造数据的,生成符合物理规律的机器人视频,给下游当仿真数据和预测模块用,官方自己列的用途里就写着仿真数据生成。LingBot-World 是练功房,一个能实时交互、按小时稳定运行的虚拟环境,机器人策略在里面试错,摔一万个杯子也不用赔钱,官方列的用途里同样明晃晃写着具身智能训练。LingBot-VLA 是最后交付的那个大脑,喝着前两者产的数据长大,装进真机干活。造数据的、练功的、干活的,一条链,全在牌桌上。

然后想起那个 55 维接口了吗,伏笔回收。对硬件厂商来说,接入这套体系的成本低到离谱,把自家机器人的关节映射进规范向量,缺的部位填零,完事。蚂蚁赌的就是这个,具身智能的安卓时刻。手机行业当年每家都想做自己的操作系统,后来大部分厂商算明白了账,做系统太贵,用安卓真香。机器人行业现在每家都在自研大脑,等哪天有厂商也把账算明白,一个开源的、20 种形态都验证过的、一块消费级显卡就能部署的大脑摆在货架上,你猜他们选什么。

安卓从来不靠卖系统赚钱。蚂蚁大概率也没指望模型本身收钱,生态起来之后,支付、云、服务,哪条路都能变现。一家做支付起家的公司去押机器人的操作系统层,怎么说呢,比它当年头铁做社交靠谱多了。

不过,先别急着冲。我把材料里几个官方没放进标题的细节挑出来,你自己称称分量。

第一个是协议。VLA 2.0 的代码仓库是 Apache 2.0,商用友好,随便折腾。World 2.0 是非商用开源协议,只许研究。发现了吗,练功房才是这条链上最值钱的资产,而它恰好是被圈起来的那个。大脑免费送你,练功房的商用门票要另谈。开源的诚意是真的,生意的算盘也是真的,两件事不冲突,但你做技术选型之前,得先知道收费站设在哪。

第二个是成功率的绝对值。GM-100 通用操作测试里,VLA 2.0 在 AgileX 双臂平台上的成功率是 34.4%,确实比 π0.5 的 32.2% 高,确实是榜一。但你把这个数字横过来看,当今最强的通用机器人策略之一,十次任务成功三次半。真机的长程任务更扎心,Astribot S1 做冰箱整理,把水果饮料分门别类放进冰箱,训练分布内成功率 60%,一旦把物品摆放位置换一换,做个分布外测试,成功率直接掉到 13.3%。是的,比对手 π0.5 的 6.7% 好一倍,可 13.3% 放在任何一个真实家庭里都约等于不可用。技术报告自己也承认,不少任务进度分很高、成功率上不去,机械臂能顺利走完九成流程,最后一下放偏了,或者松爪时机不对,前功尽弃。具身智能的困难从来不在演示视频里,在最后一厘米。

真机长程任务成功率,分布内还行,物品位置一换就大跳水,数据来自 LingBot-VLA 2.0 技术报告

第三个算媒体素养题。英文圈那篇 MarkTechPost 的报道写得很全,我这篇的不少数据也参考了它,但它文末挂着一行小字,感谢蚂蚁研究团队对本文推广的支持。带着这个信息再回头看各路通稿里的最高级形容词,你就知道哪些要打折了。倒不是说数据有假,RBench 是北大和字节的基准,作弊不了,只是「全球首个」这种定语前面通常挂着一长串限定条件,面向具身智能的、基于 MoE 架构的、开源的。定语越长,首个越水,这个规律放哪个行业都成立。

如果你看完手痒想上手,路线也给你踩好了。最平滑的是 World 2.0 的在线体验,Reactor 网页端或者灵光 APP 都行,不用部署直接玩。想跑真格的,VLA 2.0 的权重挂在 HuggingFace技术报告在 GitHub 仓库里,环境要求 Python 3.12 加 PyTorch 2.8,仓库自带下载和部署脚本。微调走 LeRobot 格式的数据集,官方给了在 RoboTwin 2.0 仿真环境里跑 50 个任务的完整例子,没有真机也能玩出个所以然。推理框架这边 SGLang 首日就适配了 World 2.0,工具链是齐的。说实话我自己还没来得及跑,模型这两天才放出来,等我测完再来汇报,翻车了也照实写。

写到这,窗外天都黑透了。我又想起智能手机刚起来那几年,每家硬件厂都觉得操作系统该自己攥在手里,几年之后,绝大多数都在给安卓交作业。我不是说蚂蚁这套一定能成,具身智能离真正好用,中间还隔着不知道多少个 34.4%。但平台级的赌注从来都是这样,下注的时候看起来像烧钱,成了之后回头看,个个都说是必然。

牌已经摊开了。接下来就看有多少机器人厂商,愿意把自己的关节映射进那 55 个维度里。