机器人的小脑,被做成了 4 亿参数的大模型,还全开源了
事情是这样的。
地平线昨天开源了一个叫 HoloMotion-1 的模型,4 亿参数。
我看到 4 亿这个数字,第一反应是,这也好意思叫大模型?现在随便一个开源 LLM 都是几十上百亿参数起步,4 亿放在搞语言的那个圈子里,属于能在手机上随便跑的那种小不点。
但它前面挂的定语是,机器人小脑大模型。
然后我顺手去翻了下机器人控制这个领域以前的模型规模。好家伙。百万级、千万级是常态。也就是说在机器人运动控制这块,4 亿参数不是小,是把以前的天花板直接顶穿了一两个数量级。
同一个数字,在 LLM 圈里是尘埃,在机器人圈里是巨兽。光这个错位,我觉得就够聊一篇了。
先把小脑这个词展开讲讲,不然后面没法往下聊。
人有大脑也有小脑。你现在端着杯子走路、刷手机、还能顺手躲开地上那个没拆的快递盒,这一整套动作里,真正需要你「想」的部分其实极少。决定去厨房接杯水,这是大脑的事。但怎么迈腿、怎么在重心偏掉的瞬间自动修正、手一抖怎么稳住,这些是小脑在后台默默跑,根本不占用你的意识。你甚至感觉不到它在工作。

机器人这两年最热的是大脑,也就是各种具身大模型、VLA(Vision-Language-Action,视觉语言动作模型,简单说就是给机器人接一个能看能听能想的大模型,让它听懂「把桌上的杯子拿给我」这种人话)。发布会上大家抢着秀的,几乎都是大脑这部分,理解力、推理、能不能听懂复杂指令。
小脑这块一直没什么声量。因为它又脏又累,还特别不出彩。它干的活是,在毫秒级的时间窗口里,根据机器人当前的姿态,算出几十个关节下一刻各自该出多大力,而且基本不能算错,算错机器人当场就摔给你看。这活儿对实时性的要求高到变态,行业里常见的控制频率要求是 50Hz,也就是每秒钟得做 50 次这样的决策(Hz 是赫兹,每秒发生的次数),频率低了机器人就抖、就僵、就栽。
所以这个领域长期的活法是,模型尽量做小,小到能在机器人身上那块算力捉襟见肘的板子上飞快跑完一轮。小模型,加大量人工调参,再给每一种动作单独训练。会走路的不一定会跳舞,好不容易会跳舞了,换一台机器人又得从头调。这种又苦又不被看见的工程活,干了多少年了。
你这两年在网上刷到的那些人形机器人精彩片段,宇树的 G1 跳舞、Figure 在流水线上搬零件、特斯拉 Optimus 叠衣服、波士顿动力 Atlas 翻跟头,单看每一个都挺震撼。但你要是稍微多看几个就会发现一个尴尬的事实,它们大多是一台机器人,针对一个特定场景,用强化学习(reinforcement learning,让机器人在仿真环境里反复试错,做对了给奖励,慢慢把一个动作磨出来)单独练出来的。这个会翻跟头的不一定会稳稳搬箱子,那个会叠衣服的换个地面材质可能就翻车。每多一个技能,背后是又一轮仿真、调参、再仿真。会的动作多了,工程量是叠加的,不是免费的。这件事一直没被解决,谁能用一个模型把一堆技能零样本通吃,谁就算真往前迈了一步,而不是又录了一段好看的 demo。
中间还隔着一道叫 sim-to-real 的坎。模型大多在仿真器里训练,仿真里的摩擦力、电机延迟、传感器噪声跟现实永远对不齐,仿真里跳得好好的,搬到真机上当场表演劈叉,这个落差能耗掉团队半条命。所以你看人形机器人这行,热闹归热闹,真正难的从来不是让它做出某一个动作,是让它换个动作、换台机器、换个地面,还稳得住。
HoloMotion-1 干的事,是反着来的。它偏要把小脑做大,做到 4 亿参数,然后再想办法让这个「大」还能在机器人本体上跑出 300FPS。
300FPS 是个什么概念。前面说过,控制频率一般 50Hz 就够用,50Hz 摊下来每次决策的预算大概是 20 毫秒。HoloMotion-1 在机器人本体那点算力上能跑到约 300FPS,等于单步只花三点几毫秒,把行业要求线甩在身后六倍。算力上凭空多出来这么一大块余量,这块余量,就是它敢把模型做大的底气所在。
它靠两样东西做到的。
一个是 MoE 稀疏激活。MoE 是 Mixture of Experts,混合专家,你可以理解成模型内部养了一群专家,每次干活只叫醒跟当前任务相关的那几个,其余的继续睡。所以参数总量是 4 亿,但每一步推理真正参与计算的只是一小撮。又大又快这件事,就是这么来的。
另一个是 KV-cache,键值缓存,推理的时候把前面已经算过的中间结果存下来,下一步直接拿来复用,不重复算第二遍。这玩意儿在 LLM 推理提速里是个老熟人了,现在被原样搬到了机器人小脑上。
这两个词,你要是天天泡在 LLM 圈,大概会觉得平平无奇,不就这些么。但它俩出现在一个跑在机器人本体上、要求 300 帧硬实时的运动控制模型里,我盯着技术报告看了一会儿,有点子牛逼。等于是把大模型推理那一整套省算力的工程经验,整建制搬进了一个完全不同的领域,而且是真跑通了,不是 PPT 上跑通。
多出来的那六倍余量到底买到了什么,这事值得多想一层。控制模型过去被按着做小,不是大家不想做大,是做大了那块板子带不动,单步推理一超过 20 毫秒,整个控制环就崩了,机器人原地变雕塑。模型一小,能记住的动作模式就有限,泛化能力天然受限,这是被算力逼出来的妥协,妥协了很多年。HoloMotion-1 把单步压到三点几毫秒,省下来的这部分时间预算,可以拿去喂一个大得多、因此见过的动作分布广得多的模型,也可以留着给后面接更重的感知。它真正撬动的不是某个 demo 帧率好看,是把这个领域被算力锁死的那个天花板,往上抬了一截。这个抬法,厉害了。
接下来这块,我觉得才是最有意思的。
它的训练数据,是杂食的。互联网上扒下来的视频、光学动捕、VR 遥操作、惯性动捕,四种来源混在一口锅里。
这里得停下来解释几个词,不然容易糊。动捕就是 motion capture,动作捕捉,给真人贴一身标记点或者穿一套传感设备,把人的动作录成数据。光学动捕精度高但贵,得有专门场地和一圈摄像头围着。惯性动捕便宜不少,靠穿在身上的惯性传感器。遥操作(teleoperation)是人远程操控机器人,操控这个过程本身,就是一份现成的「人希望机器人怎么动」的数据。
这四种数据,精度、噪声水平、坐标系、采集方式,全不一样,凑一块儿是会打架的。HoloMotion-1 弄了一套统一的处理和动作重定向流程,把它们都翻译成机器人学得动的训练数据。动作重定向(retarget)这个词解释一下,人的骨架结构和机器人的关节结构是两回事,你不能把人抬胳膊的那个角度原样抄给机器人,得做一次翻译,让机器人用它自己那副身板,做出一个「等效」的动作,这一步就是 retarget。最离谱的是从互联网视频里学,那是从一段二维的、糊的、抖的视频里,把人物的三维动作给恢复出来,再翻译给机器人,这中间隔了好几层。

喂下这么一锅杂粮之后,它端出来的是零样本迁移。零样本(zero-shot)的意思是,没有针对这个具体动作单独训练过,模型上来直接就能做。地平线放出来的清单是这样的,高动态的舞蹈动作来自互联网视频,爬行、坐下、高踢腿这种身体跟地面、跟自己大量接触的动作来自高精度光学动捕,健身动作来自便宜的 VR 设备,搬箱子这种要跟外部物体较劲的来自惯性动捕。
我把这份清单读了两遍。它挑的这几个动作,不是随手挑了几个好看的拿来炫,是恰好覆盖了人形机器人全身控制里最难啃的那几块,大幅度肢体运动、低姿态动作、接触丰富的动作、动态平衡、实时遥操作跟踪。每一个动作都精准对着一个老大难。这份清单怎么排的,我闻到一股工程师的较真劲,像是在说,你们觉得最难的这几样,我一个模型零样本全给你做了,挑不出毛病的那种全。
但我盯着这份数据来源单子看,越看越觉得,真正的故事可能不在那个跳舞视频里,在「互联网视频」这四个字上。
机器人这行最深的那口井,从来不是模型不够大,是数据不够。语言模型为什么这几年起飞,因为整个互联网就是它的训练集,文字到处都是,几乎免费。可机器人要的是动作轨迹数据,这玩意儿网上没有,得真人穿着动捕设备一段一段录,或者真机一次一次遥操作攒,又慢又贵,攒一辈子也比不上互联网上文本的零头。这是压在具身智能头上很多年的一块石头。HoloMotion-1 把互联网视频塞进数据来源,等于是在试着撬这块石头,世界上拍了人在动的视频海了去了,如果能稳定地从这些二维视频里把三维动作恢复出来、再 retarget 给机器人,机器人就第一次有了一个像文本之于语言模型那样、近乎无限的廉价数据源。能不能真撑起来还得看后续,但这个方向,比那段跳舞 demo 重要得多。
还有一点我觉得不是巧合。这事是地平线做出来的。地平线这家公司是做车规级芯片、智能驾驶起家的,常年跟一个特别拧巴的约束死磕,算力就这么点,功耗卡得死死的,延迟还不能高,模型必须在这三座大山中间找活路。机器人小脑面对的是同一类约束,板子小、不能等、不许错。一家被端侧算力毒打了这么多年的公司,转过头来做小脑大模型,反而把 MoE 和 KV-cache 这套省算力的手艺用得这么顺,回头看,顺理成章。技术的迁移,常常就是这么发生的,不是凭空蹦出个点子,是一群人被同一种约束磨久了,手上长出了茧,换个场景,茧还在。
那对我们这些写代码、手里没有人形机器人的人,这事到底有啥用。
直接的用处,坦率讲可能没有,大部分人确实没有一台人形机器人摆在工位上。但它开源的方式,值得单独说一句。
代码、论文、权重、环境,地平线这次是一整套全给了。
GitHub 代码库 https://github.com/HorizonRobotics/HoloMotion
技术报告 arXiv https://arxiv.org/abs/2605.15336
模型权重 HuggingFace https://huggingface.co/HorizonRobotics
Docker 镜像 https://hub.docker.com/r/horizonrobotics/holomotion
项目主页 https://horizonrobotics.github.io/robot_lab/holomotion
代码、论文、权重、环境,一整套全的。这在机器人领域,真不算常规操作。机器人这一行的开源,长期是雷声大雨点小,论文发得漂漂亮亮,最关键那部分往往「出于安全和商业考虑」不放出来,你兴致勃勃复现到一半,发现卡在一个没开源的模块上,干瞪眼。地平线这次连 Docker 都给了,传达的意思很明确,它是真希望有人能在自己机器上把它跑起来,而不是看完一段跳舞视频鼓个掌就散了。
说真的,对没有真机的开发者,这套东西最大的价值是当教材。它是一个把 MoE、KV-cache 这些原本长在 LLM 推理优化里的手段,成功移植到一个硬实时、低算力、不允许出错的场景里的完整工程样本,而且论文、代码、可跑环境,齐活。这种跨领域把成熟经验搬过去的思路,比那个跳舞 demo 本身值钱得多。你哪怕是做后端的,去看它怎么在算力被死死卡住的前提下,硬是把一个大模型塞进去还跑出六倍余量,这里面是有东西能拿走的。
真要看,我的建议是别上来就盯模型结构。先去翻技术报告 https://arxiv.org/abs/2605.15336 里那套四源数据怎么统一对齐、retarget 流程是怎么搭的,那部分的工程含量,往往比网络结构高,也更可迁移。然后再回 GitHub 仓库 https://github.com/HorizonRobotics/HoloMotion 对着代码看推理那条路径,重点是它怎么把 MoE 的路由和 KV-cache 在一个有硬延迟预算的循环里调度起来,这套调度思路,你做高并发服务、做实时流处理,迟早用得上,场景换了,约束的形状是一样的。它给了 Docker 镜像,你哪怕没有机器人,也能在自己机器上把推理跑起来看一眼数字,对一个开源项目来说,能让人五分钟内跑起来,这点诚意,棒棒的。
这也是我一直觉得值钱的东西,不是又一个模型刷新了某个榜,是有人把一个看起来八竿子打不着的领域的解法,原样搬过来,居然成了。这种迁移嗅觉,比记住任何一个具体模型都更扛用。
我自己还没在任何机器人上真跑过它,手头也没那个硬件,所以真机到底表现如何,我不敢替地平线打这个包票,这话得放在前面说清楚。但光把技术报告和这套开源结构从头过一遍,我已经觉得这一篇值得写下来。
写到这儿,我又想起开头那个错位。4 亿参数,在管语言的那个圈子里小到是尘埃,在管运动的这个圈子里大到是巨兽。
这两年所有的目光都钉在大脑上,谁更会想,谁更会聊,谁规划得更远。可你真要让一台机器人帮你把一箱书从这屋搬到那屋,决定「要搬」这件事零点几秒就过去了,剩下的全是小脑的苦活,怎么蹲下去不闪、怎么把箱子抱得稳、怎么在负着重的情况下走得不晃。决策很轻,执行很重。
人其实也是这样。我们总觉得自己最值钱的地方是会想,但你静下来仔细想想,一天里真正动用「想」的时间能有多少,剩下大把的时间,是身体在自动驾驶,是小脑在底下默默替你扛着,你才腾得出那点脑子,去焦虑别的事。
地平线这一下,是把机器人那个一直在后台扛着、从来没人鼓掌的小脑,认认真真当回事做了一次,还顺手把图纸全摊开了,给所有人看。
机器人能不能真的走进我们的生活,可能压根不取决于它有多会想,而取决于它会不会好好走路。