小岛AI
| ONLINE |

posts/humanoid-games-autonomy-gap.md

机器人百米 9.39 秒,不等于能上岗

小岛AI 2026 / 08 / 23

9.39 秒。

一台人形机器人跑完 100 米,成绩压过了人类男子百米世界纪录的 9.58 秒。

好家伙,这个数字天然适合上热搜。短、猛、谁都看得懂。你不用知道运动控制,也不用认识定位建图,只要见过田径比赛,就能感受到那一下冲击。

这事发生在 8 月 22 日开幕的第二届世界人形机器人运动会IT之家的开幕报道记录了 666 支队伍、2056 台机器人和 51 个赛项,澎湃新闻的现场报道则给出了百米大型组同一小组三台机器人的成绩,分别是 9.39 秒、9.47 秒和 12.41 秒。拿到 9.39 秒的是天工 Ultra,它在立定跳高项目里还跳到了 2.88 米。AP 的独立报道也核对了这些数据。

我看到这个数字的第一反应,不是机器人终于赢了人类,而是这次比较回答的到底是哪一个问题。

如果问题是人形机构能不能在一条标准赛道上,把关节、足端、惯性测量单元和控制器压到极限,9.39 秒很有分量。它证明机械结构、轻量化、运动控制和系统响应已经收敛到一个去年还很难想象的位置。

如果问题是这台机器人明天能不能进工厂连续干八小时,这个数字几乎不够用。

不是成绩有水分,也不是比赛没价值。两种问题,量的根本不是同一个东西。

跑得快,先要把整个系统拧到一起

人形机器人百米不是给电机通电,让两条腿往前倒腾就行。速度越高,每个控制周期留给系统的时间越少,一点姿态误差都会被迅速放大。

机器人要持续读取惯性测量单元、关节编码器和足端接触信号,估计身体此刻的姿态,再算出下一步落脚点、关节力矩和摆臂节奏,把指令发给执行器。这个感知、估计、决策、执行的循环,慢一拍可能只是掉速,错一拍就直接扑街。

北京人形机器人创新中心对赛事的说明提到,天工 Ultra 相比去年改了关节和构型,做了轻量化与破风设计,算法侧则重新优化运动控制、导航、定位建图和路线规划。它不再靠盯着赛道线修正方向,也能在赛道内保持高速奔跑。

这段信息比「超过人类纪录」更有意思。

前者是一张传播海报,后者才是一份工程清单。机械设计、控制算法、状态估计、定位导航、实时计算,任何一层抖一下,9.39 秒都不会出现。具身智能很少是某个大模型突然开悟,更多时候是一群做电机、减速器、控制器、嵌入式系统和算法的人,把几百个小误差一点点挤掉。

厉害了,但这种厉害很不科幻。它甚至有点像排查一条延迟飘忽的线上链路。真正拖慢你的,未必是最显眼的模型,也可能是一次传感器时间戳漂移、一个调度抖动,或者一段来不及完成的状态估计。

9.39 秒,是整条链路共同交出来的结果。

真正的进步,是遥控开始被赶出赛场

今年另一个没那么抓眼球、却更值得盯住的变化,是更多竞技赛取消人工遥控,要求机器人全程自主运行。

遥控和自主看起来只差一个手柄,工程含量差得远。

遥控模式下,人类在场外承担了最难的部分。什么时候转向,前面是不是有障碍,摔倒后该怎么调整,路线走偏了往哪修,操作员都在实时替机器人做判断。机器人更像一副性能很强的远程身体。

切到自主模式以后,感知错了没人提醒,路线偏了没人掰回来,局部最优把自己送进死角,也没有人按暂停键帮它想一想。系统得自己维护世界状态,自己决定动作,还得在执行失败后认出「刚才没做成」。

这才开始碰到智能体的硬骨头。

写软件 Agent 的朋友应该很熟悉这种落差。一个模型在干净的 demo 里把任务跑通,不难。把浏览器页面换一下,把网络延迟拉高,把权限收紧,再让它面对一个没见过的弹窗,成功率立刻换一副面孔。机器人也是同一回事,只是失败不再是终端里多一行报错,而是一百多斤的金属直接倒在地上。

所以我会把「取消遥控」看得比「超过博尔特」更重。速度展示的是上限,自主展示的是系统能不能独立承受环境的不确定性。

当然,全自主也不是一个二元开关。有没有预先录好的路线,场地是否严格结构化,网络是否稳定,失败后能否人工接管,都会改变难度。靠谱的评测不能只写一个「自主」,得把自主的边界摊开。

运动会不是工厂,但它是很凶的压力测试

体育比赛很容易被当成表演。机器人跑步、踢球、打拳,现场热闹,离生产线似乎很远。

我以前也会下意识把这种项目归到 demo。再往细看,它其实是一种相当凶的系统压力测试。

百米把控制频率、关节响应和动态稳定性推到边缘。足球把多机器人协作、目标追踪、遮挡处理和实时决策搅在一起。武术与体操测试快速姿态切换。摔倒后的起身,则直接暴露恢复策略和机械可靠性。平时藏在低速演示里的小毛病,到了比赛速度下根本没地方躲。

赛事规模也在迅速膨胀。首届有 280 支队伍、500 多台机器人和 26 个项目,今年变成 666 支队伍、2056 台机器人和 51 个项目。队伍数增长约 138%,机器人数量接近首届四倍。

2025 与 2026 参赛队伍数量对比

参赛队伍从 280 支增至 666 支,热度是真的,工程分化也会更快暴露。

规模增长说明供应链、开发平台和参赛生态在成熟,却不能直接推出产品已经成熟。GitHub Star 多不等于服务能扛流量,参赛机器人多也不等于每一台都能稳定上岗。生态热度和部署成熟度是两根曲线,短期内经常离得很远。

今年的 51 个项目里,北京市政府新闻发布会披露有 21 个场景赛,占比超过四成。零售服务要求补货、拣选打包和货品归位,灵巧手比赛里还有拧螺丝、用镊子夹豆、把不同插头插进对应接口。

这类任务没百米那么炸,但更接近真实工作的麻烦。一个螺丝孔只偏两毫米,视觉定位、手眼协调和柔顺力控就得同时在线。夹起一颗豆子更不靠蛮力,力度大了会弹飞,力度小了夹不住。插线缆还要处理遮挡、接触和微小形变。

跑步让机器人到达工作地点,手部操作才让它开始工作。

这个转向很关键。赛事如果只比跑得快,最终容易长成机器人版田径秀。把场景任务、团队协作和精细操作放进来,比赛才有机会变成一套公开的系统评测场。

9.39 秒为什么还不能换成一张工牌

先看那张最抓眼的成绩表。

机器人百米预赛与人类世界纪录对比

秒数越低越快。机器人在单次预赛里跨过了人类纪录线,但上线评测不能只保留这一列。

人和机器人用的是不同身体、不同能量系统、不同安全约束。机器人不用呼吸,不会乳酸堆积,关节输出方式也不一样。拿 9.39 秒与 9.58 秒放在一起有传播价值,却不适合推导谁取代谁。

工厂真正会问的是另一组问题。

同一任务连续跑 100 次,成功多少次。地面摩擦变了还能不能站稳。摄像头被遮住一角会不会乱走。抓取失败后能不能发现失败并重试。电量下降时性能怎么衰减。网络断开以后是安全停机,还是保持原动作往前冲。摔倒能否自己起身,起身后能否恢复任务状态。人进入工作区时,谁有最高优先级让它停下。

这些问题没一个能被 9.39 秒回答。

具身智能上线前,我更愿意看一份这样的评测合同。

autonomy:
  remote_commands_per_run: 0
  hidden_human_interventions: 0
task:
  consecutive_runs: 100
  completion_rate_target: 0.98
recovery:
  injected_failures: 20
  recovered_without_human_target: 0.90
safety:
  emergency_stop_latency_ms: 100
  unsafe_contact_count: 0
operations:
  mean_time_between_interventions_hours: 8
  state_restored_after_restart: true

这不是统一标准,只是一种思路。把「能做」改写成「在什么条件下,连续做多少次,失败后怎么回来,谁能按停」。一旦合同写到这个粒度,很多漂亮 demo 会当场露馅,真正扎实的系统也会被看见。

有点子牛逼的,从来不是一遍跑通。是第 97 遍出了意外,系统仍然知道自己在哪、刚才做到哪、下一步该重试还是该停。

这里还有一笔经常被视频剪掉的账,维护成本。

机器人在比赛里跑一趟,赛前可以做完整检查,赛后可以换件、校准、充电。到了真实工作场景,客户算的是每小时有效产出、每次人工介入成本、备件周期和停机损失。一个速度慢 20% 但能稳定跑一周的机器人,可能比百米冠军更值钱。

工程系统迟早都得回到账单上。只不过具身智能的账单里,除了 GPU 和 token,还多了电机、减速器、电池、现场工程师和安全责任。

比纪录更重要的是,评测终于开始变难

我不想给 9.39 秒泼冷水。

一个去年还会在赛道上跌跌撞撞的行业,今年能把人形机构推到这个速度,本身就够猛。666 支队伍、2056 台机器人一起进场,也说明具身智能不再只是少数实验室里昂贵的孤品。

但越是热闹,越要把问题问准。

赛场纪录告诉我们机械和控制的上限正在快速抬高。取消遥控告诉我们系统开始独自承担判断。21 个场景赛告诉我们,评测正在从「会不会动」挪向「能不能完成工作」。这三件事放在一起,比单独一个世界纪录更让人兴奋。

因为纪录总会被刷新,部署边界却不会自己消失。

下一次看到机器人跑得更快、跳得更高,可以先鼓掌。鼓完掌,再顺手问四句,它是不是自主完成,能连续成功多少次,失败后能不能回来,人什么时候可以接管。

能答好这四句,9.39 秒才会慢慢变成一张工牌。

现在,它是一张很漂亮的准考证。