人形机器人已经在上班了,8 小时连轴转,专门干你想逃进去的活

小岛AI 2026 / 05 / 14

前几天刷推文,刷到一条让我停下来的。

是一条转帖,转发的是 Figure AI CEO Brett Adcock 发的直播预告。原推文说,去看一组人形机器人以人类绩效水平完成完整的 8 小时轮班,完全自主运行,机器人型号是 Helix-02。

转发这条的那个人,配文就一行,「如果 AI 抢了你的白领工作,那就转行做蓝领吧。」🤦

然后下面接着这个直播。

我盯着这个组合看了大概三秒。那个 🤦 不是在开玩笑,是在说一件正在发生的事,用了一个既好笑又有点沉的表情说出来。

「去做蓝领」这个说法,你大概不是第一次听到。AI 这两年的浪潮里,它是一种安慰语,也是一种被很多人认真对待的判断。逻辑是,AI 先替代的是重复性的脑力劳动,程序员、客服、翻译、财务分析师,真正需要跟物理世界打交道的体力活,机器人搞不定,还要等一段时间,所以「去做蓝领」是一种暂时的安全港。

然后,5 月 13 号,Helix-02 完成了 8 小时轮班。

安全港这两个字,我现在有点说不准了。


先说 Helix-02 这件事本身。

Figure AI 是一家美国创业公司,2022 年成立,创始人叫 Brett Adcock,92 年的,连续创业者,在这之前做过劳动力招聘平台 Vettery 和电动垂直起降飞机公司 Archer Aviation,然后转头来做人形机器人,公司叫 Figure,官网介绍自己是「第一家把通用人形机器人带入现实的 AI 机器人公司」。这个自称第一的帽子戴得有点大,Tesla 和 1X 可能有话说,但暂时不管这个。

人形机器人,两条腿两条手臂、大概像人形状、能在各种环境里活动的机器人,跟工厂里那种固定在地上的机械臂是两件完全不同的事。机械臂很厉害,一秒焊几十个点,精度极高,但它只能做一个轨迹上的动作,你换一个场景它就不知道怎么办了。人形机器人的目标是通用,不需要为每个任务单独编程,能像人一样进一个新环境,搞清楚自己该干什么,然后干。

这个目标,两年前听起来还很遥远。

然后我看了一下 Figure 今年的时间线,我是真的愣了一下。

今年 1 月 27 号,Figure 发布 Helix-02,宣称这是「迄今为止人形机器人完成的最长时程、最复杂的自主任务」,展示内容是机器人在一个完整的厨房环境里,全程无干预、不重置,完成洗碗机装卸,时长 4 分钟。

3 月 9 号,客厅整理。

5 月 8 号,卧室整理。

5 月 13 号,8 小时轮班。

从 4 分钟到 8 小时,4 个月。

好家伙。


我有点好奇 Helix-02 是怎么做到这种程度的自主能力的,去看了他们对技术架构的说明,跟我预想的不一样。

大家可能对机器人控制系统的直觉是「感知,规划,执行」三步走。传感器采集数据,计算机分析、做决策,然后发指令给各个关节执行。这个框架逻辑上没问题,但对人形机器人来说有一个大挑战,就是速度。

人走路、拿东西的时候,整个系统的响应是毫秒级的,而且是实时在微调的。如果你的计算链路太长,机器人走路就不稳,手抓东西就抖。

Helix-02 的解法是把控制系统分成三层,并行运行。

最底层叫 System 0,1000 赫兹频率,就是每秒运行 1000 次,这一层专门处理平衡、接触和全身协调。机器人走路的时候每一步踩下去,地面给脚的反力、全身的重心偏移,全部要在几毫秒内响应,不然就摔了。这一层的神经网络参数量只有 1000 万,对比现在动辄几百亿参数的语言模型,很小,但它必须极快。

中间层叫 System 1,200 赫兹,处理感知到动作的转化。就是「我看到那个杯子在桌子左边」转化成「我的手需要移到这里,手指要这样弯」,这个翻译过程在这一层完成。

最上面叫 System 2,频率最低,处理语义理解和任务规划。「把那个蓝色的杯子放到左边的托盘上」,理解这句话,分解出任务步骤,往下传。

三层同时跑,各自有自己的节奏,协调成一个整体。

然后这个整体,是一个单一神经网络,从视觉输入、触觉输入、本体感受输入(本体感受是指机器人感知自己身体位置的能力,类似人闭眼也知道自己的手在哪里)直接输出控制信号,端到端,中间没有手写规则,没有人写「如果杯子在左边就把手移到这里」,是从数据里学出来的。

训练数据是超过 1000 小时的人类运动数据。不是人写的规则,是人的动作本身。

有一个细节让我看的时候停了一下,是指尖的触觉传感器,可以感知低至 3 克的力。3 克大概是一片纸巾的重量。这对机器人操作柔软或脆弱物体意味着什么,你想想就知道了,鸡蛋、草莓、注射器,这类东西机器人一直很难处理,因为不知道该用多少力,轻了没抓住,重了捏碎了。3 克的感知精度,这个问题的解决空间就大了很多。

一只机械手的指尖夹着一个透明小玻璃件,蓝色光点亮在每个指节末端,深色背景,特写镜头——指尖能感知 3 克力的写实化呈现


说回 8 小时轮班,我想聊聊这件事难在哪里。

表面上看,8 小时是 4 分钟的 120 倍,但难度不只是时间乘以 120。

真正难的地方有几个。

第一是持续稳定性。一台机器人能跑 4 分钟不出错,跟能跑 8 小时不出错,是两件完全不同的事。工作环境里会遇到各种「非预期情况」,一个东西没在预期的位置,一个新出现的障碍物,一个之前没训练过的物体摆放方式。如果机器人只会走「已知路径」,遇到异常就卡死,8 小时下来出错概率极高。能跑完 8 小时,说明它面对预期外情况有一定的恢复能力,不是硬刚着走完的。

第二是「不需要人」。这里的不需要人,是真的不需要人站在旁边备用,不需要人偶尔推一把重置,不需要人盯着万一出问题立刻接管。这个标准比「偶尔需要人帮忙」要高得多,因为你必须能处理所有你实际遇到的情况,而不是「遇到难的就等人来」。

第三是「人类绩效水平」。这不只是说跑完了 8 小时,是说跑完了 8 小时,而且做事的速度和质量跟人差不多。如果机器人做一个动作需要 5 分钟,同样的动作人做需要 30 秒,那这台机器人在经济上没有意义,没有工厂愿意用它。「人类绩效水平」这个标准,是机器人从「能做」到「值得用」的分水岭。

这三点都过了,才叫「完成了 8 小时轮班」。


我有时候会习惯性地往「有没有什么局限性」这个方向想,工程师的老毛病。

所以我也想了一下现在的局限在哪里。

从 Figure 展示的场景来看,都是相对结构化的室内环境,厨房、客厅、卧室,物体种类有限,场景范围固定。真实的工厂或物流仓库比这复杂,货物型号多样、地面状况不一、偶发故障类型更多,而且不同工厂的流程差异也很大。

成本问题是实际存在的。Figure 没有公布单台机器人的价格,但量产之前肯定不便宜。工厂要算账,要算机器人的折旧、维护频率、故障处理成本,跟一个工人的总用工成本比较,这个账什么时候能算过,现在很难给出定论。

还有一个更难衡量的,叫「长尾场景」的处理能力。一般流程没问题,但罕见情况,比如货物倒塌、地面积水、设备某个部件卡住了,这类情况从一次 8 小时的演示里很难完全验证。

但我想说的是,这些局限性,不是「这事不会发生」,而是「这事发生的时间线在哪里」。

这是两个完全不同的问题。


说一个更大的背景吧。

不只是 Figure AI,这两年整个人形机器人赛道的进度都快于大多数人的预期。

Tesla Optimus,马斯克在 2025 年底宣布开始在特斯拉内部工厂试点使用,并表示计划之后外售。1X Technologies,拿了 OpenAI 投资,在做家庭场景的 NEO 机器人,目标是能在家里帮人日常做事。Agility Robotics 的 Digit 已经在亚马逊仓库里实地测试了一段时间。Boston Dynamics 的 Atlas 在 2024 年完成了全电动化改版,那个液压驱动的老版本退役了,新版本更轻、更灵活。国内这边,宇树科技、优必选、智元机器人,也都在快速出新版本,中国政府把人形机器人列为战略新兴产业,有明确的量产目标。

Goldman Sachs 2023 年给出过一个预测,2035 年全球人形机器人市场规模 380 亿美元。我不知道那个预测的分析师有没有充分考虑到 2024-2026 年这波进度,坦率讲,我自己也没有能力判断这个数字是高估还是低估,但凭着这段时间看到的事,我有点倾向于认为,「还有很长时间才会发生」的判断,可能需要修正。

一台人形机器人独自站在深夜的仓库通道里,两侧高高的货架,冷蓝色顶灯——亚马逊那种仓库工作场景,机器人正在「上班」


回到那个「去做蓝领」的话题。

这个说法背后有一个隐含的假设,就是「机器人搞定体力活还需要很长时间,所以蓝领是安全港」。

这个假设不一定错,但它有一个问题,就是「很长时间」到底是多长。

如果你认为是 20 年,那现在考虑转蓝领的确是一个缓冲策略。

如果是 5 年,那这个策略本身就有问题了。

然后你看 Helix-02 这几个月的时间线,从 4 分钟到 8 小时,4 个月。这不是线性的进步,指数式的推进曲线在前期看起来很缓慢,但在某个临界点之后会快得让人来不及适应。

我不是在说蓝领工作明天就会消失。不会。这里有技术成熟度的问题,有成本问题,有替换现有工厂设施的时间和资金成本,有工会和法规的摩擦。这些都是实际存在的减速器。

但「蓝领是安全港」和「蓝领的某些工作在某个时间点会面临同样的冲击」,这两件事是可以同时成立的。前者说的是现在,后者说的是趋势。


怎么说呢,我自己在想这件事的时候,会陷入一个循环,就是,如果 AI 搞定白领,机器人搞定蓝领,那人能干什么。

这个问题我没有答案。我觉得老实说没人有完整的答案,包括那些在做 AI 和机器人的人。

但我有一个更小的问题,是可以想的,就是,在我现在做的事里,哪些是因为「人比机器人便宜」才存在的,哪些是因为「人真的在这里不可替代」而存在的。

这两种工作,在未来的抗压能力是不一样的。

第一种,会随着机器人成本下降而承压。第二种,相对稳健。

我是一个写程序的人。我知道我现在做的事里,有一部分是在翻译,把产品经理的需求翻译成代码,把模糊的问题翻译成可执行的方案。这部分,Claude Code 和 Cursor 已经在帮我做,而且做得越来越好。这部分在缩水,这是真实的。

但理解一个系统为什么会出问题,跟一个完全不懂技术的业务方沟通清楚真正的需求是什么,判断一个架构决策 5 年后的影响,这些目前还不行。

我不知道「目前还不行」这个状态会持续多久,但在它持续的时间里,我可以把更多精力放在这里。

厉害了,这听起来像一句废话,但我觉得「把更多精力放在不可替代的事情上」这件事,在真正想清楚之前,很多人其实没有做到。


说一个可能有点自找麻烦的想法。

我觉得「AI 和机器人会不会抢我的工作」这个问题的框架,本身就容易让人往焦虑方向走,因为它把你放在一个被动的位置,等着看会不会发生。

一个可能更有用的框架是,「在机器人越来越便宜的世界里,什么是真正有价值的」。

这两个问题表面上差不多,但心理状态完全不同。第一个让你守,第二个让你想。

守的问题是,你可能守到最后,发现防线已经移到另一个地方,而你一直在防错误的点。

想的好处是,即使结论不确定,思考本身会让你更清楚自己在哪里,手里有什么,接下来能走哪条路。


我有时候会想,技术浪潮是一件很奇怪的事情。

它总是比大多数人预期的慢,然后在某个时间点之后,又比大多数人预期的快。

2016 年有人说自动驾驶 5 年内普及,现在是 2026 年,高速路上还是有司机,但同时,某些特定区域的无人驾驶已经在跑了,不完全对,也没完全错。大模型这边,ChatGPT 出来之前,大多数人的感觉是「还早」,出来之后,大家又觉得「怎么突然就这样了」。

人形机器人这个事,我有一个不确定的感觉,就是它可能正处在「还早」往「怎么突然就这样了」过渡的那个阶段。

Helix-02 的 8 小时轮班,是这个过渡阶段里的一个数据点。


万能青年旅店有一首歌叫「在这个星球没有人能够找到我」,里面有一句,「我希望成为一个比较好的人,不害怕失去或是害怕变老。」

我有时候觉得,面对这类技术变化,「不害怕」是一种挺高级的状态,它不是说对这件事视而不见,而是说,我看到了,我认真对待它,然后我继续往前走,而不是因为害怕就停在原地。

Helix-02 完成了 8 小时轮班。

这是一件真实发生的事,不是科幻小说里的情节,不是未来某个时间点可能发生的事,是上周五,Brett Adcock 开了一个直播,然后放出来的。

好家伙,我觉得这件事值得被认真对待,而不只是被当成一条让人不舒服的消息刷过去。


最后说一句不太正经的——

「AI 越来越能干,那就干点 AI 不能干的事」是这两年最朴素的反应。盯着 Helix-02 视频看几遍后,我盘了盘自己手头还剩下点啥,得出一个完全合乎逻辑但听起来有点离谱的结论——

现在开始学厨师吧,AI 做不了八大菜系。

一只手颠着一口黑铁炒锅,锅里腾起的火焰几乎吞掉半个画面,温暖橙黄色调跟前面机器人那两张图的冷蓝形成对比——人在厨房里那种「目前还无法被替代」的瞬间

不开玩笑。机器人能 8 小时轮班、能洗碗、能整理客厅,但川菜那一勺火候、淮扬刀工、粤菜对食材本味的判断,目前还稳稳在「人真的不可替代」那一栏里。这是个梗,但梗背后是一个真问题——你手里的活,是靠手感和判断,还是靠重复执行? 前一种暂时稳;后一种不管你是白领还是蓝领,心里都得有数。

行了,明年再来对账。


顺手写一下信息来源,这次聊的 Helix-02 相关内容可以去 Figure AI 官网看,figure.ai/news,他们把每次里程碑的视频和说明都放在那里了。Brett Adcock 在 X 上有账号 @adcock_brett,如果你想实时跟进他们的进度,可以关注。