打游戏打出来的机器人:用游戏数据训练具身智能的 General Intuition
事情是这样的。
昨天刷到一条融资新闻,数字本身不算最炸的,3.2 亿美元,估值 23 亿美元。这两年 AI 圈一天能蹦出三四个这种量级的盘子,看多了会麻。让我停下来的是这家公司干的事。
它叫 General Intuition。训练数据不是爬来的网页,不是买来的论文库,是一群人打游戏时顺手上传的录屏剪辑。然后用这堆剪辑,教一台四足机器人在办公室里走路。
我盯着那行字看了几秒。打游戏的录像,拿去教机器人走路。
好家伙。
TechCrunch 那篇报道的标题起得很直白,From Fortnite to robots,从堡垒之夜到机器人。我一开始以为是那种为了融资硬编的故事,VC 圈最不缺的就是把一个普通生意包装成下一个 AGI。结果往里翻了翻,越看越觉得,这事儿的逻辑链是真的能站住的,而且站得比我想象的稳。
我想跟你唠唠这个。不是因为它融了多少钱,是因为它背后那个判断,可能会让你重新想一下,过去这些年我们打的那些游戏,到底是什么。
先把这家公司是谁讲清楚。
CEO 叫 Pim de Witte,31 岁。他手里原本有个东西叫 Medal,一个让玩家上传、分享游戏高光剪辑的平台。你打了一把神仙操作,五杀也好、极限逃生也好,截下来发上去给朋友看,就这么个产品。听起来平平无奇对吧,但它沉淀下来的数据量很吓人,每年大概 20 亿条视频,月活一千万,累计是数亿小时的游戏画面。
2025 年 10 月,他把一个团队从 Medal 里拆出来,单独成立了 General Intuition,干的就是用这堆游戏数据训练 AI。当时那轮种子轮就融了 1.34 亿美元,是有记录以来最大的种子轮之一。加上昨天这轮,累计披露融资 4.54 亿美元。
领投的是 Khosla Ventures,就是当年最早押注 OpenAI 的那家。跟投名单也挺唬人,General Catalyst、Jeff Bezos、Eric Schmidt,连 F1 退役车手 Nico Rosberg 都在里面,还有 Google DeepMind 和 MIT 的一线研究者。
钱和名头先放一边。真正让我坐直的是它的三个联合创始人,Eloi Alonso、Adam Jelley、Vincent Micheli。
这几个名字如果你混世界模型这块可能眼熟。他们是 DIAMOND 的作者,2024 年那篇用扩散模型做世界模型的工作。
聊到这我得停一下,把世界模型这个词给你说人话。
世界模型,world model,你可以理解成 AI 脑子里那个会自己脑补的小电影。它不靠外面真实的游戏引擎给它画面,而是自己预测下一帧会长啥样。你往左推摇杆,它脑子里就生成出往左转之后的那一帧;你按了跳跃键,它生成出腾空那一帧。整个游戏世界,是它自己在脑子里渲染出来的。
DIAMOND 这篇工作骚的地方在于,它用扩散模型直接预测下一帧画面。扩散模型就是画 AI 图那套,从一团噪声里一点点把图捞出来的那个东西。以前大家做这事是先把画面压成一串离散的 token,类似把图切成一个个小方块编号,再让模型去猜下一个编号。DIAMOND 不绕这道弯,直接生成像素帧。糊不糊、连不连贯,全靠它自己想象。
所以你看,这帮人不是临时下海蹭具身智能热度的。他们是先有了一套能让 AI 自己脑补游戏画面的硬核研究,手里又正好攥着 Medal 那座游戏数据金矿,然后才想到,诶,这两个东西能不能凑一块?
凑出来的结果,就是昨天那个 demo。
我得把这个 demo 单独拎出来讲,因为它是整篇报道里最有冲击力的一段,也是我看完愣了一下的地方。
第一步,他们让一个 AI 智能体在堡垒之夜里连续玩了 100 个小时。注意是连续,不是攒了 100 小时的录像,是一口气跑了 100 小时。游戏里跑图、找掩体、应对各种乱七八糟的局面,模型自己在玩。
这一步其实不算最炸,AI 打游戏这几年见得多了。炸的是第二步。
同一个模型,一个字都没重训,直接拿去驱动一台四足机器人。然后这台机器人,只用了 8 分钟的真实世界数据做微调,就能用一个单摄像头在办公室里自己导航走路了。
8 分钟。

我重新读了一遍确认没看错。一个在虚拟游戏世界里泡了 100 小时的模型,喂它 8 分钟现实数据,它就能指挥一台真机器人在物理世界里挪动了。报道里很诚实地补了一句,机器人偶尔还会撞到家具。但兄弟,它能走,它能看着摄像头自己绕,这件事本身就已经够让人后背发凉了。
为啥这一下这么关键?
因为具身智能这块,过去最大的一根刺,就是真实数据太贵了。你想训一个能干活的机器人,得真的搭一堆机械臂、机器狗,让它们在真实世界里一遍遍试错,摔坏了再修,慢得要死还烧钱。这就是为什么机器人这事喊了这么多年,落地还是磕磕绊绊。数据采集的成本卡在那儿,绕不过去。
General Intuition 的赌注就是,能不能让 AI 先在游戏这个虚拟世界里把基本功练扎实,把那种对空间、对运动、对因果的直觉先长出来,再花极少的真实数据把它对齐到物理世界。
100 小时游戏 + 8 分钟现实,如果这条路真能规模化,那它捅破的是具身智能最贵的那层窗户纸。
那问题就来了,凭什么游戏数据能练出这种迁移到现实的直觉?网上爬来的视频那么多,YouTube 上随便一搜几亿小时,为啥非得是游戏?
这就要讲到 General Intuition 真正的护城河,也是我觉得这家公司最聪明的地方。
不是数据量。是数据里有动作标签。
英文叫 action-labeled data。普通的视频,AI 看到的只是画面在动,但它不知道画面为什么动。一个角色往右跑了,是玩家按了 D 键?还是被人推了一把?还是脚本自动跑的?光看画面,模型只能猜。
而 Medal 这种平台沉淀的游戏剪辑,是能精确对上每一帧画面,玩家在那一刻到底按了哪个键、什么时候按的。画面动了,旁边清清楚楚记着,因为玩家按了空格。
这个差别看着小,意义大得离谱。
有了动作标签,模型才能真正分清两件事,哪些是我自己干的,哪些是环境对我的反应。报道里用的词是 self 和 environment,自我和环境。这俩一分开,因果关系就立起来了。我按了跳,所以我腾空了,这是我的动作导致的;我撞到墙弹回来了,这是环境给我的反馈。
这不就是直觉的底层吗。
一个婴儿学会认识世界,靠的就是不停地动手动脚,然后观察自己的动作给世界带来了什么变化。伸手碰到杯子,杯子倒了。这种我做了 A、世界变成了 B 的因果配对,攒得足够多,直觉就长出来了。
游戏里玩家的每一次操作,配上每一帧画面的变化,就是海量的、天然标好的、第一人称的因果配对。这玩意儿在物理世界里要花大价钱采,在游戏数据里它本来就免费躺在那。

公司名字起得也讲究,General Intuition,通用直觉。Khosla 那句话我觉得点透了,他说,在世界模型里,真正的量子跃迁是 AI 里直觉的涌现,而来自游戏的人类动作数据,是关键的一环。
我看到这句的时候是真的有点服气。
因为这帮人想明白了一件别人没太当回事的事。过去十几年,全世界几十亿玩家在游戏里按下的每一个键、做出的每一个操作,其实是人类用动作给虚拟世界做的、规模大到不可思议的因果标注。我们以为我们只是在打游戏放松,结果这是一座一直没被认真开采的矿。
聊到这我有点走神,想起小时候在网吧通宵,那会儿真没觉得自己在干什么了不起的事,就是单纯地,就是想多打两把,就是不想回家。现在回头看,那些深夜里几千万人重复按下的方向键,居然有一天能变成教机器人走路的教材。
是谁来自山川湖海,却囿于昼夜厨房与爱。这句词我一直很喜欢,今天忽然有种别的读法。那些被困在屏幕前、被困在一把又一把游戏里的普通人,他们打出的操作记录,正在悄悄地走向山川湖海,走向真实世界里那些机器人要去的地方。有点恍惚。
好,从天上拉回来,继续讲这家公司接下来要干嘛,因为这部分也透着他们的克制和聪明。
第一,他们不打算自己做终端产品。
de Witte 的定位很清楚,他们要做的是底层能力,把模型能力通过 API 开放出去,让别人拿这个能力去搭各种应用。API 计划今年夏末广泛开放。说人话就是,他们想做具身智能这一层的供水公司,而不是去跟每一个做机器人、做游戏 NPC 的公司抢生意。这个站位我觉得是对的,世界模型这种东西,越底层越值钱。
他们内部把那个世界模型叫 the gym,健身房。意思是,这个能自己脑补画面的模型,是用来训练智能体的练功房,不是最终交付给客户的成品。智能体在这个虚拟健身房里把本事练出来,再放到真实任务里去。
第二,他们对边界画了条线。
de Witte 明确说了,不做致命性自主武器系统。但支持像搜救这种应用。我对这条蛮在意的。一个手握能让 AI 在虚拟和现实之间自由迁移能力的团队,一开始就把军用致命武器这条路堵死,至少是个让人安心一点的信号。当然,公司说不做和最后真不做之间隔着多远,这个我也不敢替它打包票,先记下这句话,往后看它做不做得到。
第三,这部分我没想到,他们还顺手推了个东西叫 Nerve。
是个给玩家开的工种市场。玩家可以通过做数据标注赚钱,未来还能接机器人遥操作的活儿。遥操作就是人在远端实时操控机器人,机器人怎么动你怎么带。
你品品这个循环。玩家打游戏,产生带动作标签的数据,喂给模型;模型练出能力,要去现实世界,又需要人帮它做更精细的现实数据标注和遥操作;这活儿又交回给玩家来干,还给钱。
打游戏的人,先是不知不觉当了模型的老师,现在还能正式上岗,继续教它。这个设计有点子牛逼了,它把一群本来只是在消费内容的人,变成了整条具身智能产业链上游的劳动力。
当然了,泼盆冷水的话也得说。
我一向对这种听着特别顺、特别像新范式的故事保持一点警惕。这两年 AI 圈太会讲故事了,什么数据飞轮、什么涌现、什么范式转移,词儿一个比一个大,真到落地全是另一回事。我也曾经信过一些后来证明是 PPT 的东西。
具体到 General Intuition,我心里至少挂着几个问号。
100 小时游戏加 8 分钟微调能驱动机器人在办公室走路,这是一个被精心准备的 demo,还是一个能稳定复现、能往复杂任务上扩的能力?走路撞家具这种程度的导航,离真正能干活的机器人,中间还差着十万八千里。报道里也只给了这一个 demo,没有更硬的 benchmark 数字。这块我是存疑的,得等它 API 真开放出来,有人拿真东西跑过才算数。
还有就是,游戏世界和物理世界终究是两回事。游戏里的物理是程序员写死的,重力、碰撞、摩擦力都是简化过的近似。一个在简化物理里练出来的直觉,迁移到真实世界那些脏乱差的细节里,能撑多远,这是个真问题。从虚拟到现实那道坎,业内叫 sim-to-real gap,仿真到现实的鸿沟,这是机器人学多少年都没彻底填平的老坑。8 分钟微调听着很美,但它到底是真跨过去了,还是只在办公室这种规整环境里碰巧能凑合,我不好下定论。
不过话又说回来,就算打个对折,这个方向本身的想象力也够了。
我自己平时工作是给大模型搭那层让它真正能干活的工程脚手架,agent 的工具链、调度、上下文管理这些。天天看着模型在生产环境里怎么跑、怎么翻车,所以对数据从哪来这件事格外敏感。我们这行有句老话,模型架构大家迟早会趋同,最后真正分出高下的是数据。谁手里有别人弄不到的、又干净又对路的数据,谁就有护城河。
General Intuition 这一手,妙就妙在它找到了一个所有人都见过、但没人当回事的数据源。游戏剪辑,全世界到处都是,但只有 Medal 这种平台手里同时攥着画面和精确到帧的动作标签。这个组合,钱买不来,得靠多年的平台沉淀。
这才是它估值 23 亿美元、能拉来 Khosla 和 Bezos 的真正底气。不是它现在能做出多牛的机器人,是它占住了一个别人复制不了的数据位置。这本轮大部分钱要拿去干嘛?通过跟 CoreWeave 的合作扩算力,全力做下一代模型的预训练。翻译一下就是,数据位置我占住了,现在就是堆算力把这座矿往死里挖。
写到这我又想起开头那个画面。一个人深夜打完一把游戏,随手把高光剪辑传上去,关电脑睡觉。他不会知道,自己刚才那几下操作,连同几千万人的几千万次操作,正在被喂进一个模型,而这个模型,正在学着怎么在真实世界里走第一步路。
我们总以为是我们在玩游戏。也许从某个时刻起,是游戏,连同游戏里的我们,在偷偷教 AI 怎么理解这个世界。
这事儿有点浪漫,也有点让人发怵。说真的我现在还没太想明白该用哪种心情看它。先记在这,往后这家公司 API 一开放,我大概率会去亲手摸一摸,到时候再回来跟你接着聊。
反正,下次你再打开游戏,手指搭上方向键的那一瞬间,可以多一个念头,你按下的不只是一个键。