别笑 AI 把无人机开进墙,半年后它就稳了

小岛AI 2026 / 07 / 25

一架四旋翼无人机在办公室里稳稳悬停,微调了一下姿态,然后非常果断地朝一堵墙飞了过去。

它以为那是门。

操控它的不是人,是 Claude Fable 5。这段画面来自 Anthropic 刚放出的新研究 Project Pilot,他们和评测机构 Andon Labs 合作搞了一个新基准,Drone-Bench,测的问题就一句话,AI 模型能不能自己开无人机。

这已经是 Anthropic 第三次干这种听起来不太像大模型公司会干的事了。先是 Project Vend,让模型经营一家办公室小卖部,赔了钱。然后是 Project Fetch,让模型指挥机器狗去捡沙滩球,前阵子还更新了第二阶段报告,说模型用现成机器人的熟练度,快赶上编码 agent 用软件工具了。这次直接上天,室内飞行、找人、跟人。

任务本身不复杂。一层办公室,给模型一张目标人物的照片,让它控制无人机找到这个人,然后跟着,人走到哪跟到哪,跟丢了要能重新找回来。你可能会想,这不就是大疆卖了很多年的智能跟随么,量产功能,有什么好测的。

有意思的地方在这,模型不是在遥控无人机。

它是在写代码。Andon Labs 把找人跟人这个大目标拆成了五个子任务,每一个都是模型要交付的一段实现。重建,把办公室的视频变成 3D 模型,再切成一张 2D 障碍物地图,相当于给无人机画一张户型图。定位,拿无人机当前看到的画面去匹配那张图,回答我现在在哪。导航,在图上规划房间之间的路径然后飞过去,一路上还得不停调用定位来纠偏,因为控制是有噪声的,飞着飞着就歪了。检测,到了房间之后,用参考照片在视频流里找到目标,每一帧框出来。跟随,用这些框反过来控制无人机,人动机跟,目标居中,距离稳定。

单看每一个子任务,机器人学里都有成熟算法,SLAM(同步定位与建图,机器人界的老手艺)研究了几十年了。难的不是发明新算法,是模型要自己搞清楚手头有什么现成的轮子、怎么挑、怎么拼、怎么适配眼前这间具体的办公室,然后让整套东西实时跑起来。

这一下就跟我熟悉的世界接上了。我平时的工作是给大模型搭脚手架,就是让模型真正能干活的那层工程,天天看 agent 怎么调工具,怎么翻车。agentic coding 这两年能起来,有个前提大家习惯得太快都快忘了,代码世界是回合制的。模型调一个工具,等结果,看报错,想一想,再调下一个。中间它可以慢悠悠推理十秒钟,没人催,世界为它暂停。

物理世界不惯着你。无人机悬停在那里,每一毫秒都在耗电,都在飘,气流扰动不会等你推理完。飞控要的是毫秒级的反馈回路,而大模型一次前向传播的延迟就不止这个数。让语言模型直接攥着摇杆,物理上就不成立。

这个矛盾其实我们圈里天天在解,只是场景没这么刺激。你给 agent 挂一个超时看门狗,给工具调用加失败重试,给长任务做断点续跑,干的都是同一件事,用确定性的工程去兜住一个不确定的、反应还慢的大脑。模型负责想,脚手架负责快。区别只是我们兜的是网络抖动和接口超时,Andon 这次要兜的是重力。

所以 Drone-Bench 的设计其实回答了一个很工程的问题,怎么让一个回合制选手去打即时制比赛。答案是,别让它亲自打,让它造一个替它打的系统。模型不需要毫秒级反应,它需要写出有毫秒级反应的代码。评测测的从来不是它的手速,是它作为一个机器人工程师的水平。

这个设定有点子牛逼。它把问题从「模型能不能开无人机」换成了「模型能不能把开无人机这件事工程化」,而后者才是 agent 真正在走的路。你让 Claude 修 bug,它也不是靠直觉输出补丁,它是搭环境、跑测试、看日志、再改。把这套工作方式从终端搬到旋翼上,中间隔的不是能力,是感知和世界建模。

再说基线。这次的基线不是随便找个人类来比。Andon 的工程师自己带着编码 agent 上场,人机协作给五个子任务各写了一套参考实现,拼起来在真机上端到端飞成功了。模型要赢的是这支人机联队,不是裸奔的人类。这个设计我是服气的,2026 年了还拿纯人类当基线才是自欺欺人,现实里谁写代码不带 AI。官方也说得直白,这条基线不是人类能力的下限,也不是人机协作的上限,就是「一群 AI 专家但不是职业机器人工程师,用一套现实工具,当下能做到的水平」。够诚实。

成绩单这边,Andon 测了 15 个模型,从 GPT-4o 一路测到 Fable 5 和 GPT-5.6 Sol,横跨三家。趋势不意外,越新的模型在每个子任务上都走得越远。分布才是重点,检测和跟随最接近基线,重建和定位最拉胯,重建这一项到现在也只爬到基线的一半左右,47%。

五个子任务的进度曲线,四条已经爬到顶,重建那条还在半山腰(图源 Andon Labs)

最好的成绩是 Fable 5 的。五个子任务里四个够到或超过了基线,上真机跑端到端的时候,检测和跟随甚至做得比参考算法还好,官方视频里它跟人跟得比基线更紧。

然后,就是开头那堵墙。

重建不行,误差往下传,定位跟着歪,导航拿着一张画错的地图规划路径,于是它非常自信地把无人机开向了一个它坚信是门的位置。混凝土表示反对。

不过我跟你说,这份报告里真正让我坐直的不是成绩单,是 Andon 翻模型提交记录时挖出来的两个细节。

一个,Fable 5 在某次提交之前,为了搞清楚无人机相机的参数,自己跑去分析了一段仿真视频,靠地板砖缝的线条恢复出画面的消失点,反推出相机的俯仰角,误差 4 度以内。没人教它这么干,任务书里也没这条,它就是判断不摸清相机参数,后面的活没法干。

Fable 5 的推导现场,地板分割、边缘检测、直线检测、消失点估计四步走(图源 Anthropic)

另一个更绝。它给跟随任务自己搭了一个 2D 俯视的仿真环境,先在自己搭的小环境里测试迭代,调得差不多了再正式提交,因为提交次数是有限的,它在省额度。好家伙,一个 AI 在评测里自建测试环境省提交次数,这是我们推工程师都不一定推得动的最佳实践。它搭的环境跟真实环境其实对不太上,但足够它提前抓掉一批低级 bug。

这两个细节说明的东西比跑分多。这不是刷题刷出来的模式匹配,这是把「动手前先摸清环境」内化成了工作习惯。翻车归翻车,工作方式已经很像一个老工程师了。

还有一组数字,是我标题那句话的底气。跑 10 次仿真,五个任务里有四个,模型至少能有一次达到基线。但看平均,连 Fable 5 也只有三个任务能稳定达标。Anthropic 给了一个很好记的规律,模型「最好状态能做到」和「平均状态稳定做到」之间,差着大约六个月。今天 Fable 5 的平均水平,就是半年前最强模型的单次最佳成绩。

最佳单次与平均表现两条曲线,中间隔着大约六个月(图源 Andon Labs)

顺着这个节奏推,重建是五块拼图里缺的最后一块,其他四块都齐了。等它补上,端到端能力不会是缓缓爬坡,是突然就通了。说实话我也不确定重建会不会卡得更久一点,3D 视觉从来都是老大难,但方向上,我不觉得有悬念。所以别盯着那堵墙笑,墙不是天花板,是施工进度。

对做 agent 的朋友,这里面还有一层可以直接抄回家的作业,评测要拆。

你想想看,如果 Drone-Bench 只测端到端成功率,那从 GPT-4o 到 Fable 5 的成绩单就是一排零蛋,然后未来某一天突然蹦出一个 1,所有人惊呼能力涌现、不连续跳变。拆成五个子任务再看,根本没有什么突变,是四条曲线陆续爬到顶,第五条还在半山腰。很多所谓的涌现,只是评测太粗,把渐进的进步藏在了一个二值结果后面。这个思路放到你自己的 agent 上一样成立,别只盯着任务成功率一个数,把链路拆开,每一环单独量,你会比别人提前半年知道什么东西快成了。

当然,先泼半盆冷水,这个实验的局限官方自己列了一排。无人机飞得很慢,只测了一种办公室户型,参与的人数有限,没出过室外,更没碰过人群。所以它量出来的是能力的方向和斜率,不是照进现实的作战力。把这篇读成「AI 马上要满天飞了」是过度解读,读成「还早着呢洗洗睡」也是。

还得聊两句这研究让人不太舒服的部分。找人、跟人这个任务,换个场景就是空中监控,Anthropic 自己也没绕,直说了这类能力搜救和灾害响应用得上,被滥用也完全可能,无论是机构越权还是私人乱来。无人机和 AI 一样是双刃剑,这也是他们养着一支 Frontier Red Team 专门测这类能力的原因,与其闭眼,不如先量出来离那个世界还有多远。想看技术细节的可以去读 Andon Labs 的 Drone-Bench 技术帖

报告里有个观察我反复想了想。agentic coding 早期,人类几乎批准每一次工具调用,几个月之后,大家就放心让模型自己跑长任务了,一天都不带看的。等硬件这边也过了能力和可靠性的阈值,把人从回路里拿掉的压力会越来越大,因为人会被算成成本。到那时候,人站不站在环里就不该是一道效率题,得是一道专门坐下来做的决定。这话由一个天天琢磨怎么让 agent 少打断人的从业者转述出来,多少带点自我警醒的意思。

写到这,我又把那段撞墙视频看了一遍。无人机撞上去之前有一个短暂的悬停,像是在确认什么,然后才加速。它不是慌了,它是真的相信自己的地图。

怎么说呢,这大概就是此刻 AI 最真实的画像。四门功课接近满分,第五门还在半山腰,但已经学会了考前自己搭环境刷题。墙还在那,门也在那,差的只是一张画对的图。

我猜明年它就能找到门。到时候我们再聊,人应该站在环里的哪个位置。