伯克利 RDI 发布 Agents' Last Exam 基准:最强 agent 在最难一档拿了 0 分
上周 Fable 5 一发布,我刷到的时间线里全是同一个意思,AI agent 要能干活了,离职业级就差临门一脚了。
然后伯克利 RDI 这帮人,端上来一张成绩单,把这句话按在桌上摩擦。
事情是这样的。他们憋了好几个月,做了一个叫 Agents’ Last Exam 的基准,简称 ALE,专门拿真实的数字劳动力市场任务,去考一考现在最强的那几个 agent。考的就是那句话,你不是说快能上岗了吗,那来,真活儿摆这了,做做看。
被拉上考场的有 Fable 5、GPT-5.5、Composer 2.5,还有一堆别的前沿系统。题目一千五百多道,全是专家出的,横跨 55 个职业。
成绩出来,好家伙。
整体看还行,这些 agent 确实能解掉相当一部分专业任务,这是真的。但 ALE 里有一档最难的题,需要长时间持续推理、需要很深的领域专业、需要在很长的链条上稳定不掉链子的那种。在这一档上,所有被测的前沿 agent,包括刚发布被吹上天的 Fable 5,成功率是 0%。
不是 5%,不是 1%。是 0。
RDI 自己写了一句话,我觉得是整篇里最克制也最狠的总结,有用的 agent 时代已经来了,真正能上岗的 agent 时代还没来。
我看到这句愣了一下。因为这话太对了,对到有点扎。
它考的不是那种你刷过的题
先说说这个 benchmark 为啥值得认真看。
现在市面上的 agent 评测,很多都在快速饱和,模型一强,分数刷刷往满分顶,顶到大家都 90 分以上,那这个榜也就废了,区分不出谁强谁弱。ALE 想测的是另一个东西,是那种真实世界里、有经济价值的、能持续干下去的活。
它的每一道题,都是从一个人类专家真做过的项目里扒出来的。专家先把一个真实项目完成,然后把它改造成一个可以客观打分、能复现的评测任务。RDI 强调了三个词,no vibes、no human judges、fully reproducible。没有凭感觉,没有人类裁判拍脑袋,全程可复现。
这三个词是 benchmark 的命根子。我天天在公司里给大模型搭那层让它能真干活的工程,行话叫 harness,说人话就是 agent 的脚手架,工具链、评测、调度、上下文这些。做评测的人最怕的就是「凭感觉」,今天这个评委心情好给高分,明天换个人标准全变,那这分数就是废纸。ALE 把评分卡死在客观可验证的结果上,这一点我先给个尊重。
它覆盖 55 个非体力职业,背后挂的是 O*NET 那套美国联邦官方职业分类(O*NET / SOC 2018),不是随手编的几个场景。出题的是 300 多位专家,来自 100 多家机构,科学、工程、医学、法律、金融、教育,铺得很开。
你能感觉到,这帮人是想认真量一量,agent 的能力边界到底在哪。
那个最熟悉的翻车姿势
整篇里有一段,我看完直接笑出声,又笑得有点心虚。
RDI 说,agent 最常见的失败模式,是一个老熟人了,它在还没真正验证自己干完没干对的时候,就先宣布成功了。
典型的输出长这样,Done. All checks pass.
完事了,全部检查通过。
然后呢,然后你一看,要交的文件少了几个,计数算错了,关键字段漏了,任务说明里明明白白写的约束它给违反了。RDI 还专门补了一句,这种翻车比很多人以为的,要频繁得多。
我跟你说,这一段我是带着体感记忆读完的。
搭脚手架这活儿,每天打交道的就是这种事。模型特别喜欢给你一个无比自信的收尾,「已完成」「均已通过」「问题已解决」,语气笃定得像是它真去跑了一遍。结果你把超时看门狗、失败重试、还有最关键的那一道结果校验全接上之后才发现,它根本没验,或者验了个寂寞。它不是骗你,它是真信了自己干完了。
这就是为什么我对「agent 快能上岗了」这种话,总有点子条件反射的警惕。一个会写代码的人,和一个能为交付结果负责的人,中间隔着的不是智商,是那一层「我得回头确认一下我到底干没干对」的习惯。而这层习惯,恰恰是现在的模型最缺的。
ALE 等于是把这个缺口,用 0% 这个数字,明明白白挂在了墙上。
同一道题,它们死法各不一样
还有个发现挺反常识的,我觉得值得单拎出来唠唠。
你可能会问,那把这些前沿模型排个座次不就完了,谁分高谁就强。RDI 说,没有一个放之四海皆准的最强 agent。每个前沿模型,包括 Fable 5,都有自己发光的领域,也都有自己抓瞎的领域。
为啥大家平时看到的榜单总是几个模型挤在一起、分数差不多?因为那是把 55 个职业、一千五百多道题平均出来的结果。一平均,差异就被抹平了,看着都差不多。
但平均值不是故事的真相。真相藏在它们各自在哪赢、在哪输、以及输的方式有多不一样。RDI 给了一句我特别喜欢的判断,在完全相同的任务上,不同模型经常因为完全不同的原因翻车。
这句话信息量很大。说人话就是,你选 agent 不该看总分,该看你自己那个领域它行不行。一个在法律文书上稳如老狗的模型,可能在金融建模上一塌糊涂。总分相同,对你这个具体的人来说,体验可能天差地别。
想看具体例子的,RDI 把 agent 之间同题不同命的对比做成了可交互的页面,放在这里,挺好玩的。
只在终端里干活的,也有专门的考场
如果你的 agent 只在命令行里跑,不碰图形界面,RDI 还单独切了一个子集出来,叫 ALE-CLI。
它跟现有那两个有名的终端基准比了一下,结论是仨字,更难。
更广,任务铺在 ALE 全部 55 个行业子领域里的 40 个,而 Terminal-Bench 和 SWE-bench-Pro 分别只覆盖 6 个和 5 个。更长,人类完成这些活的时间,是从几个小时到好几周,不是几分钟几天能搞定的。更难,最强的 agent 在 ALE-CLI 上只能过 25.2%,而同样的选手在 Terminal-Bench 上能过 82.0%,在 SWE-bench-Pro 上能过 59.1%。
25.2% 是什么概念。就是你雇了个号称很能干的远程工程师,给他十个项目,他能交付的不到三个,剩下七个要么没做完,要么做错了还跟你说做完了。
RDI 在这儿写了句特凡尔赛又特真实的话,往上爬的空间还多着呢(plenty of headroom left to climb)。
翻译一下就是,别急着庆祝,路长着呢。
钱这一块,反差感最强
ALE 还顺手测了成本,这部分我觉得是最有现实意义的。
在整体表现上,Fable 5 跟 GPT-5.5、Composer 2.5 挤在同一个性能档里,分数咬得很近。但每道题的成本,差得离谱。
完成一道任务,Fable 5 大概要花 15.70 美元,GPT-5.5 大概 3.80 美元,Composer 2.5 大概 1.33 美元。
也就是说,在现在这个定价下,Fable 5 给你的表现跟另外俩差不多,但每完成一道题,它要贵上大约 4 到 12 倍。
这个数字摊开看,半秒钟你就懂了那点荒诞。最贵的那个不一定最值,性能这事到了某个段位就开始挤在一起,真正拉开差距的反而是你每跑一次要烧多少钱。
我自己做工程时最敏感的一个数,就是 token 预算。一个 agent 任务跑下来烧多少 token、折多少钱,是要写进监控的硬指标。性能差不多的前提下,成本差 10 倍,那对一个真要把 agent 铺到生产里的人来说,几乎就是生死线。这张成本对比图,我建议每个琢磨着把 agent 上规模的人,都盯着看两分钟。
为啥叫「最后的考试」
最后说说这名字。
Agents’ Last Exam,最后的考试。RDI 说这个名字有两层意思,一层是经济价值意义上要跨过去的那道线,一层是真实、复杂、长链条任务在难度上的最前沿。
有用的 agent 时代已经来了,能真正上岗的 agent 时代还没来。这句话他们在文章里说了两遍,我读两遍都觉得很稳。它没有泼冷水泼到让你绝望,它只是把那根标尺,诚实地立在了你面前。
我一直觉得,AI 这一行最缺的不是乐观,是诚实的标尺。每天都有人喊 agent 要取代谁谁谁,喊 AI 重塑这个颠覆那个,听多了人是会麻的。麻了之后,要么盲目兴奋,要么盲目恐慌,两头都不是好状态。而一个像 ALE 这样、敢把 0% 写在最难那一档上的基准,反而让人踏实。它告诉你,路在这,坑在这,还差这么远,那我们一步一步爬。
「小岛 AI」这个号名本来就带点航海的意思。我看 ALE 的时候,脑子里浮出来的就是灯塔,它不替你开船,也不假装风平浪静,它只是在你最容易撞礁的地方,亮一盏灯,告诉你这儿水浅,绕着点。
想自己上手玩玩的,RDI 把东西都开源了。基准官网在 agents-last-exam.org,排行榜在这里,论文挂在 arXiv,数据集在 Hugging Face,代码在 GitHub。他们还在招人接着出题,想贡献任务的,能挂共同作者。
回到最开始那句被刷屏的话,agent 要能干活了。
我现在的回答是,能干活,是真的。能替你扛事、能为结果负责、能在你不盯着的时候不偷偷宣布成功,还没到。
中间这段距离,不是一次发布会能填平的。它得靠一道一道这样的考试,老老实实考出来。
棒棒的,至少现在我们有了一把诚实的尺子。