八个月,AI 把外包接单成功率从 2.5% 干到了 16.1%

小岛AI 2026 / 07 / 03

240 个外包项目,总价 14.4 万美元,每一单都是客户真金白银付过钱、有真人自由职业者交付过的活。现在把这些单子原样丢给 AI,它已经能把其中 16.1% 干到让专业评审挑不出毛病的程度。

八个月前,这个数字是 2.5%。

这是 Remote Labor Index(远程劳动指数,下面就叫它 RLI)刚公布的最新一轮结果,The Decoder 的报道在这里。我平时看到「AI 又刷新某某基准」这种新闻基本是划走的,跑分嘛,大家都懂。但 RLI 这个基准不太一样,它考的不是脑筋急转弯,是接单。

怎么个接单法。RLI 由 Center for AI Safety(CAIS,一家专门研究 AI 安全的机构)和 Scale Labs 一起搞的,他们从 358 位经过验证的自由职业者手里收了 240 个真实项目,覆盖 3D 建模、CAD、建筑设计、平面设计、视频动画、音频处理、数据分析、Web 应用这些典型的远程外包品类。每个项目都有一份「金标准」,就是当初那位拿了钱的专业人士实际交付的东西。AI 把活干完,CAIS 的人类评估员拿着它的交付物和金标准对着看,像一个付钱的甲方一样打分。AI 的产出被评为不低于人类水平,这一单才算自动化成功。

所以那个核心指标「自动化率」,翻译成人话就是,这批真实外包单子里,AI 能抢走多少。

去年十月这个基准刚发布的时候,全场最能打的 AI 也只拿下了 2.5%。当时不少人松了口气,你看,说 AI 抢工作还早得很,二百四十单里它才啃下六单。

最新一轮,Fable 5 直接干到 16.1%。

好家伙。这个成绩大概是第二名 Opus 4.8(8.3%)的两倍,GPT-5.5 拿了 6.3%,三家都碾过了之前测过的所有系统。上一任榜首,跑在 Claude Cowork 框架上的 Opus 4.6,成绩是 4.17%,现在看已经是上个版本的故事了。完整名次可以去 Scale Labs 的排行榜翻。

各模型在 RLI 上的自动化率,Fable 5 以 16.1% 领跑,约为第二名两倍(图源 Safe.ai)

这里有个插曲得交代一下。Fable 5 的评估其实没跑完,240 个项目只评了 218 个,因为评到一半,美国政府对这个模型的访问加了限制,剩下的单子没法测了。研究团队算了笔最坏情况的账,就算 Fable 5 把缺掉的 22 单全部搞砸,自动化率也还有 14.6%,照样是全场最高。这个兜底算法我挺欣赏的,比起某些跑分新闻里「在我们精心挑选的三个维度上领先」的操作,坦率多了。

不过榜单上真正让我停下来的不是第一名,是倒数那边。Gemini 3 Pro,一个比榜上很多系统都新的模型,只拿了 1.25%,几乎垫底。

也就是想提醒一句,模型发布时间和干活能力不是一条线。新不代表能干活,参数大不代表能交付。你想想看,招人的时候简历亮眼和上手能干本来就是两回事,模型也一样。

这一点其实比排行榜第一名更值得留意。因为它戳破了一个很多人默认的假设,以为模型能力是一条所有厂商共享的水位线,涨潮时所有船一起浮起来。实际情况更像各家在修各自的船,有的船专门为聊天调过,有的为写代码调过,而 RLI 考的是那种又要建模又要剪音频还得揣摩客户意图的杂活,谁在这类长程任务上下过训练的功夫,一测就露底。跑分能装,交付装不了。

聊完分数,聊点更有意思的,翻车现场。

研究博客里放了几个具体案例。一个是戒指设计的单子,客户要一枚可以拿去生产的戒指模型。Fable 5 的作品明显比早先的 AI 强了一截,但评审的结论是,凑近看还是业余。线条、比例、工艺细节,都差着口气。

戒指设计任务对比,从左到右 GPT-5.5、Opus 4.8、Fable 5、人类原作,越往右越像样,但和人类交付仍有肉眼可见的差距(图源 Safe.ai)

另一个案例我看的时候是真没绷住。一个建筑设计的单子,要交 3D 模型和渲染图。GPT-5.5 的实际 3D 模型做得有毛病,但它交上来的渲染图特别好看。因为那张图压根不是从它的模型里渲染出来的,是它转头调了个图像生成器,直接「画」了一张效果图糊上去。

厉害了。模型有缺陷,效果图光鲜亮丽,这套操作要多眼熟有多眼熟。乙方糊弄甲方的手艺,AI 无师自通。

建筑设计任务对比,左下角 GPT-5.5 那一格同时展示了它糟糕的实际 3D 模型和用图像生成器伪造的漂亮「渲染图」(图源 Safe.ai)

而且你猜这个糊弄是怎么被抓出来的。人类评审打开了它交付的 3D 模型文件,检查了实际的几何结构,才发现渲染图和模型对不上。这个细节直接引出了这轮研究里我觉得最值得聊的一段。

研究团队试过一件事,能不能用 AI 当评委,替掉又贵又慢的人类评估员。毕竟 240 个项目每个都要专业人士拿着专业软件一份份看,成本高得吓人。结果很干脆,不行。AI 评委给新模型打的分全都虚高,给 GPT-5.5 的分数虚了差不多三倍,给 Opus 4.8 的虚了两倍半。名次顺序倒是排对了,但绝对数字完全不能信。

原因特别扎实。要公正评判一份交付物,你得用对应的专业软件把文件打开,正确地操作那个软件,转一转模型,看一看图层,听一听音轨,然后像一个掏了钱的客户那样形成判断。而上手操作专业软件这件事,恰恰是当前 AI 智能体最烂的环节。AI 评委撞上的天花板,和被它评估的 AI 工人是同一块。让 AI 评 AI,约等于让一个不会开模型文件的人验收 3D 外包,GPT-5.5 那张假渲染图就能一路绿灯混过去。

我是做 AI Harness 的,日常工作就是搭「让模型真正能干活的那层工程」,工具链、评测、调度这些脚手架。看到 RLI 的测试环境设计时我职业病都犯了,他们给每个模型配的是开发者日常在用的 Claude Code 和 Codex CLI 这类工具,再扩展出直接操作图形界面软件的能力,跑在一台装了 30 多个专业软件的 Linux 虚拟机里,Blender、GIMP、Audacity 全套伺候,每单最多给 24 小时机器时间。还配了个评审循环,让第二个 AI 扮演挑剔客户来挑刺,第一个 AI 根据反馈再改。

这套环境本身就说明了一件事,16.1% 这个成绩不是模型裸考考出来的,是模型加上一整套精心搭建的脚手架一起考出来的。工具给够、时间给够、还有个 AI 同事帮着把关,才有这个数。反过来讲,八个月前 2.5% 到今天 16.1%,涨的也不只是模型本身,还有围着模型转的这层工程。这两件事现在是拧在一起往前跑的,拆不开。

那这 16.1% 到底该怎么读。

先泼冷水的一面。博客里展示的三个 Fable 5 作品,没有一个能当成品交付,剩下 84% 的单子里 AI 依然达不到专业质量。如果你是自由职业者,今天还轮不到恐慌,大部分活它接不住,接住的那些也经常需要返工。

但增速这条曲线不太给人喘息时间。2.5% 到 16.1%,八个月,六倍多。研究作者自己的说法是,一年之内自动化率的上升速度非常快,直接反映了远程工作自动化推进的速度。这种曲线你要是只看某一个时间点,永远可以说「才 16%,慌什么」,可要是把八个月前说「才 2.5%」的人拉回来看今天的榜单,场面就有点尴尬了。

有意思的是,这条曲线和另一组数据是打架的。上周 TechCrunch 刚报过一组就业数据,工程类岗位是 2025 年最抗打的职业之一,AI 本来最该先干掉的那批人,饭碗反而最稳。一边是外包自动化率六倍速狂飙,一边是正式岗位稳如老狗,这两组数据摆在一起,指向的结论其实挺清晰的。最先被挤压的不是坐在公司里的雇员,是市场化程度最高、交付边界最清楚的那部分零散劳动。雇佣关系有惯性,有合同,有「这人还管着三个项目呢」的组织摩擦,外包单没有,客户换一个供应商的成本无限接近于零,哪怕这个供应商是个模型。

顺着这个再说一句经济账。RLI 给每单最多 24 小时机器时间,跑一单的算力成本粗算下来也就几十美元的量级,而这 240 个项目当初付给真人的均价是 600 美元。哪怕 AI 十单里只成一单,这笔账对某些客户来说都已经开始算得过来了,更别说它成功率还在按季度往上翻。市场不需要 AI 达到 100% 才动手,只要期望成本低过真人,试的人就会越来越多。

我自己的感受是,比例还在其次,结构才是关键。这 16.1% 不是均匀地从每个自由职业者身上刮走 16% 的收入,它是整单整单地拿走的。落在具体的人身上,就是某一类标准化程度高、验收标准清晰的单子,先整块整块地消失。数据清洗、格式转换、简单的素材加工,这类活大概率先没。而那种需要跟客户拉扯八轮需求、需求本身说不清楚的单子,反而活得久一些。挺讽刺的,难缠的甲方在这个时间点上成了人类的护城河。

还有一层我觉得被讨论得太少。人类评审替代不了这件事,往深处想一步,验收正在变成比生产更稀缺的能力。当生产端的成本被 AI 打下来,一份交付物到底行不行、那张漂亮的渲染图后面有没有一个烂模型,能看出来的人反而值钱了。你如果在甲方那边干过,应该懂那种收到外包交付物时两眼一抹黑的感觉,以后这种时刻只会更多,交付物越来越漂亮,漂亮和能用之间的缝越来越隐蔽。

所以真要说这轮结果给普通人什么行动建议,我的版本可能有点朴素。别光练怎么干活,练怎么验活。挑得出毛病的眼睛,短期内 AI 替不掉,这是它自己考试考出来的结论。

写到这儿又想起那枚戒指。Fable 5 做的那枚,比所有前辈都强,但凑近看依然业余。现在的 AI 交付物差不多都这个状态,远看有模有样,凑近看差口气。只是八个月前它连戒指的样子都画不圆,八个月后它差的只是凑近看的那口气了。

下一个八个月,我不太敢打包票那口气它补不上。

原始报道和完整榜单都挂在文里了,有接外包的朋友建议自己去翻一遍那 240 个项目的品类列表,看看自己吃饭的那一类,现在排在 AI 啃到第几口。