Anthropic 昨晚发了两个模型,其实是同一个

小岛AI 2026 / 06 / 10

事情是这样的。今天早上咖啡还没喝完,刷到 Anthropic 半夜甩出来的发布公告,标题里并排站着两个名字,Claude Fable 5 和 Claude Mythos 5。

我第一反应是,一次发俩?Anthropic 什么时候学会机海战术了。

点进去看完,发现事情比「发俩模型」有意思多了。这俩根本就是同一个模型。同一套权重,同一个脑子,唯一的区别是身上穿没穿防护服。Fable 5 是穿了防护服、所有人都能用的版本,Mythos 5 是脱了防护服、只发给一小撮网络安全防御者和基础设施厂商的版本。

官方在脚注里还专门解释了名字。Fable 来自拉丁语 fabula,「被讲述之事」,和希腊语的 mythos 是近亲。同一个故事,两种讲法,差别只在谁有资格听全本。

好家伙,连命名都在跟你打哑谜。

先把硬信息过一遍,再聊我真正想聊的东西。

Anthropic 给这一档模型起了个新名字,叫 Mythos 级,位置在 Opus 之上。也就是说,从昨天开始,Opus 4.8 不再是他们家最强的公开模型了。第一个 Mythos 级模型其实四月就有了,叫 Claude Mythos Preview,但只通过一个叫 Project Glasswing 的计划、跟美国政府合作,定向发给网络防御机构。昨晚的发布,相当于把这一档能力第一次开闸放给普通用户。

能力上,官方的说法是几乎所有基准都是 SOTA,而且任务越长越复杂,领先越大。我挑几个我觉得有质感的数据点。

Stripe 在早期测试里,拿 Fable 5 在一个 5000 万行的 Ruby 代码库上做了一次全库迁移,一天干完。人工估算是一整个团队干两个多月。在 Cognition 的 FrontierCode 评测里,也就是那个专门测「你写的代码能不能达到生产代码库验收标准」的基准,Fable 5 在前沿模型里排第一,开中等推理力度就够了。

视觉那边有个细节我看完愣了一下。以前的 Claude 玩宝可梦火红版,得给它配一堆辅助工具,地图、导航、游戏状态全喂到嘴边,玩得还是磕磕绊绊。Fable 5 这次通关了,全程只看原始游戏截图,没有地图,没有导航,没有任何额外信息。纯靠看。

记忆这块也有个挺好玩的实验。让模型玩《杀戮尖塔》,一个很吃长线规划的卡组构建游戏,给它一个能自己记笔记的文件记忆,Fable 5 从这份记忆里获得的提升是 Opus 4.8 的三倍,打到最终章的频率也是三倍。同样一本笔记,有人翻完就忘,有人越用越强。

至于脱了防护服的 Mythos 5 在干什么,公告里写得更像一篇科研简报。内部的蛋白质设计专家拿它把药物设计的部分环节加速了大约十倍,14 个蛋白靶点里有 9 个产出了值得跟进的候选药物方向。它提的一个关于大肠杆菌蛋白机制的新假说,后来被一个独立研究同一问题的实验室发论文证实了。还有一周多的自主基因组学研究,汇了 138 个物种、数百万细胞的数据,训出来的模型比《科学》期刊上新发的那个强,参数量还小一百倍。

厉害了。但这些都不是我今天想聊的重点。

我想聊的是那层防护服本身。

我平时的工作是给大模型搭脚手架的,就是 agent 的工具链、调度、评测这些让模型真正能干活的工程层。所以看发布公告的时候,我的职业病是不看跑分,先看系统设计。这次发布里最值得琢磨的设计是,当 Fable 5 的分类器检测到你的请求涉及网络安全、生物化学或者蒸馏时,它不拒绝你,而是悄悄把这个请求转给 Opus 4.8 来回答,然后告诉你一声。

注意这个动作。不是「对不起我不能回答」,是「这题换我师弟来答」。

绝大多数船照常出海,少数被信号灯引去另一条航道

这是个很微妙的产品决策。直接拒答的体验是墙,回退降级的体验是限速。官方说超过 95% 的会话完全不会触发回退,对这些会话来说,你用的 Fable 5 实际上就是 Mythos 5,一字不差。剩下不到 5% 的会话,你拿到的是 Opus 4.8 的答案,也不算糟。

为什么要搞这么一套东西,而不是像以前一样训练模型自己学会拒绝?公告里给的理由值得细读。Mythos 级模型在网络安全上的能力,已经强到能给恶意行为者提供「从搜索引擎拿不到的实质性帮助」。更麻烦的是,这个领域大量请求是双刃剑,同一个问题,安全研究员问是日常工作,攻击者问就是备战。模型自己分不清提问的人是谁,所以干脆在模型外面再立一层独立的 AI 分类器,专门盯着这几类话题。

红队测试的数据也放出来了。外部漏洞赏金计划测了一千多个小时,没人找到通用越狱。他们请的外部红队机构在长程任务上也没攻破,只有英国 AISI 在一个很短的测试窗口里朝着一个通用越狱摸到了点进展。官方的表态挺坦诚,完全杜绝越狱大概是不可能的,目标是让残存的越狱足够慢、足够贵,在被规模化利用之前就能发现。

把这些拼起来看,你会发现这次发布真正的新东西不是模型,是发布结构。

以前发模型,故事线是「我们训了个更强的,大家快来用」。这次的故事线是「我们训了个强到不能直接给你的,所以我们造了一套准入体系,按你的身份决定你能用到几成功力」。普通用户拿到 95 成,Glasswing 里的网络防御者拿到网络安全那块的全量,接下来还有一个生物医学的可信访问计划,让药企研究员拿到生物那块的全量。同一个模型,按行业切片发货。

配套的还有一条我差点划过去的政策。Mythos 级模型的所有商业流量,强制保留 30 天,第一方第三方平台都算。不拿去训模型,只用于安全监控,所有人工访问都留日志。这种条款放在两年前的模型发布里是不可想象的,现在它安安静静躺在公告倒数第三段,像机场安检通知一样理所当然。

写到这我想起来,五月份我还写过一篇 Mythos Preview 帮安全团队五天打穿苹果 M5 内核防线的文章。当时那个模型还是个只在小圈子里流通的传说,一个多月后,它的正式版已经摆在所有人的 API 列表里了,价格还打了对折,每百万输入 10 美元,输出 50 美元。前沿能力从实验室漏到大众手里的速度,比我的咖啡凉得都快。

接着聊点体感的东西。沃顿商学院的 Ethan Mollick 拿到了早期访问权,他那篇体验文我建议你完整读一遍,里面有个细节我反复看了好几次。

他让 Fable 5 做一张等时圈地图,就是那种「从伦敦出发,五小时能到哪」的地图,要求用真实数据,考虑飞机、火车、步行、开车。这个任务他拿以前所有模型都试过,没有一个能做出半点能用的东西,因为它需要查几千条真实旅行数据,还要做无数个小的取舍判断。

Fable 5 接到任务之后干了什么呢。它自己启动了一批子智能体帮它查资料,大部分是更便宜的 Sonnet,最后查回来 2200 多个具体航班、从法国 TGV 到日本新干线的列车时刻表、好几篇学术论文里的各国道路速度。这些智能体在跑的同时,它自己开始写代码,然后又派了一批智能体去测试验证,全程给自己记笔记。几个小时后交出一张高度复刻 1881 年伦敦原版风格的交互地图。

Mollick 让它补齐偏远地区的数据,它又组了一个互相对抗的智能体小组,研究组查资料,审查组挑刺,把去太平洋皮特凯恩岛的船期都搞清楚了。

一个模型在你看不见的地方,给自己组了个团队,还配了 QA。

Mollick 给这种体验找的词我觉得找得特别准。他说去年用 AI 像与巫师共事,你念咒语,奇迹发生。现在咒语强到他不确定自己还是不是巫师了,更像一个赞助人,描述需求,付钱,验收成果,而召唤的过程发生在他看不见的地方,几百个小决定他一票都没投过。他说,我不再掌舵,我只是下订单。

船坞自己干活,赞助人的椅子是空的

这个「赞助人」的比喻让我想到文艺复兴时期的美第奇家族。美第奇资助米开朗基罗的时候,不会蹲在脚手架边上指导他凿子该往哪下,他们给钱,给方向,然后等着验收大卫像。区别在于米开朗基罗凿了三年,Fable 5 的工期是九个半小时,这是 Mollick 那个最大项目的实际耗时,让它从一份 19 页的设计文档开始,写出一个研究者需要了很多年但从来没人觉得值得做的数据分析工具,代码已经开源了

说真的,读到「我不再掌舵」那句的时候,我心里咯噔了一下。掌舵这件事,恰好是我们这些做工程的人最后的自留地。代码可以让模型写,方案可以让模型出,但「盯着它怎么干活」这个位置一直是人的。如果模型强到过程完全不可见也不需要可见,那工程师剩下的活,就是定义验收标准了。怎么说呢,我自己也没想明白这是解放还是失业,可能两者都是。

最后说点实用的。Fable 5 现在就能用,API 上模型名是 claude-fable-5文档在这。订阅用户有个要紧的时间窗,从现在到 6 月 22 日,Pro、Max、Team 这些订阅计划免费包含 Fable 5,6 月 23 日起就要移出订阅、改成消耗额度了,官方说容量够的话会延长,但这种话听听就好。想试的这两周抓紧。

完整的安全评估在 system card 里,对齐数据那部分写得比公告细很多,关心模型会不会骗人的可以去翻 6.2 节。

一年前我们还在争论 agent 到底是不是炒概念。现在一个模型可以自己组团队、自己做 QA、自己写九个半小时的代码,而厂商发布它的方式,已经变成了像管制品一样分级分发。

船开得比海图画得快。我们这些在船上的,把日志记勤一点吧。