Opus 5 半价追平旗舰,以后 90% 的活可能轮不到 Fable 5 出手了

小岛AI 2026 / 07 / 25

一分钱没涨,模型直接换代。

今天凌晨 Anthropic 把 Claude Opus 5 放了出来,输入每百万 token 5 美元,输出 25 美元,跟上一代 Opus 4.8 一个价。但官方给它的定位是,能力贴着自家最强的 Fable 5 打,价格只要一半。

好家伙,同样的价钱,芯直接换成准旗舰了。

先把通稿信息快进完,都是你在别的号也能刷到的。跑分方面,官方说 Frontier-Bench 上它是 Opus 4.8 的两倍,CursorBench 3.2 上贴到 Fable 5 峰值成绩的 0.5% 以内,ARC-AGI 3 这种考察新颖问题求解的基准,得分是次优模型的三倍。OSWorld 2.0,就是让模型直接操作电脑桌面干活的那个测试,官方口径是用三分之一的成本超过了 Fable 5。发布即全平台,Claude.ai、Claude Code、API 一起上,CNBCTechCrunch 当天都发了报道。

通稿部分到此为止。跑分是官方跑的,话是官方说的,听个大概就行,等第三方复测出来再当真也不迟。

我更想跟你聊的是另一件事,这次发布真正改变的不是榜单排名,是默认选择

你打开模型下拉框的时候,选的其实不是模型,是一套价格和能力的组合。以前这个组合很清楚,日常的活给 Opus,最难的题掏钱上 Fable 5,心里那杆秤大家都拨得明明白白。现在 Anthropic 把秤砣挪了,准旗舰的能力落到了旗舰一半的价位上,整个选型逻辑都得重算。

我按人群把账摊开算一遍。

订 Claude Max 的朋友,你什么都不用做,默认引擎已经换成 Opus 5 了。Fable 5 还在列表里躺着,但按官方这个基准差距,你大部分场景可能根本想不起来切过去。花同样的订阅费,日常干活的那个模型直接升了一级,这是纯赚。

订 Pro 的朋友,这次是最大赢家。Fortune 的报道里点得很清楚,Opus 5 是 Pro 档位能摸到的最强模型。上个月 Fable 5 发布的时候多少人对着 Max 的价格咬牙,现在一个贴着旗舰打的模型直接落进了 Pro 的订阅费里。白给的,接住就行。

API 党的账最简单,也最舒服。价格跟 Opus 4.8 完全一样,能力官方说翻倍,那这就是一次不用改预算表的无脑升级,把模型名从 opus-4-8 改成 opus-5,收工。我自己维护的几条流水线就是这么打算的,改一行配置的事。

真正需要动脑子的是新出的 effort 档位。这次 Opus 5 带了个换挡功能,low、medium、high、max 四档,档位越高模型琢磨得越深,烧的 token 也越多。这个设计我是真的觉得顺手,跑批量任务的时候,分类、打标、格式转换这种流水线活挂 low 档,把省下来的预算留给 high 档去啃真正的硬骨头。以前这种分层要靠挂两个不同的模型来实现,现在一个模型内部就能换挡,路由逻辑能省掉一截。给个我自己准备落地的粗糙分法,回答有标准答案、错了能兜住的活走 low,写代码改 bug 这类要来回验证的走 high,max 留给一天遇不上一次的硬题,medium 当默认。档位这东西没有普适答案,先跑一周看账单再调,比看任何人的攻略都准。

秤砣挪了,记得重新拨你自己的那杆秤

还有个 Fast Mode,2.5 倍速度,2 倍价格。这个账就得看场景了,人机对话里等得心焦的那种交互式场景值得掏,后台跑的批量任务纯属浪费,慢就慢点,反正没人盯着进度条。

挂无人值守流水线的人,除了价格还得看两个不上热搜的指标。一个是一致性,早期用户反馈里反复出现的一条是多次运行结果稳定,这一点对后台任务比跑分重要得多,模型十次里有一次抽风,你的重试逻辑和告警就得为那一次专门写一堆代码。另一个是对齐,官方说 Opus 5 在自动行为审计里拿了他们家最好的分数,欺骗性行为率最低。听着像宣传稿的话术,但放到 agent 场景里这是个很实际的问题,一个会在中间步骤里糊弄你的模型,你就得在每个环节后面加校验,校验本身也要花 token,模型越老实,这层税就越薄。

生态那边的动作也值得记一笔。发布当天 GitHub Copilot 这些主流开发平台就接入了,通用访问不带数据保留要求,公司里管合规的同事看到这条应该会松口气,以前评估模型接入内部工具链,数据留存政策能来回扯上好几周。

那 Fable 5 还有什么用,双倍的价钱到底还值不值。

我的判断是,留给两类场景。一类是你真的在啃前沿难题,差的那 0.5% 恰好卡在你的及格线上,那该掏还得掏。另一类比较特殊,网络安全。官方这次说得很直白,Opus 5 在漏洞利用这类攻防能力上刻意没有跟进,明显落后于只对受审核机构开放的 Mythos 5,普通用户命中相关请求还会被回退到旧模型处理。做安全研究的朋友这次得看官方新开的 Cyber Verification Program,走认证通道放宽限制,这条路径跟价格没关系,跟资质有关系。

除了这两类,坦率讲,我想不出继续默认挂旗舰的理由。90% 的日常活,写代码、改 bug、整理文档、跑 agent 流程,Opus 5 这个价位段没有对手。这个判断可能有点激进,欢迎评论区来抬杠。

官方口径下的三代模型价格与基准对比

发布材料里还有个细节,戳到了我的本行。

官方演示里,给 Opus 5 一个残缺的需求,它自己搭了一套测试框架,自己写了条计算机视觉的处理流水线,然后对着测试反复验证迭代,直到跑通为止。官方原话是它「更擅长验证自己的工作,并且会耐心迭代直到成功」。

我的日常工作恰好就是给大模型搭这类脚手架,就是让模型真正能把活干完的那层工程,评测怎么挂、失败怎么重试、上下文怎么管,行话叫 harness。所以看到「模型自己搭测试框架」这句话的时候,我的感受是有点微妙的。搭脚手架的人,看着模型开始自己搭脚手架了。

倒也不是饭碗焦虑。这行干久了都清楚,工程层的补丁本来就是给模型能力的空窗期打的,能力追上来一块,补丁就退役一块,然后我们换个更高的楼层继续搭。真正的信号在于,验证与迭代这个环节以前是纯工程层的活,现在开始长进模型本体了。下半年再设计 agent 流水线的时候,有些校验环节也许可以从「必须外挂」降级成「兜底保险」,省下来的复杂度都是实打实的维护成本。

冷水照例泼一瓢。effort 档位是把双刃剑,默认档如果调得保守,普通用户的第一体感可能反而是「怎么还不如吹的那么神」,到时候网上大概率会吵一轮。跑分和体感之间隔着一条河,VentureBeat 也提醒这次的定位重心在 coding、agent 和企业工作流,你要是拿它写小说,提升未必有榜单那么夸张。

最后回到那个下拉框。上个月 Fable 5 发布的时候,大家讨论的是天花板又抬高了多少。这次 Opus 5 发布,抬的不是天花板,是地板。天花板决定行业能走多远,地板决定你我每天实际用上的是什么。

对干活的人来说,地板抬一截,比天花板抬一截实惠多了。

秤砣挪了,记得重新拨你自己的那杆秤。