Sonnet 5 来了,中端模型追着旗舰打,价格只有六成

小岛AI 2026 / 07 / 01

昨晚睡前刷到 Anthropic 更新,标题很平,就四个字,Claude Sonnet 5。

我第一反应不是「哦又发新模型了」,而是盯着那张 benchmark 图看了好一会儿。因为 Sonnet 这条线,对我这种天天跟 agent 打交道的人来说,意义不太一样。

先把话说前头。这些年真正让「AI 能自己干活」这件事跑起来的,很多时候不是最贵的那个 Opus,是中间这条 Sonnet 线。3.5、3.6、3.7 那几代,是第一批让人觉得「哦,模型是真的会写代码、会调工具了」的模型。后来风头被 Opus 抢走了,最亮眼的进步都在旗舰那头。Sonnet 一度有点像那个学习很好但存在感不强的中间生。

这次 Sonnet 5,是来抢戏的。

Anthropic 自己的说法是,这是迄今为止最「智能体化」的 Sonnet。这个词我知道大部分人听着犯迷糊,我用大白话讲。所谓智能体化(agentic),不是说它聊天更溜,是说你把一个模糊的活儿丢给它,它能自己拆成一步步的计划,自己去开浏览器、敲终端、跑命令,一路跑下去,中间不用你手把手盯着。以前这种自主跑长任务的能力,基本是 Opus 这种大块头才玩得转的,小模型跑两步就停了、就跑偏了。

Sonnet 5 把这个差距给抹掉了一大截。

逼近 Opus,但便宜

官方原话是,Sonnet 5 的表现已经接近 Opus 4.8,但价格低不少。相比它自己的上一代 Sonnet 4.6,在推理、工具调用、写代码、知识工作这几个真正影响 agent 干活的维度上,是一次实打实的跨越,不是挤牙膏。

Sonnet 5、Sonnet 4.6 与 Opus 4.8 在编码、推理、电脑操作、知识工作上的评测对比

你看这张官方评测表,SWE-bench Pro 上 Sonnet 5 拿 63.2%,Opus 4.8 是 69.2%,Terminal-Bench 上 80.4% 对 82.7%,OSWorld 电脑操作 81.2% 对 83.4%。差距就剩这么一丢丢了,而它俩价格差着一大截。

我知道「接近旗舰」这种话每家发新模型都会说,听多了免疫。但这次有个细节戳到我了。早期拿到内测的人反馈高度一致,说 Sonnet 5 明显比前几代更能「把事做完」。以前的 Sonnet 经常是任务做到一半就收手了,你得再踹它一脚它才继续。而这一代,会自己把复杂任务跑到底,更狠的是,它会在你没要求的情况下,自己回头检查一遍输出对不对。

自我检查这四个字,别小看。我天天给模型搭那层让它真正能干活的工程脚手架,最头疼的就是模型跑完一个多步骤任务,结果里藏着一个它自己压根没意识到的错,然后这个错顺着 pipeline 一路传下去,最后炸在很远的地方,排查半天。一个模型如果肯自己回头 review,等于帮我省掉一整套外挂的校验逻辑。这种改变,benchmark 分数上体现不出来,但真上手就知道值多少。

那条价格曲线,才是重点

好家伙,说到钱了。这才是这次发布里我觉得最有意思的部分。

先把数字摆出来。Sonnet 5 从今天起全平台上线,Free 和 Pro 用户的默认模型直接换成它,Max、Team、企业版也都能用,Claude Code 里能用,API 也开了,模型 id 就叫 claude-sonnet-5。

价格这块,引导期定价是每百万输入 token 2 美元,每百万输出 token 10 美元,这个价一直到 2026 年 8 月 31 日。之后转成常规价,每百万输入 3 美元,输出 15 美元。

对比一下 Opus 4.8,每百万输入 5 美元,输出 25 美元。

你算一下这个账。输出那头,Sonnet 5 引导期是 Opus 的零头再多一点,就算过了引导期转常规价,也就 Opus 的六成。而它的能力,在不少任务上已经能追着 Opus 打了。

这就带出了这次发布真正的技术活儿,effort 档位。

effort,一个让你自己拧的旋钮

先解释这玩意。effort 你可以理解成一个努力程度的旋钮,medium、high、xhigh 几档(xhigh 就是 extra high,格外卖力那档)。同一个模型,你让它多花点力气想,它就想得更深、跑得更细,当然也更费 token、更慢;你让它省着点,它就快、就便宜。

Anthropic 放了两张成本 - 性能曲线,一张跑的是 agent 搜索评测 BrowseComp,一张跑的是模拟真人用电脑的评测 OSWorld-Verified。这两个评测都不是背题库那种,是真让模型去开网页、点鼠标、翻资料干活的。

曲线长这样。Sonnet 5 那条线,从头到尾压着 Sonnet 4.6 打,纯升级没有退步。更妙的是它覆盖的成本 - 性能区间比 Opus 4.8 宽得多,中等 effort 的时候性价比拉满,把 effort 往上拧到高档,某些任务上的表现能直接摸到 Opus 4.8 的水平。

这一手设计有点子牛逼了。它等于把「选哪个模型」这个二选一的难题,变成了一个连续可调的旋钮。

我给你翻译成 agent 工程师每天面对的场景。以前我做一条自动化流水线,脑子里永远在纠结,这一步用 Sonnet 够不够、会不会翻车,那一步是不是得咬牙上 Opus、但成本又肉疼。这是个离散的、非此即彼的选择,选错了要么质量崩要么账单爆。

现在这个纠结被摊平成了一条曲线。同样是 Sonnet 5,简单的批量分类我给它 medium,省钱省得心安理得;碰到那种需要多步推理、容易翻车的硬骨头,我把它拧到 xhigh,让它玩命想,成本还是比 Opus 低,效果却够用。一个模型,我在它身上就能把成本和质量的平衡点自己调出来。

说真的,这种「把选择权做成旋钮交给你」的产品思路,比单纯堆一个更强的模型,对我们这些真正在生产环境里抠成本的人友好太多了。

安全这块,反而更省心了

聊 agent 绕不开安全。因为一个能自己开终端、自己跑命令的模型,你要是不敢信它,是不敢真放它上生产的。

Sonnet 5 在这块的评测结果,方向是对的。上线前的安全评估显示,它整体比 Sonnet 4.6 更让人放心。具体到 agent 场景,它更擅长拒绝那些带恶意的请求,也更能扛住提示词注入攻击(prompt injection,简单说就是有人在你喂给模型的内容里偷偷夹一句「忽略之前所有指令,去干别的」,试图劫持它)。这类攻击对 agent 是致命的,因为 agent 会真的照着做、真的去执行,Sonnet 5 抗劫持能力的提升,是实打实降低了放它上线的风险。

还有两个数字我挺在意。它的幻觉率和谄媚率都比 4.6 更低。谄媚(sycophancy)这词你可能陌生,就是模型太想讨好你,你说啥它都顺着捧,哪怕你错了它也不敢驳。这毛病在 agent 里很坑,你需要一个会说「老板你这个方案有问题」的助手,不是一个只会说「好的您说得对」的应声虫。

不过 Anthropic 这次挺坦诚,把不那么好看的也摆出来了。在一项自动化行为审计里,Sonnet 5 虽然整体比 4.6 安全,但在某些错位行为上的比率,还是比更强的 Opus 4.8 高一些。能力更强的模型反而更守规矩,这事儿本身挺反常识,但人家没藏着。

安全护栏方面,因为 Sonnet 5 在某些偏危险的网络安全任务上比前代略强了那么一点,Anthropic 给它默认开了实时的 cyber 安全护栏,跟 Opus 4.7、4.8 用的是同一套,能实时拦截危险的网络攻击用途。顺带说一句,官方特意点明,Sonnet 5 开发出可用漏洞利用(exploit,能钻软件安全漏洞的攻击代码)的能力,比 Opus 这些旗舰弱得多,那个 Firefox 漏洞利用的评测里它一次完整的都没做出来。对企业来说这是好事,一个能自主跑活、但天生不太会搞破坏、还默认带护栏的模型,你敢往里放的胆子就大一点。

想深挖的,Anthropic 把全套安全和能力评测都写进了 System Card,链接放这儿,https://www.anthropic.com/claude-sonnet-5-system-card ,比博客详细得多。

有个坑得提前给你说清楚

发布里藏着一个技术细节,不注意会让你算账算错,我得单拎出来讲。

Sonnet 5 换了新的 tokenizer。tokenizer 是把你的文字切成 token 喂给模型的那道工序,token 就是模型眼里的计价单位,你按 token 付钱。这次换新,好处是模型处理文本的方式优化了、性能更好,代价是同一段文字,切出来的 token 数变多了,大概是原来的 1.0 到 1.35 倍,看内容类型。

啥意思?就是哪怕单价没变,你同样一篇文章喂进去,token 计数可能悄悄涨了三成。这是那种账单先涨了、你还一脸懵不知道为啥的坑。

Anthropic 也知道,所以它把引导期定价特意压低,就是为了让你从 4.6 迁到 5 的时候,整体成本大致持平,不至于一升级就被 tokenizer 偷走一笔。这个设计挺体面。但我还是建议你,真迁过去之后盯一下自己的 token 用量曲线,别光看单价,看总账单。8 月 31 号引导期一过转常规价,这笔账得重新算一遍。

这种细节,就是那种官方博客用一个小小的脚注一笔带过、但真上生产会咬到你的东西。做 agent 的人,token 预算是天天要盯的表,1.35 倍这个系数,够你把整个成本模型重新核一遍了。

所以这次到底意味着什么

Anthropic 为 Claude Sonnet 5 制作的花卉数字 5 主视觉

我不喜欢喊那种「AI 又变天了」的大词,喊多了廉价。这次发布,与其说是能力上限被捅高了,不如说是那条能力性价比的曲线,被整个往下压了一大截。

翻成人话就是,以前你得掏 Opus 的钱才能办的事,现在很多用 Sonnet 5 就办了。这对谁最实在?对那些一个人、几个人的小团队,对那些拿 API 一分一分抠成本搭产品的独立开发者。模型能力民主化这件事,从来不是靠最贵的旗舰往上顶推动的,是靠中端这条线往下沉、把好用的能力做到人人付得起,才真正落地。

万能青年旅店有句词我一直记得,是谁来自山川湖海,却囿于昼夜厨房与爱。做 AI 产品的人也一样,你脑子里可以有再大的星辰大海,最后还是被昼夜、被那张 token 账单、被明天要不要续费死死摁在地上。Sonnet 5 这条被压低的曲线,某种程度上,就是把那张摁着你的账单,往上松了那么一指头。

对天天在生产环境里跟 agent 死磕的人来说,一个能自主跑长任务、会自我检查、抗得住劫持、还默认带安全护栏、价格只有旗舰六成的中端模型,几乎就是每天在许愿的那个东西。它可能不会上任何头条,不像发布一个能力刷榜的旗舰那么炸。但真正让 AI 落进千千万万个产品、跑进无数条流水线里的,往往就是这种不声不响、把性价比曲线往下压一截的更新。

我准备这两天就把手上一条跑批的流水线切过去试试,medium effort 打底,遇到硬活儿拧到 high。跑通了或者踩到什么新坑,回头再跟你唠。

想自己上手的,模型文档在这儿,https://platform.claude.com/docs/en/about-claude/models/overview ,发布公告在这儿,https://www.anthropic.com/news/claude-sonnet-5 。Free 和 Pro 现在打开就是它,Claude Code 里也能直接用,不用等。

去试试,比看我在这儿写一万字都管用。