以后你用哪个模型,轮不到你说了算

小岛AI 2026 / 07 / 23

Cursor 昨天把 Cursor Router 正式推了出来,一个替你选模型的路由器。发布博客我从头到尾翻完,最扎眼的不是省钱数字,是他们顺手甩出来的一个统计,用 Cursor 的开发者里,大约六成会把某一个模型设成日常主力,然后焊死不动。

写 CRUD 用它,改 bug 用它,让它顺个变量名也用它。前沿模型的价格,干着大量根本不需要前沿智能的活。

Cursor Router,就是冲着这六成人来的。

先把事情本身讲清楚,这部分我快进。Cursor Router 是个请求级的模型路由器,你发给 agent 的每一条消息,先过一个分类器。分类器看你的查询、上下文、任务复杂度、领域,再结合它对各家模型脾气的了解,把请求分给它认为最合适的那个。简单任务给性价比最高的,改 UI 给审美最好的,长周期的硬骨头给前沿推理模型。用户侧就三个档位,Intelligence、Balance、Cost,你在成本和智能的曲线上挑个大概位置,剩下的它做主。目前面向团队版和企业开放,桌面端、Web、CLI 都能用。

官方给的数据挺猛。Auto Intelligence 档在用户满意度上接近 Fable,成本砍掉六成左右,跟 Opus 4.8 花差不多的钱,满意度还高出 15%。

Auto 各档位与 Fable 5、Opus 4.8、GPT-5.6 Sol 的满意度与成本对比

三个几千人规模的企业客户提前用了两周,比起把所有流量都怼给 Opus 4.8,账单分别省了 52%、31% 和 32%,质量没掉。

抢先体验的三个企业客户,两周试用期的成本节省

坦率讲,光看工程,这活儿干得挺专业。

有两个细节我想单独拎出来,因为大部分转发这条新闻的号,大概率不会提。

一个是评估方式。Cursor 没拿离线跑分说事,是直接在生产流量上做在线 A/B,路由器本身基于 60 多万个真实请求训练,再放到几百万个真实请求里检验,优化目标用的是用户满意度。判定方式很朴素,你接受了输出、接着写下一个功能,算强正向信号,你出手纠正 agent,算强负向信号。除此之外还看代码保留率,agent 写的代码过段时间还有多少活在代码库里。这两个指标他们内部用了九个月,每次换模型都拿它压秤。

另一个是缓存感知。很多朋友可能不知道,切换模型是有隐藏成本的。prompt 缓存(模型厂商把你反复发送的长上下文缓存起来,命中了能便宜大几成)是跟着模型走的,路由器把你从 A 模型切到 B 模型,缓存直接作废,全额重新计费。Cursor 专门在会造成缓存未命中的数据集上训练路由器,报出来的省钱数字也把这部分损耗算了进去。这一手有点子牛逼,见过太多 demo 阶段漂亮、一上生产就被缓存击穿的方案,这条细节让我确认他们是认真在算账,不是在做 PPT。

好家伙,写到这你可能觉得这是篇夸夸文。别急,顺着这个再往下聊,味道就变了。

我一直觉得看这类发布,数据要看,数据没说的更要看。Cursor Router 整个叙事的前提,是那六成焊死主力模型的人做错了。真的错了吗。怎么说呢,站在账单的角度,确实错了,用前沿模型的价格顺变量名,冤。但一个人焊死一个模型,买的从来不只是能力,是可预测性。我知道它长什么样,知道它什么时候容易犯浑,知道它写出来的代码我扫一眼要重点防哪里。这种熟悉感,本身就是生产力的一部分。

路由器把这个换掉了。你面对的不再是一个模型,是一个每条请求都可能换人的调度系统。今天帮你改 bug 的,和昨天帮你改 bug 的,可能不是同一个脑子。而界面上,它们都叫 Auto。

再往深一层,是优化目标的问题。满意度这个指标有个天然盲区,它只能捕捉你发现了的问题。你纠正 agent,负反馈,记账。可你没发现的那个坑呢。路由系统的优化方向是你不抱怨,不是代码对。一个便宜模型写的代码你没看出毛病、顺手 commit 了,在满意度的账本里,这是一次成功的路由。代码保留率能兜一部分底,坏代码早晚被删,但那个周期以月计,而且删的时候,没人会把锅归因到几个月前的某一次路由决策上。

我不是说 Cursor 在糊弄。人家把训练方法、评估口径摊开写在博客里,连缓存未命中都主动披露,这已经比行业平均水平体面很多。我是说,当「你满意」成为优化目标,系统会越来越擅长让你满意。这和「给你最好的代码」大部分时候重合,少部分时候不重合。而那少部分,恰好落在你最看不见的地方。

然后是真正的大账,订阅经济这本账。

做我们这行的对此都挺敏感(我日常就是给模型搭脚手架的,agent 的调度、评测、上下文管理这层工程),AI coding 产品这两年的核心矛盾,是用户的用量涨得比付费意愿快得多。Cursor 每周在各家模型之间路由数亿次请求,对上游它批发买 token,对下游收订阅和用量费,中间的差价就是它的生存空间。路由器每省下一个 token,省的都是它自己的成本,或者企业客户的账单,两头都得感谢它。这不是一个功能,这是它的财报。

官方还贴了一张每次 commit 的成本表,Fable 5 交付一次 commit 要 12.69 美元,Opus 4.8 Thinking 是 7.34,Auto Intelligence 6.76,Balance 只要 4.63。同样是交付一次 commit,价差能拉到接近三倍。这张表与其说是给开发者看的,不如说是给 CFO 看的。

各模型与 Auto 档位的每次 commit 成本,价差接近三倍

更妙的是位置。模型中立这个词 Cursor 喊了很久,路由器让中立第一次变成了权力。当六成用户不再指名要哪个模型,模型厂商在 Cursor 面前就从品牌变成了供应商。今天 Grok 4.5 在高难度任务上报价合适,就多分点流量过去,明天谁降价谁上。Joel Spolsky 二十多年前写过一篇 Strategy Letter V,讲聪明的公司都在把自己的互补品变成大宗商品,自己站到稀缺的那一环上。模型是 Cursor 的互补品。Auto 模式每多一个用户,模型这个环节就更接近大宗商品一分。

反过来站在 Anthropic、OpenAI 的角度看,他们烧几百亿拉开的那一点前沿差距,在路由器眼里只是分类器的一个特征维度。品牌忠诚度这东西,路由器是拿来消解的,不是拿来服务的。

所以我的看法是,这次发布真正的新闻不是省 60%,是选择权的批发转移。以前选模型是用户的事,现在 Cursor 说,交给我。你去翻文档会发现,管理员可以按团队开启 Auto、设默认档位、允许或者屏蔽特定模型。注意,这些权限给的是管理员,不是你。在企业版的世界里,你桌上那个模型选择器头顶还压着两层,一层是公司管理员,一层是路由分类器。它们都比你先做决定。

顺带一提,Cursor 同步还在把 agent 本身也做瘦,动态工具调用让工具描述不再预载进每个提示词,用到才加载,配合他们持续瘦身的 agent 评测框架。路由省的是单价,这些省的是用量。整套组合拳的方向非常一致,token 效率就是毛利率。

那被路由的人还能做什么。几条我觉得能落地的。

一,复杂任务显式选模型。Auto 是默认,不是强制,模型选择器还在。我自己的感受是,真值得动用前沿模型的场景就那几类,跨文件重构、并发问题、性能调优、需要长链路推理的架构设计。这些手动锁死你信任的模型,其余的交给 Auto,让它省它的钱,你守你的关键路径。

二,学会验证。前两天圈里传过一篇挺有意思的论文,让模型生成随机数,不同模型的「随机」有各自的偏好分布,采样多了能当指纹用,识别 API 背后到底是谁在回答。原本是用来抓中转站偷换模型的,在路由时代,这类验证手段会从偏门变成刚需。你未必真去跑统计检验,但至少要有这根弦,Auto 档下 agent 表现突然变糊,先去看这条请求被路由给了谁,Cursor 的界面里能看到实际用的模型。看不到的产品,就别用它的 Auto。

三,把保留率这个思路偷回家。别只在 agent 输出的当下评价它,隔一两周回头看,它写的东西还有多少活着。这是 Cursor 内部给模型压秤的办法,个人拿来称一称自己的 AI 依赖质量,一样好使。

写到结尾,我想起一个不太严谨但忍不住的类比。以前打车,你能记住几个好司机的电话,现在网约车系统派单,你只选快车还是专车。派单效率高吗,高得多,账单也好看。但慢慢地,没人再记得任何一个司机的脸。

模型正在网约车化。Intelligence、Balance、Cost,专车、快车、拼车。那六成把模型焊死的人,是最后一批记得司机长相的乘客。

这多半是好事,账单会证明这一点。只是那个大家为了一个模型的脾气吵得面红耳赤的时代,那个你会因为某段注释会心一笑、转手发到群里的时代,正在被一个 4.63 美元的数字轻轻合上。

下一次点开模型选择器,不妨多停一秒再关掉。还能自己做的选择,且选且珍惜。