以后你用哪个模型,轮不到你说了算
Cursor 昨天把 Cursor Router 正式推了出来,一个替你选模型的路由器。发布博客我从头到尾翻完,最扎眼的不是省钱数字,是他们顺手甩出来的一个统计,用 Cursor 的开发者里,大约六成会把某一个模型设成日常主力,然后焊死不动。
写 CRUD 用它,改 bug 用它,让它顺个变量名也用它。前沿模型的价格,干着大量根本不需要前沿智能的活。
Cursor Router,就是冲着这六成人来的。
先把事情本身讲清楚,这部分我快进。Cursor Router 是个请求级的模型路由器,你发给 agent 的每一条消息,先过一个分类器。分类器看你的查询、上下文、任务复杂度、领域,再结合它对各家模型脾气的了解,把请求分给它认为最合适的那个。简单任务给性价比最高的,改 UI 给审美最好的,长周期的硬骨头给前沿推理模型。用户侧就三个档位,Intelligence、Balance、Cost,你在成本和智能的曲线上挑个大概位置,剩下的它做主。目前面向团队版和企业开放,桌面端、Web、CLI 都能用。
官方给的数据挺猛。Auto Intelligence 档在用户满意度上接近 Fable,成本砍掉六成左右,跟 Opus 4.8 花差不多的钱,满意度还高出 15%。

三个几千人规模的企业客户提前用了两周,比起把所有流量都怼给 Opus 4.8,账单分别省了 52%、31% 和 32%,质量没掉。

坦率讲,光看工程,这活儿干得挺专业。
有两个细节我想单独拎出来,因为大部分转发这条新闻的号,大概率不会提。
一个是评估方式。Cursor 没拿离线跑分说事,是直接在生产流量上做在线 A/B,路由器本身基于 60 多万个真实请求训练,再放到几百万个真实请求里检验,优化目标用的是用户满意度。判定方式很朴素,你接受了输出、接着写下一个功能,算强正向信号,你出手纠正 agent,算强负向信号。除此之外还看代码保留率,agent 写的代码过段时间还有多少活在代码库里。这两个指标他们内部用了九个月,每次换模型都拿它压秤。
另一个是缓存感知。很多朋友可能不知道,切换模型是有隐藏成本的。prompt 缓存(模型厂商把你反复发送的长上下文缓存起来,命中了能便宜大几成)是跟着模型走的,路由器把你从 A 模型切到 B 模型,缓存直接作废,全额重新计费。Cursor 专门在会造成缓存未命中的数据集上训练路由器,报出来的省钱数字也把这部分损耗算了进去。这一手有点子牛逼,见过太多 demo 阶段漂亮、一上生产就被缓存击穿的方案,这条细节让我确认他们是认真在算账,不是在做 PPT。
好家伙,写到这你可能觉得这是篇夸夸文。别急,顺着这个再往下聊,味道就变了。
我一直觉得看这类发布,数据要看,数据没说的更要看。Cursor Router 整个叙事的前提,是那六成焊死主力模型的人做错了。真的错了吗。怎么说呢,站在账单的角度,确实错了,用前沿模型的价格顺变量名,冤。但一个人焊死一个模型,买的从来不只是能力,是可预测性。我知道它长什么样,知道它什么时候容易犯浑,知道它写出来的代码我扫一眼要重点防哪里。这种熟悉感,本身就是生产力的一部分。
路由器把这个换掉了。你面对的不再是一个模型,是一个每条请求都可能换人的调度系统。今天帮你改 bug 的,和昨天帮你改 bug 的,可能不是同一个脑子。而界面上,它们都叫 Auto。
再往深一层,是优化目标的问题。满意度这个指标有个天然盲区,它只能捕捉你发现了的问题。你纠正 agent,负反馈,记账。可你没发现的那个坑呢。路由系统的优化方向是你不抱怨,不是代码对。一个便宜模型写的代码你没看出毛病、顺手 commit 了,在满意度的账本里,这是一次成功的路由。代码保留率能兜一部分底,坏代码早晚被删,但那个周期以月计,而且删的时候,没人会把锅归因到几个月前的某一次路由决策上。
我不是说 Cursor 在糊弄。人家把训练方法、评估口径摊开写在博客里,连缓存未命中都主动披露,这已经比行业平均水平体面很多。我是说,当「你满意」成为优化目标,系统会越来越擅长让你满意。这和「给你最好的代码」大部分时候重合,少部分时候不重合。而那少部分,恰好落在你最看不见的地方。
然后是真正的大账,订阅经济这本账。
做我们这行的对此都挺敏感(我日常就是给模型搭脚手架的,agent 的调度、评测、上下文管理这层工程),AI coding 产品这两年的核心矛盾,是用户的用量涨得比付费意愿快得多。Cursor 每周在各家模型之间路由数亿次请求,对上游它批发买 token,对下游收订阅和用量费,中间的差价就是它的生存空间。路由器每省下一个 token,省的都是它自己的成本,或者企业客户的账单,两头都得感谢它。这不是一个功能,这是它的财报。
官方还贴了一张每次 commit 的成本表,Fable 5 交付一次 commit 要 12.69 美元,Opus 4.8 Thinking 是 7.34,Auto Intelligence 6.76,Balance 只要 4.63。同样是交付一次 commit,价差能拉到接近三倍。这张表与其说是给开发者看的,不如说是给 CFO 看的。

更妙的是位置。模型中立这个词 Cursor 喊了很久,路由器让中立第一次变成了权力。当六成用户不再指名要哪个模型,模型厂商在 Cursor 面前就从品牌变成了供应商。今天 Grok 4.5 在高难度任务上报价合适,就多分点流量过去,明天谁降价谁上。Joel Spolsky 二十多年前写过一篇 Strategy Letter V,讲聪明的公司都在把自己的互补品变成大宗商品,自己站到稀缺的那一环上。模型是 Cursor 的互补品。Auto 模式每多一个用户,模型这个环节就更接近大宗商品一分。
反过来站在 Anthropic、OpenAI 的角度看,他们烧几百亿拉开的那一点前沿差距,在路由器眼里只是分类器的一个特征维度。品牌忠诚度这东西,路由器是拿来消解的,不是拿来服务的。
所以我的看法是,这次发布真正的新闻不是省 60%,是选择权的批发转移。以前选模型是用户的事,现在 Cursor 说,交给我。你去翻文档会发现,管理员可以按团队开启 Auto、设默认档位、允许或者屏蔽特定模型。注意,这些权限给的是管理员,不是你。在企业版的世界里,你桌上那个模型选择器头顶还压着两层,一层是公司管理员,一层是路由分类器。它们都比你先做决定。
顺带一提,Cursor 同步还在把 agent 本身也做瘦,动态工具调用让工具描述不再预载进每个提示词,用到才加载,配合他们持续瘦身的 agent 评测框架。路由省的是单价,这些省的是用量。整套组合拳的方向非常一致,token 效率就是毛利率。
那被路由的人还能做什么。几条我觉得能落地的。
一,复杂任务显式选模型。Auto 是默认,不是强制,模型选择器还在。我自己的感受是,真值得动用前沿模型的场景就那几类,跨文件重构、并发问题、性能调优、需要长链路推理的架构设计。这些手动锁死你信任的模型,其余的交给 Auto,让它省它的钱,你守你的关键路径。
二,学会验证。前两天圈里传过一篇挺有意思的论文,让模型生成随机数,不同模型的「随机」有各自的偏好分布,采样多了能当指纹用,识别 API 背后到底是谁在回答。原本是用来抓中转站偷换模型的,在路由时代,这类验证手段会从偏门变成刚需。你未必真去跑统计检验,但至少要有这根弦,Auto 档下 agent 表现突然变糊,先去看这条请求被路由给了谁,Cursor 的界面里能看到实际用的模型。看不到的产品,就别用它的 Auto。
三,把保留率这个思路偷回家。别只在 agent 输出的当下评价它,隔一两周回头看,它写的东西还有多少活着。这是 Cursor 内部给模型压秤的办法,个人拿来称一称自己的 AI 依赖质量,一样好使。
写到结尾,我想起一个不太严谨但忍不住的类比。以前打车,你能记住几个好司机的电话,现在网约车系统派单,你只选快车还是专车。派单效率高吗,高得多,账单也好看。但慢慢地,没人再记得任何一个司机的脸。
模型正在网约车化。Intelligence、Balance、Cost,专车、快车、拼车。那六成把模型焊死的人,是最后一批记得司机长相的乘客。
这多半是好事,账单会证明这一点。只是那个大家为了一个模型的脾气吵得面红耳赤的时代,那个你会因为某段注释会心一笑、转手发到群里的时代,正在被一个 4.63 美元的数字轻轻合上。
下一次点开模型选择器,不妨多停一秒再关掉。还能自己做的选择,且选且珍惜。