你让最贵的模型干杂活,钱就是这么烧没的
同一个任务,四种模型搭配,做出来的东西质量差不多,账单却从 1339 美元一路排到 10565 美元。八倍的差距,不在模型强弱,在分工。
这是 Cursor 前两天发的实验报告里最扎眼的一组数字。他们让一群 agent 从零开始,用 Rust 重写 SQLite。不给源码,不给测试用例,不给现成的二进制,连网都不让上,就丢过去一份 835 页的官方文档,你们自己看着办。
然后他们换着法子搭配模型。有的运行里一个前沿模型包办所有事,有的运行里让最强的模型只负责规划,具体干活的换成快速便宜的小模型。四小时跑下来,每种搭配的产出质量都接近,钱却差出一个身位。用 GPT-5.5 从头包到尾,光执行部分就烧了 9373 美元。换成 Opus 4.8 出方案,Cursor 自家的快速模型 Composer 2.5 动手,整个执行队伍一共花了 411 美元。
四百块和九千块,干的是同一份活。
我的日常工作就是给大模型搭脚手架,agent 的调度、评测、上下文管理这一层,让模型真正能干活的那层工程。所以刷到这篇报告的时候职业病犯了,把每张图都点开放大看了一遍。看完最大的感受是,这份报告表面在秀肌肉,实际在教所有人省钱。
先把实验本身讲清楚。
Cursor 管这套系统叫 agent swarm,直译是智能体蜂群,就是几百个 AI agent 同时在一个代码库里干活的那种玩法。今年早些时候他们干过一票更猛的,让蜂群从零写一个浏览器,当时作为概念验证算成功,但产出离能用的软件还差得远。这次他们回头挑了个更可衡量的目标,SQLite。数据库这东西好就好在有标准答案,SQLite 官方有一套叫 sqllogictest 的测试集,里面是数百万条已知正确结果的查询,你的引擎答对多少就是多少分,糊弄不了。
比赛规则也干净。同样的模型,同样的四小时预算,旧版蜂群和新版蜂群各跑一遍。
旧版的表现,怎么说呢,很像一个没有任何管理的几百人团队。用 Grok 4.5 那次,前两个小时提交了 68000 次 commit,速度是新版的 70 倍。听起来很能干对吧,再看另一个数字,合并冲突累计超过 70000 次,而且增速还在往上翘,完全没有收敛的意思。冲突最惨的一个文件被 1173 个不同的 agent 改过,累计冲突 7771 次。好家伙,一千多个 agent 排着队改同一个文件,这不是协作,这是踩踏。
Cursor 在两小时不到的时候把这次运行按了暂停,再跑下去纯烧钱。
新版蜂群,同一个模型,同样四小时,全程冲突不到一千次,最抢手的文件也只冲突了 47 次,测试通过率一路爬到 80%。

灰线是旧版蜂群,合并冲突两小时冲破 7 万次还在加速,橙线是新版,四小时几乎贴地。图来自 Cursor 官方博客
更狠的对比在代码量上。Fable 5 那组搭配,新旧两版最后都通过了完整测试集,旧版写了 64305 行引擎代码,新版只用 9908 行。Opus 那组更夸张,旧版 19013 行拿 97 分,新版 4645 行拿 100 分。四分之一的代码,更高的分。
中间发生了什么,才是这篇报告真正值钱的部分。
新版蜂群里只有两种角色。规划器,由最强的模型驱动,只负责把目标拆成小块然后分出去,从不亲自写代码。worker,由便宜快速的模型驱动,只负责把手里那一小块写完,从不操心全局。任务天然长成一棵树,根上是总目标,一层层往下拆,拆到叶子就是一个个具体的活。
这个分法听着平平无奇,对吧。项目经理和程序员嘛,人类公司都这么干。但它在 agent 身上解决的问题,比在人身上更要命。
一个单独的 agent 接一个大任务,它得自己走完整棵树,每往叶子钻一层,都要在上下文里同时记着祖先节点、当前位置、最终目标。上下文窗口就那么大,装了细节就挤掉全局,顾了全局就丢掉细节。Cursor 认为这就是长时间运行的单 agent 会慢慢跑偏的原因,不是模型变笨了,是它的工作记忆被两头拉扯。
拆开之后,规划器的上下文里永远不会塞进实现细节,worker 的上下文可以百分百押在眼前这一小块活上。谁都不用劈叉。
Cursor 怀疑,蜂群的可扩展性主要来自这种上下文效率,而不是并行本身。这个判断我是服的,因为它顺带解释了另一个现象,哪怕任务不大,这么拆照样能提升表现,跟并行度关系不大。
报告里还引了经济学家科斯 1937 年那篇企业为什么存在。科斯的答案是,协调成本涨得比工作本身快,所以组织会长成边界清晰的层级,而不是所有人跟所有人直接对话。九十年前的论文拿来解释 AI 蜂群的组织结构,居然严丝合缝。
当然,光有分工理念跑不出这个分数,工程上的脏活才是大头。这部分我看得最过瘾,因为每一个失效模式,人类团队都眼熟。
先是脑裂。两个规划器互相不知道对方存在,在代码库两头用不同方式实现了同一个概念。旧版跑到最后长出 54 个 crate,Rust 里一个 crate 大致相当于一个独立的包,里面赫然有三个互不相干的 SQL 解析包。三拨 agent 各写各的 SQL parser,谁也不知道别人在写。新版从很早就稳定在 9 个 crate,之后再没涨过。
然后是大文件。有些文件天然是热点,谁都要往里加两行,又没有任何一个 agent 觉得瘦身是自己的责任,于是它越长越肥,传输慢,diff 慢,冲突全在它身上。新版的解法是让 worker 有权举报臃肿文件,一旦被标记就冻结新提交,派一个外部 agent 专门来拆。
合并冲突本身也有讲究。两个 agent 撞了车,按理说该先理解对方的意图再合并,但 worker 干不了这个,实践里要么把对方的改动直接覆盖,要么把自己的扔了。Cursor 的解法有点子牛逼,出冲突时召一个中立的第三方 agent 进场,它谁的活都不干,唯一的目标是公正高效地把这个冲突调解掉。相当于给蜂群配了个专职仲裁员。
最有意思的是僵化。agent 在人类代码库里被训练出一个习惯,核心代码别乱动。这在别人家做客时是美德,轮到自己从零盖楼就成了病,明明地基设计歪了,谁都不敢动。新版蜂群允许 agent 有意提交破坏性变更,改完留一条注释说明理由,然后让编译器把这次变更的冲击波传导出去,所有依赖旧设计的地方全部构建失败,每个撞上编译错误的 agent 会找到那条注释,理解动机,把自己负责的部分改到对齐。
用编译错误当广播系统。我愿称之为本次报告最佳设计。
还有一层保险是审查。Cursor 试了各种审查视角,有的看 worker 的完整对话记录,有的只看产出,有的只看代码库,还让审查者换模型、换个性。结论是没有任何单一视角能抓到所有问题,但一堆彼此低相关的视角叠起来,可靠性就能上去,跟自动驾驶不依赖某一个完美传感器是同个思路。而且审查的算力成本远低于被审查的工作,这笔钱花得非常划算。
好,工程细节先打住,回到钱上。

六种配置的总账单,从 1339 美元到 20057 美元,带星号的两根是非正式校准运行。图来自 Cursor 官方博客
四种搭配里,worker 至少吃掉 69% 的 token,多数运行里超过 90%。但钱的分布完全是另一回事。Opus 4.8 加 Composer 2.5 那组,Opus 作为规划器只产出一小部分 token,却占了差不多三分之二的成本。token 在 worker 手里,钱在规划器手里。

灰色是规划器的 token,橙色是 worker 的,几乎每种配置里 worker 都吃掉九成上下。图来自 Cursor 官方博客
这个倒挂说明,大型任务里真正需要前沿智能的环节其实很少。最初的任务拆解,关键的设计决策,几处艰难的取舍,就这些。一旦贵模型把不确定性收敛成一份清晰的指令,剩下的活便宜模型照着做就行。规划是奢侈品,执行是日用品。
还有个细节我建议多读两遍。Fable 5 当规划器那组,它的单 token 价格差不多是 Opus 4.8 的两倍,但规划账单反而更低,因为它用更少的 token 就把方案定了。听起来更强的规划器还更省钱,先别急。它带的 worker 消耗的 token 是 Opus 那组的好几倍,整场跑下来总账单 2234 美元,反而比 Opus 那组的 1339 美元更贵。
规划器的账单会骗人。规划的质量不体现在规划自己花了多少钱,体现在下游执行烧了多少。方案定得含糊,执行侧就得靠试错把含糊的部分填回来,那才是成本黑洞。这跟人类团队一模一样,省掉的设计评审,最后都变成加班。
那这跟手里没有几百个 agent 可指挥的普通开发者有什么关系。关系大了,这笔账的结构你今天就能抄。
第一件事,别再让最贵的模型干杂活。我自己也犯这毛病,图省心,什么活都丢给最强的模型,改个变量名也是它,跑个格式化也是它。看完这篇报告可以醒醒了。正确的姿势是让贵模型出方案,出一份写得足够清楚的方案,然后把执行换成便宜模型。Claude Code 和 Cursor 现在都支持规划和执行阶段分开选模型,这个开关不是摆设。
第二件事,把力气花在 spec 上。Cursor 在报告结尾说,这次实验里真正稀缺的资源是对意图的准确描述。835 页文档进去,一个数据库出来,蜂群像一台把意图逐层翻译成代码的编译器,只不过每一步都是概率性的。你写给 AI 的每一份需求描述,都是这台编译器的源代码。源代码写得含糊,编译产物就是垃圾,这个锅不该模型背。
第三件事,审查多开几个便宜的视角。与其让一个贵模型从头审一遍,不如让几个便宜模型从不同角度各审一遍,一个只看 diff,一个只跑测试,一个专挑安全隐患。低相关视角叠加比单个完美审查者靠谱,这是 Cursor 用真金白银验证过的。
哦对了,那个蜂群写出来的数据库是公开的,仓库在 github.com/cursor/minisqlite,solo Opus 4.8 那次运行的产出。Cursor 自己说初步看着不错,但还没做深入的人工分析,欢迎大家去挑毛病。我还没来得及细看,等翻完了有发现再跟你们汇报。
最后回到开头那两个数字。411 美元和 9373 美元,同一份活,中间隔着的不是模型代差,是一份清楚的分工和一份写明白的方案。模型一年比一年强,价格一年比一年卷,这些都轮不到我们做主。轮得到我们做主的,从头到尾只有一件事,把要干什么讲清楚。
船开得再快,罗盘不准也是白跑。