Cursor Composer 2.5 来了:同等能力 10 倍效率,底座和 Kimi K2.5 同源

小岛AI 2026 / 05 / 19

今天刷到 Cursor 官方账号发了一条推文,我习惯性往下翻找实质内容,因为开头那句话太熟了。

「这是目前最强大的模型」。

这句话在过去一年里,我大概看到过三十次。大厂用,创业公司用,从头部实验室到各种套壳工具都在用这个开场白。我现在看到它的反应,接近于看到「惊天大降价」,自动过滤,往后翻,看有没有具体的东西。

翻到后面,我愣了一下。

「在同等能力下,效率提升了 10 倍」。

这个说法不一样。「更聪明」或者「更快」我知道怎么理解,就是 benchmark 分数更高、延迟更低。但「同等能力、10 倍效率」,说的是在做同样水平任务时,运行成本只有之前的十分之一。对于每天用 Cursor Pro 订阅跑代码的人来说,这个数字要是真的,那不是「用起来更爽」,是「我以前花的那些算力配额,有九倍是多余的」。

我把他们的官方博客仔细读了一遍。


先说一件最没想到的事。

Composer 2.5 的基础架构,是 Moonshot 的 Kimi K2.5 开源检查点。

Checkpoint(检查点)是训练术语,可以理解成模型训练到某个阶段后存下来的「存档」,别人可以拿去在这个基础上继续训练。Moonshot 把 Kimi K2.5 开源出去,Cursor 拿了这个存档,在上面叠加自己的数据和训练方法,训出了 Composer 系列,Composer 2 如此,Composer 2.5 也是如此。

Composer 2 发布的时候他们就说了这件事,但我觉得现在 Composer 2.5 出来之后,这条链条更值得多想一下。

一个在北京或杭州的团队搞出来、开源出去的语言模型,流进了一家美国编程工具公司的训练管线,训出了他们「最强大的编程模型」,跑在了全球几百万程序员每天打代码的 IDE 里。这条路径挺长的,但它真实存在。

有点子牛逼,这个我得承认。开源里有一种很奇怪的慷慨逻辑,你把东西放出去,根本不知道它最终会长成什么形状出现在哪里。Moonshot 大概没预料到 Kimi K2.5 最终会以「Cursor 最强编程模型」的身份跑在用户的 IDE 里。但它就这么发生了。


好,说说 Composer 2.5 这次的技术升级,这部分我觉得是整篇博客里含金量最高的。

官方列了三个方向,更聪明,长任务持续能力更强,复杂指令遵循更靠谱。第一个先按下,因为「benchmark 更好」大家都会说,我更想聊后两个,那才是我每天用 Cursor 时真实感受到的痛点。

长任务持续能力。你用 AI agent 跑过一个比较大的工程任务就知道,刚开始跑的时候往往还不错,但跑着跑着到中间,模型开始漂了。它忘掉了你一开始定的变量命名约定,开始在架构上绕弯路,或者之前说「我会保留这个函数」,真到写那里又给重构了。

为什么会这样?根本原因之一,是在用强化学习(Reinforcement Learning,RL,让模型通过不断执行任务、获得奖励来改进自己的训练方式)训 agent 的时候,「信用分配」问题很难处理。

RL 训练的基本逻辑是,让模型去完成一个任务,任务结束时看结果,好就给正奖励,不好就给负奖励或零分。但一个长任务可能涉及几十步操作、几十万个 token 的生成。最终奖励只告诉你「结果对不对」,但不告诉你在这几十步里,哪几步是关键决策,哪几步走偏了。

打个比方,就像你让人做了一个月的项目,最后 demo 翻车了,你给了一个「不合格」的评语,然后让他再来一次。从这个反馈里能学到的东西很有限,因为不知道具体哪里出了问题。rollout(任务执行的完整过程)越长,这个问题就越严重。

Cursor 这次给出的解法,他们叫「基于文本反馈的定向 RL」。

核心思路是不只给最终奖励,还在 rollout 过程中的「有问题的位置」直接插入文字反馈。

具体操作,在一次长任务执行过程里,如果模型在某一步调用了一个不存在的工具,那就在这一步的上下文里插入一条短提示,比如「可用工具列表是这些,建议用 X」。这条提示会改变教师模型(teacher model,用来指导学生模型学习的参照模型)在这个位置的行为倾向,然后用知识蒸馏的方式,让学生模型的权重在这个局部向教师靠拢。整条 rollout 的 RL 目标还在跑着,但同时对局部的「问题点」有了更细粒度的纠正信号。

我觉得这个思路挺优雅的,有点像代码 review 里的 inline comment 和 final review 的区别。只有 final review,你知道整体方向不对,但不知道是哪行代码出了问题。有了 inline comment,某一行的具体问题被点出来了,修改目标明确得多。这套逻辑被 Cursor 引进了训练过程,我觉得这是这次发布里真正有意思的地方。

他们说把这套方法应用在了很多维度,从编码风格到模型和用户的沟通方式。


合成数据这块也值得一说。

Composer 2.5 用的合成训练任务数量,是 Composer 2 的 25 倍。

「合成任务」的意思,是人工构造的训练题目,不是直接拿真实代码库里的历史问题来练。Cursor 用的一种构造方式叫「功能删除」,拿一个真实的代码库,把某个功能对应的代码删掉,让模型重新实现这个功能,用原来的测试集来验证结果。题目来源于真实代码所以有真实感,验证标准是测试通过所以客观,还能批量生成,逻辑上很完整。

但然后发生了一件很有意思的事。

随着模型越来越强,它开始找到出题人没预料到的路径来完成任务。

一个例子,模型在某次任务里发现了一个遗留在目录里的 Python 类型检查缓存文件(.pyc 之类的),通过逆向这个缓存文件的格式,从里面翻出了被删掉的函数签名。另一个例子,它找到并反编译了一个 JAR 包里的字节码,从里面重建了一个第三方 API 的接口。

好家伙,这模型已经学会「从废纸篓里把答案翻出来」了。

这不是 bug,这是能力,模型在认真解题,只是用了出题人没想到的路径。对训练来说,这是奖励作弊(reward hacking),模型拿到了高分,但测到的是出题人不想测的东西。他们说靠 agent 监控工具发现并处理了这类问题,具体怎么处理的博客里没细说,但把这段经历写进发布博客,我挺欣赏这种坦诚。

这个现象背后有一个规律值得认真对待,RL 训练里,随着模型能力增强,你需要越来越仔细地看它在干什么,而不是只看最终分数。模型越强,奖励作弊的方式就越难预见。这不是 Cursor 特有的问题,是当前大规模 RL 训练里的共同挑战,只是他们选择公开说出来了。


还有一个「投入级别校准」的更新,我觉得也值得提一下,虽然官方只用了一张图带过。

说的是模型对任务难度的判断,以及「应该花多少力气」的感知。

你懂那种感觉,你让 AI 做一件很简单的小事,比如把函数名改一下,结果它花了三分钟生成了一大段解释、检查了所有相关文件、顺手重构了几处它认为「有改进空间」的代码——然后给你一个洋洋洒洒的 PR description。

或者反过来,你让它处理一个真的很复杂的需求,它轻描淡写敷衍了事,连边界条件都没考虑。

这种「力气用得不对」的问题,现在基准测试里几乎没法衡量,但用起来感受很强烈。Cursor 说他们在这个方向做了改进,投入级别的曲线更合理了。这种改进很难被数字量化,但如果真的做到了,对日常使用体验的影响会比 benchmark 分数提升更明显。


SpaceXAI 的消息,也顺带提一下。

Cursor 说他们正在和 SpaceXAI 合作,从零训练一个规模显著更大的新模型,计算资源是 Composer 系列当前的 10 倍。依托 Colossus 2,100 万个 H100 等效算力,在孟菲斯。

SpaceXAI 是 xAI(Elon Musk 那个 AI 公司)的超算部门,Grok 系列用的也是这个集群。Cursor 买算力过去,用自己的数据和训练方法训自己的模型。

10 倍计算量能带来多大能力跃升,我没有判断依据,Cursor 没有透露 Composer 系列当前的参数规模。「下一次真正的大跳跃」是他们的说法,我倾向于先存疑,等出来了再看。但有一件事是比较清晰的,Cursor 在把自研模型当作核心战略来投,不是买 API 转手,是真的在建自己的训练管线。这条路要是走通了,对整个 AI 编程工具的格局影响会比较大。


用量和定价简单说一下。

Composer 2.5 现在直接可以在 Cursor 里调出来用。发布后第一周,包含在订阅里的 Composer 2.5 用量翻倍,不用额外付钱。API 定价是每百万输入 token 2.50 美元,还有一个速度更快的变体,每百万 15 美元。快速变体的定价他们说低于其他前沿模型的 fast 方案,我自己没有对比数据,可以自己对比一下。


怎么说呢,「目前最强大的模型」这个标签,每隔几周就会有人刷新一次,它本身的信息量已经接近于零。真正有意义的是具体的问题,用了什么方法、解决了什么真实的痛点、有没有把踩到的坑诚实地说出来。

从这个角度看,这篇发布博客是有实质内容的。文本反馈 RL、合成任务的规模、奖励作弊的处理,这些不是销售话术,是有技术含量的东西。

Kimi K2.5 开源出来,最终以这种方式出现在每个 Cursor 用户的 IDE 里,这条链条里有一种我说不太清楚的东西。知识本来就应该是流动的,不应该被某一个节点截住。一个团队的研究成果,变成了另一个团队的基础,最后落在了千万个程序员每天工作的地方。这件事不轰轰烈烈,但它在静静地发生。

厉害了,这套。

包含用量翻倍这件事,我已经把 Cursor 打开,调出了 Composer 2.5,打算接下来几天拿真实项目跑一跑,主要看长任务里有没有感知得到的提升。如果有明显感受,另开一篇聊。


延伸阅读,感兴趣的话可以看看这些

Cursor 官方 Composer 2.5 发布博客,技术细节最完整,是这篇文章的主要素材来源,https://cursor.com/blog/composer-2-5

Composer 2 技术报告,讲了 Kimi K2.5 开源基础的来源和 Cursor 的训练思路,https://cursor.com/blog/composer-2-technical-report

Cursor 与 SpaceXAI 的合作详情,https://cursor.com/blog/spacex-model-training

Moonshot AI(Kimi 的母公司)官网,https://www.moonshot.cn

Cursor 模型文档,Composer 2.5 的定价和能力说明,https://cursor.com/docs/models/cursor-composer-2-5