Devin 新模型 2 美元一次追平 GPT 5.5,底座是 Kimi

小岛AI 2026 / 07 / 10

做 Devin 的那家 Cognition,今天凌晨发布了他们迄今训过的最强模型 SWE-1.7。跑分确实硬,自家的 FrontierCode 1.1 基准上拿了 42.3%,几乎贴着 GPT 5.5 的 43.0%,单次任务平均成本却只要 2 美元上下,大概是 Opus 4.8 的五分之一。

但跑分不是这篇博客最劲爆的地方。最劲爆的是第二段里一句写得特别平静的话,SWE-1.7 是从 Kimi K2.7 基座训出来的。

美国最出圈的 AI 编程公司,自家历史最强的模型,底座是月之暗面的开源模型。这句话搁两年前,你敢信。

Cognition 官方发布图,SWE-1.7

先把背景铺一下。Cognition 就是 2024 年靠 Devin 一夜刷屏的那家,当时号称第一个 AI 软件工程师,演示视频被扒出剪辑痕迹,挨了整整一年的骂。后来他们闷头把产品做扎实,又把 Windsurf 收了,慢慢从「演示驱动型公司」变成了真有用户、真有场景的 agent 公司。但在很长时间里,Devin 底下跑的都是别人家的模型,他们自己的定位更像是我干的这行,给模型搭脚手架的,工具链、沙箱、调度、上下文管理,让模型真正能干活的那层工程。

现在这家搭脚手架的公司,训出了一个逼近前沿的模型。而且训练思路跟传统前沿实验室完全不是一个路子。

先看数字,三个基准的成绩单我直接搬过来。

基准SWE-1.7Kimi K2.7 CodeGPT-5.5Opus 4.8
FrontierCode 1.1 Main42.3%30.1%43.0%46.5%
Terminal-Bench 2.181.5%72.7%84.2%86.9%
SWE-Bench Multilingual77.8%73.5%76.8%84.4%

几个信息一眼就能读出来。第一,Opus 4.8 还是老大,三个基准全压着打,前沿实验室的排面还在。第二,SWE-1.7 跟 GPT 5.5 基本咬平,FrontierCode 差 0.7 个点,SWE-Bench Multilingual 反超一个点。第三,也是我觉得最有意思的,它比自己的基座 Kimi K2.7 Code 整整高出 12 个点。

12 个点是什么概念。FrontierCode 是 Cognition 自己出的编码基准,专门收拾那些在 SWE-Bench 上刷到饱和的模型,题目是真实世界的高难度工程任务,上一代 SWE-1.6 在上面只有 9.4%。从 9.4 到 42.3,一代之间从垫底跳到前沿,而这中间他们没有从零预训练任何东西,全部增益来自 RL 后训练,就是让模型在真实任务环境里反复试错,做对给奖励,做错给惩罚,一轮一轮把行为磨出来的那套训练方法。

FrontierCode 1.1 Main 各模型得分,SWE-1.6 到 SWE-1.7 一代跳了 33 个点

这里有个业内流传挺广的说法,叫后训练天花板。大意是一个基座模型的能力上限在预训练阶段就定死了,后训练只能把已有的能力激发出来,压榨空间有限,尤其是基座本身已经被原厂做过大量 RL 之后,二道贩子再训收益会很薄。Kimi K2.7 恰恰就是一个被月之暗面自己重度 RL 过的模型。按天花板理论,Cognition 在上面继续训,应该没多少油水了。

结果人家硬是又榨出 12 个点。官方博客原话说得也不客气,这个结果挑战了后训练天花板的说法,RL 能把能力推得比此前认为的远得多。

同一个基座,RL 后训练前后在三个基准上的差距

怎么做到的,博客里给了四大块技术细节,我跟你说,这部分写得相当实在,不是那种发布会 PPT 水平的东西,是真把工程细节摊开了讲。我挑几个看完印象最深的,尽量用人话讲。

第一个是熵坍缩的处理。RL 训久了有个经典毛病,模型越训越保守,不再探索新路子,奖励曲线几百步就躺平,行话叫熵坍缩。Cognition 找到的一个关键原因藏在采样细节里,那些概率极低的 token 一旦被采出来,往往来自已经跑偏的轨迹,拿到低奖励之后,梯度更新反而会让本来就占优的 token 更占优,分布越来越尖,探索空间越缩越小。他们的解法是用 top-p 采样直接不让这些低概率 token 被采出来,再配合一个叫采样分布回放的技巧解决训练和推理分布对不上的问题。修完之后,整轮训练熵基本恒定,想深挖的可以去看他们引的熵坍缩论文DeepSeek-V3.2 的技术报告

第二个是跨集群训练,这块看得我有点子牛逼。Cognition 没有 OpenAI 那种十万卡连成一片的超级集群,那玩意是稀缺资源,轮不到一家创业公司。但 RL 有个天然的好性质,只有做梯度更新的 trainer 必须待在一个高带宽集群里,负责生成训练轨迹的推理引擎是自包含的,扔哪儿都能跑,只要拿到最新权重。于是他们把训练铺到了三大洲四个数据中心,自有 GPU 加上 Fireworks 这种推理供应商的算力混着用。权重同步不传全量,每隔几步算一个压缩过的权重差量,体积砍掉 99% 以上,通过云对象存储分发。最后的效果是 1T 参数模型的跨大洲权重更新,端到端 1 到 2 分钟完成,推理侧只停 3 到 4 秒。

好家伙,别人拼谁的集群大,他们拼的是怎么把散落全球的小集群缝成一台机器。穷有穷的打法,而且这个打法是可复制的。

第三个是长任务的自压缩,这个设计我个人最喜欢。agent 干长活有个绕不开的墙,上下文窗口装不下。任务干到一半,几十万 token 的操作历史把窗口塞满了,后面还有一半活没干完怎么办。他们的做法是训练模型自己写工作摘要,快到上限时让它总结当前状态,然后从这份自己写的摘要恢复接着干。妙的地方在于这是端到端训出来的,模型同时学会两件事,把摘要写得信息密度更高,以及更擅长从摘要恢复工作。这个思路他们最早在 Kevin-32B 上验证过,这次靠它把单条训练轨迹拉到了最长 6 个小时。一个模型连续干 6 小时的活,中途自己给自己写交接文档,想想这个画面。

第四个是数据质检,看着最不性感,我怀疑反而是贡献最大的。他们把每个训练任务过一遍自动化执行测试,把验证器会误判的任务筛出去,把模型要么必做对要么必做错的任务也筛出去,只留那些模型偶尔能做对的,因为只有这种任务有学习信号。防作弊做得更狠,沙箱断网、剥掉 git 历史、评分路径和 agent 隔离,只要检测到作弊企图,不管有没有得逞,整条轨迹直接判零分。

为什么我说数据质检可能贡献最大,因为它直接解释了这个模型训出来的性格。博客最后一节讲行为差异,SWE-1.7 跟基座 Kimi K2.7 比,动手之前会把代码库摸得透得多,工具调用、文件读取、搜索的次数甚至比 Opus 4.8 和 GPT 5.5 还多。修 bug 的时候更倾向于追根因,主动考虑边界情况和对抗输入,遇到语义模糊的地方,它会写个小脚本跑一下验证,而不是猜。

你想想看这个因果链。训练数据里的假阳性被清干净了,糊弄式的解法骗不到奖励,模型慢慢就学会了只有真正端到端解决问题才有饭吃。所谓的严谨,不是 prompt 里写出来的,是被奖励函数逼出来的。

当然也有代价,博客里也没藏着。这模型想得多,做得也多,改动范围比任务实际需要的大,会顺手写额外的测试、碰更多的文件。用过重度推理模型的朋友大概都有体感,你让它修个小 bug,它给你把周边三个文件都重构了。Cognition 说这是全行业的一致趋势,推理越多,手伸得越长。这毛病他们下一步想治。

模型已经在 Devin 全线上线了,走 Cerebras 的推理,1000 tok/s,就是每秒吐一千个 token,正常人阅读速度的一百多倍,agent 场景里这个速度差不多消灭了等待感。

事实讲完了,聊聊我自己的看法。说实话有些判断我也不确定,就当 lunch 桌上的闲聊。

这件事对前沿实验室的护城河,是一次挺实在的敲打。以前的叙事是,想要前沿能力就得从预训练开始烧,几十亿美金起步,这道墙把 99% 的公司挡在外面。现在 Cognition 展示了另一条路,拿一个足够强的开源基座,配上一流的 RL 工程和数据质检,在垂直领域怼到前沿水平,成本还只有五分之一。墙没塌,Opus 4.8 依然是天花板,但墙上被凿出了一个洞,而且凿洞的方法是公开发表的。

对开源基座生态,这是一个标志性时刻。Kimi、DeepSeek、GLM 这批中国开源模型,正在变成全球 AI 应用层的地基,有点像当年的 Android,谷歌造系统,全世界的厂商在上面盖楼。这次盖楼的是美国最头部的编程 agent 公司,盖出来的楼还真到了前沿高度。顺便说一句,SWE-1.7 训练里用的交替长度惩罚,参考的也是 Kimi K2.5 的论文,采样分布回放来自 DeepSeek。楼上楼下,已经开始互相借设计图了。

对我们这种写代码的普通人,选型逻辑也在变。以前选编码模型基本就是在两三家前沿实验室之间挑,现在多了一类选手,垂直领域专训模型。它们通用能力不一定顶尖,但在自己的赛道上性价比可以做到很吓人。而且这类模型会越来越多,因为 Cognition 把方法论写得太明白了,原文FrontierCode 基准都值得一读,做 agent 方向的朋友建议认真读,普通用户扫一眼跑分表就行。

最后还有一层,是我自己干这行的私心感受。SWE-1.7 是直接在 Devin 的生产环境里训练的,模型跑在真实的沙箱里、用真实的工具链、面对真实的超时和报错。换个角度看,Cognition 真正的壁垒可能从来不是模型,而是那套花了两年多在生产环境里磨出来的脚手架,几百万次真实任务淌过的沙箱、验证器、评分管线。模型谁都可以拿 Kimi 训,这套东西没地方下载。

怎么说呢,两年前所有人都觉得,模型是皇冠,工程是打杂的。现在做工程的那批人,拿着开源的皇冠毛坯,自己雕出了一顶。

浪往哪边打,说不太准。但船底下的水,肉眼可见地在变深。