Kimi K2:460 万美元,赢了

小岛AI 2026 / 05 / 14

杨植麟录那个视频的时候,背景就是一堵白墙。

没有精心布置的书架,没有特意调的灯光,就那样坐在镜头前,40 分钟,把 Kimi K2 的整个训练过程平静地拆开说了一遍。我看完的第一个感受不是「牛」,是这个人好平静。

那种平静不是无所谓的平静,是一个做完了一件事的人坐在那里复盘的状态。就像你见过那种程序员,把一个真的跑通了的系统一行一行解释给你看,没有销售感,没有宣传感,就是在讲事情。

先说说他的来历。现在大家应该都认识了,但我还是有必要再过一遍,因为这段背景是理解后面所有东西的前置条件。

杨植麟,1992 年生,清华大学计算机系,本科班级第一。然后是卡内基梅隆大学博士,CMU,北美计算机学术排名顶级的学校之一。博士期间,他是 Transformer-XL(https://arxiv.org/abs/1901.02860)和 XLNet(<https://arxiv.org/abs/1906.08237)的共同作者,这两篇工作是 2019 年前后语言模型领域真正有分量的论文,不是那种发了就没人理的,是被大量后续工作引用、在工程上实际产生影响的那种。之后在> Google Brain 和 Meta AI 都做过研究员,然后回国创办了 Moonshot AI,也就是 Kimi(https://kimi.ai)。

这段履历讲完,我需要说一件事,他的背景确实牛,但更重要的不是「证明他厉害」,而是解释了一件事,为什么他能看到别人看不到的东西,为什么他会去做线性注意力这种在学术上早有讨论但在工程上很少有人真正落地的方向。


上周有一场 8 模型实时编程大战。

参赛的包括 Kimi K2、GPT-5.5、Claude Opus 4.7,还有几个其他主流模型。最终结果,Kimi K2 第一,GPT-5.5 第三,Claude Opus 4.7 第五。

这个排名发出来,一波「哇」是免不了的。AI 圈的评测排名隔三差五就有一个,各种模型自称在各种基准上超了各种人,大家看两眼就过了。但这次不一样的地方,在于旁边那个数字。

Kimi K2 的训练成本,460 万美元。这是杨植麟在视频里自己说的。

放几个参照数字。GPT-4 的训练成本,OpenAI 没有正式公布,但综合公开信息,大致在 1 亿美元量级。Meta 训练 Llama 3 系列,数亿美元的算力预算是行业普遍认知。一些相对「便宜」的开源模型,训练成本也普遍在千万美元级别。

Kimi K2,460 万美元,编程评测第一名。

好家伙。

我知道这个比较有一些不严谨的地方,训练成本包含很多变量,芯片型号、数据采购成本、人工调优的投入,不同团队的计算方式可能差很大。但就算留出足够的误差空间,这个数字跟行业均值之间的差距,已经不是换一种统计方法能解释掉的了。


那他们到底做了什么不一样的事?

杨植麟在那 40 分钟里讲了几个核心打法,我尝试用程序员能听懂的话翻译一遍。

第一个,线性注意力机制,linear attention。

标准的 Transformer 注意力(attention,也就是模型处理文字时,决定「每个词应该关注其他哪些词」的计算方式),计算复杂度是 O(n²),上下文长度翻倍,计算量是四倍,长 10 倍,计算量是一百倍。这对于处理长代码文件、长对话、大型 codebase 来说是个实实在在的瓶颈,上下文越长,烧掉的算力越夸张。

线性注意力把这个复杂度降到了 O(n),线性增长。上下文翻倍,计算量也翻倍,不是四倍。看起来只是一个符号的差距,工程含义是,同样的算力可以处理更长的上下文,或者处理相同任务只需要更少的算力。

你可以这样想,如果编程任务里需要理解一个几千行的代码库,标准注意力机制下,那个理解成本是随长度平方增长的,线性注意力下,那个成本是随长度线性增长的。做同样的事情,消耗的算力可以差一个数量级。

这个方向在学术界讨论了好几年,但「讨论」和「真的把它工程化落地在一个顶级大模型上并且在真实评测里打第一」,是完全不同的两件事。后者需要的不只是知道这件事在理论上可行,而是把每一个工程细节都做对,让它在实际训练里真的稳定、真的有效。

线性注意力与标准注意力的对比

第二个,子代理架构,sub-agents。

编程任务天然是层层嵌套的,一个稍微复杂点的需求里面,可能包含十几个子任务,接口设计、错误处理、并发控制、测试覆盖,每个都是独立的思考单元。让一个模型单线程一口气从头到尾做完,很容易前面做了后面忘了,或者在解决一个局部问题时把整体目标搞乱了。

子代理的思路是分而治之,主代理负责理解任务和拆解计划,把子任务分发给子代理并行处理,再汇总结果。这个架构方向在 Agent 领域不是新的,但能在真实的编程评测里做到 Kimi K2 这个效果,说明他们在协调机制、任务拆解、结果整合上做了很多工程打磨。

第三个,最难翻译的,「极致优化」。

这个词听着像口号,实际上是一种工程态度,具体表现在数据配比怎么选,学习率如何调,哪些计算路径可以用近似、哪些地方必须精确,每个超参数的调优都要有依据。就像写性能敏感代码,你要知道哪里有 cache miss,哪里有分支预测失败,然后一个一个去对付。

算力充裕的时候,你可以靠暴力解决很多调优问题,烧更多算力弥补优化不到位的损失。算力有限的时候,你必须更聪明,每一次前向传播都要用在最值得的地方。460 万美元能做到这件事,说明这种「极致优化」不只是态度,是真实落地在训练代码和工程流程里的。

三个东西组合起来,就是那个结果。

厉害了,真的。


我还想讲讲同期发生的另一件事,因为放在一起看,能看到一个更大的图景。

Ramp AI Index(https://ramp.com/leading-indicators/ai-index-may-2026)是一个追踪美国企业 AI 采用情况的报告,基于 5 万多家美国企业的实际付费数据。最新报告显示,Anthropic 在 B2B 企业 AI 采用率上,首次超越了 OpenAI,数字是 34.4% 对 32.3%。Anthropic 过去一年在企业市场的渗透率涨了四倍,OpenAI 同期只增长了 0.3%。

这件事放在两年前讲,没人会信。OpenAI 有先发优势,有 ChatGPT 的品牌效应,有和大量企业的既有合作关系,Anthropic 怎么可能追上来。

结果就这么发生了。The Decoder(https://the-decoder.com/anthropic-overtakes-openai-in-b2b-adoption-for-the-first-time-according-to-ramp-spending-data)在分析这件事时引用了 Ramp 首席经济学家的话,「我们从未见过如此动态的软件行业,新进者可以在数月内颠覆市场领导者,而技术的迭代速度压倒了传统的客户粘性。」

这句话放在 Kimi K2 的语境里,也是成立的。所有人还在讨论谁敢烧更多钱、谁有更大的算力集群,规则已经在悄然改变了。


这些东西跟我们有什么关系?

我知道大模型训练本身,跟大部分做 AI 应用的团队关系不大,你大概不会去自己训一个,你用 API,做 Agent,做工具,做工作流。但 Kimi K2 这件事有一个隐含的信号值得放进心里,就是,当一个只有顶级架构能力才能做到的东西被做出来,接下来它会被学习、被改进、被工具化、被扩散,然后渗透到下游应用的能力上来。

线性注意力做到了大规模工程可用,意味着会有更长上下文的 API、更低延迟的推理服务、更有效率的 Agent 框架在后面等着。你作为应用开发者,处理长代码文件、长文档、复杂推理链的成本会降低,能力上限会提升。

这个链条,每一层都在往下传导,速度比大多数人预期的快。

效率与智慧,而非蛮力

还有另一件事也想说。杨植麟那 40 分钟不只是在讲 Kimi K2 的架构,也是在讲一种做事方式,就是在资源有限的情况下把优化做到极致,把聪明用对地方,然后在一个大家都觉得「这需要很多钱」的赛道里,用更少的钱做出了不亚于甚至超过别人的东西。

这种思路本身是对「只要砸钱就能赢」这个逻辑的一次质疑。不是说钱不重要,钱当然重要,而是说,资源的限制有时候会逼出来一种纯靠钱堆不出来的架构智慧。


最后绕回那堵白墙。

坐在那里,40 分钟,把整个训练过程平静地讲清楚,对手也在看,竞争者也在听,他还是讲了。

我觉得那种平静是很贵的东西。不是「我们赢了所以我很淡定」的表演性平静,是一个对自己做了什么心里有数、愿意开放地把它讲清楚的人的平静,一种底气。

AI 行业里宣发的东西多得很,颠覆、重塑、超越,每个月都有,精心调了光的发布会也从不缺少。这堵白墙反而有点异类。

万能青年旅店有一首老歌,《揪心的玩笑与漫长的白日梦》,里面有一句「是谁来自山川湖海,却囿于昼夜厨房与爱」。在 AI 时代,算力就是很多团队囿于的那个「昼夜厨房」,你被限制在一个固定的资源上限里,只能在架构上想更多,在优化上做更多。

Kimi K2 的 460 万美元,也许是目前最实在的一个答案,说明这条路是走得通的。

那 40 分钟视频,Berry Xia(https://x.com/berryxia/status/2054733412846690443)的推文里有说强烈推荐,如果你正在做 AI Agent,或者在考虑 2026 年怎么入场大模型相关的赛道,确实值得存下来看。