Kimi K3 追到 Fable 身后了,而且它开源

小岛AI 2026 / 07 / 17

「全球最大开源模型」这个头衔,昨天换人了。

月之暗面发布 Kimi K3,总参数 2.8 万亿,上下文窗口 100 万 token,原生看图看视频,思考模式默认开着。官方口径是「全球首个开源 3 万亿级模型」,2.8 进位到 3,四舍五入这块拿捏得相当熟练。

跑分先快进一遍,毕竟你在别的号大概已经刷过了。GDPval-AA v2,一个拿 44 个职业、9 大行业真实工作任务考模型的基准,K3 拿了 1687 分,全球第三,前面只剩 Claude Fable 5 Max 的 1815 和 GPT-5.6 Sol Max 的 1747.8,Claude Opus 4.8 的 1600 被它压在身后。另一个专考长程知识工作的 AA-Briefcase,它干脆爬到了第二,1527 分,把 GPT-5.6 Sol Max 都挤下去一位。Axios 的报道用的词是 stuns,外媒给它贴的标签是「Fable 级体感」。

GDPval-AA v2 榜单前四,Kimi K3 是其中唯一的开源模型

一个开源模型,坐进了全球前三的牌桌。放两年前你敢信。

通稿部分到此结束。我今天想聊的是另一件事,这次发布里有个细节,大部分报道一笔带过了,但我觉得它比跑分有意思得多。

发布是 7 月 16 号。kimi.com 当天能用,App 能用,API 能用,Kimi Code 能用。唯独权重,要等到 7 月 27 号才放出来。

也就是先官宣「全球最大开源模型」,过 11 天再真的开源。中间正好卡着上海的世界人工智能大会。怎么说呢,发布会的档期艺术,和模型能力一样,都是练出来的。

我不是要阴阳这个操作,发布节奏是人家的自由。我想抠的是「开源」这两个字本身。这两年它越来越像一种发布会修辞,谁都在说,但每家说的都不是一个东西。所以趁着 K3 这波,把这个词拆开看看,对屏幕前写代码的你,一个 2.8 万亿参数的开源模型,到底开的是什么。

先泼一盆最冷的水。就算 27 号权重真的挂上来了,你打算用什么跑?

官方技术文档推荐的部署配置,是 64 个加速器起步的超节点。K3 是个稀疏 MoE 模型,MoE 就是混合专家,整个模型由 896 个「专家」子网络组成,每次推理只叫醒其中 16 个干活。听起来很省,算力上确实省,但显存一点不省,因为你不知道下一个 token 会叫醒哪 16 个,所有专家的权重都得在卡上待命。哪怕用上官方的 MXFP4 量化,就是把权重压到 4 位浮点、体积砍到原来四分之一的那种压法,2.8 万亿参数落到显存里还是 1.4TB 这个量级。

你家里那张 4090,24GB。中间差着两个数量级。

跑不动。不是优化一下就能跑的那种跑不动,是物理上跑不动。

所以「全球最大开源模型」这个头衔里,「最大」和「开源」两个词,对个人开发者其实是互相抵消的。模型越大,开源里「你可以自己跑」的那层含义就越稀薄。K3 的权重下载下来,对你我而言更像一个可以审计、可以研究、可以引用的文物,而不是一个能塞进自家机器的工具。

那这次发布里真正跟你有关的是什么?我的答案是那张价格表。

API 定价,缓存命中的输入 2 元人民币每百万 token,未命中 20 元,输出 100 元。这里的缓存指 prompt 缓存,同一段上下文反复发给模型时,命中缓存的部分按一折收费。官方说编程场景的缓存命中率超过 90%。

Kimi K3 API 三档定价,缓存命中与未命中差着 10 倍

我平时的工作就是给模型搭脚手架,让 agent 真正能干活的那层工程,所以天天盯 token 账单。一个 agent 干活的真实开销,大头从来不是新内容,是同一份系统提示、同一堆工具定义、同一段对话历史,每一轮都原样重放一遍。缓存命中率 90% 的编程场景,实际输入成本就是标准价的一折附近。这张价格表不是给聊天用户设计的,是照着 agent 时代的消耗结构设计的。

好家伙,跑分打的是 Fable 5,收费对标的却是白菜价,这个组合才是真正的杀招。

技术上也有几个值得工程师多看一眼的点。K3 用了自研的 Kimi Delta Attention,一种混合线性注意力,把百万 token 上下文下的解码速度拉快了 6.3 倍。还有个叫 Attention Residuals 的东西,官方说它是残差连接的即插即用替代品,训练效率提了大概 25%,额外开销不到 2%。整体扩展效率比上一代 K2 高了 2.5 倍左右。这些数字单看都不炸裂,但堆在一起你会发现,这家公司在「怎么把巨型模型训得起、跑得快」这条工程线上,是真的有点子牛逼。

顺着 K2 说两句,这也是我一直追着 Kimi 写的原因。

五月份 K2 出圈,靠的是 460 万美元的训练成本,穷训练打出富效果,大家津津乐道的是性价比叙事。之后是 Cursor Composer 2.5 被扒出底座和 K2.5 同源,再之后 Devin 的新模型 SWE-1.7 直接官宣建在 Kimi 上。海外一线 AI 编程产品,拿中国开源权重当底座,拿回去自己做后训练,这条路已经被反复验证过了。

现在回头看 K3,你会发现叙事完全换了。460 万美元的故事是「花小钱办大事」,2.8 万亿参数的故事是正面军备竞赛。同一家公司,两个月,从省钱人设切到规模对轰,这个转身背后是很清楚的判断,开源模型已经不满足于当闭源的平替,它要的是牌桌上的正座。

这也回答了一个问题,既然个人跑不动,那放权重给谁看?

给云厂商和推理服务商,权重一开放,托管这个模型的就不止月之暗面自己,各家会竞价,价格会被继续往下卷。给做产品的公司,Cognition 和 Cursor 的先例摆在那,拿到权重就能做深度定制,这是闭源 API 永远给不了的。给研究者和做蒸馏的团队,蒸馏就是拿大模型当老师教小模型,2.8 万亿参数的老师开放出来,整个开源生态的天花板都会被抬一截。

权重开放买的从来不是「人人都能跑」,是生态位。个人开发者在这个局里的角色,不是下载权重的人,是享受价格战的人。

坦率讲,它也没赢麻。官方自己都承认,整体水平还是落后 Claude Fable 5 和 GPT-5.6 Sol,在 FrontierSWE、DeepSWE 这类最硬的软件工程基准上差距依然明显。「Fable 级体感」是体感,不是追平。而且思考模式默认拉满,深度任务的延迟和账单什么样,得等大规模真实使用之后才见分晓,我暂且保留怀疑。

但第三名的跑分,加上开放的权重,加上一折的缓存价格,这三件事组合在一起的杀伤力,比任何单独一项都大。跑分第一的模型不开源,开源的模型跑不进前三,便宜的模型上不了强度,过去这个三角一直是稳的。K3 是头一个同时往三个角上都伸手的。

所以你看,追到 Fable 身后这件事,最狠的部分真不是 2.8 万亿参数。参数是吨位,吨位你我反正开不动。最狠的是它把「开源」从一种姿态做成了武器,官宣抢头条,权重定档期,价格清场子,一套动作行云流水。

7 月 27 号权重上线,才是这场发布真正的第二幕。到时候各家托管价格一出来,这张牌桌会更热闹。我先把 Kimi Code 排进待试清单了,试完再来跟你汇报。