Kimi K3 开源 2.8 万亿参数,但自己部署这条路基本被堵死了

小岛AI 2026 / 07 / 26

1.4TB。

这是 Kimi K3 全量权重压到四比特之后的体积。不是没压过的原始大小,是已经用 MXFP4 榨了一轮的结果。十六比特那版大概 5.6TB。

Moonshot 在 Kimi K3 的官方技术博客里写得很清楚,2026 年 7 月 27 日之前放出全量权重。放出来那一刻,它就是人类公开过的最大一份开源权重,2.8 万亿参数,没有之一。

这句话够刷屏了,今天明天所有号都会写「史上最大开源模型」。我想聊的是标题底下那张账单。对天天给模型搭脚手架的人来说,真正要算的从来不是参数量,是这玩意到底能不能落到你手里。

先把话放这儿。我的判断是,这次开源你大概率下不下来,下下来也跑不动,但它对你依然有用,只是有用的方式跟大部分人想的不太一样。

先拆两个数字,不拆开后面全是误会。

2.8 万亿是总参数量。但 Kimi K3 是 MoE 架构,Mixture of Experts,混合专家,人话讲就是模型里养了一大堆小专家,每个 token 进来只叫醒其中几个干活,剩下的躺着。官方博客给的数是 896 个专家里每次激活 16 个,折下来每个 token 真正参与运算的大概 500 亿参数。

所以 2.8 万亿描述的是这模型能装多少东西,500 亿描述的是它回你一句话要做多少次乘法。这俩是两回事,而且是差了将近六十倍的两回事。

好家伙,这个错位才是整件事的关键。

算力上它像个中等偏大的稠密模型,内存上它像头巨兽。前者决定它每生成一个 token 花你多少钱,后者决定你有没有资格把它开起来。绝大多数人看到 2.8 万亿的第一反应是「那得多贵啊」,其实贵的不是算,是养。

这也是为什么 Kimi 的 API 定价能开得那么好看。官方平台给的价是缓存命中的输入 0.30 美元每百万 token,未命中 3.00 美元,输出 15.00 美元。官方还说在编程类负载上缓存命中率能过 90%。你把这组数摆到一个「2.8 万亿参数」的旁边,会觉得哪儿不太对,其实一点毛病没有,因为它每步只烧 500 亿参数的算力。

但这只是硬币的一面。

硬币翻过来,是那 1.4TB 得一直躺在高速显存里,一个 token 都还没进来就得先躺好。这不是硬盘容量,硬盘 1.4TB 现在两百块钱就能买到。这是显存,是那种一张卡八万起步的东西。

粗算一下。按 80GB 一张的加速卡算,光装下权重就得十八张左右,还没给上下文和并发留任何余量。换成目前最新那代,一个节点八张卡、每张 192GB,加起来 1.5TB 出头,刚刚好把权重塞进去,然后基本什么都不剩。而 Kimi K3 是带 100 万 token 上下文窗口的模型,你真要用这个上下文,KV cache(把已经算过的注意力中间结果存下来,避免每生成一个新 token 都从头重算,代价是吃显存,而且吃得跟上下文长度成正比)还要往上叠。

Moonshot 自己在博客里的建议也很实在,推荐部署在 64 张以上加速卡的超节点配置上。

64 张。

不是我夸张,是官方原话。

按各类加速卡的显存容量直接折算,装下 1.4TB 权重最少需要的卡数,还没算上下文和并发的余量

然后是 MXFP4 这层,很多通稿会一笔带过,但它其实是一道暗门。MXFP4 是四比特浮点格式,带分块缩放因子,Kimi 从 SFT 阶段就开始做量化感知训练(quantization-aware training,训练的时候就让模型知道自己以后要被压成四比特,提前学着补偿精度损失,比训完再硬压效果好得多),激活值用的是 MXFP8。

这套组合能原生跑的硬件,主要是英伟达 Blackwell 那一代和 AMD 的 MI400。也就是说,这份权重从格式上就给硬件划了条地板线。你手上那堆前两代的卡,就算凑出 1.4TB 显存,也未必能舒服地吃下这个格式。Hugging Face 上已经有人写了一份关于这套量化方案的拆解,里面那句「四比特是压缩后的数字,不是原始数字」我觉得应该印在所有讨论这次开源的帖子顶上。

这里插一句我自己的偏见。我平时的活是给模型搭那层让它真正能干活的脚手架,工具链、调度、上下文预算这些,所以我对「纸面能力」和「上线能力」之间的落差格外敏感。这两个东西在小模型上差得不多,在这个尺度上,差的就是一整个机房。

所以「开源」这两个字,到这个量级上,需要被重新读一遍。

一份让你能下载权重的授权,和一套你能真正跑起来的服务,中间隔着的东西比大部分人想的远。小模型时代那条路,下权重、装 ollama、跑起来、爽,那条路在 1.4TB 面前直接断了。断得干干净净。

那这次开源到底开给了谁。

我的答案是,开给了那些本来就在机房里摆着一整排 Blackwell 的人。云厂商、推理服务商、少数几家真有 GPU 集群的大企业。TECHi 那篇从推理经济学角度算账的报道里有一句我觉得说得特别准,大意是这个尺寸的开源权重不会把能力推到边缘,只会把它挪给那些付得起钱让 1.4TB 一直保持温热的人。

授权书上写着人人可拥有,硬件在底下悄悄地把能真正行使这个权利的人筛回了原来那一小撮。

这话听着有点刺耳,但我不觉得这是在批评 Moonshot。他们的工程是真的漂亮,2.8 万亿参数还能把 scaling 效率相对 K2 提到大约 2.5 倍,这已经很牛了。我想说的是另一件事,我们得停止把「开源」自动读成「可及」。这两个词在前沿量级上已经悄悄分家了。

那对你我这种在公司里选型的人,这次开源还剩下什么价值。

我觉得剩下三样,而且都不小。

第一样,是议价权。你之前只能在闭源 API 之间挑,现在多了一个选项,同一份权重可以在好几家云上被托管,你可以横向比价、比 SLA、比数据合规。这不是「自己跑」,这是「换供应商的成本变低了」。听起来平淡,但对一个已经把产品压在某家模型上的团队来说,这个平淡的东西在续约谈判桌上很值钱。

第二样,是可审计。权重公开意味着第三方可以真的去测它、去拆它、去复现它的评测数字,而不是只能对着厂商发的柱状图点头。Moonshot 说的那些漂亮结果,比如让 K3 在 48 小时自主跑通一颗芯片设计、在 4 平方毫米里跑到 100MHz 和每秒 8700 token 的仿真解码吞吐,或者让它从零写出一个叫 MiniTriton 的编译器把 Triton 在部分负载上比下去,这些在权重公开之前都只是厂商的一面之词。公开之后,社区会去验。这件事对整个行业的健康度,比多一个能下载的文件重要得多。

第三样,是不会被断供。你的产品跑在一个开源权重上,厂商就算明天关停 API、涨价、或者把某个能力从模型里悄悄下掉,你手里还捏着一个可以搬走的东西。哪怕搬去别人的机房,也比什么都没有强。

不过这第三样得打个折。你把 Kimi K3 部署到某家云上,你依然是在别人的基础设施里跑别人托管的权重,你逃开的是单一厂商,逃不开的是「还是得租」。很多朋友可能没意识到这个区别,租一个开源模型和拥有一个开源模型,中间隔着一个机房。选型 PPT 里这两件事经常被折叠成同一格,实际运维起来完全不是一码事。

顺着这个再聊聊一个几乎没人提的东西,license。

到我写这篇为止,Kimi K3 的开源许可条款还没有公布。Moonshot 的说法是许可会跟权重一起发。

这事看着小,其实是全场最大的变量。「开源权重」这四个字在过去两年里被用得极其松散,从近乎 MIT 那种你随便拿去用的宽松授权,到只许研究不许商用、或者商用要按用户量分级申请的定制协议,全都叫开源权重。这两种对一个正在做技术选型的公司来说,是完全相反的两个结论。

所以这周如果有人跟你说「我们排期里加一个 Kimi K3 自部署方案吧」,你可以很温和地问一句,你看过它的 license 了吗。答案一定是没看过,因为那份文件现在还不存在。

我的建议很朴素,现在可以拿 API 做原型,验证它到底适不适合你的场景,但别急着把它写进架构文档里当既定事实。等 27 号那份许可落地了,读完再决定。先原型后承诺,别反过来。

具体到这周,我说三个不用等 27 号就能干的。

一是先用 API 把场景验干净。Kimi 的 API 平台上模型标识就是 kimi-k3,先花几十块钱把你手上那个最难缠的 case 喂进去,看它接不接得住。能力验证跟部署方案是两条独立的路,先走便宜那条。

官方给的单任务成本对比,横轴是每个任务花多少美元,Kimi K3 那条线在四美元档就够到了 72 分

二是把缓存策略提前想好。它的定价里缓存命中和未命中差了十倍,0.30 对 3.00。如果你的 agent 每轮都在重拼 prompt、把系统提示词和工具定义的顺序打乱,那 90% 命中率跟你没关系,你会实打实按十倍付钱。前缀稳定这件事,在这个价差面前值得单独排一个工单。

三是提前拉上能读许可条款的人。这不是工程师能一个人拍板的事,商用范围、下游训练限制、归属要求,这几项决定了你能把它放进产品的哪一层。27 号文件一出就有人能立刻读,比到时候临时抓人快得多。

我知道这话说出来有点扫兴。热点稿嘛,读者更想看的是「国产模型又赢了」或者「开源要变天了」这种情绪。但我一直觉得,一个真在生产环境里干活的人,价值就在于能在所有人喊「牛逼」的时候,冷静地把那张账单摊开看一眼。

那 Kimi K3 到底牛不牛。

牛。这点我一点不含糊。第三方跟踪机构这个月把它放在综合智能指数的第二到第三档,只落后 Claude Fable 5 和 GPT 5.6 Sol,在前端代码竞技场上还拿了第一。Moonshot 官方自己也很坦率,博客里直接写了整体表现仍然落后于那两个最强的闭源模型。厉害了,这种坦率在发布稿里挺少见的。

官方放出的编程类评测,蓝条是 Kimi K3,六项里两项排第一,其余几项紧贴 Fable 5 和 GPT-5.6 Sol

它还是原生多模态、带 100 万 token 上下文、能在 Kimi Code 里做长周期的工程任务。官方讲的那个天体物理案例我印象很深,让它复现 I-Love-Q 普适关系,它自己读了二十多篇论文、跑了三百多个状态方程、写了三千多行 Python,还揪出了已发表公式里的不一致,两小时干完一个有经验的研究者一到两周的活。

这些能力是真的。只不过能力和可及性是两条线,这次事件里,这两条线拉开的距离比以往任何一次都大。

还有一个容易被忽略的细节,Moonshot 说他们给 vLLM 社区贡献了一份适配 KDA 的前缀缓存实现,会跟模型一起放出来。vLLM 是现在开源推理栈里最主流的那个。也就是说这次开源不只是甩一堆权重文件出来,配套的推理侧工作也一起给了。对那些真有能力部署的团队来说,这比多几个百分点的跑分实在得多。棒棒的,这才叫认真开源。

坦率讲,我对 27 号这个日期本身也留着一点保留。开源时间表滑档不是什么新鲜事,往前数几年,说好某月放权重最后拖了两个月的例子有的是。所以在权重真的出现在 Hugging Face 上、许可条款真的能读到之前,所有讨论都还带着一个前提,这是一个承诺,不是一个已经交付的东西。

写到这儿我想起前几年那种感觉。那时候开源模型的意义特别朴素,就是你能在自己那台风扇呼呼响的机器上,把一个几十亿参数的东西跑起来,然后在深夜看着终端里一行行往外吐字,觉得这事儿是真的浪漫。

现在最前沿那批开源模型,已经跑不进任何一间卧室了。它们只能活在机房里,活在一整排价值数百万的加速卡上,活在电费账单里。

这不是谁的错,是尺度自己长成了这样。就像航海从独木舟走到了万吨货轮,你不能怪货轮不让人划着玩。但你得清楚地知道,你现在讨论的「开源」,跟你十年前理解的那个词,已经不是一回事了。

所以回到最开头那个数。

1.4TB,常驻,保持温热,随时待命。

这次发布里最不性感、也最诚实的一个数字就是它。谁付得起让它一直这样待着的钱,「开源」这两个字就是给谁的。

如果 Moonshot 27 号真把权重和一份公司敢签的许可一起交出来,那这个「谁」的范围会明显扩大一圈。

如果其中任何一样掉了链子,史上最大的开源模型,实际上还是属于那份本来就跑着一切的名单。

我们 27 号见。