Ling-3.0-flash 激活只有 5.1B,但它真不是小模型
昨晚 21 点 41 分,蚂蚁百灵把 Ling-3.0-flash 放了出来。
数字确实好看。总参数 124B,是上一代 1T 级旗舰 Ring-2.6-1T 的 12.4%;每个 token 的激活参数只有 5.1B,是 Ring 的 8.1%。然后在大多数榜单上,它对标甚至超过了那台 1T。

这种「十分之一的体量打平上一代旗舰」的叙事,今年已经出现过很多次了,我一开始也是快进着看的。真正让我停下来的是架构那一段里的三个字母。
KDA。
如果你也在追这半年的模型架构,看到这三个字母应该会有一点微妙的感觉。KDA 的全称是 Kimi Delta Attention。是月之暗面的东西。
好家伙。
蚂蚁这台机器上,有两个零件是月之暗面的
先说清楚 KDA 是什么,不然后面聊不动。
传统的 attention(注意力机制,模型决定「读到这个词的时候该回头看哪些词」的那套算法)有个天生的毛病,每生成一个新 token,它都要回头把前面所有 token 再看一遍。上下文越长,每一步就越慢越贵,是平方级往上涨的那种贵。
线性注意力想解决的就是这个。它不回头翻全书,而是维护一个固定大小的记忆状态,边读边往里面记笔记,该忘的忘掉,该留的留住。代价是这个笔记本容量有限,写得不好就会把关键信息挤掉。
KDA 的贡献在于把「怎么忘」这件事做细了。它是在 Gated DeltaNet 的基础上,把原来那个标量衰减因子换成了一个向量,摊成对角矩阵,于是记忆状态里的每一个特征通道都有了自己独立的遗忘速率。变量名可以死死记住,上一句的语气词可以立刻扔掉,不再是一刀切地整体打折。这套东西写在月之暗面今年那篇 Kimi Linear 里,论文和代码都是公开的(https://arxiv.org/abs/2510.26692 ,仓库在 https://github.com/MoonshotAI/Kimi-Linear )。
Kimi Linear 自己的用法是 KDA 和全注意力按 3:1 交替堆。也就是每四层里留一层「回头看全书」的兜底。
Ling-3.0 的比例是 5:1,每六层里五层 KDA 加一层 MLA。
比原作者更激进。
我盯着这两个比例看了一会儿。3:1 到 5:1 听着差得不多,但线性层占比从 75% 提到了 83%,长上下文那部分的开销是实打实往下掉的一档。蚂蚁敢这么押,官方给的理由是「原生」两个字,上一代 Ling-2.6 是靠架构迁移改造出来的,先按老架构训一版再往线性上搬;Ling-3.0 从预训练第一步就是混合线性,所以整条链路的组件是在同一个训练周期里互相适配长起来的,不是后期硬接的。
这个区别我觉得比比例数字本身重要。改造出来的混合架构,你会发现它总有些地方别扭,像给一辆已经装好的车换悬挂,能跑,但调不到最舒服那个点。原生训的没有这个历史包袱。
然后是第二个零件。
再往下读到「响应快」那一节,官方说长会话的 TTFT(time to first token,从你按下回车到吐出第一个字的延迟)降了 60% 到 80% 以上,靠的是 SGLang HiCache 加 Mooncake 的分级缓存。
Mooncake 也是月之暗面的。
它就是 Kimi 自己的推理服务平台,一套以 KVCache 为中心的分离式架构,把集群里那些闲着的 CPU、内存和 SSD 拼成一个共享的 KV 缓存池。论文在 https://arxiv.org/abs/2407.00079 ,代码开源在 https://github.com/kvcache-ai/Mooncake 。
所以你把这台 124B 拆开看,负责「怎么记住长上下文」的注意力机制来自月之暗面,负责「记住的东西存哪儿、下次怎么捞回来」的缓存底座也来自月之暗面。蚂蚁往里面填的是自己的数据、自己的 MoE 稀疏策略和自己那一万多个 Agent 训练环境。
巧的是就在这几天,据 The Decoder 报道,英国 AI 安全研究所联合美国那边发了份评估,说 Kimi K3 在 ExploitBench 上拿了 32.2%,落后美国前沿模型的 76.2% 一大截。中文圈那两天讨论的基本都是这个落差。
结果同一个星期,另一家的新旗舰在用它的注意力和它的缓存。
我不知道该怎么形容这件事。基础设施这东西,声量和影响力经常是脱钩的。你在榜单上的名次和你在别人机器里的存在感,是两回事。
现在说那三件被吃掉的事
上面聊的是我觉得好玩的部分。下面这三件,是我看完官方原文之后觉得必须说一下的,因为它们全都明明白白写在里面,但传出来的过程中被压成了一句「蚂蚁开源了个 124B 小模型,激活只要 5B,性能打平 1T」。
这句话里,三个词有问题。
先说「小」。
激活 5.1B 是真的,它决定的是单次推理要算多少浮点运算,也就是吞吐和延迟。但决定你能不能把这玩意儿装进机器的,是总参数量 124B。
124B 参数按 BF16 存,光权重就是 248GB 出头。就算量化到 INT8 也要 124GB,INT4 压到 62GB 左右,再加上 KV cache 和运行时开销。一张 80GB 的 H100 装不下 BF16 的它,得多卡。

激活参数少,省的是每一步的算力;总参数摆在那儿,该占的显存一分不少。这两件事是分开的。
有意思的是,官方原文分得比转述的人清楚得多。它自己给了两个指标的定义。智能密度等于平均榜单分数除以总参数量,官方明说这个是「衡量起步部署硬件门槛」;智效比等于平均分数除以单 token 激活参数量,衡量的是「高并发服务能力」。
人家把「你要花多少显存才能开机」和「开机之后你能扛多少并发」拆成了两个指标写出来。是我们在转述的时候把两个揉成了一句「小模型」。
不过这两个指标我也想说句不太客气的话。分数除以参数量这类比值型指标,好用,但也很容易变成新的刷分靶子。分母越小比值越好看,那接下来一年大家会怎么优化,答案不用猜。真正的部署决策从来不看比值,看的是绝对值加约束条件,我这几张卡、这个延迟预算、这个并发量,够不够。比值指标适合放在发布稿里做叙事,不适合拿来当选型依据。我自己看这类数字的习惯是先把分母抄下来,再去算那个绝对值。
回到硬件这块,还有个容易被忽略的账。1/64 的专家激活比例,官方的依据是 Ling Scaling Law,越低的激活比例带来越高的效率杠杆,上一代是 1/32,这一代直接砍半。听着是纯赚,但稀疏度往上走,路由的难度和不均衡的风险是同步涨的。同样的总参数,你要在六十四份里挑一份,挑错的代价比在三十二份里挑错更大,而且线上一旦出现热门专家被挤爆的情况,某几张卡忙死其余闲死,你算出来的那个漂亮吞吐是拿不到的。这活儿有点子牛逼,但也是真难,蚂蚁敢把稀疏度砍到这儿,说明训练侧的负载均衡做得应该是有点东西的。
再说「TTFT 降 60%」。
这个数字我一开始也是当成模型特性读的,读第二遍才发现前提条件写得很清楚。原文说的是,命中 L3 Cache 相比直接重新计算,可以把 TTFT 降 60% 到 80% 以上。
L3 是哪个 L3。SGLang HiCache 借了 CPU 三级缓存的设计思路,把 GPU 显存当 L1,把主机内存当 L2,把分布式存储当 L3,而 Mooncake 就是那个 L3 后端(设计文档在 https://kvcache-ai.github.io/Mooncake/design/hicache-design.html )。
也就是说这份收益的来源是,你的会话被调度到了另一个节点,或者本地缓存被新请求挤掉了,本来要重算前面几万个 token,现在从集群共享的那个池子里把 KV 捞回来就行。
这是一套服务端基建的能力。是蚂蚁那边有一个跨节点共享的缓存集群,所以你调他们的 API 能吃到。
你自己拉起一个单实例,没有那个 L3 池子,这 60% 就跟你没关系。我在工作里给模型搭那层跑起来要用的工程脚手架,长会话的 prefix 缓存命中率是天天要盯的东西,我可以负责地说,把 HiCache 加 Mooncake 这套在自己集群里搭对、让命中率真的上去,是一个独立的、不轻的活儿,跟你用哪个模型权重基本无关。
模型权重里不包含这份工程红利。别把服务商的基建能力记在模型账上,回头自己部署的时候会很困惑为什么慢这么多。
第三件,「开源」。
这个最简单,官方最后一段的原话是,模型权重将在免费期结束后正式开源。免费期截到 8 月 3 日 23 点(北京时间)。
也就是说这会儿,你能碰到的只有 API。OpenRouter 上那个免费入口是 https://openrouter.ai/inclusionai/ling-3.0-flash:free ,百灵官方平台同步开。权重要等下个月。
我看到有几个地方已经在写「蚂蚁开源 124B」了,那个「已」字是抢跑的。差这几天不算什么大事,但如果你正打算清一块硬盘出来准备拉权重,可以先不用清。
泼完冷水,说说它到底哪里让我有点兴奋
上面三段都在减法,容易读成阴阳,那不公平。这次发布里我觉得真有分量的东西是另外几个。
先把那张对比图里的数按了一遍。两个模型都有分的十一项里,Ling-3.0-flash 平均 66.8,Ring-2.6-1T 平均 54.6,高出两成多。拉开最狠的是 SkillsBench,44.8 对 11.9,以及 IFBench 的 74.5 对 44.6。Ring 只在 Multi-IF 上赢了一点点,89.3 对 87.7。

也就是说这不是「打平」,是在 Agent 和指令遵循这一块实打实地超了一截,而在知识广度那种吃参数量的地方它才是持平或者略输的。这个分布跟官方自己承认的取舍完全吻合,我反倒因此更信这组数。
最实的还是 MiniAppBench 那个数。25.3%。
这个 benchmark 的规则是,给模型一句话的用户需求,让它生成一个完整可用的 APP(榜在 https://miniappbench.github.io/ )。参与评测的 16 个主流模型,平均通过率 17%。Ling-3.0-flash 拿到 25.3%,跟总参数规模大约是它两倍的开源 SOTA 打平。
我对这个指标的偏爱是有原因的。跑分榜单里数学题和代码题的分数已经很难看出差别了,大家都在 90 分往上互相咬,看半天看不出谁强。而「一句话生成一个能用的 APP」是那种没法靠刷题混过去的任务,它同时考规划、考工具调用的稳定性、考中间出错之后能不能自己拐回来。
16 个模型平均 17% 这个数字本身就很说明问题。这活儿现在还是十次里成不了两次。所以每次看到有人拿 demo 视频宣布「一句话做 APP 已经实现了」,我都想让他把同一个 prompt 连跑十遍再剪。
配套的训练做法也值得看一眼。官方说 Coding、General、Deep Research 三类 Agent 的可交互训练环境扩到了一万多个,并且在强化学习阶段引入了完整执行轨迹的复盘和步骤贡献评估,给每一步生成细粒度的训练信号。
一万多个可交互环境,厉害了。这个量级的环境不是写几个 mock 接口就完事的,每一个都得能真的被 agent 操作、能返回状态、能判定成功失败,光维护成本就很吓人。
这条我读着挺有共鸣的。长程任务最难的地方不是模型不会做,是它做错了你没法告诉它错在第几步。一个二十步的任务最后失败了,只给一个「失败」的总分,模型学到的东西非常稀薄,它不知道是第 3 步查错了资料还是第 17 步把文件写坏了。步骤级信号就是在解这个。谁真正把这套做扎实了,长程 Agent 的成功率曲线会明显不一样。
还有一个我没想到的,Ling Multi-Agent。官方说在 BrowseComp 和 BrowseComp_zh 上,多智能体协同架构能拿到 log-linear 的性能提升,思路建立在 SearchSwam 那篇论文的「委派智能」范式上(https://arxiv.org/abs/2606.09730 )。
log-linear 是个挺谦虚也挺诚实的表述。它承认了收益是递减的,你加 agent 数量,分数按对数往上爬,不是线性也不是免费。但换个角度,能确认它至少是往上爬的、而不是加到第五个就开始互相打架掉分,这个结论对做多 agent 编排的人来说是有用的。我见过太多多 agent 方案是负收益的,几个 agent 互相传递着越来越离谱的中间结论,最后一起翻车。
上下文是原生 256K,可扩到 1M。
还有官方自己写的局限性那一段,我反而觉得是全文最可信的部分。原话是,受限于极致压缩的参数规模,模型的资源倾斜主要聚焦于智能体与核心推理能力,因此在广度知识储备上做了一定妥协;同时多语言控制仍有提升空间,长对话或高压交互场景下偶发会出现中英混杂。
翻译成大白话,冷知识问它容易露怯,聊久了会开始中英夹着说。
这两条都是真的短板,而且都写在了发布稿里。一份发布稿愿意写「我们在知识广度上做了妥协」,比它后面跟着的任何一张柱状图都让我更愿意去试一下。因为它承认了这是一次取舍,不是一次奇迹。
而取舍是可以被工程判断的。奇迹不能。
所以这台机器该怎么用
坦率讲,这次发布对不同人的意义差得挺远,说真的不能一句话概括。
如果你在做线上的 Agent 服务,调 API 那种,这可能是这个月最值得测一下的东西。5.1B 激活带来的低延迟和低成本是真的,加上人家服务端那套集群缓存,长会话的接续体感会有区别。免费窗口到 8 月 3 日,测试成本是零,没什么理由不接一路流量过去跑跑看。测的时候记得挑长会话、多轮工具调用的场景,那是它被专门打磨的地方,也是差异最容易看出来的地方。
如果你惦记的是本地部署或者私有化,先把预期调对。等 8 月之后的权重,然后按 124B 去准备机器,不是按 5.1B。它的价值在于同样的显存里你塞进了一台推理更快、并发更能扛的模型,不在于它突然让单卡变得可行。
如果你只是想跟一下这波架构走向,那我觉得该记住的就是那两个数,5:1 和 1/64。混合线性加极稀疏 MoE 这条路,今年下半年应该会有更多家往上撞,毕竟前面已经有人把坑踩过一轮了。原生训练比后期改造效果好这个经验,大概也会被反复验证。
回到开头那三个字母。
一个做支付和金融的公司,用一个做聊天助手的公司的注意力机制,配上那家公司开源的推理缓存,训出一台对标自己上一代 1T 旗舰的模型,然后拿去自动化 Blender 建模和 Excel 透视表。
这条链路上,没有一环是原本设计好要连在一起的。KDA 那篇论文写的时候大概没想过它会被别人以 5:1 的比例堆在预训练里,Mooncake 开源的时候大概也没想过它会成为同行长会话延迟数字的一部分。
开源这东西的复利,很多时候不长在你自己的产品里,长在别人的下一个版本里。跑得最远的那些零件,最后都不太在乎自己被装在谁的船上。
八月三号之后权重放出来,我们再看看这条船好不好开。