美团把 1.6 万亿参数的模型开源了,训练全程没碰 N 卡
美团把 1.6 万亿参数的模型开源了,训练全程没碰 N 卡
一家送外卖的公司,把一个 1.6 万亿参数的大模型,连权重带推理代码,用 MIT 协议整个扔到了 GitHub 上。
周末刷到 LongCat 官方那条公告的时候,我第一反应是又一个开源模型发布,常规操作,中国大厂这两年开源节奏本来就猛。DeepSeek 在前面,Qwen 在前面,智谱在前面,美团这个 LongCat 系列之前也发过 LongCat-Flash,属于第二梯队里挺努力的那种。
然后我点进 GitHub 仓库把 README 从头读到尾,读出了三个越来越不对劲的点。不对劲的意思是,每一个单拎出来都值得聊,叠在一起就有点吓人了。
先说第一个,也是最平静的一个,协议。
MIT。不是那种「开源但商用要申请」的社区协议,不是 Llama 那种带着一堆使用条款的自定义许可,就是 MIT,跟你在 npm 上随手 install 的某个左移补零的小工具包同一个协议。权重 MIT,推理代码 MIT,你拿去微调、蒸馏、商用、套壳卖钱,法律上都没人拦你。一个 1.6T 参数的模型给这个协议,放两年前是没法想象的事。两年前大家还在为「开放权重算不算开源」吵架,现在美团直接掀桌,行了别吵了,MIT,自己看 LICENSE 文件。
1.6T 什么概念,这里得展开一下。它是 MoE 架构,混合专家模型,你可以理解成模型里养了一大群各有专长的小模型,每次推理只叫醒其中几个干活。所以 1.6 万亿是总参数,每个 token 实际激活的大概是 48B,也就是说推理时的计算量跟一个 48B 的稠密模型差不多,但知识容量是 1.6T 的体量。这个设计现在是大参数模型的标配,DeepSeek-V3 是 671B 总参数激活 37B,LongCat-2.0 直接把总量干到了 1.6T。
好家伙,外卖平台,1.6T。
第二个不对劲的点,成绩单。
官方给的评测表里,对手全是闭源旗舰,Gemini 3.1 Pro、GPT-5.5、Claude Opus 三个版本。开源模型跟闭源旗舰同台对比不稀奇,稀奇的是它真有几项打平甚至打赢了。Terminal-Bench 2.1 上 70.8 分,跟 Gemini 3.1 Pro 的 70.7 基本贴脸。SWE-bench Pro 上 59.5,比 GPT-5.5 的 58.6 高,比 Claude Opus 4.6 的 57.3 也高。SWE-bench 是拿真实 GitHub issue 让模型修代码的评测,Pro 版更难,这个分数放在一个 MIT 协议随便下的模型身上,写代码这块它是真能打的。

当然,成绩单要看全。跟最新的 Opus 4.8 比,差距还是肉眼可见,Terminal-Bench 差 8 分,SWE-bench Pro 差将近 10 分。基础能力像 GPQA-diamond 这种研究生级科学题,88.9 对闭源第一梯队的 92 到 94,也还差着几分。另外表里带星号的分数是引用对手官方报告的,不带星号的是美团自己统一环境测的,跨来源对比这种事,你懂的,看个大概就好,别拿着小数点后一位去吵架。
我自己的判断是,这个模型的定位非常清晰,就是奔着写代码和跑 agent 去的。README 里明说了跟 Claude Code、OpenClaw、Hermes 这些编码工具做了深度集成,仓库级改代码、自动执行任务这些场景专门调过。通用能力不是第一优先级,coding agent 才是。这个取舍我觉得挺聪明,通用榜单卷不过闭源三巨头,那就在程序员每天真实用的场景里做到能用、好用、还免费。
然后是第三个点,就是标题里那个,也是我读到的时候真的停下来的地方。
README 原话,整个训练和大规模部署,完全构建在 AI ASIC 超节点上。
翻译一下。ASIC 是专用集成电路,为特定任务定制的芯片,这里指的是非 NVIDIA 的国产 AI 加速卡。也就是说,这个 1.6T 参数、35 万亿 token 喂出来的前沿规模模型,预训练从头到尾没有跑在英伟达的卡上。不是「部分算力用了国产芯片」,不是「推理环节做了适配」,是 fully built,全程。
35 万亿 token 是什么量级,GPT-4 当年传闻的训练量是 13T 上下,Llama 3 是 15T。35T 的预训练,官方说耗费了数百万加速器天,就是几百万张卡跑一天的总量。而且他们特意写了一句,全程没有回滚,没有不可恢复的 loss 尖刺。
这句话圈外朋友可能感受不到分量。大规模训练是个极其脆弱的过程,几千几万张卡连续跑几个月,硬件会坏,网络会抖,数值会溢出,loss 曲线动不动给你表演一个垂直起跳。训练团队的日常就是盯着曲线随时准备回滚到上一个 checkpoint,一次大回滚烧掉的电费和时间都是真金白银。在一个全新的、生态远不如 CUDA 成熟的硬件平台上,把 35T token 一口气跑完还不出事故,这背后的工程能力,怎么说呢,我作为一个天天跟分布式任务失败重试打交道的人,看这句话跟看恐怖片似的。

官方自己也不装了,README 里直接写,这证明我们有能力在替代硬件平台上进行前沿规模的训练。
这句话是写给谁看的,大家心里都有数。英伟达的卡对中国公司越来越难买,这是明牌。之前的普遍预期是,没有 N 卡,前沿模型训练要打个大折扣。LongCat-2.0 等于把一个反例拍在了桌上,而且是以开源的方式拍的,权重你可以下载,代码你可以审,不是 PPT 里的一页宣传。
有点子牛逼。
聊完这三个点,再往技术里走一层,讲讲它的长上下文方案,这部分对做应用的朋友比较有用。
LongCat-2.0 支持 1M token 的上下文,一百万 token,大概能塞下一整个中型代码仓库外加全部文档。长上下文的老大难是注意力机制的平方复杂度,序列长一倍,计算量涨四倍,1M 长度下如果老老实实算全量注意力,成本会离谱到没法商用。所以各家都在做稀疏注意力,思路都差不多,别让每个 token 看所有历史,挑重要的看。
DeepSeek 在 V3.2-Exp 里给的方案叫 DSA,用一个轻量的索引器先给历史 token 打分,挑出高分的再做注意力。LongCat 这次的 LSA,LongCat Sparse Attention,直接在 README 里点名了 DSA 的两个毛病,索引器打分还是平方复杂度,以及输出不连续导致内存访问碎片化。然后给了三个改进,我用人话过一遍。
第一个,流感知索引。挑 token 的时候不纯按分数天女散花地挑,而是把预算拆成连续块加随机选点。碎片化的内存读取变成大段顺序读取,显存带宽一下就打满了。这个思路做过性能优化的朋友会很眼熟,数组顺序遍历比链表乱跳快,不是因为算得快,是因为内存访问模式对硬件友好。
第二个,跨层索引。他们观察到相邻几层的注意力关注点其实很稳定,既然如此,一次打分的结果就让好几层共享着用,索引成本直接除以层数。推理时每两层共享一次索引,投机解码的三步草稿也共用一次。
第三个,分层索引。先用块级别的粗打分捞一批候选,再在候选里做细粒度挑选,两阶段漏斗,索引器每次要处理的范围小了一个量级。
三个改进全是围着同一个目标转的,让稀疏注意力不光在论文里省计算量,还要在真实硬件上省出真实的延迟。这种脏活累活属性的优化,通常只有真的要把 1M 上下文拿去线上扛流量的团队才会做得这么细。
另外还有个小众设计叫 N-gram Embedding,从他们自家 LongCat-Flash-Lite 继承来的,单独给词组级别的组合留了 135B 参数的嵌入表。逻辑是 MoE 的稀疏度已经卷到甜点区之后了,继续加专家收益递减,不如把参数花在另一个正交的稀疏维度上。这个判断对不对我没法验证,但敢在 1.6T 的模型里拿 135B 参数出来做非主流设计,说明人家是真做过 scaling 实验的,不是拍脑袋。
想上手的话,路径也都是现成的。权重在 Hugging Face 和 ModelScope 都有,FP8 版本也给了。推理框架 SGLang 的适配已经合进主干,官方推荐 16 张 H20 起步,张量并行加专家并行。对,你没看错,训练全程国产 ASIC,部署示例推荐的是 H20,推理生态的迁移显然还在路上,NPU 部署走他们另一个仓库的分支。这个反差本身就挺真实的,训练是自己家的事,咬牙能扛,推理是千家万户的事,生态说了算。
不想折腾部署的,longcat.ai 上可以直接开聊。
还有个细节我必须单独拎出来说,因为踩过同类坑。它的 chat template 里,工具调用的 arguments 字段要求传 dict,不是 OpenAI 标准里的 JSON 字符串。README 用一行注释轻描淡写地提了一句。我日常工作就是给模型搭工具链这一层的,这种「跟标准差一点点」的地方是集成时最阴的坑,你的重试逻辑、参数校验、日志序列化全都默认 arguments 是个 string,换模型的时候一切正常,直到某个工具调用静默失败。要接这个模型的朋友,把适配层的类型断言先改了再说,别问我为什么对这种事情这么敏感。
冷静的话也说在最后。它不是全能冠军,跟 Opus 4.8 的差距是实打实的,基础科学推理还差几分,浏览搜索类任务也没到第一梯队。官方措辞里那些最漂亮的分数,有几项对比的是对手半年前的版本。开源模型的评测表从来都要打个折看,这个不针对谁。
但我还是觉得这个发布值得认真对待,原因不在分数,在它同时把三件事做成了。前沿体量的模型,最宽松的协议,一条完全绕开 N 卡的训练链路,任何一件单独发生都只是新闻,三件叠在一起,等于往桌上放了一个新的参照系。以后再有人说没有 N 卡就训不了大模型,或者说开源模型永远追不上闭源,反驳不需要写小作文了,甩一个 repo 链接就行。
这一年看着 DeepSeek、Qwen、GLM、Kimi 一个个把牌打出来,每次都觉得,中国公司在开源这条线上是真的下了重注的。这次轮到一家外卖公司把 1.6T 的模型和 MIT 协议一起推出来,牌桌上的人越来越多,出牌越来越狠。
对我们这些在浪里开小船的人来说,这是好事。水涨的时候,船都会高一点。