美团甩出 1.6T 大模型 LongCat-2.0,价格还便宜到离谱

小岛AI 2026 / 06 / 30

前阵子在 OpenRouter 上,有个叫「Owl Alpha」的匿名模型,悄没声地爬到了榜单很靠前的位置。

没有发布会,没有技术报告,连是谁家的都不知道,就挂着一只猫头鹰的图标在那儿跑分。一堆人在论坛里猜,有人赌是某家闭源大厂偷偷放出来测水温的小号,有人赌是哪个海外实验室的下一代。结果谜底揭开,好家伙,是美团。

对,就是那个你点外卖、那个骑手电瓶车后座插着小旗子的美团。它甩出来一个 1.6 万亿参数的大模型,叫 LongCat-2.0,而且当天就在硅基流动上线了,直接能调

我刷到这条的时候,正蹲在工位上等一个跑了二十分钟的评测脚本出结果。扫到「美团」「1.6T」「登顶 OpenRouter」几个词凑在一起,我盯着屏幕,脑子里第一反应是,这几个词怎么会出现在同一句话里。

说真的,过去这一两年,外卖平台做大模型这事我是有点条件反射式不信的。送外卖的、跑配送的,做个调度算法、做个智能客服我信,但你说要从零训一个万亿参数的旗舰模型,还要去跟 GPT 这一档掰手腕,听着就像楼下便利店老板说他周末在车库造火箭。

但这回它是真造出来了,而且火箭还挺能飞的。

我想跟你唠唠这玩意,因为它身上有几个点,越扒越觉得不对劲,是那种「卧槽原来是这样」的不对劲。

先把参数摆出来。1.6T 总参数,听着吓人,但它是 MoE 架构。MoE 全称 Mixture of Experts,混合专家,你可以把它想象成一个大公司里养了几百个专家,但你来问一个问题,不会把所有人都喊到会议室,只叫相关的那几个来。所以 LongCat-2.0 虽然总共 1.6 万亿参数,每次真正干活的只激活大概 480 亿(48B),算力开销比同等规模的稠密模型省得多。

然后是上下文窗口,原生支持 100 万 token。100 万 token 什么概念,差不多能把一整个中等规模的代码仓库连同它的文档一口气塞进去,让模型一边看全局一边改代码,不用你切来切去喂片段。

最让我没绷住的是价格。在硅基流动上,输入缓存每百万 token 一分五美分($0.015),输入 $0.75,输出 $2.95。我对着这串数字看了两眼,又翻出来跟我手头几个常用的闭源 API 比了比。这个输出价格,差不多是同档能力模型的一个零头。

厉害了。一个外卖公司,把前沿模型的价格打到了这个份上。

价格便宜可以靠补贴,可以靠亏钱换市场,这套打法美团熟得很。但模型能力是骗不了人的,跑分这东西,硬碰硬。

我们看它最能打的那个数。SWE-bench Pro,这是个专门考模型解真实软件工程问题的榜,给你一个 GitHub 仓库里的真 issue,让你提交一个能通过测试的补丁。这玩意比那些做选择题的榜难太多了,因为它逼着模型真的去读代码、理解上下文、写出能跑的 patch。LongCat-2.0 在上面拿了 59.5 分,超过了 GPT-5.5 的 58.6。

我盯着这两个数看了好一会儿。不是说它领先多少,领先不到一个点,谈不上碾压,而是它居然真的站到了这一档的牌桌上。一个你以为只会算配送路径的公司,做出来的模型在最硬核的编程评测上跟 GPT 平起平坐。这事儿本身就有点子魔幻。

其它几个数也都不虚。Terminal-Bench 2.1 拿了 70.8,这个考的是模型在命令行里实际操作的能力,多语言版的 SWE-bench 是 77.3。它的定位写得很直白,从底层就是冲着 agentic coding 去的,也就是让模型当一个能自己读代码、自己跑命令、自己改 bug 的编程智能体。

那它凭什么能做到这一步?我去翻了官方的技术博客,里面有三个设计,我觉得挺值得跟你掰扯掰扯。

一个 token 进来,只唤醒少数相关专家,三组专家各管一摊

第一个叫 LSA,LongCat Sparse Attention,稀疏注意力。注意力机制你可以理解成模型读文章时「每个字要回头看前面哪些字」的那套机制,问题是上下文越长,这个回头看的开销涨得越夸张,是平方级别地涨。想撑住 100 万 token,硬算根本扛不住。稀疏注意力的思路是,不让每个 token 都去看全部历史,只看真正相关的那一小撮,开销一下就压下来了。LongCat 还专门拿数千亿 token 的百万级长文本喂着训,把这条长上下文的能力真的练扎实,而不是参数表上写个 1M 充门面。

第二个名字起得很妙,Zero-Compute Experts,零算力专家。前面说 MoE 每次激活一部分专家对吧,但传统 MoE 有个尴尬,不管你这个 token 是难是易,激活的专家数量是固定的。问题是有些 token 简单得很,一个标点、一个空格,犯不上动用那么多专家。LongCat 的做法是让激活量动态变化,每个 token 实际激活 330 亿到 560 亿之间浮动,简单的少用点,难的多调点,算力花在刀刃上。这种「能省则省」的工程脾气,我个人是真的欣赏。搞 harness 的人,就是天天给模型搭运行脚手架、抠超时和算力预算的那帮人,对这种地方的敏感是刻在骨子里的。

第三个叫 MOPD,多教师在线策略蒸馏。它把模型里的专家分成了三组,Agent 专家、Reasoning 推理专家、Interaction 交互专家,来活儿了按任务类型门控路由。你让它写代码跑工具,调 Agent 那组;你让它做复杂推理,调 Reasoning 那组;你跟它日常对话,走 Interaction。这种分工不是拍脑袋切的,是训练的时候就用不同的「教师」分别带出来的。

听着挺玄对吧。我用大白话给你串一遍,一个能撑住超长上下文又不爆算力的注意力,加一套按难度动态分配算力的专家系统,再加一组各管一摊、术业有专攻的专家分组。三样凑一块儿,才托起了那个 59.5 分。

讲到这儿,你可能觉得这就是又一个不错的国产模型发布,价格猛、能力够、还开源(MIT 协议,权重马上放出来,可以去 Hugging Face 蹲)。但真正让我后背有点发麻的,是另一件事。

这个模型,从头到尾,全程是在国产芯片上训出来的。

我再说清楚一点。它是业内第一个在五万卡国产算力集群上,完成全部训练加上大规模推理部署的万亿参数模型。训练、推理,整条链路,全部跑在国产的 AI ASIC 超节点上,预训练烧掉了数百万张加速卡的运行小时,吃了 35 万亿 token 的语料。南华早报和 VentureBeat 都给了它一个定语,中国目前在本土芯片上训出来的最大的 AI 模型。

五万卡国产算力集群,整条训练加推理链路都跑在国产 AI ASIC 上

这事儿的分量,得放到这两年的大背景里才掂得出来。这两年所有人聊大模型,绕不开一个焦虑,叫算力卡脖子。最先进的训练卡拿不到、买不够,成了悬在国内每一家做大模型的公司头上的那把剑。大家嘴上都说要用国产卡替代,但真到了训旗舰模型这种最吃算力、最娇贵、最容不得出错的活儿上,敢全程压在国产卡上的,几乎没有。因为训练一个万亿模型,跑就是几个月,中间任何一环掉链子,几千万就打水漂了。

美团这回,是真的把整个旗舰模型的身家性命,压在了国产芯片这条路上,而且它跑通了,还跑出了能跟 GPT-5.5 掰手腕的成绩。

我坐在工位上想了挺久这件事。它的意义不在于「美团很牛」,而在于它证明了一条路是走得通的。在它之前,国产卡能不能扛住前沿模型的训练,是个悬而未决的问号,大家心里都没底。现在美团把这个问号,掰成了一个句号。

是谁来自山川湖海,却囿于昼夜厨房与爱。我一直挺喜欢万青这句词。今天看着一个送外卖的公司,囿于配送、囿于骑手、囿于商家后台那些最琐碎的昼夜,却在另一边悄悄憋出一个能登顶国际榜单的大模型,还是用着别人都不敢全押的国产芯片,我说不太清这是一种什么感觉,大概是觉得,事情正在一些你想不到的角落里,悄悄地变好。

说实话我也不确定 LongCat-2.0 能不能在真实生产里站住脚,跑分归跑分,真接到 agent 工作流里、真扔到一线代码库上反复折腾过,才知道它到底成色几何。这个我还没大规模试,得花时间。但光是「外卖公司」「五万卡国产集群」「干平 GPT-5.5」这几个词能凑在一条新闻里,对我来说,今天这一条就已经够下饭了。

权重马上开放,GitHub 和硅基流动都能上手。要是你最近正缺一个便宜又能打的编程模型,这只猫头鹰,值得你亲手薅两下试试。

反正我电脑这边,评测脚本的环境已经在配了。