2.8万亿参数刷屏的这周,拿第一的只有2B

小岛AI 2026 / 07 / 19

这周 AI 圈的主旋律就一个字,大。

周四 Kimi K3 刷屏,2.8 万亿参数。昨天 Qwen3.8 官宣,2.4 万亿。朋友圈里全是万亿俱乐部的跑分截图,看得人都有点麻了。

然后今天上午,上海 WAIC 的一个分论坛上,面壁智能发了个新模型。多大呢,2B。

2B 是什么概念,Kimi K3 的参数量是它的一千四百倍。放在这周的新闻流里,这个数字小得像个错别字。

但这个 2B 拿了个全球第一。

好家伙,还是一天双发。上午发布 MiniCPM5-2B,4B 以下参数级别全球性能第一,同步完成 9 款芯片的 Day0 适配。下午 OpenBMB 的推特跟着官宣,开源首个具身智能模型系列 MiniCPM-Robot,让机器人能理解、记忆、行动。

大家都在往上卷的时候,有人在往下卷,而且卷出了名堂。我觉得这事比这周任何一个万亿参数的发布都值得聊聊。

先把发布本身快进讲完,这些信息你在别的号也能刷到,我尽量压缩。

MiniCPM5-2B,在 Artificial Analysis 的 AA-Index 榜单上拿了 17 分,是 4B 以下模型的最高分。多个基准的平均分 54.26,对比一下同量级的选手,Qwen3.5-2B 是 41.66,Gemma-4-E2B-it 是 37.62。更有意思的是它还超过了 LFM2.5-8B-A1B 的 49.15,那是一个 8B 稀疏架构的模型,参数量是它四倍。

同量级选手平均分对比,2B 还顺手越级掀了一个 8B

单项里有几个数字挺扎眼。长文本理解 AA-LCR 得分 42.33,超出第二名十六分多。数学推理 AIME-2026 拿了 60.95,同量级的 Qwen3-1.7B 只有 36.88。还有一个 τ²-Bench Telecom,这是个模拟真实客服场景的 agent 评测,考模型会不会在多轮对话里正确调用工具办事,它跑了 90.35。

数学推理这一项,对同量级选手接近翻倍

一个 2B 的模型,原生支持混合思考,能在快速响应和深度推理之间切换,上下文窗口给到 512K,单次能塞进整本长篇小说或者几十万行代码。

我日常的工作就是给大模型搭脚手架,让 agent 能在生产环境里真正把活干完的那层工程。所以看到 τ²-Bench 这个分数时我是真有点坐直了。工具调用、多轮任务这些能力,以前默认是云端大模型的地盘,端侧小模型能把 demo 跑通就算及格。90 分这个量级,说明它是照着「端侧 agent 基座」去训的,不是照着聊天玩具去训的。

发布材料里也印证了这一点。它的训练流程里专门排了 200B 规模的 Agent Midtraining,加上百万条高质量轨迹的 SFT 和强化学习对齐。翻译成人话,人家从预训练阶段就在教这个模型干活,而不是训完了再想办法教它用工具。

再说 9 款芯片 Day0 适配这件事。华为昇腾、海光、昆仑芯、沐曦、摩尔线程、平头哥、清微智能、天数智芯、英伟达,再延伸到 ARM 端侧平台,模型发布当天,这些芯片上就能跑,精度跟英伟达平台对齐,部分芯片的性价比还反超了。

写 CUDA 之外代码的朋友应该懂这有多难得。一套模型跨九种芯片架构,还要精度对齐,这背后是 FlagOS 社区的统一软件栈在兜底。以前这种适配是模型发布后几个月的事,现在压到了第零天,这一手有点子牛逼。

发布会还有个彩蛋,面壁跟英特尔在现场签了合作备忘录,此前基于英特尔 18A 制程的 Core Ultra 平台,180 TOPS 的算力已经能支持 35B 参数模型本地部署。你下一台笔记本可能真的塞得下一个中型模型。

通稿部分到此为止。接下来聊点通稿里不会写的。

很多朋友可能不知道面壁这家公司。它不是新玩家,恰恰相反,它的创始团队是中国最早摸到大模型的那批人。2020 年,22 岁的曾国洋在一个晚间聚会上支了张桌子,展示了中国第一个大语言模型 CPM-1,一个打字机一样的网页,打几个字按 Tab,它就往后补内容。那时候 ChatGPT 还要再等两年。

最早看见大模型的人,后来却转身去做最小的模型。2023 年下半年,所有人都在追参数、追 OpenAI 的时候,他们选了端侧这条冷清的路。

为什么,曾国洋在前几天的一个专访里讲得很直白。他们在赛道上待得太久了,国内厂商从 2021 到 2023 卷参数,从几百亿一路卷到十万亿,但十万亿参数没带来真正的智能。最早的 ChatGPT 也就 250 到 500 亿参数。经历过这些实践的人知道,单纯把模型训大是条死路。

面壁给自己找的尺子叫知识密度,同等尺寸下模型能装进多少智能。他们还喊出一条面壁定律,知识密度每 3.5 个月翻一番,同等智能所需的参数规模指数级下降。

这话听着像营销口号对吧,我一开始也这么觉得。但配套的方法论是实打实的。他们搞了个叫模型风洞的技术,像造飞机不用造完整了再试飞,先把外壳放风洞里吹,他们能在小规模实验里预测完整训练后的效果,几天出结果。2024 年靠这套技术训了个 2B 的验证版本,效果超过了同期 Meta 的 LLaMA 8B,这才有了 MiniCPM 这个系列。

这次的 UltraX 数据治理方案也是同一个思路的延续。用一个 0.6B 的小模型对网页数据做行级的增删改,把数据清洗从「筛掉垃圾」升级成「可校验、可追溯的编辑程序」。曾国洋有句话我印象很深,做模型就是做数据。他要求每个算法工程师训练前必须亲自看数据,一百多个数据集挨个检查。他举过一个例子,上万条微调数据里有两条因为处理不当截断了半句话,训练完的模型就开始在对话里说到一半戛然而止。两万条里两条有问题,模型就学坏了。

嘶。我想起自己排查过的那些 agent 灵异行为,多少次最后挖出来就是数据或者 prompt 里一个不起眼的破损。这种对细节的偏执,可能才是 2B 打赢 8B 的真正原因。

那为什么端侧这条路值得走,我给你几个从工程视角的理由。

云端模型的资源约束是弹性的,推理成本高了可以优化 infra,可以烧钱补贴用户。端侧是硬约束,曾国洋的原话很妙,模型太大跑不动就是跑不动,补贴钱没用,功耗太高会发热,你不可能补贴一个冰块。

这种硬约束反而逼出了真功夫。云端可以靠堆卡掩盖的低效,在端上全部现形。量化损失怎么恢复,功耗怎么压,首响应延迟怎么砍,每一项都是躲不掉的工程债。所以你看面壁这两年的动作,跟高通、联发科、英特尔、AMD 挨个做适配,新出的 BitCPM-CANN 系列能让同一块内存多装约 6 倍大的模型。在内存价格飞涨的今年,这个能力值钱得很。

而对我们这些写代码的人,端侧模型的价值可以数得更具体。不用 API key,不用按 token 付费,断网能跑,数据不出设备。你要给公司内部文档做个问答助手,法务不批云端 API 的场景太常见了,一个能在办公电脑本地跑的 2B agent 基座,很多事一下就顺了。

再说说下午那个容易被忽略的发布,MiniCPM-Robot。

这是面壁第一个具身智能模型系列,全部开源。里面有 MiniCPM-RobotManip,一个 1.5B 的通用视觉语言动作模型,就是常说的 VLA,看图像、听指令、直接输出机械臂的动作。还有做真实世界目标跟踪的 MiniCPM-RobotTrack,和一个专为具身模型设计的高性能推理框架 PhyAI。

我点开 GitHub 看了一眼,仓库已经挂出来了,不是 PPT 发布。

把这两个发布摆在一起看,面壁的路线就清楚了。机器人跟手机一样,是个不能无限堆算力的地方,电池、功耗、实时性全是硬约束,天然是小模型的主场。一个 1.5B 的 VLA 意味着普通开发者用消费级硬件就能玩真机,而不是看着英伟达发布会流口水。

曾国洋在专访里有个比喻,端侧模型把数字世界和真实世界的边界接起来,像气球的外皮,云端是里面的气。这周大家都在看气有多大,很少有人看皮。但你入手的每一台手机、每一辆车、未来家里的每一个机器人,装的都是皮。

当然,我得泼两瓢冷水,不然这篇就成通稿了。

第一瓢,MiniCPM5-2B 发布了,但截至今晚还没开源。官方说法是即将开源,模型权重和各芯片的适配镜像会同步上 Hugging Face 和魔搭。发布会先行、权重后放,这在行业里不算罕见,但在它真的落到你硬盘里之前,所有跑分都只是别人家的跑分。想动手的朋友可以先盯着 OpenBMB 的 GitHub 和 Hugging Face 主页,Robot 系列倒是现在就能下。

第二瓢,2B 就是 2B。它拿的是 4B 以下的第一,不是全球第一。你让它写复杂系统的架构方案、做深度研究,它还是打不过云端那些万亿参数的巨兽。端侧模型的正确用法是干那些高频、轻量、贴身的活,总结、改写、工具调用、设备控制。指望一个 2B 替代你的 Claude 订阅,那是既误解了端,也误解了云。

但方向这个东西,有时候比当下的绝对能力重要。

知识密度每 3.5 个月翻一番,这个定律哪怕只对一半,往后推两年,今天旗舰云端模型的能力就会被压进一个手机能跑的尺寸里。到那天,「模型跑在哪」就不再是技术问题,而是你愿不愿意把自己的数据交出去的问题。

万能青年旅店唱过,是谁来自山川湖海,却囿于昼夜厨房与爱。大模型这两年都在山川湖海里比谁的浪大,而端侧这批人在认真研究昼夜、厨房与爱,那些贴着人的、琐碎的、真实的场景。

这周刷屏的是 2.8 万亿,但十年后回头看,真正改变你每天生活的,说不定是这个还没开源的 2B。

权重真放出来那天,我打算第一时间拉到本地跑一遍,到时候把实测写给你看。

相关链接放这里,想深挖的自取。

MiniCPM-Robot 开源仓库 https://github.com/OpenBMB/MiniCPM-Robot MiniCPM 系列主仓库 https://github.com/OpenBMB/MiniCPM OpenBMB 的 Hugging Face 主页 https://huggingface.co/openbmb Robot 系列官宣推文 https://x.com/OpenBMB/status/2078839529591759025 Artificial Analysis 榜单 https://artificialanalysis.ai