新浪开源VibeThinker-3B:推理可压缩,事实知识不能
一个 30 亿参数的小模型,在 AIME 2026 数学竞赛上飙到 94.3 分,跟六千七百亿参数的 DeepSeek V3.2 掰手腕,体量却只有人家的三百分之一。
这事儿是新浪干的。对,就是你印象里那个做微博的新浪。他们旗下的 WeiboAI 团队上周把一个叫 VibeThinker-3B 的模型直接开源扔了出来,HuggingFace 和 GitHub 上代码权重全给,MIT 协议,随便商用。
我看到这个分数的时候,第一反应不是兴奋,是怀疑。3B 啊兄弟。这是个能塞进你笔记本、甚至塞进手机的尺寸。这么小的模型在竞赛数学上干到 94 分,要么是基准被刷烂了,要么就是这帮人真的发现了点什么。
后来我把模型卡和论文翻了一遍,越看越觉得有点子意思。它真正想讲的不是「我又小又强」这种营销话术,而是一个挺朴素、但我之前一直没太想明白的判断。
推理这东西,是可以被压缩进小模型的。
但事实知识,压不进去。
这两句话听着简单,把它拆开你会发现,它差不多动了过去两年大家对「模型为什么要那么大」的一个默认假设。
先说说这个分数到底是什么概念。
AIME 全称 American Invitational Mathematics Examination,美国数学邀请赛,是给高中里数学最顶尖那批人准备的选拔考试,题目难到什么程度呢,能进 AIME 本身就已经是万里挑一了。这种题没有套路可言,靠的是真的把一个数学结构在脑子里转明白。过去这是大模型才敢碰的硬骨头。
VibeThinker-3B 在 AIME 2026 上拿了 94.3。
更狠的是代码。它在 2026 年四五月份的 LeetCode 竞赛题上,128 道题首次提交就过了 123 道,通过率 96.1%。打过 LeetCode 周赛的朋友应该懂,能首杀(一次提交通过,不靠测试用例反复试错)96% 的竞赛题,这个水平放真人里也是金牌选手段位了。
然后是那个最扎眼的对比。在一个叫 IMO-AnswerBench 的奥数级基准上(IMO 就是国际数学奥林匹克),VibeThinker-3B 拿了 76.4 分,配上他们一个叫 CLR 的推理策略能上到 80.6。
对面是谁呢。
DeepSeek V3.2,6710 亿参数,78.3 分。 GLM-5,7440 亿参数,82.5 分。 Kimi K2.5,一万亿参数,81.8 分。
你把这几个数摆一起看。一个 3B 的小不点,跟动辄几千亿、上万亿参数的庞然大物,在同一道奥数考卷上分数咬得死死的。论文里给的说法是体量差了 200 到 333 倍。
好家伙。三百倍的体量差,分数就差那么三五分。

我盯着这张表看了挺久。说实话,我一开始是不太信的。我天天的工作就是给这些大模型搭运行的脚手架,简单讲就是给 AI agent 做工具链、调度、评测这些让模型真正能干活的工程层,所以我对「跑分好看」这件事天生有点免疫。跑分这玩意儿水太深了,刷榜、过拟合、测试集泄漏,每一样都能让一个平庸模型在排行榜上闪闪发光。
但有两个细节让我把怀疑收回去了一点。
第一,他们用的基准里有 AIME 2026 和 2026 年四五月的 LeetCode 竞赛题。这俩都是新鲜出炉的,模型训练的时候这些题大概率还没出现在互联网上,想靠背答案蒙混过关比较难。
第二,也是更关键的,他们没只报喜。模型卡里老老实实写了它弱的地方。
这就引出了整篇里我觉得最值得唠的部分。
VibeThinker 这帮人提出了一个假设,名字起得有点学术,叫参数压缩-覆盖假设(Parametric Compression-Coverage Hypothesis)。翻译成人话大概是这样。
一个模型脑子里其实装着两种很不一样的东西。一种是推理能力,就是给你一个数学题、一段代码逻辑,怎么一步步推到答案的那套「思维的骨架」。另一种是事实知识,就是「珠穆朗玛峰有多高」「某个蛋白质的结构是什么」「2018 年世界杯谁夺冠」这种需要硬记下来的、散落在世界各个角落的零碎信息。
他们的判断是,第一种东西,那套推理的骨架,是高度结构化的、可以被压缩的。你不需要一个特别大的网络去装它,三十亿参数就够它施展了。
而第二种,那些海量的事实知识,是压不动的。世界有多大,需要记住的事实就有多多,你想让一个模型什么都知道,就只能往大了堆参数。覆盖(coverage)这个词就是这意思,知识的本质是覆盖面,覆盖面靠的就是体量。
所以你看 VibeThinker-3B 的成绩单会发现一个特别清晰的分裂。
凡是有明确可验证信号的任务,数学、代码、STEM 推理,它能跟巨无霸打平甚至反超。因为这些任务考的是推理骨架,而骨架能压进 3B 里。
但一到知识密集的题,那种纯靠「你记不记得这个事实」的考法,它对大模型的优势就明显缩水了。它在 GPQA Diamond(一个研究生级别、覆盖物理化学生物的硬核知识问答基准)上拿了 70.2 分,这个分数对一个 3B 来说已经相当能打了,但跟它在数学上那种碾压式的性价比一比,差距一下就出来了。知识题它追不上去,因为那些事实根本没法被塞进这么小的盒子。

我读到这儿的时候是真愣了一下。
因为这套说法,某种程度上解释了一个我一直觉得别扭的现象。
你有没有过这种体验。同一个大模型,你让它做一道复杂的逻辑推理,它行云流水给你推得明明白白。可你随口问它一个有点冷门的事实,比如某个小众开源库的某个函数签名,它一本正经给你编了个根本不存在的 API 出来。
我以前一直把这俩当成同一种能力的波动,觉得就是模型「时灵时不灵」。现在 VibeThinker 这套假设给了我另一个视角,这俩可能压根就是两套东西。推理是模型真的「会」,知识是模型「背过但记串了」。一个靠的是结构,一个靠的是容量。它们在模型里的存在方式,可能从根上就不一样。
如果这个判断是对的,影响其实挺大的。
我们这两年看模型,习惯性地把「参数大」直接约等于「更聪明」。千亿、万亿,数字越大越唬人。但 VibeThinker 这事儿在提醒你,至少在推理这一块,大不大跟聪不聪明的关系,可能没你想得那么直接。聪明(会推理)是一回事,博学(记得多)是另一回事。我们一直在为「博学」付参数的钱,但很多时候我们真正要的,其实只是「聪明」。
这就是我觉得这个小模型最有意思的地方。它不是又一个刷榜选手,它是拿一个 3B 的极端样本,戳了一下行业的一个惯性认知。
再说说他们怎么把模型练出来的,这部分对干活的人有参考价值。
VibeThinker-3B 的底子是阿里的 Qwen2.5-Coder-3B,一个本来就偏代码方向的小模型。在这个基础上,WeiboAI 做了一套多阶段的后训练(post-training,就是在预训练好的基座上再做的那一层针对性打磨)。
流程大概是四步。先是两阶段的监督微调,喂数学、代码、对话的数据。然后是多阶段的强化学习,专门冲数学、编程、STEM。再来一道自蒸馏(self-distillation,让模型把自己学到的东西再消化提炼一遍)做巩固。最后做指令跟随的精修。
这套组合拳他们起了个名字,叫频谱到信号原则(Spectrum-to-Signal Principle,简称 SSP),里面还有个最大熵引导的策略优化(MaxEnt-Guided Policy Optimization,MGPO)。名字挺唬人,但我理解它的核心想法没那么玄,就是先让模型在训练里保持足够的「探索广度」,把可能性的频谱铺开,再慢慢从这片噪声里把真正有效的「信号」提纯出来。说人话就是,别一上来就让模型钻牛角尖,先让它放开了乱试,再收敛。
我不知道这套方法是不是真有他们说的那么神,毕竟论文里的方法和真复现出来的效果,中间隔着的坑我太清楚了。但思路是自洽的,而且最关键的是,东西开源了,权重和代码都在 GitHub 上摆着(仓库在这儿,https://github.com/WeiboAI/VibeThinker ),谁不服谁可以自己拉下来跑。这种把家底全亮出来的姿态,我一向是欣赏的。藏着掖着只发个 API 让你猜的,我反而警惕。
那这玩意儿对你我意味着什么。
如果你是做端侧、做本地部署的,这事儿值得认真看一眼。3B 的尺寸,意味着它能跑在你的笔记本上,甚至经过量化(quantization,把模型权重的精度压低来换体积和速度)之后塞进性能好点的手机里。一个能本地跑、不用联网、不烧 API 费用、还能在数学和代码上有竞赛级表现的模型,对很多场景是降维的。做个本地的解题助手,做个离线的代码辅助,做个跑在边缘设备上的逻辑推理引擎,成本一下就压下来了。
但我也得泼盆冷水,免得你冲动。
别把它当全能选手。VibeThinker 自己都说了,它强在有可验证信号的推理任务。你拿它去做需要广博知识的活,比如写一篇要旁征博引的稿子、回答各种长尾的事实问题、做开放域的问答,它大概率会让你失望,甚至一本正经给你编。它擅长的是「算」和「推」,不是「记」和「答」。用之前先想清楚你的活到底吃哪种能力,别拿着一把手术刀去砍柴。
我自己的感受是,VibeThinker-3B 这种模型的出现,标志着一个挺微妙的转折。
过去我们追大模型,是因为我们默认「什么都要会」。一个模型得既能推理又能博学,既会写代码又懂天文地理。于是参数越堆越大,成本越来越高,最后变成只有几家巨头玩得起的游戏。
但 VibeThinker 在说另一种可能。也许未来不是一个无所不知的超级大脑,而是一堆各有所长的小专家。负责推理的,可以很小很快很便宜,跑在你身边。负责调取海量知识的,再去查那个大的、放在云端的库。推理和知识,本来就不一定非得焊死在同一个模型里。
这让我想起 unix 哲学里那句老话,do one thing and do it well,一个程序只做一件事,并且把它做到极致。我们写了几十年代码,最后发现最稳的系统从来不是一个什么都干的巨石,而是一堆各管一摊、能拼能换的小零件。模型这条路,会不会最终也绕回到这个地方,我说不好,但 VibeThinker 这个 3B 的小东西,至少让我重新认真想了想这个问题。
毕竟,一个能在你手机里安静跑着、还能帮你解出奥数题的小模型,比一个躺在某个数据中心里、每次调用都在烧钱的万亿巨兽,听起来要可爱多了。
模型在这儿,HuggingFace 地址 https://huggingface.co/WeiboAI/VibeThinker-3B ,感兴趣的可以自己拉下来玩玩,跑通了记得回来告诉我效果咋样。更详细的测评和背景,The Decoder 那篇报道写得不错(https://the-decoder.com/sinas-open-model-vibethinker-3b-aims-to-show-reasoning-compresses-well-but-factual-knowledge-doesnt )。
推理可压缩,知识压不进。这八个字,我大概还会琢磨一阵子。