这个月开源模型爆了:DeepSeek V4、Gemma 4、Kimi K2.6、MiMo 2.5 一起来了

小岛AI 2026 / 05 / 19

五月发生了一件挺魔幻的事。

在不到三周时间里,DeepSeek 发了 V4,Google 发了 Gemma 4,Moonshot 发了 Kimi K2.6,小米发了 MiMo V2.5 Pro,智谱发了 GLM-5.1,还有一堆二线但不差的模型同期涌出来。

这么密集的发布节奏,在开源模型圈挺少见的。

然后同一周,美国国家标准与技术研究院旗下的 CAISI(Center for AI Standards and Innovation)出了一份评估报告,结论是:开源模型和美国头部闭源模型的差距在扩大,而且按他们的测算,这个差距会越来越宽。

你同时看到这两件事,会有一种信息撞车的感觉。开源模型刚刚迎来有史以来最猛的一个月,官方机构的报告说开源正在落后。

到底谁说得对?


先说 CAISI 的报告说了什么,以及为什么它可能说得不全对。

CAISI 用的是基于 IRT(项目反应理论,Item Response Theory——一种把不同基准测试的成绩换算成统一 Elo 分的方法)的评分框架,选了九个基准测试对 DeepSeek V4 Pro 进行评估。

结论很直接:开源模型在这套评分体系下,跟 Claude 4 Opus、GPT-5 等顶级闭源模型的 Elo 差距在拉大。

但报告本身有两个问题让人存疑。

第一,DeepSeek V4 Pro 在其中几个基准上的分数异常低——CTF-Archive-Diamond(一个安全挑战赛基准)只跑了子集然后用 IRT 外推,PortBench 是 CAISI 内部不公开的基准,ARC-AGI-2 用的是和公开排行榜不同的评分方式。这几项评分对最终 Elo 的影响非常大,而且都不透明。

第二,基准测试的设置。CAISI 的编程任务评估用的是 bash + for 循环 + 固定 token 预算,不是 Claude Code 或 OpenCode 这类模型实际在训练和使用的框架。这就好比测赛车的速度,非要把它放在普通公路上跑,然后说它比 F1 赛道慢。

Epoch AI 用他们的 ECI 框架做了同样的比较,结论稍微不同:开源和闭源的差距大概在 3-7 个月左右,从 DeepSeek R1 发布以来基本维持在这个区间,没有显著扩大。

所以这份报告的结论,要打个问号。


现在来说这个月发的那些模型,一个一个过。

DeepSeek V4

分 Pro 和 Flash 两个版本。Pro 是个 1.6T 参数、激活 49B 的 MoE 大模型(MoE,混合专家架构,Mixture of Experts——把模型分成很多个「专家」子网络,每次推理只激活其中一部分,这样参数量大但实际计算量小);Flash 是 284B 参数、激活 13B 的小一号版本。

有意思的是,社区反馈 Flash 可能比 Pro 更实用。Pro 的尺寸撑起了参数量,但实际表现没有跟上;Flash 相对精炼,性价比更高。

技术报告很详细,尤其是长文本处理的架构改动,喜欢读技术细节的可以翻一翻。

Hugging Face:https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash

Gemma 4

Google 终于把 Gemma 系列更新了。这次发了好几个尺寸:4B、9B、31B 的 dense 模型,还有一个 26B 激活 4B 的 MoE 版本。

但更值得说的是许可证变了——Google 这次用了 Apache 2.0,把之前 Gemma 系列自定义许可证的法律不确定性直接消除了。商用友好、可以修改分发,这是一个信号:Google 在认真对待开源这件事了,不只是放模型权重出来做做样子。

HF: https://huggingface.co/google/gemma-4-26B-A4B-it

Kimi K2.6

Moonshot 对 K2 系列的更新版本。综合能力继续往上走,目前在同级别开源模型里算第一梯队。

这次比较值得关注的是长程任务(long-horizon task)的能力——他们展示了模型能持续工作数小时来完成一个任务或者做性能优化,而不是在长对话里逐渐失去上下文。配合 K2.6 跑在 Mac 上做本地推理优化的演示,说明在端侧能力上他们也在认真做。

HF: https://huggingface.co/moonshotai/Kimi-K2.6

小米 MiMo V2.5 Pro

这个可能是最让人意外的。小米的开源模型团队(XiaomiMiMo)去年开始发模型,今年的 2.5 Pro 在基准上已经能和 Kimi K2.6、GLM-5.1 掰手腕了,并且在真实用户测试里的表现也不差。

许可证是 Apache 2.0,开放得很彻底。一家手机厂商能把模型做到这个水平,有点子牛逼了。

HF: https://huggingface.co/XiaomiMiMo/MiMo-V2.5-Pro

GLM-5.1

智谱对 GLM-5 的更新。这次重点放在长程任务上,和 Kimi K2.6 的方向有些接近——都在强调「不只是对话,能做持续性的工作」。综合得分有提升,在中文任务上依旧有优势。

HF: https://huggingface.co/zai-org/GLM-5.1


说几个可能相对低调但值得记一下的:

Laguna XS.2(Poolside AI):poolside 第一次发公开权重,一个 33B 激活 3B 的编程专向模型,本地可跑,能力在同尺寸里不差。他们的技术博客里有一篇关于编程评估里的 reward hacking 问题,写得很扎实,值得读一读。

Trinity-Large-Thinking(Arcee AI):推理版本的 Trinity,在 OpenRouter 排行榜上待了一段时间,适合跑 agentic 应用。

LFM 2.5-350M(LiquidAI):用 28 万亿 token 训练了一个 3.5 亿参数的小模型,可能是参数/训练量比最极端的模型之一,感兴趣的可以看看他们的训练策略。


聊完模型,说一个让我想多说两句的点。

这份 CAISI 报告出来之后,有人用它的结论说「中国开源正在落后」,也有人用它的方法论漏洞说「这评估不可信」。

我觉得这两种反应都在减少信息量。

真实情况是:评估基准在捕捉模型真实能力方面,本来就是不完整的。你用固定 bash 环境跑编程任务,和用 Claude Code 跑,结果天差地别。你用某几个你选择的基准测试,Elo 差距就是你选的那几个基准说了算。

这不是说那份报告造假,而是说标准化评估本质上是一种简化,而简化就有它看不到的地方。

真正的问题不是「开源比闭源落后多少个月」,而是「在你真正要用模型做的那件事上,哪个模型合适」。

这个月发了这么多模型,最大的好处是:选择多了,可以自己跑测试了,不用再靠别人的排行榜替你决定。

Kimi K2.6 跑你的代码任务可能很好,GLM-5.1 在中文场景里可能更顺手,MiMo 2.5 Pro 如果能本地跑又满足你的需求那就更省事了。

自己试,是唯一可信的评估方式。


最后说一句。

这个月的节奏提醒了我一件事:开源模型赛道的「爆炸」不是一次性事件,而是一种持续的状态。去年 DeepSeek R1 是一次冲击,然后大家以为会平息,但它没有平息,反而变成了一种新的基准线——每隔几周就有一两个值得认真看的新模型出来。

这对用模型的人来说是好事,选择在增加,成本在下降。

对于习惯了「等大厂闭源模型更新」的工作流,现在可能是时候重新看一眼开源这边了。


相关链接: