OpenRouter 周榜前五全是国产,登顶的不是 DeepSeek
6.13T tokens。
这是腾讯混元 Hy3 上一周在 OpenRouter 上被烧掉的 token 量。六万亿,一周。今天凌晨,腾讯混元的官方账号发推,宣布 Hy3 拿下 OpenRouter 大模型排行榜第一。距离它正式发布,刚过去六天。
我点开榜单看了一眼,比第一名换人更扎眼的是另一件事。周用量前五,腾讯 6.13T、小米 MiMo-V2.5 5.95T、DeepSeek 5.22T、MiniMax 4.26T、智谱 GLM 3.19T,全是国产模型。Anthropic 排最高的那个型号,第七。
好家伙。就在大家还在刷 GPT-5.6 Sol 和 Fable 5 的这一周,全球开发者的 token,一大半流进了国产模型的口袋。

不过先别急着转发国产之光。这个榜怎么读,里面的水分和真金怎么分开算,比第一名是谁有意思得多。今天想跟你把这笔账算清楚。
先讲这个榜是什么。很多朋友可能不知道,OpenRouter 是一个大模型的聚合网关,你接一个 API,就能在几百个模型之间随便切换。它的排行榜不是跑分榜,是用量榜,统计的是全世界开发者每周真金白银烧掉的 token。这两种榜的差别很大。跑分榜考的是模型会不会做题,题库是公开的,各家都会针对性优化,你懂的,高考做多了谁还不会应试。用量榜不一样,它记录的是开发者把哪个模型接进了自己的产品、自己的 agent、自己的工作流,用得不爽随时会换走。前者是考试成绩,后者是复购率。
所以海外圈子一直有个说法,benchmark 会说谎,OpenRouter 不会。开发者用脚投票,票数就是 token。
但这话只对了一半。这个榜有两个盲区,不知道的话很容易被带节奏。
第一个盲区,它只统计走 OpenRouter 的流量。OpenAI 和 Anthropic 的大客户基本都直连官方 API,那部分量根本不经过这里。所以 Anthropic 排第七,不代表 Claude 没人用,只代表通过聚合网关用 Claude 的人相对少。这个榜更像是中小开发者和独立开发者的民意调查,不是全市场的普查。
第二个盲区,也是这次的关键,免费额度会灌水。
翻一下腾讯混元发布当天的推文,里面明明白白写着,FREE API for 2 weeks。Hy3 从 7 月 7 日起在 OpenRouter 上限时免费两周,到 7 月 21 日截止。也就是说,它登顶的这一周,整周都泡在免费期里。
免费模型在 OpenRouter 上是什么待遇,接过 agent 的兄弟应该有体感。跑批量任务、刷合成数据、测试自动化流水线,第一反应都是先找免费端点薅。一个能打的模型挂上 free 标签,用量想不爆炸都难。所以 6.13T 里有相当一部分,是冲着不要钱来的流量,免费期一结束,这部分会退潮。
对比一下就更清楚。第二名小米 MiMo-V2.5 的 5.95T,是付费价位跑出来的,而且周环比还涨了 36%。DeepSeek 那 5.22T 更是常年稳定的存量。同样是 T 级用量,含金量不一样。
所以我的读法是,Hy3 这个第一,打个七折看。热闹是真热闹,水分也是真有。
那扣掉水分,还剩下什么,这才是我真正想聊的部分。
剩下的东西,恰恰藏在腾讯官方博客里那些不性感的段落里。我做的工作是给大模型搭脚手架,就是 agent 的工具链、调度、评测这些让模型真正干活的工程层,职业病使然,看模型发布我从来不先看跑分,先看它敢不敢公布生产环境的脏指标。Hy3 这次公布的几个数字,有点子牛逼。
第一个,跨脚手架稳定性。官方说 Hy3 在 Codebuddy、Cline、KiloCode 这几个不同的编程 agent 框架下跑 SWE Bench Verified(一个用真实 GitHub issue 考模型修代码能力的测试集),分数标准差控制在 4 个百分点以内。这条普通读者可能扫一眼就过了,但凡接过 agent 的人都知道这有多难。同一个模型,换个框架、换套工具描述,表现掉一截是家常便饭,模型对 prompt 格式的敏感度堪比猫对纸箱形状的执念。敢把跨框架方差写进发布博客的,我印象里这是头一家。
第二个,幻觉率。内部评测里幻觉率从 12.5% 降到 5.4%,常识错误率从 25.4% 降到 12.7%。注意,他们的目标写的是「有依据才回答、无依据明示缺失,数据和状态不乱编」。这个目标平平无奇,但愿意把降之前的数字也晒出来,等于承认自家上一版四分之一的常识陈述有问题。坦率讲,这种自曝比任何满分跑分都让我多信三分。
第三个,多轮对话不跑偏。多轮问题率从 17.4% 降到 7.9%,长对话理解基准 MRCR 从 42.9% 提到 75.1%。跑 agent 任务的时候,模型聊到第十几轮忘了最初的约束,是所有人都踩过的坑,这个指标直接对着痛点打。
再往下看参数和价格。Hy3 是 295B 总参数的 MoE 架构(Mixture of Experts,模型分成一堆专家小组,每次只叫醒一小撮干活),激活参数只有 21B,跑一次推理的算力开销跟一个 21B 的小模型差不多,效果却按官方说法能比肩参数规模两到五倍的旗舰。256K 上下文。腾讯云的定价是每百万 token 输入 1 元、输出 4 元,命中缓存 0.25 元。什么概念,主流旗舰模型输出价格普遍在它的十倍到三十倍之间。而且 Apache 2.0 开源,GitHub 和 HuggingFace 都能直接下,商用没有附加条款。

还有些侧面信号。发布第三天,IT 之家报道 Hy3 在腾讯自家的 WorkBuddy 上调用激增,排队率一度超过 50%,官方紧急扩容。X 上的 karminski 实测说这玩意 agent 能力超强,阿易那边的实测视频里,Hy3 写的前端 demo 直接调起摄像头做实时手部骨架追踪加粒子特效,帧率一百多不掉。这些都是免费薅不出来的口碑,薅羊毛的人不会帮你发实测视频。
盲测那条也值得一提,腾讯内部组织 270 位专家拿真实工作任务做盲测,Hy3 均分 2.67,比 GLM-5.1 的 2.51 高,前端、数据存储、CI/CD 这几类优势最明显。内部盲测当然要打个问号,裁判和选手一个东家。但结合上面那堆脏指标一起看,这个模型的画像是成立的,它不追求在任何一项上封神,它追求的是便宜、稳定、听话,接进生产环境不闹幺蛾子。
怎么说呢,这是一个奔着干活去的模型,不是奔着发布会去的模型。
顺着这个再多说一句背景。腾讯混元今年 1 月底才重建完基础设施,4 月底发 preview 版本,在五十多个业务里收反馈,7 月初发正式版,不到半年跑通了从底层基建到产品落地的全流程,另外这个模型已经接进了微信生态,服务的是十亿级的用户面。前几个月大家聊国产模型,说的都是 DeepSeek、Kimi、智谱、MiniMax,腾讯基本查无此人。结果人家闷头半年,第一次露脸就把海外开发者的周用量榜拿了。声量最小的那个玩家,用量先起来了,这剧情有点民谣了,火车驶向云外,梦安魂于九霄,谁都没注意的车厢里坐着个闷声干活的。
最后落到你能拿走的动作上。
如果你想试,现在到 7 月 21 日之间是窗口期,OpenRouter 上的免费端点零成本随便测,拿你自己的真实任务喂它,写代码、改 bug、跑多轮 agent 流程都行,别拿网上的段子题测,段子题各家都优化过。如果你有本地或私有化需求,HuggingFace 直接下权重,vLLM 已经官方支持,硅基流动和 OpenCode 上也有免费试用入口。
但如果你打算往生产环境接,我的建议是再等等。等 7 月 21 日免费期结束,等白嫖流量退潮,再看两个东西。一看付费转化后它在榜单上还剩多少量,那才是真实的复购。二看免费羊毛党撤走之后,付费端点的延迟和限流表现,现在的排队和扩容数据都被免费流量污染了,说明不了问题。
说实话,写到这我自己也还没想好要不要把手头一条流水线的模型换成它,1 元的输入价确实很难不心动,但生产环境的迁移从来不是看价格表做的决定,是看它连续跑两周不出幺蛾子才做的决定。
7 月 21 日之后,我会再去看一眼那个榜。潮水退了,留在沙滩上的数字才是这个模型真正的成色。到时候如果它还站在前五,那国产之光四个字,我一个字都不会打折。