598GB 压到 85GB,腾讯把旗舰模型塞进一张卡
上周你想在自己机器上跑腾讯的旗舰模型 Hy3,得先凑出将近 600GB 显存,八卡服务器起步,个人玩家基本可以散了。今天开始,一张卡就行。
腾讯混元上午发了公告,给 Hy3 出了官方量化版。1bit 版本 85.5GB,单张 96GB 推理显卡装得下,4bit 版本 169.9GB,两张卡。权重都在 Hugging Face 上,还顺手把 llama.cpp 的适配 patch 一起开源了。
昨天我刚写过 Hy3,它发布六天冲上 OpenRouter 用量榜第一,当时我提醒过,那个榜有免费期灌水的成分,得看 7 月 21 日免费期结束后的留存。结果第二天官方就把「你自己搬回家跑」这条路铺好了。这个节奏怎么说呢,很难不怀疑是排好的,先用免费期让全世界开发者尝到味道,再在热度最高的时候放出量化版,告诉你免费期结束也不怕,整个模型你可以直接拿走。运营节奏有点子牛逼。
不过今天不聊运营,聊点实在的。「295B 单卡可部署」这句话,每个字都是真的,但每个字后面都挂着一行小字。我替你把小字读完了,咱们一笔一笔算。
先从量化本身讲起,很多朋友可能不知道这玩意的原理,其实特别朴素。模型的权重本来是用 16 位浮点数存的(BF16 格式,每个数占 2 个字节),295B 个参数就是接近 600GB。量化做的事,就是把这些 16 位的数压成更短的整数,4bit 是压成 4 位,体积砍到四分之一,1bit 理论上砍到十六分之一。代价是精度,就像把一张 RAW 照片压成 JPEG,压得越狠,细节丢得越多。
但这次公告里有个细节值得抠一下。官方说的 1bit 版本,格式叫 IQ1_M,这是 llama.cpp 社区定义的一种量化格式,名义上平均每个权重 1.75 bit,并不是字面上的 1 bit。而且模型里有些部分是不能狠压的,embedding 和关键的注意力层一压整个模型直接变傻,所以这些地方保留了更高精度。我拿文件体积倒推了一下,不带 MTP 的纯权重是 83.4GiB,乘 8 再除以 295B 个参数,平均下来每个权重差不多 2.4 个 bit。
所以严格讲,这是一个「2.4bit 版本」。好家伙,从 16 压到 2.4,缩了 6.7 倍,这依然是个狠活,但离「1bit」这个数字还是有段距离的。这也不是腾讯一家的叫法问题,整个社区都管 IQ1 系列叫 1bit,你知道这层换算关系就行,别真以为权重被压成了 0 和 1。

第二笔账,压掉的这些 bit,换走了多少智商。
官方的说法是,4bit 版本(Q4_K_M)在绝大多数位置上的输出分布和满血版几乎一致,Agent、多语言代码、长文理解都贴着满血走。这个我倾向于信,4bit 量化这两年在开源社区已经被验证烂了,Q4_K_M 基本是公认的无痛档,大家平时跑 DeepSeek、跑 Qwen 的量化版也都是这么选的。

1bit,好吧,2.4bit,就没那么理所当然了。按老经验,压到 2bit 附近模型会明显变笨,开始胡言乱语都不稀奇。官方说他们的 1bit 版本长文理解几乎持平满血,代码和 Agent 只有小幅回落,如果属实,这个成绩是超出我预期的。不过这里得挂个免责声明,这些数字全部来自官方自测,第三方复测还没出来。llama.cpp 社区那帮量化狂人应该这两天就会把困惑度曲线跑出来,建议观望两天再下载,毕竟 85GB 不是小流量。

我的建议特别简单,预算够两张卡就上 4bit,只有一张卡又非要本地跑再选 1bit,并且做好它在复杂推理上偶尔犯迷糊的心理准备。顺带一提,公告里还有个 GPTQ Int4 版本,可以直接用 vLLM 部署,那个是给要对外提供服务的团队准备的,个人玩家看前两个就行。
公告里还有一个容易被扫过去的点,我反而觉得是最有诚意的部分。他们给 llama.cpp 写了 MTP 支持的 patch,直接公开了。
MTP(multi-token prediction,多 token 预测)可以理解成模型自带的草稿员。正常生成是一个 token 一个 token 往外蹦,MTP 让模型一次多猜几个,再批量验证,猜对了就白赚。官方数据是接受率稳定在 60% 左右,1bit 版本解码提速 50%,4bit 提速接近 60%。投机解码这个思路本身不新鲜,但给一个 295B 的模型在 llama.cpp 里补全 MTP 支持,是实打实的工程苦活,而且 patch 公开之后别家模型也能照着抄。这一手比多发十张跑分图有诚意。
第三笔账,硬件。这可能是大部分人最关心的,也是幻灭来得最快的地方。
单卡可部署,指的是单张 96GB 的推理显卡。你手里的 4090 是 24GB,5090 是 32GB,都差着好几倍。96GB 这个规格,对应的是 RTX PRO 6000 这个级别的专业卡,一张的价格大概能买四五张 4090。所以「单卡」的意思不是你机箱里那张卡,是机房里那种卡只需要一张了。
但先别关页面,GGUF 这个格式还留了另一条路。llama.cpp 的看家本领就是 CPU 和 GPU 混着跑,权重放进内存也能推理,只是慢。而 Hy3 有个特殊的地方,它是 MoE 架构(Mixture of Experts,模型内部分成一堆专家,每次只叫醒一小撮干活),295B 总参数每次推理只激活 21B。对本地部署这是天大的好消息,因为生成速度主要卡在每生成一个 token 要搬多少权重,21B 的激活量摊到 2.4bit 上,每步实际要读的数据并不吓人。
这条路上最现实的选手,其实是大内存的 Mac。128GB 统一内存的 Mac Studio 刚好能把 85.5GB 权重连带上下文一起装下,内存带宽也够看。说实话我自己还没试,也没有 128GB 的 Mac 给我试,老板如果你看到这段就当我没说。但按 MoE 的账面数据估,跑出能用的速度是有戏的。评论区如果有 Mac Studio 的朋友跑通了,求一份每秒 token 数,我是真的好奇。
第四笔账,也是最扎心的一笔,钱。
昨天说过,Hy3 在 OpenRouter 上的正式定价是每百万 token 0.14 美元,折合人民币一块钱出头一百万 token。一张 96GB 的专业卡按六万块算,这笔钱全拿去买 API,够你烧掉六十万亿 token。什么概念,Hy3 登顶那一周,全世界开发者在 OpenRouter 上总共才烧了 6.13 万亿,你一张卡的钱够全球用量烧十周。这还没算电费、折旧,和你半夜调环境的那些时间。
所以如果你上本地部署的理由是省钱,可以醒醒了,这笔账在数学上就不成立。旗舰模型的推理是规模生意,数据中心的单 token 成本永远比你家里低一个数量级。
那这个量化版到底给谁用,我寻思了一下,大概四种人。数据出不了门的,医疗、金融、法务,或者公司内网有硬性合规要求,API 再便宜也没用,以前这类场景只能拿小模型凑合,现在能上旗舰了,这是真刚需。要离线的,船上、野外、没网的实验室。要魔改的,研究员要看原始 logits、要改采样策略、要接自己的推理框架,API 不会给你这些。最后一种,纯粹的折腾魂,在自己机器上跑通一个 295B 模型这件事本身就是目的,不需要商业理由,这种快乐我完全理解,而且尊重。
你想想看,两年前这个名单上还有一大类人,图便宜的。当年 GPT-4 的 API 贵得肉疼,本地跑开源模型是真能省钱。现在国产旗舰把价格打到一块钱一百万 token,这类人已经被 API 收编了。本地部署从省钱手段变成了一种主张,我的数据我做主,我的模型我做主。
文章开头那个对比,600GB 到 85GB,最后想再多说一句。
这次真正的变化不是腾讯多传了几个文件,是跑得起旗舰模型这件事的门槛,从一个机构的预算降到了一个发烧友的预算。六万块当然不便宜,但它第一次进到了个人咬咬牙够得着的区间,和八卡服务器是两个物种。开源模型放出权重只是第一步,量化、llama.cpp 适配、MTP patch 这些脏活干完,权重才真正属于社区。
昨天的用量榜讲的是有多少人在租这个模型,今天的量化版讲的是有多少人能拥有它。租和有之间隔着什么,每个在大城市交过房租的人都懂。
Hy3 的免费期 7 月 21 日结束。量化版没有免费期,它下下来就一直是你的。