小岛AI
| ONLINE |

posts/qwen38-open-weights-delivered.md

Qwen3.8 权重真来了,但普通开发者先别急着下载

小岛AI 2026 / 08 / 15

Hugging Face 上,213 个权重分片排得整整齐齐。

这一次,不是 Preview,不是 API 模型名,也不是「很快开放」四个字。

Qwen 官方组织已经放出 Qwen3.8-2.4T-A95BQwen3.8-2.4T-A95B-FP8 两个仓库。模型卡、配置、Tokenizer、聊天模板、许可证、权重索引和 safetensors 文件都在,仓库公开,也没有申请访问的闸门。

七月十九日,Qwen 官宣 2.4T 新旗舰时,权重还是将来时。那时能摸到的只有托管的 Qwen3.8-Max-Preview,官方承诺「很快」开放权重。一个月不到,那张期票兑付了。

这件事值得单独写一篇跟进,不是因为参数又变大了,也不是因为官方跑分表又添了一列。

而是「承诺」终于变成了可以验收的交付物。

上次那张期票,今天能划掉了

程序员对「即将支持」都有一点条件反射。文档里写了这四个字,脑子里会自动生成一个没关的 issue。什么时候代码合并,什么时候版本发布,什么时候真实用户拉下来能跑,那个勾才算划掉。

Qwen3.8 这次至少把最重要的几项交齐了。

两个仓库的提交历史显示,最早一批权重在八月九日上传,模型卡和许可证随后更新。BF16 仓库里有 213 个权重分片,权重索引记录的总大小约 4.89 TB,换成大家看存储时更常见的二进制单位,大约 4.45 TiB。官方 FP8 仓库同样是 213 个分片,约 2.50 TB,也就是 2.27 TiB。

Qwen3.8 的 BF16 与官方 FP8 权重体积对比

图 1,体积来自两个官方权重索引,FP8 约为 BF16 的一半。

好家伙,光是「比较省」的那份 FP8,就足够让不少 NAS 当场进入贤者时间。

但体积大不影响交付成立。开放权重最核心的意义,本来就不是保证每个人都能在书房里跑起来,而是外部可以检查文件、研究结构、适配框架、做量化和微调,也能把厂商的能力声明放进独立评测里重新过一遍。

七月时,社区只能测试托管 Preview,无法确认服务端到底用了什么精度、推理预算和运行参数。今天,完整配置文件已经摆在桌上。92 层,2.4T 总参数,每个 token 激活 95B,512 个路由专家里选 10 个,再加 1 个共享专家。整套骨架由 69 层 Gated DeltaNet 线性注意力和 23 层完整注意力交错组成,原生上下文是 262,144 token,官方称可扩到 1,010,000 token。

MoE(Mixture of Experts,混合专家)里的 95B 激活参数,回答的是每一步主要算多少,不是机器只需装下多少。下一枚 token 可能去找另一组专家,整套 2.4T 权重仍要待命。

Qwen3.8 总参数与每 token 激活参数对比

图 2,95B 描述单步计算量,不是权重驻留量。

所以这次最准确的更新不是「Qwen 又宣布开源」,而是「Qwen 把旗舰开放权重真的交出来了」。前一句是新闻,后一句才是验收结果。

这点我愿意给一个明确判断,承诺兑现了。

两个仓库,不是同一份文件换了名字

很多朋友看到 BF16 和 FP8,容易把后者理解成压缩包版本,下载更小,解压以后都一样。

没那么简单。

BF16 用 16 位浮点数保存主要权重,体积接近 4.45 TiB。FP8 把大量权重量化到 8 位浮点格式,官方 config.json 写明采用动态激活量化和 128×128 的细粒度分块。它把权重体积压到约 2.27 TiB,差不多砍掉一半,也更适合支持 FP8 的数据中心 GPU。

FP8 模型卡称性能指标与原始模型近似。这里得留半步,这是官方口径,不是第三方已经复现完毕的结论。量化误差、推理内核、并行策略和采样参数都可能影响真实任务。仓库出现只是让独立验证终于可以开始,不会把厂商跑分自动升级成社区共识。

另一个更容易踩坑的地方,是开放 checkpoint 和云端 Qwen3.8-Max 并不完全同构。

官方模型卡写得很直白,开放的 Qwen3.8-2.4T-A95B 是纯文本模型,不支持图片输入,所有交互必须开启思考模式,不能关闭。每次响应会先生成 <think>...</think> 里的推理内容,再给最终答案。推理深度可以用 reasoning_effort 调成 xhighmediumlow,历史推理上下文默认通过 preserve_thinking 保留。

Qwen Cloud 的 Qwen3.8-Max在这个底座上额外提供视觉输入、非思考模式、默认 1M 上下文和官方内置工具。

这块非常关键。

有人用云端 Max 看图、调用内置搜索,再把 Hugging Face checkpoint 拉下来,发现同一个模型名怎么少了功能,第一反应很可能是部署坏了。其实不是 bug,是产品边界不同。权重开放不等于托管服务的全部能力一起打包下载,云端还有外围模型、工具、运行时和产品逻辑。

厉害了,开源之后第一个工程任务,居然是先别把两个 Qwen3.8 当成同一个东西。

2.27 TiB 只是入场券

如果只看 95B 激活参数,可能会产生一个挺危险的错觉,这不就是一个计算量接近百亿级的大模型吗,多插几张卡应该能跑。

少算,不等于少装。

Qwen 的官方模型卡推荐生产和高吞吐场景使用 SGLang、vLLM 或 TokenSpeed,并强调要用最新框架版本。真正打开 vLLM 的 Qwen3.8 部署配方,硬件画风就很诚实了。

当前配方把这款模型标为 advanced。它不是拿权重大小刚好塞满显存,而是额外留出约两成空间,给 KV cache、运行时 buffer、路由和并行通信。按这套容量规划,BF16 需要约 5,871 GB 显存,FP8 需要约 2,996 GB。配方给出的 B300 示例规模分别是 24 张和 16 张,换成 H200 则是 48 张和 32 张。

这些数字不是宇宙常数。上下文缩短、并发降低、CPU offload、更新的内核和别的量化格式,都可能改变部署规模。可它们足够说明量级,官方 FP8 不是一张消费级显卡,也不是普通八卡工作站的活。按当前成熟配方,它是一套多节点服务工程。

再加上 262K 原生上下文,问题会更热闹。模型权重是固定房租,KV cache 是随着上下文和并发增长的水电费。把 2.27 TiB 权重勉强塞进去,只代表门打开了,不代表还能让十几个长任务同时坐下吃饭。

SGLang 的官方 Cookbook甚至为不同 GPU、精度、节点数、专家并行和投机解码分别给配置。看完那张矩阵,个人电脑上的下载按钮突然有了一点行为艺术感。

坦率讲,这不是在劝退开源。

这是把「能下载」和「能稳定服务」分开。前者今天已经实现,后者需要机房预算、网络拓扑、框架版本和一堆性能工程。忽略这层差异,才会把开放权重写成一场人人今晚都能参加的本地狂欢。

许可证很宽,但不是 Apache 2.0

七月预告时,还有一项完全没法验收,许可证。

现在答案也落地了。

Hugging Face 把它标成 license:other,仓库里使用自定义的 Qwen3.8-Max License。它给的基础权限很宽,包括使用、复制、修改、合并、发布、分发、再许可、出售、部署、托管、微调和创作衍生作品。个人研究、小团队实验、企业内部部署和很多普通商业项目,都有明确可走的空间。

但它不是 Apache 2.0,不能只看见「免费」两个字就把法务评审删了。

许可证要求复制或分发时保留版权与许可声明。商业产品或服务如果月活超过 1 亿,或者月收入超过 2,000 万美元,需要在产品界面显著展示对应模型名称。

更要紧的一条,经营 Model as a Service,也就是让第三方通过 API 或托管端点控制模型输入、参数或训练数据,或者经营以 AI 编程、办公生产力为主的 AI Work Assistant,且许可方与关联方连续任意 12 个月合计收入超过 5,000 万美元,商业使用前要另行取得 Qwen 许可。

纯内部使用有豁免,前提是不向第三方提供软件、输出或底层模型能力。翻译成项目语言就是,给自己公司内部员工用,和把能力包装成外部 API、编码助手卖给客户,走的不是同一张检查表。

怎么说呢,这份许可证对绝大多数开发者很友好,对做到相当规模的平台业务则把边界写得很具体。真正需要紧张的不是周末做 Demo 的人,而是准备把它塞进商业模型服务、AI IDE 或办公助手,并且业务已经跨过收入门槛的团队。

到那个体量还靠工程师在 README 里猜许可证,多少有点子牛逼了。把法务叫进群,成本比上线后补许可低得多。

普通开发者真正拿到的,不是 2.27 TiB 文件

讲到这里,可能有人会问,既然个人跑不动,许可证还有条件,这次开放跟普通开发者有什么关系。

关系不在于每个人都把 213 个分片下载完。

第一层价值是可验证。社区可以核对架构、量化方案和聊天模板,推理框架能针对真实 checkpoint 做适配,评测团队也不必只信托管接口。模型卡上的成绩仍然是厂商成绩,但终于有了被复跑、被质疑、被修正的入口。

第二层价值是可迁移。云厂商可以部署同一份权重,企业可以在自己的环境里做数据隔离,研究团队可以继续量化、蒸馏和微调。普通开发者未必拥有集群,却能使用竞争带来的更多托管入口、更低价格和更透明的运行选项。

第三层价值是可退出。API 供应商涨价、限流或改变产品策略时,权重存在就多一条迁移路径。这个路径很贵,不代表它没用。灾备方案平时也不拿来跑主流量,可它的存在会改变采购谈判和技术决策。

当然,今天也别急着宣布一切已经圆满。第三方还需要复现性能,框架还会继续修兼容性,社区量化要验证精度,托管商也要把多节点账单算明白。开放权重是独立验证的起点,不是验证已经结束。

我自己的判断是,Qwen 这次做对了最重要的一件事。

它没有让「很快」无限期漂在公告里。

七月那面写着开源的旗子已经升起来,八月这艘装着 213 个分片的船也真的靠岸了。箱子很重,使用说明里还有几行必须读的小字,但船上确实有货。

期票,可以收进档案了。