MiniMax H3 最值钱的不是 2K,是开放权重
2K、15 秒、原生立体声,外加一个不到主流模型三分之一的价格。
把这几个词挤进一张发布海报,已经足够在今天的视频模型圈里横着走。可 MiniMax H3 的官方公告里,真正让我反复确认的是一句还没完成时态的话。
权重会在未来几天开放。
注意,是「计划开放」,不是已经下载到硬盘。现在的 ModelScope 页面更像一张预告票,许可证、完整权重、推理代码、显存需求和硬件适配到底长什么样,还要等文件真的落地再验收。
这个区别很要命。
今天把 H3 直接叫成「已经开源的视频模型」,属于把发货通知当签收短信。可如果 MiniMax 按承诺把那几块拼图补齐,它的分量又确实不只是多了一个能生成漂亮片子的网页入口。
我自己的判断是,2K 会很快被下一张参数表盖过去,开放权重才可能留下工具链。
视频模型终于开始离开抽卡机
过去两年,视频生成产品很像一排装修越来越豪华的老虎机。
你塞进去一句提示词,等几十秒,拿回一段视频。运气好,人物、运镜、光线都对。运气差,手指多一根,招牌少一个字,或者前九秒很稳,收尾一秒突然物理学休假。
用户能做的通常是改提示词,再抽一次。
闭源 API 当然也能做生产系统。MiniMax 现有的视频 API 文档已经提供文生视频、图生视频、首尾帧和主体参考,任务提交、轮询状态、拿回文件这一套也很标准。广告公司和应用开发者不需要养 GPU,接 API 反而省事,这点没必要硬拗。
问题出在更深一层。
当视频生成进入真正的制作流程,团队要管的就不再是「能不能出一条片」,而是版本能不能固定、同一角色能不能跨镜头稳定、敏感素材能不能不出内网、一个镜头改坏后能不能回滚、成本突然翻倍时能不能换推理后端。
这些活听着不像发布会上的主角,却决定模型能不能进生产。做过一点 Agent 工程的人大概都熟悉这种尴尬,demo 的收尾动作是点击生成,系统的第一步才刚从这里开始。
权重开放之后,玩法会变。
推理框架可以针对 H3 做量化、分块加载和显存调度,硬件厂商可以自己补算子,工作室可以固定某个版本做回归测试,企业也能把未公开的商品、分镜和音频留在自己的边界里。再往前一步,社区还可能长出节点编辑器、LoRA、角色一致性工具、批量评测器和各种奇怪但有用的工作流。
好家伙,这才是开源模型最能打的地方。不是每个人都去训练一遍,而是有人愿意把模型周围那些脏活累活做成公共零件。
MiniMax 的官方 X 公告发布后,H3 很快同时出现在 r/StableDiffusion 和 r/LocalLLaMA 的热门讨论里。两个社区关心的点也很诚实,大家不是只围观样片,而是在追问权重什么时候到、ComfyUI 能不能首日接上、普通显卡到底跑不跑得动。
这群人的兴奋,不是又多了个网站可以充值。
是终于可能拿到扳手。

黑箱只能接片,开放底座才能接上版本、硬件、监控和工具链。
H3 真正统一的不是输入框
当然,只有开放还不够。一个能力平平的模型把权重发出来,也不会自动变成基础设施。
H3 值得继续盯,是因为它试图把视频生成里那些被切碎的任务重新揉回一个模型。
官方示例很能说明问题。用户可以给一段参考视频、一张人物图片和一段音频,然后用自然语言要求模型参考视频里的希区柯克式镜头运动,让图片中的人物唱歌,并让人声匹配音频。
以往这类需求要拆成好几段。先锁人物,再迁移动作,再做口型,再配音,再补音效,任何一步的输出漂一点,后面就跟着歪。H3 想让文本、图片、视频和音频共享同一份上下文,由语言描述它们之间的关系,再统一生成和编辑。
这里的关键词不是「支持四种输入」,而是关系。
把四个文件拖进输入框不难,难的是模型知道视频一提供镜头运动,图片二提供人物身份,音频三提供声音与节奏,而且修改背景时别顺手把人物的衣服和声线一起换掉。真正的创作意图,从来不是素材列表,而是一张约束关系网。

多模态的难点不在四个输入框,而在素材之间的关系能否被理解和验收。
MiniMax 给这套表示起了个挺长的名字,Contextual Omni Representation。大白话讲,就是让语言当总调度员,把不同模态和目标视频之间的关系说清楚。官方披露,多数原始素材需要约 10 万 token 的推理,再被蒸馏成平均约 4000 token 的描述。
这个数字很有意思。它提醒我们,视频模型眼里的「一句提示词」,背后可能是一大段关于人物、动作、镜头、声音和时序的结构化理解。屏幕上看着干净,机房里一点都不轻松。
如果 H3 的上下文表示能随权重一起开放,社区拿到的就不只是一个从噪声到画面的黑盒,还有机会把创作流程中的约束做成可以组合、可以检查的中间层。到那时,视频 Agent 才不只是替你点击生成按钮,它可以读分镜、配素材、规划镜头、调用模型,再让另一个检查器验人物、字幕、品牌标识和声音是否过关。
有点子牛逼的地方就在这里。模型开始从「画面生成器」往「多模态执行器」挪。
2K 背后那笔更值得看的工程账
发布稿里最抢眼的自然是原生 2K,但 H3 并不是把低清结果交给一个传统超分模块放大。
官方称,它会让基座模型带着原始多模态上下文,重新生成自己的低分辨率结果。传统超分遇到小字和细节丢失时,只能根据附近像素猜一个看起来合理的答案。H3 的 In-Context Regeneration 则能再次读取人物、文字、图片和音频约束,尝试把原本该有的细节找回来。
这对品牌、电商和 UI 场景比单纯的分辨率数字重要得多。
一张海报里的小字错了,1080p 放大到 2K 只会得到更清晰的错字。产品包装上的 Logo 漂了,锐化得再漂亮也不能交付。带着上下文重生成,至少在设计上承认了一个事实,高清不是像素多,高清得先把内容做对。
H3-VAE 也在替这件事付账。VAE 可以理解为把视频压进模型容易处理的潜空间,再从潜空间还原。MiniMax 称新版 VAE 带来 4 倍有效序列长度,降低训练与推理成本,也是原生 2K 的关键。
另一笔账藏在训练调度里。多模态上下文让序列长度的方差扩大到原来的 3 倍,理解和生成又是两类很不一样的计算负载。H3 把两者分开调度,并在单个样本的异构计算与多个样本的负载均衡之间做权衡,端到端训练吞吐提升接近 30%。
这段看着很工程,甚至有点不适合放发布会大屏。但它恰好解释了为什么我更关心权重。
一个视频模型要成为底座,画质只是入场券。更高的压缩率、可拆分的计算负载、对硬件兼容的提前考虑,才决定社区能不能把它塞进不同的 GPU、云平台和本地节点。硬件适配如果只能由原厂做,所谓开放生态很快会卡在安装报错上。
MiniMax 还宣称,H3 的 2K 每秒价格低于主流模型三分之一,768p 则低于主流 720p 模型的一半。这个数字先别急着当横评结论。官方没有在公告里给出完整对照表,生成时长、失败重试、峰值并发和具体套餐都会改变真实成本。
但方向很清楚。视频模型的竞争正在从谁能做出最惊艳的一条样片,转向谁能把每一秒可靠地塞进工作流。
先别急着替开源庆功
写到这里得泼一点冷水。
H3 的完整技术报告还没出来,权重也没真正放出。模型多大、要多少显存、许可证允不允许商用和微调、有没有完整推理代码、主流消费卡能跑到什么速度,目前都没有答案。
「开放权重」和「开源」也不是同一个词。权重可下载,不代表训练数据、训练代码、评测脚本和许可证都开放。对普通创作者而言,如果一次生成仍要多张高端卡,社区版本可能依旧离桌面很远。对企业而言,如果许可证限制关键场景,私有部署的想象空间也会打折。
所以我会把 H3 的验收拆成三个时间点。
今天验收的是方向。统一多模态上下文、原生立体声、上下文内重生成,加上明确的开放权重承诺,这套组合够新,也对准了生产流程的痛点。
权重落地那天验收的是诚意。文件是否完整,许可证是否清楚,推理代码能不能复现官方结果,硬件适配是不是只有一句愿景,都得逐项看。
再过几周验收的才是生态。ComfyUI 节点有没有长出来,量化版本损失多大,消费卡是否能跑,角色一致性和文字渲染能不能经住批量测试,社区会用实际项目投票。
棒棒的,参数发布会终于快结束了,接下来轮到 CUDA out of memory 发言。
我可能看走眼,H3 也可能在权重发布后暴露一堆工程问题。但视频生成走到今天,最缺的已经不是另一段能刷屏十五分钟的 demo,而是一块允许开发者拧螺丝、换零件、接监控、做回归的底座。
2K 会过时,15 秒会变成 30 秒,价格也会继续往下掉。
能不能让别人拿着扳手进来,才决定一款模型最终留下的是海报,还是一条路。