20 秒视频是顺手的,FLUX 3 瞄的是机器人
昨晚,Black Forest Labs 发布了 FLUX 3。一家靠文生图起家的公司,官宣帖里排面最大的两个合作方,一个是造机械手的瑞士机器人公司 mimic,另一个是奥迪。
不是 Canva,不是 Freepik,是机械手和汽车厂。
今天中文圈的标题基本都在刷同一个点,单条 prompt 生成 20 秒视频,还带原生音频。这确实猛,猛到值得刷屏。但我把官方博客和 VentureBeat 的深度报道翻完之后,感受是 20 秒视频只是这次发布里最好传播的那部分,真正的赌注写在官宣帖最后一句,我们的模型可以扩展到为机器人预测动作。
一个做图的,图还没做到头,跑去教机器人干活了。这事我想跟你唠唠。
先把通稿部分快进完,两百字。FLUX 3 是一个多模态基础模型,图像、视频、音频在同一个架构里联合训练,不是三个模型拼在一个接口后面。产品线有四条,FLUX 3 Video、FLUX 3 Image、FLUX 3 Action,外加一个之后才来的开源版 FLUX 3 Dev。Video 支持文生视频、图生视频、关键帧转场、多语言对白,单次最长 20 秒,每条视频自带同步音频。现在 Video 和 Action 进入审批制的 Early Access,谁都能申请,BFL 说了算。没有公开 API,没有定价,Image 要再等几周。

官方给的初步评测里,10 秒 720p 文生视频的人类偏好对比,FLUX 3 对 Luma Ray 3.2 胜率 93%,对 Runway Gen-4.5 胜率 77%,对 Kling v3 Pro 六成,对 Google 的 Gemini Omni Flash 是 52%,五五开。注意这些数字全部标注了「早期候选检查点的初步评估」,测的还不是现在放出来的这版,方法学和样本量都没公布。赢 Luma 和 Runway 算赢了两个成名已久但已经不在第一梯队的对手,跟 Omni Flash 打平才是真正有信息量的那行,因为 Omni 已经全量可用,Gemini API 上 720p 视频每秒 0.10 美元,明码标价。一边是能买到的五五开,一边是买不到的五五开,企业选型的人今天没法为 FLUX 3 算任何一笔账。

通稿到此为止。下面聊我真正想聊的。
回到官宣帖那句话。BFL 说,因为图像、视频、音频是在一个统一架构里联合训练的,这个架构可以直接扩展去预测机器人的动作。这背后是他们今年 3 月发的 Self-Flow 训练方法,简单讲就是让理解和生成共用一套表征,而不是各学各的。这次他们把算力和数据都加大加满,然后发现一件挺关键的事,视频生成和动作预测不需要两个独立的地基,同一个模型底座,学会了生成视频,顺带就有了预测动作的潜质。
如果你平时不看机器人这条线,我用人话展开一下这为什么重要。
机器人领域这几年最流行的一个词叫世界模型,听着玄乎,拆开很朴素,就是一个能在脑子里预演世界的模型。你把一杯水推到桌子边缘,它能预判下一秒杯子会掉下去、会碎、会溅一地。人脑里天生带这套仿真器,所以你伸手接住往下掉的手机根本不用思考。机器人没有,它每学一个新动作,都得靠真实世界的演示数据硬喂。
而喂数据这件事,贵到离谱。
mimic 的 CTO 在采访里说得很直白,机器人最难的部分是数据,每个新任务通常都要让机器人重复自己几个小时。行业里常见的量级是一个操作任务 30 小时以上的演示数据,一个真实的机械臂,一遍一遍地抓杯子、放杯子、抓杯子、放杯子,旁边还得有人盯着。我是搭 AI 脚手架的,天天为了攒点像样的评测数据到处扒拉,看到「每个新任务 30 小时真机数据」这种成本结构,只能说一声敬佩,这比我们苦多了。
视频模型的机会就在这里。一个把互联网视频看了个遍的模型,见过无数杯子掉落、门被关上、手指捏起东西的画面,物理世界怎么运转的常识已经在权重里了。BFL 的原话是,图像教会结构,视频教会动态,动作揭示因果。在这样的底座上教机器人,不是从零教,是唤醒。
他们跟 mimic 合作的 FLUX-mimic 给出了第一个数字,在 FLUX 3 的视频底座上微调一个具体的操作任务,最少只要 30 分钟的机器人数据。此前要 30 小时以上的活,现在 30 分钟。六十倍。
好家伙。这个数字要是能在更多任务上站住,机器人学习的成本结构就直接改写了。

当然,谦逊铺垫还是要有的,这数字出自官方通稿和合作方 CTO 之口,带着「depending on task difficulty」的限定词,独立复现一个都还没有。30 分钟是宣传口径里最好看的那个刻度,实际落到千奇百怪的任务上会衰减多少,谁也不知道。我的态度是数字先打个七折听,但方向本身我信,因为押这个方向的不止 BFL 一家。上周 arXiv 上有篇 ABot-World-0,做的是动作条件的视频世界模型,一张 RTX 5090 就能跑 720P 的交互式世界生成。学界工业界最近全在往同一个口子挤,视频生成模型顺路变成物理世界的仿真器,这已经不是某一家的叙事,是一条正在成型的公路。
BFL 的 CEO Robin Rombach,就是当年 Stable Diffusion 论文的一作,这次说了一句我觉得会被反复引用的话,你没法在现实面前作弊,只学图像的模型只能生成图像,但世界不是由静止帧组成的,它会动、会响、会变化、会回应。
这句话有点子牛逼的地方在于,它顺手宣判了纯文生图这个赛道的天花板。
你想想看,图像生成卷到今天卷什么,手指头终于不多不少了,文字终于不乱码了,光影终于像回事了。然后呢。单张好看的图,商业价值的上限肉眼可见,壁纸、海报、电商详情页。而 BFL 给出的路线是,图像只是世界的一帧采样,把帧连起来是视频,把视频里的因果学出来是动作,把动作接到真实硬件上,是机器人。每往前走一步,可触达的市场就换一个量级。奥迪出现在合作名单里,大概就是这个逻辑的注脚。
所以我的判断是,20 秒带声视频是 FLUX 3 拿来进场的门票,牌桌上真正押的是「视觉智能」这个大盘,创意工具、仿真、电脑操作、机器人,全算它的射程。别人发视频模型是为了跟 Kling 和 Veo 抢生成市场,BFL 发视频模型,一半心思在给机械臂造大脑。
聊完远方,回来算一笔近处的账,这笔账跟屏幕前用 FLUX 干活的你更相关。
这次发布,没有权重。
可能有小伙伴对这几个字没什么体感。FLUX 能有今天的江湖地位,靠的不是 API 卖得好,是 FLUX.1 dev 这个开放权重版本。权重开放,你就能把模型下载到自己机器上跑,能在它上面练 LoRA,一种只训练一小块外挂参数、让模型学会特定画风或人物的轻量微调法。整个开源图像生态,ComfyUI 里的工作流、Civitai 上几万个风格 LoRA、无数小团队的定制管线,都长在这个权重上。BFL 起家的剧本就是 Stability 出走的团队用开放权重换来整个社区的拥护。
而 FLUX 3,Video 和 Action 走审批制内测,Image 几周后 API 上线,开源的 FLUX 3 Dev 排在整个发布序列的最后,官方说法是今年晚些时候。
这个顺序本身就是表态。旗舰先闭源商业化,开源版慢一拍,等价值最高的窗口期过了再放。这条路眼熟不,Mistral 走过。开源起家攒声量,模型一到前沿水平,最好的那版就开始收着放。我不是在指责,训练多模态大模型的算力账单摆在那,德国公司融资环境又不如湾区,商业上这么排完全能理解。但对着 FLUX.1 dev 生态吃饭的开发者,实打实的处境变化也得摊开说。
坦率讲,短期内天塌不下来。FLUX.1 dev 的权重就在你硬盘里,已有的 LoRA 和工作流一个都不会失效,图像生成该怎么跑还怎么跑。真正的变化在预期层面,从今天起,你手里那套东西的技术代差开始计时了。等 FLUX 3 Image 的 API 上线,闭源版在复杂 prompt 和文字渲染上的优势落到实处,客户就会开始问,为什么你出的图不如别人家的。而你能摸到的开源版,要等到年底,等来的具体是什么规格、什么许可证,现在没人说得准。
值得记一笔的是,BFL 对 FLUX 3 Dev 的承诺范围其实比历代都大,官方博客的原话是开放权重的多模态骨干,覆盖视频、音频、图像和动作预测。以前的 Dev 只给图像,这次纸面上是全家桶。如果真兑现,那会是开源社区第一个能本地跑的多模态世界模型底座,搞机器人的实验室怕是要连夜排队。但纸面承诺和 Hugging Face 上一个能下载的权重文件之间,隔着大半年的商业考量,我建议期待放着,决策别等它。
具体点的建议就三条。手里有成熟 FLUX.1 dev 管线的,继续跑,别慌着迁移,闭源新版没定价没 API,你现在想跳也没地方跳。做视频生成选型的,把 FLUX 3 放进观察列表但别下结论,等公开 API 和正式 benchmark,记住现在那份漂亮的胜率表测的是个早期检查点。而如果你在碰机器人或者具身方向,去把 Early Access 申请填了,30 分钟微调这个说法值得亲手验一验,万一是真的,你比同行早半年上车。
写到这儿想起来,两年前大家讨论 BFL 的时候,话题还是他们的图为什么比 Midjourney 有质感。两年后他们发布会的主角换成了机械手和汽车。做图的不想只做图了,做视频的目标不是好莱坞,这个行业的公司好像都在偷偷换赛道,往同一个方向,让模型从看世界走到碰世界。
奥迪和 mimic 站在官宣帖里的画面,大概就是下一个时代提前发来的一帧预告。至于 20 秒的视频,那是给我们这些还停留在屏幕前的人,顺手发的糖。