FLUX 3 Video 介绍
FLUX 3 是 Black Forest Labs 的首个多模态基础模型。本文介绍它的视频生成能力,以及统一的图像-视频-音频架构为何重要。

FLUX 3 Video 是 FLUX 3 的视频生成能力。FLUX 3 是 Black Forest Labs(BFL)在 2026 年 7 月发布的新一代多模态基础模型,目前处于早期访问阶段。这也是 BFL 首个在单一架构下联合训练图像、视频与音频的模型。
不只是视频模型,而是世界模型
大多数视频模型只专注于生成像素。FLUX 3 的出发点不同:它从多种感官输入中学习一个统一的世界表征。图像提供某一时刻的空间结构与关系;视频补充时间、运动与物理规律;音频补充视觉无法捕捉的因果声响关系;语言则把这些感知与指令、抽象概念连接起来。
通过同时训练所有模态,模型利用它们之间的相互约束来理解世界真实的运行方式。用 BFL 的话说:声音必须与撞击对应,运动必须遵守质量规律,未来必须由过去推演而来。BFL 将这种方法称为真实世界视觉智能,而视频生成正是其中最难的部分。
FLUX 3 Video 能做什么
FLUX 3 单次生成可产出最长 20 秒、带有原生音频的多样化视频。核心视频能力包括:
- 文本生成视频(Text-to-Video) —— 描述场景即可得到完整片段。
- 图像生成视频(Image-to-Video) —— 让起始画面动起来,或把图片作为视觉参考。
- 视频生成视频(Video-to-Video) —— 保留源视频的核心元素,将其转换到新场景或新语境。
- 视频-音频延续生成 —— 基于输入的视频和音频,继续生成匹配的画面与声音。
- 关键帧生成视频 —— 在指定关键帧之间控制过渡。
- 智能片段串联 —— 把多个独立片段连接成更长的多镜头序列。
- 丰富的风格与画幅 —— 从手持摄像机质感、动画到电影级画面都能胜任。
- 多语言对白 与动态字体设计。
值得注意的一点是,音频是与视频原生同步生成的。这意味着口型可以与语音对齐,音效也可以与画面中的物理事件对应,而不是后期叠加。
背后的架构
FLUX 3 建立在 BFL 的 Self-Flow 方法之上,在同一个底层架构中对齐多模态生成与理解,并在此基础上大幅扩展了算力与数据规模,实现视频、图像、音频的同步训练。
同一个骨干网络既能生成内容,也能驱动物理智能。在 BFL 与 mimic robotics 合作的 FLUX-mimic 项目中,FLUX 3 的早期版本被用于视频-动作模型,已在奥迪(Audi)产线进行测试与部署。BFL 透露,视频预测占据了模型总训练算力的 95% 以上 —— 这足以说明逼真运动是核心难题,也解释了为何解决它能同时解锁创意生成与物理机器人应用。
对开发者和创作者的意义
FLUX 3 目前仍在早期访问阶段,API 定价和全面开放还在逐步推进。如果你正在构建视频工作流,可以申请早期访问,测试统一音视频生成、更长连贯片段和更强风格控制是否符合你的需求。
本质上,FLUX 3 不是一个单一用途的视频工具。它是一个多模态基础模型,视频生成只是其对物理世界广泛理解的其中一种表达。对产品团队来说,这意味着需要拼接的独立模型更少,而图像、视频与声音之间的输出一致性更高。