模型指南
FLUX 3 是什么?
FLUX 3 是 Black Forest Labs(BFL)于 2026 年 7 月 23 日发布的多模态基础模型。与此前专注图像的 FLUX 系列不同,FLUX 3 在同一套架构里同时学习图像、视频和音频——因此它可以单次生成最长 20 秒的视频,对白、音效和配乐都与画面一起原生产出。
本页会讲清 FLUX 3 各条能力线分别能做什么、Self-Flow 训练方法如何运作、它与当前主流视频模型的对比结果,以及分阶段开放的节奏——最后告诉你在哪里体验带原生音频的 Flux 3 视频生成。

FLUX 3 速览
- 研发方
- Black Forest Labs(BFL),FLUX 系列背后的德国前沿实验室
- 发布时间
- 2026 年 7 月 23 日发布,各项能力按阶段进入早期访问
- 模态
- 图像、视频、原生音频、语言与动作预测,全部在一个模型内
- 视频时长
- 单次生成最长 20 秒,可串联成更长的多镜头序列
- 音频
- 音频随画面原生生成:多语言对白、音效与配乐
- 输入方式
- 文字提示、起始图、视觉参考、关键帧,以及现成的视频或音频
- 开放状态
- FLUX 3 Video 与 Action 已开放早期访问;Image 将在数周内跟进
- 开放权重
- 开放权重的多模态骨干 FLUX 3 Dev 计划稍后发布
一个模型,四条产品线
FLUX 3 的每项能力都构建在同一个多模态 flow-matching 模型之上,各自经过早期访问阶段后陆续开放。
FLUX 3 Video
早期访问文生视频、图生视频、视频生视频与关键帧控制转场——原生音频在同一次生成中产出。单次最长 20 秒,还能通过智能串联把片段连成角色与风格一致的多镜头长片。
FLUX 3 Image
数周内开放覆盖多种风格、构图、画幅与分辨率的图像生成与编辑。早期结果显示,它在复杂提示词理解、多语言文字渲染和编辑表现上都优于此前的 FLUX 版本。
FLUX 3 Action
合作伙伴访问把同一套基础模型用于物理 AI:预测动作会如何改变场景。与 mimic robotics 合作开发的 FLUX-mimic 已驱动灵巧机器人操作,并在奥迪的生产环境中完成测试。
FLUX 3 Dev
规划中面向内容创作与动作预测的开放权重多模态骨干,延续 BFL「前沿能力 + 开放获取」的传统。具体时间与许可条款尚未公布。
Self-Flow 如何支撑这一切
FLUX 3 构建在 Self-Flow 之上——这是 BFL 在单一架构内对齐多模态生成与理解的方法。一个多模态 Transformer 把图像、视频和音频转换成同一套内部表征,再从这套表征还原出输出。经过这样的训练,模型学会了场景如何构成、物体如何运动,以及什么声音对应什么物理事件。
这正是它的音频是「原生」而非事后配音的原因:画面和声音出自同一次生成,脚步声落在帧上,口型对上台词,环境声跟着镜头走。视频预测占了 FLUX 3 训练算力的 95% 以上——这也让同一个骨干可以延伸到机器人动作预测,而不损失创作能力。

FLUX 3 与主流模型的对比
在 BFL 的发布评测中,观众对 10 秒 720p 带原生音频的文生视频片段进行两两对比。以下数字表示观众在对比中更偏好 FLUX 3 的比例。
对比 Luma Ray 3.2
93%
对比 Runway Gen-4.5
77%
对比 Grok Imagine Video
69%
对比 Kling v3 Pro
60%
对比 Happy Horse v1
59%
对比 Happy Horse 1.1
57%
对比 Seedance 2.0
52%
对比 Gemini Omni Flash
52%
数据来自 Black Forest Labs 对开发阶段 FLUX 3 候选版本的内部评测。样本量、评测人数与完整方法尚未公布,应视为早期信号而非最终基准;BFL 表示完整结果将随正式开放一并发布。
FLUX 3 常见问题
亲眼看看 FLUX 3 的效果
光看介绍不够直观。打开 Flux 3 视频生成器,写一条提示词或上传一张图,得到带原生音频的电影感片段——也可以先浏览官方演示片。