A 20-second cinematic shot of a lone astronaut walking across a red desert at sunset, slow tracking camera, distant dust storm, wind ambience, subtle synthetic breathing, dramatic orchestral swells, anamorphic lens flare.
FLUX 3 是什么?
FLUX 3 是 Black Forest Labs(FLUX.1 / FLUX.2 系列团队)的多模态基础模型,在统一架构下联合学习图像、视频和音频。它的每一项能力——图像合成与编辑、带原生音频的视频、多语言文字、甚至动作预测——都来自同一套多模态流匹配主干。
对创作者而言,这意味着一个模型就能覆盖过去需要好几个工具才能完成的工作:生成图像、制作带声音的短视频、在画面内编辑视觉、并在多帧之间保持角色或产品一致。
- 统一多模态模型:图像、视频、音频、动作共用一套主干。
- 多种风格、比例与分辨率的图像合成与编辑。
- 单次生成最长 20 秒、带原生音频的视频。
- 图像与视频中的多语言高精度文字渲染。
- 情境内编辑与多参考图一致性。
- 面向物理 AI 的动作预测,与 mimic robotics 合作开发。
能力总览
四大能力,一个模型
FLUX 3 在统一主干上覆盖图像、视频、音频与动作。
图像
多风格、多比例、多分辨率的合成与编辑,多语言高精度文字,强提示词遵循。
视频
单次生成长达 20 秒、带原生音频的视频——文生视频、图生视频、视频生视频、关键帧到视频。
音频
音频与视频联合原生生成,声音对应画面事件,包括对白、环境声、音效。
动作
FLUX 3 能为机器人预测物理动作,与 mimic robotics 合作开发,并在真实生产任务中测试。
核心架构
基于 Self-Flow:一个模型,覆盖所有模态
FLUX 3 是一个多模态流匹配模型。Black Forest Labs 没有把文生图、视频、音频三个模型外挂拼合,而是用一种叫 Self-Flow 的方法,在同一套主干上同时跨视频、图像、音频联合训练。
Self-Flow 的目标是高效地在同一架构内对齐多模态的「生成」与「理解」。官方称,相比标准流匹配,它的生成误差更低、操控任务成功率更高——这也是 FLUX 3 能在跨模态的生成、编辑、理解之间流畅切换的原因。
- 所有模态共享同一套多模态流匹配主干。
- Self-Flow 在同一架构内对齐生成与理解。
- 官方称相较标准流匹配,生成误差更低、操控成功率更高。
- 通过扩展算力与数据,跨视频、图像、音频联合训练。
能力详解
FLUX 3 在各模态上的优势
从图像合成到最长 20 秒带原生音频的视频,再到情境内编辑与动作预测。
图像生成与编辑
FLUX 3 能在多种风格、画面比例和分辨率下合成与编辑图像。相比早期 FLUX,它在复杂提示词处理和文字生成上有显著提升,包括多语言的高精度文字。
- 多种风格、比例与分辨率。
- 复杂提示词处理相较早期 FLUX 明显提升。
- 多语言高精度图内文字。
- 情境内编辑:换背景、扩图、局部重绘。
最长 20 秒视频生成——带原生音频
FLUX 3 单次可生成长达 20 秒、风格高度多样的视频,且每个输出都包含原生音频——声音与画面事件相对应。
- 文生 / 图生 / 视频生 / 关键帧到视频,以及续写。
- 广泛的风格与画面比例。
- 支持多语言对白与视频中的强排版表现。
- 片段可拼接成数分钟的多镜头序列。
原生音频与多语言理解
由于 FLUX 3 是音频与视频联合训练,声音是与画面一起原生生成的,而不是事后配音,包括对白、环境声以及与画面物理事件绑定的音效。
- 音视频原生联合生成。
- 对白、环境声与事件绑定音效。
- 视频中的多语言对白。
- 图像与视频中的多语言高精度文字。
情境内编辑与一致参考
FLUX 3 支持跨图像和视频的情境内编辑——可以换背景、扩展画布或重绘细节,同时保持主体不变。多张参考图可跨镜头保持角色、产品或风格一致。
- 换背景、扩画布、局部重绘。
- 多参考图保持角色与产品一致。
- 适合叙事与多场景工作流。
超越媒体:面向物理 AI 的动作预测
FLUX 3 不只是一个媒体模型。由于它学习的是对世界的统一表征,它还能预测物理动作——这是一项面向机器人的能力。他们与 mimic robotics 合作开发了 FLUX-mimic,用于灵巧操作,并在奥迪的真实生产任务中测试。
- 把动作预测原生集成进 FLUX 3。
- 从视频主干微调专用动作模型。
- 与 mimic 合作的 FLUX-mimic 灵巧操作。
对战成绩
FLUX 3 强在哪里
在 Black Forest Labs 公布的对战中,FLUX 3 优于多家主流视频模型。被特别点名的强项:捕捉人脸表情、把声音与物理事件关联、多语言能力。
- 93%
- vs Luma Ray 3.2
- 77%
- vs Runway Gen-4.5
- 60%
- vs Kling v3 Pro
- 52%
- vs Seedance 2.0
| 对比模型 | FLUX 3 胜率 |
|---|---|
| Luma Ray 3.2 | 93% |
| Runway Gen-4.5 | 77% |
| Grok Imagine Video | up to 69% |
| Kling v3 Pro | 60% |
| Happy Horse v1 | 59% |
| Happy Horse 1.1 | 57% |
| Seedance 2.0 | 52% |
| Gemini Omni Flash | 52% |
初步结果,评测口径为 10 秒、720p、带音频的文生视频片段。数据可能随版本更新变化,引用前请回官方最新资料复核。
从 FLUX.1 到 FLUX 3
只梳理能力演进:从图像基础到统一多模态世界模型——不涉及可用性或开源状态。
FLUX.1
图像基础
奠定 Black Forest Labs 的图像生成基础,并成为被广泛使用的开源模型。
FLUX.2
生成 + 编辑
把图像生成与编辑统一进单一模型。
FLUX 3
多模态世界模型
联合处理图像、视频、音频和动作——从分离的媒体工具迈向统一的世界模型。
使用场景
用 FLUX 3 能做什么?
覆盖视频、图像、设计、营销、多语言与编辑等通用场景;电商只是众多工作流之一。
短视频
制作 20 秒带原生声音的视频,用于社媒、广告、叙事——文生 / 图生 / 视频生视频。
多镜头序列
借助视觉参考,把片段拼成数分钟、角色一致的多镜头叙事。
图像创作
跨比例与分辨率生成写实场景、风格化插画、重排版图形。
多语言内容
渲染多语言高精度文字,制作视频中的多语言对白。
编辑与重混
换背景、扩图、局部重绘、重混源视频,主体保持不变。
设计与营销
制作广告创意、社媒图形、概念图、品牌视觉,图中文字可靠。
众多场景之一
电商与产品
生成产品视觉和短产品视频——这只是 FLUX 3 众多工作流之一。
提示词库
FLUX 3 Prompt 示例
覆盖电影感视频、多语言文字、编辑、多参考一致性与原生音频等通用场景。
Starting from the provided image, animate a gentle 10-second loop: soft hair movement, blinking eyes, shifting light from a window, and quiet room ambience with faint bird sounds outside.
A bold poster with the word "HELLO" in large serif type beside its equivalents in Chinese (你好), Japanese (こんにちは), and Arabic (مرحبا), vivid gradient background, high-accuracy multilingual text rendering, clean modern layout.
Keep the central character and motion of the source video, but transport the scene to a rainy neon city at night — reflect puddles, glowing signs, soft rainfall sound, and a lo-fi synth soundtrack.
Keep the subject exactly the same. Replace the background with a minimalist studio with a single soft light source, and extend the canvas to a 16:9 banner on the left side with clean negative space.
Using the uploaded reference images to keep the same character, generate a 15-second video of that character walking through three different locations — a forest, a subway station, and a beach — with consistent face, clothing, and proportions across all shots.
A 12-second video of a woodworker carving a chair in a workshop — include the rhythmic sound of the chisel, wood creaks, soft workshop ambience, and a faint radio playing in the background, all tied to the on-screen actions.
A whimsical Studio-Ghibli-style illustration of a floating market on clouds, warm watercolor textures, soft pastel palette, vendors on small boats, drifting lanterns, gentle depth of field.
常见问题
FLUX 3 FAQ
关于 FLUX 3 是什么、能做什么、如何对比的解答——不涉及可用性或开源路线图。
FLUX 3 是什么?
FLUX 3 是 Black Forest Labs 的多模态基础模型,在统一架构下联合学习图像、视频和音频。它能生成与编辑图像、制作带原生音频的短视频、渲染多语言文字、预测物理动作——全部出自同一个模型。
FLUX 3 和 FLUX 3.0 是同一个模型吗?
是。FLUX 3 是官方名称,FLUX 3.0 是用户常用的搜索写法,指同一个模型。
FLUX 3 能做什么?
FLUX 3 能生成与编辑图像、制作最长 20 秒带原生音频的视频、渲染多语言高精度文字、进行情境内编辑、用多张参考图保持一致性,并为机器人预测物理动作。
FLUX 3 视频能做多长?
单次生成最长 20 秒,带原生音频。多个片段还能拼接成数分钟的多镜头序列。
FLUX 3 能生成音频吗?
能。FLUX 3 的音频与视频原生联合生成,包括对白、环境声和与画面事件绑定的音效,而非事后配音。
FLUX 3 和 FLUX 2 有什么区别?
FLUX.2 把图像生成与编辑合为一体。FLUX 3 更进一步:它是联合处理图像、视频、音频和动作的多模态模型,在复杂提示词处理和多语言文字生成上均有提升。
FLUX 3 和 Runway / Kling / Seedance 比怎么样?
在 Black Forest Labs 的对战中,FLUX 3 优于 Runway Gen-4.5(77%)、Kling v3 Pro(60%)、Seedance 2.0(52%)。这些是初步结果,后续可能继续提升。
FLUX 3 能在图和视频里生成文字吗?
能。多语言高精度文字渲染是 FLUX 3 的强项,适合海报、广告创意、缩略图和画面排版。
