AlimvoAlimvo

多模態 AI 模型

FLUX 3:多模態 AI 模型 來自 Black Forest Labs

一個統一模型涵蓋圖像、影片、音訊與動作——FLUX 3 可生成與編輯視覺內容,製作最長 20 秒帶原生聲音的影片,並以清晰的多語言文字遵循複雜提示詞。

  • 文生图
  • 文生视频(20 秒)
  • 原生音频
  • 多语言文字
  • 情境内编辑
  • 多参考图
  • 动作预测

FLUX 3 是什麼?

FLUX 3 是 Black Forest Labs(FLUX.1 / FLUX.2 系列团队)的多模态基础模型,在统一架构下联合学习图像、视频和音频。它的每一项能力——图像合成与编辑、带原生音频的视频、多语言文字、甚至动作预测——都来自同一套多模态流匹配主干。

对创作者而言,这意味着一个模型就能覆盖过去需要好几个工具才能完成的工作:生成图像、制作带声音的短视频、在画面内编辑视觉、并在多帧之间保持角色或产品一致。

  • 统一多模态模型:图像、视频、音频、动作共用一套主干。
  • 多种风格、比例与分辨率的图像合成与编辑。
  • 单次生成最长 20 秒、带原生音频的视频。
  • 图像与视频中的多语言高精度文字渲染。
  • 情境内编辑与多参考图一致性。
  • 面向物理 AI 的动作预测,与 mimic robotics 合作开发。

能力总览

四大能力,一个模型

FLUX 3 在统一主干上覆盖图像、视频、音频与动作。

  • 图像

    多风格、多比例、多分辨率的合成与编辑,多语言高精度文字,强提示词遵循。

  • 视频

    单次生成长达 20 秒、带原生音频的视频——文生视频、图生视频、视频生视频、关键帧到视频。

  • 音频

    音频与视频联合原生生成,声音对应画面事件,包括对白、环境声、音效。

  • 动作

    FLUX 3 能为机器人预测物理动作,与 mimic robotics 合作开发,并在真实生产任务中测试。

核心架构

基于 Self-Flow:一个模型,覆盖所有模态

FLUX 3 是一个多模态流匹配模型。Black Forest Labs 没有把文生图、视频、音频三个模型外挂拼合,而是用一种叫 Self-Flow 的方法,在同一套主干上同时跨视频、图像、音频联合训练。

Self-Flow 的目标是高效地在同一架构内对齐多模态的「生成」与「理解」。官方称,相比标准流匹配,它的生成误差更低、操控任务成功率更高——这也是 FLUX 3 能在跨模态的生成、编辑、理解之间流畅切换的原因。

  • 所有模态共享同一套多模态流匹配主干。
  • Self-Flow 在同一架构内对齐生成与理解。
  • 官方称相较标准流匹配,生成误差更低、操控成功率更高。
  • 通过扩展算力与数据,跨视频、图像、音频联合训练。

能力详解

FLUX 3 在各模态上的优势

从图像合成到最长 20 秒带原生音频的视频,再到情境内编辑与动作预测。

  • 图像生成与编辑

    FLUX 3 能在多种风格、画面比例和分辨率下合成与编辑图像。相比早期 FLUX,它在复杂提示词处理和文字生成上有显著提升,包括多语言的高精度文字。

    • 多种风格、比例与分辨率。
    • 复杂提示词处理相较早期 FLUX 明显提升。
    • 多语言高精度图内文字。
    • 情境内编辑:换背景、扩图、局部重绘。
  • 最长 20 秒视频生成——带原生音频

    FLUX 3 单次可生成长达 20 秒、风格高度多样的视频,且每个输出都包含原生音频——声音与画面事件相对应。

    • 文生 / 图生 / 视频生 / 关键帧到视频,以及续写。
    • 广泛的风格与画面比例。
    • 支持多语言对白与视频中的强排版表现。
    • 片段可拼接成数分钟的多镜头序列。
  • 原生音频与多语言理解

    由于 FLUX 3 是音频与视频联合训练,声音是与画面一起原生生成的,而不是事后配音,包括对白、环境声以及与画面物理事件绑定的音效。

    • 音视频原生联合生成。
    • 对白、环境声与事件绑定音效。
    • 视频中的多语言对白。
    • 图像与视频中的多语言高精度文字。
  • 情境内编辑与一致参考

    FLUX 3 支持跨图像和视频的情境内编辑——可以换背景、扩展画布或重绘细节,同时保持主体不变。多张参考图可跨镜头保持角色、产品或风格一致。

    • 换背景、扩画布、局部重绘。
    • 多参考图保持角色与产品一致。
    • 适合叙事与多场景工作流。
  • 超越媒体:面向物理 AI 的动作预测

    FLUX 3 不只是一个媒体模型。由于它学习的是对世界的统一表征,它还能预测物理动作——这是一项面向机器人的能力。他们与 mimic robotics 合作开发了 FLUX-mimic,用于灵巧操作,并在奥迪的真实生产任务中测试。

    • 把动作预测原生集成进 FLUX 3。
    • 从视频主干微调专用动作模型。
    • 与 mimic 合作的 FLUX-mimic 灵巧操作。

对战成绩

FLUX 3 强在哪里

在 Black Forest Labs 公布的对战中,FLUX 3 优于多家主流视频模型。被特别点名的强项:捕捉人脸表情、把声音与物理事件关联、多语言能力。

93%
vs Luma Ray 3.2
77%
vs Runway Gen-4.5
60%
vs Kling v3 Pro
52%
vs Seedance 2.0
对比模型FLUX 3 胜率
Luma Ray 3.293%
Runway Gen-4.577%
Grok Imagine Videoup to 69%
Kling v3 Pro60%
Happy Horse v159%
Happy Horse 1.157%
Seedance 2.052%
Gemini Omni Flash52%

初步结果,评测口径为 10 秒、720p、带音频的文生视频片段。数据可能随版本更新变化,引用前请回官方最新资料复核。

从 FLUX.1 到 FLUX 3

只梳理能力演进:从图像基础到统一多模态世界模型——不涉及可用性或开源状态。

  1. FLUX.1

    图像基础

    奠定 Black Forest Labs 的图像生成基础,并成为被广泛使用的开源模型。

  2. FLUX.2

    生成 + 编辑

    把图像生成与编辑统一进单一模型。

  3. FLUX 3

    多模态世界模型

    联合处理图像、视频、音频和动作——从分离的媒体工具迈向统一的世界模型。

使用场景

用 FLUX 3 能做什么?

覆盖视频、图像、设计、营销、多语言与编辑等通用场景;电商只是众多工作流之一。

  • 短视频

    制作 20 秒带原生声音的视频,用于社媒、广告、叙事——文生 / 图生 / 视频生视频。

  • 多镜头序列

    借助视觉参考,把片段拼成数分钟、角色一致的多镜头叙事。

  • 图像创作

    跨比例与分辨率生成写实场景、风格化插画、重排版图形。

  • 多语言内容

    渲染多语言高精度文字,制作视频中的多语言对白。

  • 编辑与重混

    换背景、扩图、局部重绘、重混源视频,主体保持不变。

  • 设计与营销

    制作广告创意、社媒图形、概念图、品牌视觉,图中文字可靠。

  • 众多场景之一

    电商与产品

    生成产品视觉和短产品视频——这只是 FLUX 3 众多工作流之一。

提示词库

FLUX 3 Prompt 示例

覆盖电影感视频、多语言文字、编辑、多参考一致性与原生音频等通用场景。

电影感文生视频

A 20-second cinematic shot of a lone astronaut walking across a red desert at sunset, slow tracking camera, distant dust storm, wind ambience, subtle synthetic breathing, dramatic orchestral swells, anamorphic lens flare.

图生视频

Starting from the provided image, animate a gentle 10-second loop: soft hair movement, blinking eyes, shifting light from a window, and quiet room ambience with faint bird sounds outside.

多语言文字

A bold poster with the word "HELLO" in large serif type beside its equivalents in Chinese (你好), Japanese (こんにちは), and Arabic (مرحبا), vivid gradient background, high-accuracy multilingual text rendering, clean modern layout.

视频重混

Keep the central character and motion of the source video, but transport the scene to a rainy neon city at night — reflect puddles, glowing signs, soft rainfall sound, and a lo-fi synth soundtrack.

情境内编辑

Keep the subject exactly the same. Replace the background with a minimalist studio with a single soft light source, and extend the canvas to a 16:9 banner on the left side with clean negative space.

多参考一致

Using the uploaded reference images to keep the same character, generate a 15-second video of that character walking through three different locations — a forest, a subway station, and a beach — with consistent face, clothing, and proportions across all shots.

原生音频

A 12-second video of a woodworker carving a chair in a workshop — include the rhythmic sound of the chisel, wood creaks, soft workshop ambience, and a faint radio playing in the background, all tied to the on-screen actions.

风格化插画

A whimsical Studio-Ghibli-style illustration of a floating market on clouds, warm watercolor textures, soft pastel palette, vendors on small boats, drifting lanterns, gentle depth of field.

开始创作

在 Alimvo 探索多模态创作

用 Alimvo 的图像与视频生成器练习 FLUX 3 所面向的工作流——文生图、文生视频、编辑与多语言创意。

常见问题

FLUX 3 FAQ

关于 FLUX 3 是什么、能做什么、如何对比的解答——不涉及可用性或开源路线图。

FLUX 3 是什么?

FLUX 3 是 Black Forest Labs 的多模态基础模型,在统一架构下联合学习图像、视频和音频。它能生成与编辑图像、制作带原生音频的短视频、渲染多语言文字、预测物理动作——全部出自同一个模型。

FLUX 3 和 FLUX 3.0 是同一个模型吗?

是。FLUX 3 是官方名称,FLUX 3.0 是用户常用的搜索写法,指同一个模型。

FLUX 3 能做什么?

FLUX 3 能生成与编辑图像、制作最长 20 秒带原生音频的视频、渲染多语言高精度文字、进行情境内编辑、用多张参考图保持一致性,并为机器人预测物理动作。

FLUX 3 视频能做多长?

单次生成最长 20 秒,带原生音频。多个片段还能拼接成数分钟的多镜头序列。

FLUX 3 能生成音频吗?

能。FLUX 3 的音频与视频原生联合生成,包括对白、环境声和与画面事件绑定的音效,而非事后配音。

FLUX 3 和 FLUX 2 有什么区别?

FLUX.2 把图像生成与编辑合为一体。FLUX 3 更进一步:它是联合处理图像、视频、音频和动作的多模态模型,在复杂提示词处理和多语言文字生成上均有提升。

FLUX 3 和 Runway / Kling / Seedance 比怎么样?

在 Black Forest Labs 的对战中,FLUX 3 优于 Runway Gen-4.5(77%)、Kling v3 Pro(60%)、Seedance 2.0(52%)。这些是初步结果,后续可能继续提升。

FLUX 3 能在图和视频里生成文字吗?

能。多语言高精度文字渲染是 FLUX 3 的强项,适合海报、广告创意、缩略图和画面排版。