如何使用 FLUX 3 生成视频

· Flick 内部影片制作人 · LinkedIn

Jul 2026

FLUX 3 是 Black Forest Labs 的新多模态前沿模型,于 2026 年 7 月 23 日启动抢先体验。单一架构可生成图像、最长 20 秒的视频、同步音频和动作预测。

对于影片制作者而言,FLUX 3 是首批主要 AI 视频发布之一,对话、效果、环境声和画面可以来自同一次生成。本指南介绍 FLUX 3 的功能、如何使用 FLUX 生成视频、目前实际可用的功能、与 Seedance、Kling、Veo 和 Grok 的对比,以及如何在 Flick 影片制作工作流程中使用 FLUX 风格的输出。

FLUX 3 发布视频。来源:@bfl_ai on X

快速解答:FLUX 能生成视频吗?

是的。FLUX 3 可以生成视频。在发布时,Black Forest Labs 将 FLUX 3 Video 描述为一个文本到视频模型,能够生成最长 20 秒的片段,并可选择原生同步音频。

问题答案
FLUX 能生成视频吗?是的,通过 FLUX 3 Video
主要工作流程文本到视频,预计围绕更广泛的模型家族提供图像/视频工作流程
最大片段长度最长 20 秒
音频原生同步音频,可选
图像生成在初始 Video/Action 访问后推出完整图像生成
访问方式通过申请获得早期访问
定价未公布
开放权重承诺在 2026 年晚些时候提供
最佳用途电影级片段、画面与声音测试、对话时刻、声音感知的 B-roll 以及多模态影片实验

在 Flick 中构建你的影片

新模型快速上线。你的角色、故事和剪辑始终属于你。

FLUX 3 的发布

Black Forest Labs 于 2026 年 7 月 23 日宣布推出 FLUX 3,这是一个跨越图像、视频、音频和动作的多模态模型家族。发布宣传很简单:不是为图像训练一个模型,为视频训练另一个,为音频训练另一个,为动作预测训练另一个,而是 FLUX 3 在各种模态中使用一个架构。

Image

BFL 首席执行官 Robin Rombach 这样总结这一理念:"你无法欺骗现实。一个只学习图像的模型只能生成图像。" 这一框架对电影制作者很重要,因为 AI 视频最困难的部分不再是单个漂亮的画面。而是连续性:画面、动作、声音、角色、物理和剪辑节奏都必须保持一致。

对电影制作者重要的规格

功能发布时的 FLUX 3
视频文本到视频,每次生成最长 20 秒
音频原生同步音频,与画面一起生成且可选
图像完整图像生成,在初始发布阶段后推出
架构一个跨图像、视频、音频和动作的模型,BFL 称之为"Self-Flow"
基准测试BFL 报告在 77% 的比较中,FLUX 3 优于 Runway Gen-4.5
变体FLUX 3 Video、FLUX 3 Image、FLUX 3 Action、FLUX 3 Dev 和 FLUX-mimic
开放权重承诺在 2026 年晚些时候提供
访问方式在 Black Forest Labs 通过申请获得早期访问
早期测试者Canva、Burda、Magnific、Krea、Picsart、Audi 等

在独立测试跟上之前,将基准测试数字视为供应商声明。更重要的实际要点是,FLUX 3 在一次生成中结合了视频和音频,这对电影制作者的工作流程有直接影响。

人们用 FLUX 3 制作的内容

早期访问测试者在发布前就拥有该模型,首批示例展示了为什么电影制作者如此关注:电影级构图、强烈的光线、连贯的动作以及同一系统中的原生音频潜力。

"I've been playing around with FLUX 3 for the last few weeks — it's an incredibly impressive model." Credit: @venturetwins on X.
"过去几周我一直在试用 FLUX 3——这是一个令人印象极其深刻的模型。" 来源:@venturetwins on X

A cinematic FLUX 3 test shared shortly after launch. Credit: @umesh_ai on X.
发布后不久分享的电影级 FLUX 3 测试。来源:@umesh_ai on X

这些示例仍处于早期阶段,但它们指向了正确的评估标准。不要仅凭静帧画面的美感来评判 FLUX 3,而要看动作、声音、时序和场景逻辑是否协调一致。

如何使用 FLUX 生成视频

1. 从具体镜头开始,而非模糊想法

FLUX 3 可能支持文本生成视频,但一个好的视频提示词仍然是镜头指导。从一个具体的镜头开始:

  • 画面中有谁或什么?
  • 摄像机在哪里?
  • 什么在移动?
  • 随时间会发生什么变化?
  • 音频应包含什么?
  • 模型应避免什么?

较弱的提示词:

夜晚的未来城市。

更好的提示词:

夜晚缓慢航拍推进,掠过被雨水浸润的未来城市。霓虹招牌倒映在下方的水坑中,蒸汽从街道通风口升起,远处交通嗡鸣声,低沉的合成器音调在镜头下逐渐增强。电影级写实风格,湿润的沥青路面,体积光效,无可读文字,无标志。

第二个提示词同时给出了 FLUX 视觉和音频的指导。


Image

2. 同时为画面和声音编写提示词

FLUX 3 的重要意义之一是原生同步音频,它与 Seedance 2.5 等模型一起生成。在提示词中充分利用这一点。

一个强大的 FLUX 提示词应包含:

  • 摄像机:推进、移动、手持、固定、航拍、跟踪、环绕。
  • 主体动作:行走、转身、伸手、奔跑、犹豫、抬头。
  • 环境动态:雨、烟、风、尘土、人群、火、水。
  • 声音:脚步声、布料声、引擎嗡鸣、雷声、对话、环境音、寂静。
  • 时序:"两秒后"、"当摄像机到达他们身边时"、"在结尾处"。
  • 限制条件:无文字、无额外角色、保持身份、逼真动作。

示例:

Locked-off medium shot of a tired astronaut sitting alone inside a dim spacecraft cockpit.
At the start, only the soft instrument panel glow lights their face. After three seconds, a red warning light begins pulsing.
The astronaut slowly turns toward the window as distant debris taps against the hull.
Audio: low spacecraft hum, faint alarm pulse, subtle breathing inside the helmet, no music.
Cinematic realism, shallow depth of field, no text, no extra characters.

3. 保持首次测试简单

对于早期的 FLUX 生成,请避免需要过多编排的场景。使用一个主体、一个镜头概念和一个声音概念。

良好的初始测试:

  • 一个人在雨中行走,脚步声同步。
  • 门砰地关上,配合撞击声。
  • 宇宙飞船驾驶舱警报,伴有脉冲红光。
  • 怪物从雾中出现,伴有低沉的咆哮声和环境音。
  • 安静的对话反应镜头,带有室内环境音。
  • 汽车从镜头前驶过,带有引擎声和轮胎声。

风险较高的测试:

  • 多人对话且精确对嘴。
  • 复杂的打斗编排。
  • 清晰可辨的标识或界面文字。
  • 在一个提示词中包含多地点序列。
  • 精确的品牌标志。
  • 需要表演连贯性的长情感戏。

4. 生成变体并按序列价值进行比较

不要只问"哪个片段看起来最好?"要问"哪个片段剪辑效果最好?"

在审查变体时,请检查:

  • 第一帧是否与之前的场景匹配?
  • 最后一帧是否创建了有用的剪辑点?
  • 声音是否有助于剪辑,还是分散注意力?
  • 动作是否无需解释就能清晰理解?
  • 片段是否保持了主体的身份特征?
  • 运动是否在物理上合理?

最好的 FLUX 输出可能不是最炫目的那个,而是能够与其他镜头自然衔接的那个。

5. 当较短的输出更干净时使用它们

FLUX 3 宣传最长可达 20 秒,但这并不意味着每个片段都应该是 20 秒。AI 视频通常在镜头具有明确、具体目的时看起来最佳。

在以下情况使用 5-8 秒:

  • 定场镜头。
  • 切换镜头。
  • 插入镜头。
  • 反应镜头。
  • 带声音的质感镜头。
  • 运动测试。

在以下情况使用 10-20 秒:

  • 主体保持稳定。
  • 动作有开始、中间和结束。
  • 音频表现很重要。
  • 镜头需要时间呼吸。
  • 片段旨在作为一个完整的微场景。

FLUX 视频提示词模板

使用以下结构:

[Shot type / camera movement] of [subject] in [setting].
[Subject action over time].
[Environmental motion over time].
Audio: [dialogue, ambience, effects, silence, music direction].
Style: [cinematic style, lens, lighting, texture].
Constraints: [identity, no text, no logos, no extra characters, realistic motion].

示例:

Slow handheld tracking shot behind a detective walking down a narrow motel hallway at midnight.
The detective moves cautiously, one hand near the wall, then stops when a door creaks open at the end of the hall.
Fluorescent lights flicker overhead, dust floats in the air, rain runs down the window at the far end.
Audio: soft footsteps on carpet, low motel electricity hum, distant rain, one sharp door creak, no music.
1970s neo-noir, 35mm film grain, warm green fluorescent cast, realistic motion.
No readable text, no logos, no extra people.

FLUX 3 视频提示词示例

对话时刻

Close-up of an exhausted pilot in a dim cockpit, helmet visor half raised.
The pilot looks down, breathes once, then says quietly: "We are not going back."
Warning lights pulse across their face as the camera slowly pushes in.
Audio: cockpit hum, soft alarm beeps, intimate dry dialogue, no music.
Cinematic sci-fi realism, shallow depth of field, preserve face, no text.

声音先行恐怖镜头

Locked-off wide shot of an empty farmhouse hallway at night.
At first nothing moves. After four seconds, a floorboard creaks off-screen, then the hanging light swings slightly.
Audio: deep room tone, distant wind, single floorboard creak, faint chain movement, no music.
Natural darkness, practical bulb light, realistic horror atmosphere, no visible monster.

产品风格运动

Slow studio orbit around a matte black cinema camera on a reflective table.
Light sweeps across the lens glass as the camera rotates, revealing subtle dust particles in the air.
Audio: quiet mechanical rotation, soft room tone, no music.
Premium commercial lighting, crisp reflections, minimal background.
No logos, no text, keep object shape consistent.

史诗级外景

Wide cinematic shot of ancient ships cutting through dark water at dawn.
Oars move in rhythm, sails snap in the wind, mist wraps around rocky cliffs.
Audio: waves against wood, distant sailcloth snapping, low wind, subtle drum pulse.
Historical epic realism, warm sunrise, 70mm texture, grounded scale.
No modern objects, no fantasy creatures, no readable text.

安静的角色节奏

Medium close-up of a young inventor sitting alone at a cluttered workbench before sunrise.
They tighten one small screw, stop, and smile when the machine begins to hum.
Dust floats in the first blue morning light through the window.
Audio: tiny metal screw turn, soft electric hum, morning birds outside, no music.
Naturalistic indie film style, gentle lens softness, realistic hands.

如何在 Flick 中使用 FLUX

FLUX 3 目前处于早期访问阶段,因此在发布前应验证确切的 Flick 原生集成。但 FLUX 输出是标准视频,这意味着你现在就可以将 FLUX 片段作为 Flick 影片工作流程的一部分:将片段放到画布上,将它们与你的参考组织在一起,与其他模型生成的内容进行比较,并将它们剪辑到序列中。

在 Flick 中构建 FLUX 就绪项目:

  1. 打开新画布。创建一个新的 Flick 项目,并为最终发布选择宽高比:16:9、9:16 或 1:1。
  2. 可视化构建场景。使用文本节点作为提示词笔记,生成场景静帧,收集参考,并将镜头计划保留在画布上。
  3. 首先锁定重复出现的角色。在依赖任何视频模型之前,使用 Flick 的角色参考工作流程在静帧中固定角色。这很重要,因为每个视频模型都可能在不同镜头间产生漂移。
  4. 生成或导入 FLUX 片段。如果你的工作区中有 FLUX,当你需要在一次处理中同时获得画面和同步声音时,直接使用它。如果你在早期访问期间在其他地方生成了 FLUX,请将视频文件导入画布。
  5. 比较模型输出。对声音感知镜头使用 FLUX,对参考密集型或较长片段使用 Seedance,对强烈运动使用 Kling,对精致电影级真实感使用 Veo。影片保留在画布上,而模型根据每个镜头变化。
  6. 提取有用的帧。如果 FLUX 片段生成了一个强有力的最终帧,保存或提取该帧并将其用作下一个镜头的参考。
  7. 一起调色和编辑。将 FLUX 片段、无声 AI 视频片段、语音片段、音乐和编辑放在同一个项目中,使序列感觉像一部影片。
🎬
Flick 的优势在于你的故事、角色、参考、提示词笔记、生成的片段和最终编辑都保持连接在一个画布上。新模型可以轮换使用,但你的影片保持井然有序。

FLUX 如何改变 AI 影片制作工作流程

在同步 AI 视频出现之前,通常的工作流程是这样的:

  1. 生成一个无声片段。
  2. 挑选最佳镜头。
  3. 使用 TTS 或语音模型添加对话。
  4. 从音效库添加拟音。
  5. 添加环境音。
  6. 添加音乐。
  7. 尽量让所有元素听起来像是在同一个房间里发生的。

FLUX 3 将其中一些工作整合到生成过程本身。门可以在关闭时发出砰的一声。驾驶舱警报可以随着红灯闪烁。角色可以在镜头移动的同时说话。

这并不意味着后期制作变得无关紧要。它让初始成果更接近电影效果。你仍然需要剪辑、混音、调色和精修,但原始生成的内容可能已经附带了时间点和声音提示。

FLUX 3 与当前 AI 视频模型对比

模型/工作流最大片段原生音频文本生成视频参考/一致性状态
FLUX 3最长 20 秒是,同步正式发布时验证抢先体验
Seedance 2.5最长 30 秒音频参考塑造节奏最多 50 个参考资源推出中 / 测试版
Kling O3验证当前限制验证当前支持全能参考已上线
Grok Imagine 1.5最长 15 秒无文档记录预览 API 不支持参考转视频已上线
Veo取决于模型/版本支持版本中的原生音频素材 / 参考访问权限不一
Flick 画布项目级工作流支持音频作为项目的一部分多模型跨模型角色参考已上线工作流层

Seedance 在参考包工作流中仍然重要。Kling 在运动密集型镜头中仍然重要。Veo 在精致的真实感和支持版本的原生音频方面仍然重要。Grok 在快速图像转视频探索方面仍然重要。FLUX 3 的差异化优势在于单次多模态生成,画面和声音协同设计。

FLUX 3 尚未证明的能力

FLUX 3 前景看好,但抢先体验阶段仍有重要问题未获解答:

  • 能否精确控制音频? 我们需要了解提示词对对话、拟音、环境音和音乐的控制程度。
  • 能否在保持相同表演的同时重新生成画面? 电影制作者需要镜头级别的控制。
  • 能否在镜头间保持声音一致? 只有角色能够保持声音一致性,原生音频才最有意义。
  • 参考功能有多强? 角色、服装和场景的一致性决定了它是否适用于真正的影片制作。
  • 迭代成本如何? 定价将决定人们是用于实验还是用于制作。
  • 承诺的权重开放程度如何? 从长远来看,开发者版本可能比托管版本更重要。

在这些问题公开解答之前,将 FLUX 3 视为一项重要的新功能,而非已解决的端到端制作系统。

生成更好 FLUX 视频的最佳实践

  • 一次提示一个镜头。
  • 包含音频指导,而不仅仅是视觉指导。
  • 明确指定镜头运动。
  • 保持早期测试简单。
  • 避免可读文字和标志。
  • 当稳定性重要时使用较短片段。
  • 将优秀的画面保存为参考。
  • 检查声音是否有助于剪辑。
  • 将 FLUX 片段与其他模型对比,而不是假设一个模型在每个镜头中都胜出。
  • 在 Flick 中保持影片井然有序,这样你可以在不丢失项目的情况下切换模型。

常见错误

  • 在提示词中忽略音频。 FLUX 3 的差异化优势是同步声音,因此要指导它。
  • 尝试在一次生成中完成整个场景。 一个片段应该是一个镜头。
  • 过度使用完整的 20 秒。 只有在动作保持连贯时,较长的片段才更好。
  • 只评判画面。 要听时间点、音效设计、环境音和表演。
  • 假设供应商基准是最终结果。 独立对比才重要。
  • 忘记连续性。 一个精美的片段仍然必须与角色、场景和序列匹配。
  • 等待一个完美的模型。 在实践中,每个镜头使用最佳模型,然后在一个工作流中组装影片。

常见问题

FLUX 3 能生成视频吗?

是的。FLUX 3 Video 可以生成最长 20 秒的文本生成视频片段,可选原生同步音频。

如何使用 FLUX 生成视频?

编写一个专注于镜头的提示词,描述摄像机运动、主体运动、环境运动、风格、约束条件和音频。生成多个变体,选择剪辑效果最好的片段,并将其与序列的其他部分组织在一起。

FLUX 3 会生成音频吗?

是的。FLUX 3 可以在同一次生成中与视频一起生成同步音频。这意味着画面和声音是一起创建的,而不是仅在之后添加声音。

FLUX 3 是开源的吗?

还不是。FLUX 3 通过申请以抢先体验方式推出。Black Forest Labs 表示计划在 2026 年晚些时候推出开放权重的开发者版本。

FLUX 3 与 FLUX 2 有何不同?

FLUX 2 主要是一个图像模型。FLUX 3 是一个跨图像、视频、音频和动作预测的多模态架构。

FLUX 3 的价格是多少?

价格尚未公布。目前访问权限通过 Black Forest Labs 的抢先体验流程获取。

FLUX 3 比 Runway 更好吗?

Black Forest Labs 报告称,在 77% 的基准比较中,FLUX 3 优于 Runway Gen-4.5。仍需要独立测试。

我可以在 Flick 中使用 FLUX 3 吗?

如果 FLUX 在您的 Flick 工作区中可用,可以直接将其用作视频模型。如果您在抢先体验期间在其他地方生成 FLUX 片段,可以将它们导入 Flick 画布,与您的参考素材一起组织,并与项目的其他部分一起剪辑。

我应该首先用 FLUX 做什么?

从短小的、声音感知的镜头开始:雨中的脚步声、关门声、对话节拍、驾驶舱警报、汽车驶过,或者氛围建立镜头。这些可以揭示同步音频是否真正有助于您的序列。