如何使用 FLUX 3 生成影片

· Flick 內部影片製作人 · LinkedIn

Jul 2026

FLUX 3 是 Black Forest Labs 推出的全新多模態前沿模型,於 2026 年 7 月 23 日開放早期體驗。單一架構即可生成圖像、長達 20 秒的影片、同步音訊以及動作預測。

對於影片創作者而言,FLUX 3 是首批能在同一次生成中產出對白、音效、環境音與畫面的重要 AI 影片發布之一。本指南將說明 FLUX 3 的功能、如何使用 FLUX 生成影片、目前實際可用的功能、與 Seedance、Kling、Veo 和 Grok 的比較,以及如何在 Flick 影片製作工作流程中使用 FLUX 風格的輸出。

FLUX 3 發布預告片。來源:@bfl_ai on X

快速解答:FLUX 能生成影片嗎?

可以。FLUX 3 能生成影片。在發布時,Black Forest Labs 將 FLUX 3 Video 描述為一個文字轉影片模型,能夠生成最長 20 秒的片段,並可選擇性地產出原生同步音效。

問題答案
FLUX 能生成影片嗎?可以,透過 FLUX 3 Video
主要工作流程文字轉影片,預計將在更廣泛的模型家族中提供圖像/影片工作流程
最長片段長度最長 20 秒
音效原生同步音效,可選
圖像生成完整圖像生成功能將在初始 Video/Action 存取後陸續推出
存取方式申請搶先體驗
定價尚未公布
開放權重承諾於 2026 年稍後釋出
最佳用途電影級片段、畫面與音效測試、對話時刻、音效感知的 B-roll,以及多模態影片實驗

在 Flick 中打造你的影片

新模型快速上線。你的角色、故事和剪輯永遠屬於你。

FLUX 3 的發布

Black Forest Labs 於 2026 年 7 月 23 日宣布 FLUX 3,作為一個跨圖像、影片、音效和動作的多模態模型家族。發布的核心理念很簡單:不再為圖像訓練一個模型、為影片訓練另一個、為音效再訓練一個、為動作預測又訓練一個,FLUX 3 使用單一架構跨越所有模態。

Image

BFL 執行長 Robin Rombach 這樣總結這個前提:「你無法欺騙現實。只學習圖像的模型只能生成圖像。」這個定位對電影工作者很重要,因為 AI 影片最困難的部分不再是單一漂亮的畫面,而是連續性:畫面、動作、音效、角色、物理和剪輯節奏都必須一致。

對電影工作者重要的規格

功能FLUX 3 發布時
影片文字轉影片,每次生成最長 20 秒
音效原生同步音效,與畫面一起生成且可選
圖像完整圖像生成,將在初始發布階段後陸續推出
架構跨圖像、影片、音效和動作的單一模型,BFL 稱為「Self-Flow」
基準測試BFL 報告指出,在 77% 的比較中 FLUX 3 優於 Runway Gen-4.5
變體FLUX 3 Video、FLUX 3 Image、FLUX 3 Action、FLUX 3 Dev 和 FLUX-mimic
開放權重承諾於 2026 年稍後釋出
存取方式在 Black Forest Labs 透過申請搶先體驗
早期測試者Canva、Burda、Magnific、Krea、Picsart、Audi 等

在獨立測試跟上之前,請將基準測試數字視為廠商聲明。更重要的實際要點是,FLUX 3 在單次生成中結合影片和音效,這對電影工作者的工作流程有直接影響。

人們用 FLUX 3 製作什麼

搶先體驗測試者在發布前就取得了模型,首批範例展示了為什麼電影工作者如此關注:電影級構圖、出色的光影、連貫的動作,以及同一系統中的原生音效潛力。

"I've been playing around with FLUX 3 for the last few weeks — it's an incredibly impressive model." Credit: @venturetwins on X.
「我在過去幾週一直在試用 FLUX 3——這是一個令人印象極為深刻的模型。」來源:@venturetwins on X

A cinematic FLUX 3 test shared shortly after launch. Credit: @umesh_ai on X.
發布後不久分享的電影風格 FLUX 3 測試。來源:@umesh_ai on X

這些範例仍處於早期階段,但它們指向了正確的評估標準。不要僅憑靜態畫面的美感來評斷 FLUX 3。應該以動作、聲音、時間掌控和場景邏輯是否協調一致來判斷。

如何使用 FLUX 生成影片

1. 從具體鏡頭開始,而非模糊的想法

FLUX 3 可能支援文字轉影片,但好的影片提示詞仍然是鏡頭導演。從一個具體的鏡頭開始:

  • 畫面中有誰或什麼?
  • 攝影機在哪裡?
  • 什麼在移動?
  • 隨著時間推移什麼會改變?
  • 音訊應該包含什麼?
  • 模型應該避免什麼?

弱的提示詞:

夜晚的未來城市。

更好的提示詞:

緩慢的空中推進鏡頭,掠過雨後的未來城市夜景。霓虹招牌倒映在下方的水窪中,蒸汽從街道通風口升起,遠處交通的嗡嗡聲,低沉的合成器無人機音在鏡頭下逐漸增強。電影寫實風格,濕潤的柏油路面,體積光,無可辨識文字,無標誌。

第二個提示詞同時提供了視覺和音訊方向給 FLUX。


Image

2. 同時為畫面和聲音撰寫提示詞

FLUX 3 重要的原因之一是原生同步音訊,它與 Seedance 2.5 等模型一起生成。在提示詞中善用這項功能。

一個強大的 FLUX 提示詞應該包含:

  • 攝影機:推進、滑軌、手持、固定、空拍、追蹤、環繞。
  • 主體動作:行走、轉身、伸手、奔跑、猶豫、抬頭。
  • 環境動態:雨、煙霧、風、塵埃、人群、火焰、水流。
  • 聲音:腳步聲、布料摩擦聲、引擎低鳴、雷聲、對話、環境音、靜默。
  • 時間掌控:「兩秒後」、「當攝影機到達他們身邊時」、「在結尾」。
  • 限制條件:無文字、無額外角色、保持身份一致、逼真的動作。

範例:

Locked-off medium shot of a tired astronaut sitting alone inside a dim spacecraft cockpit.
At the start, only the soft instrument panel glow lights their face. After three seconds, a red warning light begins pulsing.
The astronaut slowly turns toward the window as distant debris taps against the hull.
Audio: low spacecraft hum, faint alarm pulse, subtle breathing inside the helmet, no music.
Cinematic realism, shallow depth of field, no text, no extra characters.

3. 保持第一次測試簡單

對於早期的 FLUX 生成,應避免需要過多編排的場景。使用一個主體、一個鏡頭概念和一個聲音概念。

適合的初期測試:

  • 一個人在雨中行走,腳步聲同步。
  • 門猛然關閉,搭配撞擊聲。
  • 太空船駕駛艙警報,伴隨脈衝紅光。
  • 怪物從霧中現身,搭配低沉咆哮和環境音。
  • 安靜的對話反應鏡頭,搭配室內環境音。
  • 汽車從鏡頭前駛過,搭配引擎和輪胎聲。

風險較高的測試:

  • 多人對話,需要精確的唇形同步。
  • 複雜的打鬥編排。
  • 清晰可辨的標誌或介面文字。
  • 在單一提示詞中的多場景序列。
  • 精確的品牌標誌。
  • 需要表演連貫性的長情緒節奏。

4. 生成變化版本並按序列價值比較

不要只問「哪個片段看起來最好?」而要問「哪個片段剪接起來最好?」

檢視變化版本時,請確認:

  • 第一幀是否與前一個場景匹配?
  • 最後一幀是否創造了有用的剪接點?
  • 聲音是否有助於剪接,還是會分散注意力?
  • 動作是否無需解釋就能清楚理解?
  • 片段是否保持了主體的身份?
  • 動作是否在物理上看起來合理?

最好的 FLUX 輸出可能不是最華麗的那個,而是能與其他鏡頭自然銜接的那個。

5. 當較短的輸出更簡潔時就使用它

FLUX 3 宣稱可達 20 秒,但這不代表每個片段都應該是 20 秒。AI 影片通常在鏡頭具有簡潔、明確的目的時看起來最好。

使用 5–8 秒於:

  • 建立鏡頭。
  • 插入鏡頭。
  • 特寫鏡頭。
  • 反應鏡頭。
  • 搭配聲音的質感鏡頭。
  • 動作測試。

使用 10–20 秒於:

  • 主體保持穩定。
  • 動作有開始、過程和結束。
  • 音效表現很重要。
  • 鏡頭需要時間呼吸。
  • 片段本身就是一個完整的微型場景。

FLUX 影片提示詞範本

使用此結構:

[Shot type / camera movement] of [subject] in [setting].
[Subject action over time].
[Environmental motion over time].
Audio: [dialogue, ambience, effects, silence, music direction].
Style: [cinematic style, lens, lighting, texture].
Constraints: [identity, no text, no logos, no extra characters, realistic motion].

範例:

Slow handheld tracking shot behind a detective walking down a narrow motel hallway at midnight.
The detective moves cautiously, one hand near the wall, then stops when a door creaks open at the end of the hall.
Fluorescent lights flicker overhead, dust floats in the air, rain runs down the window at the far end.
Audio: soft footsteps on carpet, low motel electricity hum, distant rain, one sharp door creak, no music.
1970s neo-noir, 35mm film grain, warm green fluorescent cast, realistic motion.
No readable text, no logos, no extra people.

FLUX 3 影片的提示詞範例

對話時刻

Close-up of an exhausted pilot in a dim cockpit, helmet visor half raised.
The pilot looks down, breathes once, then says quietly: "We are not going back."
Warning lights pulse across their face as the camera slowly pushes in.
Audio: cockpit hum, soft alarm beeps, intimate dry dialogue, no music.
Cinematic sci-fi realism, shallow depth of field, preserve face, no text.

聲音先行的恐怖鏡頭

Locked-off wide shot of an empty farmhouse hallway at night.
At first nothing moves. After four seconds, a floorboard creaks off-screen, then the hanging light swings slightly.
Audio: deep room tone, distant wind, single floorboard creak, faint chain movement, no music.
Natural darkness, practical bulb light, realistic horror atmosphere, no visible monster.

產品風格動態

Slow studio orbit around a matte black cinema camera on a reflective table.
Light sweeps across the lens glass as the camera rotates, revealing subtle dust particles in the air.
Audio: quiet mechanical rotation, soft room tone, no music.
Premium commercial lighting, crisp reflections, minimal background.
No logos, no text, keep object shape consistent.

史詩級外景

Wide cinematic shot of ancient ships cutting through dark water at dawn.
Oars move in rhythm, sails snap in the wind, mist wraps around rocky cliffs.
Audio: waves against wood, distant sailcloth snapping, low wind, subtle drum pulse.
Historical epic realism, warm sunrise, 70mm texture, grounded scale.
No modern objects, no fantasy creatures, no readable text.

安靜的角色節奏

Medium close-up of a young inventor sitting alone at a cluttered workbench before sunrise.
They tighten one small screw, stop, and smile when the machine begins to hum.
Dust floats in the first blue morning light through the window.
Audio: tiny metal screw turn, soft electric hum, morning birds outside, no music.
Naturalistic indie film style, gentle lens softness, realistic hands.

如何在 Flick 中使用 FLUX

FLUX 3 目前處於搶先體驗階段,因此在發布前應確認 Flick 的確切原生整合方式。但 FLUX 輸出的是標準影片格式,這意味著您已經可以將 FLUX 片段視為 Flick 影片工作流程的一部分:將片段放到畫布上,與您的參考資料一起整理,與其他模型生成的內容進行比較,並將它們剪輯到序列中。

在 Flick 中建立 FLUX 專案:

  1. 開啟全新畫布。建立新的 Flick 專案,並選擇最終發布的長寬比:16:9、9:16 或 1:1。
  2. 以視覺方式建構場景。使用文字節點作為提示詞筆記,生成場景靜態畫面,收集參考資料,並將鏡頭規劃保留在畫布上。
  3. 先鎖定重複出現的角色。在依賴任何影片模型之前,使用 Flick 的角色參考工作流程,先在靜態畫面中固定角色。這很重要,因為每個影片模型在不同鏡頭之間都可能產生偏移。
  4. 生成或匯入 FLUX 片段。如果您的工作區可使用 FLUX,當您需要在一次操作中同時生成畫面和同步音效時,直接使用它。如果您在搶先體驗期間於其他地方生成了 FLUX,請將影片檔案匯入畫布。
  5. 比較模型輸出。針對音效感知鏡頭使用 FLUX,針對參考密集或較長的片段使用 Seedance,針對強烈動態使用 Kling,針對精緻的電影寫實風格使用 Veo。影片留在畫布上,而模型依每個鏡頭變換。
  6. 提取有用的影格。如果 FLUX 片段產生了強烈的最終影格,請儲存或提取該影格,並將其用作下一個鏡頭的參考。
  7. 一起調色和剪輯。將 FLUX 片段、無聲 AI 影片片段、語音片段、音樂和剪輯放在同一個專案中,讓序列感覺像一部完整的影片。
🎬
Flick 的優勢在於您的故事、角色、參考資料、提示詞筆記、生成的片段和最終剪輯都保持連結在同一個畫布上。新模型可以輪換使用,但您的影片始終保持井然有序。

FLUX 如何改變 AI 影片製作工作流程

在同步 AI 影片出現之前,常見的工作流程是這樣的:

  1. 生成一段靜音片段。
  2. 挑選最佳鏡次。
  3. 使用 TTS 或語音模型加入對話。
  4. 從音效庫加入擬音。
  5. 加入環境音。
  6. 加入音樂。
  7. 盡量讓所有元素聽起來像是在同一個空間發生的。

FLUX 3 將部分工作整合到生成過程本身。門可以伴隨著關門聲砰地一聲關上。駕駛艙警報可以隨著紅燈一起閃爍。角色可以在鏡頭移動的同時說話。

這並不代表後期製作變得無關緊要。它讓初始成果更接近電影的質感。你仍然需要剪輯、混音、調色和精修,但原始生成的內容可能已經附帶時間點和聲音提示。

FLUX 3 與當前 AI 影片模型的比較

模型/工作流程最大片段長度原生音訊文字轉影片參考/一致性狀態
FLUX 3最長 20 秒是,同步音訊正式版本時確認早期體驗
Seedance 2.5最長 30 秒音訊參考影響節奏最多 50 個參考素材推出中/測試版
Kling O3確認目前限制確認目前支援Omni Reference上線中
Grok Imagine 1.5最長 15 秒無文件說明預覽 API 不支援參考轉影片上線中
Veo依模型/版本而定支援版本中包含原生音訊Ingredients / 參考存取權限因情況而異
Flick 畫布專案層級工作流程支援音訊作為專案的一部分多模型跨模型角色參考上線的工作流程層

Seedance 對於參考包工作流程仍然重要。Kling 對於動態密集的鏡頭仍然重要。Veo 對於精緻的寫實感和支援版本的原生音訊仍然重要。Grok 對於快速的圖像轉影片探索仍然重要。FLUX 3 的差異化在於單一多模態生成,畫面和聲音一起設計。

FLUX 3 尚無法證明的部分

FLUX 3 前景看好,但搶先體驗階段仍有重要問題尚未解答:

  • 能否精確控制音訊? 我們需要了解提示詞對對話、擬音、環境音和音樂的控制程度。
  • 能否在保持相同表現的情況下重新生成畫面? 電影製作者需要鏡次層級的控制。
  • 能否讓聲音在不同鏡頭間保持一致? 只有當角色能保持聲音一致性時,原生音效才最有意義。
  • 參考功能有多強? 角色、服裝和場景的一致性決定了它是否適用於真實影片製作。
  • 迭代成本有多高? 定價將決定人們是用於實驗還是正式製作。
  • 承諾的權重有多開放? 長期來看,開發者版本可能比託管版本更重要。

在這些答案公開之前,請將 FLUX 3 視為一項重大新功能,而非已完善的端到端製作系統。

製作更佳 FLUX 影片的最佳做法

  • 一次提示一個鏡頭。
  • 包含音訊指示,而不只是視覺指示。
  • 清楚指定鏡頭運動。
  • 早期測試保持簡單。
  • 避免可讀文字和標誌。
  • 當穩定性重要時使用較短片段。
  • 將優質畫面儲存為參考。
  • 檢查聲音是否有助於剪輯。
  • 將 FLUX 片段與其他模型比較,而非假設單一模型贏得所有鏡頭。
  • 在 Flick 中保持影片的組織性,這樣你就能在不失去專案的情況下切換模型。

常見錯誤

  • 在提示詞中忽略音訊。 FLUX 3 的差異化在於同步化音效,所以要明確指示。
  • 要求在一次生成中完成完整場景。 一個片段應該是一個鏡頭。
  • 過度使用完整的 20 秒。 只有當動作保持連貫時,較長片段才更好。
  • 只評判畫面。 聆聽時間點、音效設計、環境音和表演。
  • 假設供應商的基準測試是最終結果。 獨立比較才重要。
  • 忘記連續性。 一個美麗的片段仍然必須符合角色、場景和序列。
  • 等待一個完美模型。 實務上,每個鏡頭使用最佳模型,然後在單一工作流程中組裝影片。

常見問題

FLUX 3 能生成影片嗎?

可以。FLUX 3 Video 能生成最長 20 秒的文字轉影片片段,並可選擇包含原生同步音訊。

如何使用 FLUX 生成影片?

撰寫一個聚焦於鏡頭的提示詞,描述攝影機運動、主體動作、環境動態、風格、限制條件和音訊。生成多個變化版本,選擇剪輯效果最佳的片段,並將其與序列的其他部分整理在一起。

FLUX 3 會生成音訊嗎?

會。FLUX 3 能在同一次生成中產出與影片同步的音訊。這意味著畫面和聲音是同時創建的,而非事後才加入聲音。

FLUX 3 是開源的嗎?

目前還不是。FLUX 3 以申請制的早期體驗形式推出。Black Forest Labs 表示,開放權重的開發者版本計畫於 2026 年稍後推出。

FLUX 3 與 FLUX 2 有何不同?

FLUX 2 主要是圖像模型。FLUX 3 是跨越圖像、影片、音訊和動作預測的多模態架構。

FLUX 3 的費用是多少?

定價尚未公布。目前的存取權限須透過 Black Forest Labs 的早期體驗流程取得。

FLUX 3 比 Runway 更好嗎?

Black Forest Labs 報告指出,在 77% 的基準比較中,FLUX 3 較 Runway Gen-4.5 更受青睞。仍需要獨立測試。

我可以在 Flick 中使用 FLUX 3 嗎?

如果您的 Flick 工作區中有 FLUX,可直接將其作為影片模型使用。如果您在早期體驗期間於其他地方生成 FLUX 片段,可將其匯入 Flick 畫布,與參考素材一起整理,並與專案的其他部分一起剪輯。

我應該先用 FLUX 做什麼?

從具有聲音感知的短鏡頭開始:雨中的腳步聲、關門聲、對白片段、駕駛艙警報、汽車經過聲,或富有氛圍的建立鏡頭。這些能揭示同步音訊是否真正有助於您的序列。