
FLUX 3で動画を生成する方法
Jul 2026
FLUX 3はBlack Forest Labsの新しいマルチモーダルフロンティアモデルで、2026年7月23日にアーリーアクセスとして公開されました。1つのアーキテクチャで画像、最大20秒の動画、同期された音声、アクション予測を生成します。
映画制作者にとって、FLUX 3は対話、効果音、環境音、映像が同じ生成から出力される初の主要なAI動画リリースの1つです。このガイドでは、FLUX 3ができること、FLUXで動画を生成する方法、今日実際に利用可能なもの、Seedance、Kling、Veo、Grokとの比較、そしてFlickの映画制作ワークフローでFLUXスタイルの出力を使用する方法を説明します。
簡単な答え: FLUXは動画を生成できますか?
はい。FLUX 3は動画を生成できます。ローンチ時、Black Forest LabsはFLUX 3 Videoを、最大20秒のクリップを生成でき、オプションでネイティブな同期音声を備えたテキストから動画へのモデルとして説明しています。
| 質問 | 回答 |
|---|---|
| FLUXは動画を生成できますか? | はい、FLUX 3 Videoを通じて可能です |
| 主なワークフロー | テキストから動画へ、より広範なモデルファミリーにおいて画像/動画のワークフローが予定されています |
| 最大クリップ長 | 最大20秒 |
| 音声 | ネイティブな同期音声、オプション |
| 画像生成 | 初期のVideo/Actionアクセス後に完全な画像生成が展開されます |
| アクセス | 申請によるアーリーアクセス |
| 価格 | 未発表 |
| オープンウェイト | 2026年後半に予定 |
| 最適な用途 | シネマティッククリップ、映像と音声のテスト、対話シーン、音声対応のBロール、マルチモーダル映画実験 |
Flickで映画を作ろう
新しいモデルがすぐに使える。あなたのキャラクター、ストーリー、編集はそのまま。
FLUX 3のローンチ
Black Forest Labsは2026年7月23日にFLUX 3を、画像、動画、音声、アクションにわたるマルチモーダルモデルファミリーとして発表しました。ローンチのコンセプトはシンプルです: 画像用、動画用、音声用、アクション予測用にそれぞれ別のモデルをトレーニングする代わりに、FLUX 3はモダリティ全体で1つのアーキテクチャを使用します。

BFLのCEOであるRobin Rombachは、この前提を次のように要約しました: 「現実をごまかすことはできません。画像だけを学習するモデルは、画像しか生成できません。」 このフレーミングが映画制作者にとって重要なのは、AI動画の最も難しい部分がもはや単一の美しいフレームではないからです。それは継続性です: 映像、動き、音、キャラクター、物理法則、編集リズムのすべてが一致する必要があります。
映画制作者にとって重要なスペック
| 機能 | ローンチ時のFLUX 3 |
|---|---|
| 動画 | テキストから動画へ、1回の生成で最大20秒 |
| 音声 | ネイティブな同期音声、映像と同時に生成され、オプション |
| 画像 | 完全な画像生成、初期ローンチフェーズ後に展開 |
| アーキテクチャ | 画像、動画、音声、アクションにわたる1つのモデル、BFLは「Self-Flow」と呼んでいます |
| ベンチマーク | BFLの報告によると、FLUX 3は比較の77%でRunway Gen-4.5よりも好まれました |
| バリアント | FLUX 3 Video、FLUX 3 Image、FLUX 3 Action、FLUX 3 Dev、およびFLUX-mimic |
| オープンウェイト | 2026年後半に予定 |
| アクセス | Black Forest Labsでの申請によるアーリーアクセス |
| アーリーテスター | Canva、Burda、Magnific、Krea、Picsart、Audi、その他 |
ベンチマーク数値は、独立したテストが追いつくまではベンダーの主張として扱ってください。より重要な実用的なポイントは、FLUX 3が動画と音声を1回の生成で組み合わせることであり、これは映画制作者にとって即座にワークフローへの影響があります。
FLUX 3で人々が制作しているもの
アーリーアクセステスターはローンチ前にモデルを利用しており、最初の事例は映画制作者が注目している理由を示しています: シネマティックなフレーミング、強力なライティング、一貫性のある動き、そして同じシステム内でのネイティブ音声の可能性です。


事例はまだ初期段階ですが、適切な評価基準を示しています。FLUX 3を静止画の美しさだけで判断しないでください。動き、音、タイミング、シーンの論理が一貫しているかどうかで判断してください。
FLUXで動画を生成する方法
1. 曖昧なアイデアではなく、ショットから始める
FLUX 3はテキストから動画への変換に対応していますが、優れた動画プロンプトは依然としてショットの指示です。1つの具体的なショットから始めましょう:
- フレーム内に誰が、または何があるか?
- カメラはどこにあるか?
- 何が動くか?
- 時間経過で何が変化するか?
- オーディオには何を含めるべきか?
- モデルは何を避けるべきか?
弱いプロンプト:
夜の未来都市。
より良いプロンプト:
雨に濡れた夜の未来都市をゆっくりと空撮でプッシュイン。ネオンサインが下の水たまりに反射し、通りの換気口から湯気が立ち上り、遠くの交通音が響き、ローシンセのドローンがショットの下で構築される。シネマティックなリアリズム、濡れたアスファルト、ボリュメトリックライト、読めるテキストなし、ロゴなし。
2つ目のプロンプトは、FLUXに視覚と音響の両方の指示を与えています。

2. 映像と音を一緒にプロンプトを書く
FLUX 3が重要である理由の1つは、ネイティブで同期されたオーディオです。これはSeedance 2.5のようなモデルと並行して生成されます。プロンプトでそれを活用しましょう。
強力なFLUXプロンプトには以下を含める必要があります:
- カメラ: プッシュイン、ドリー、ハンドヘルド、固定、空撮、トラッキング、オービット。
- 被写体の動き: 歩く、振り向く、手を伸ばす、走る、躊躇する、見上げる。
- 環境の動き: 雨、煙、風、埃、群衆、火、水。
- 音: 足音、布の音、エンジン音、雷、会話、環境音、静寂。
- タイミング: 「2秒後」、「カメラが彼らに到達したとき」、「最後に」。
- 制約: テキストなし、余分なキャラクターなし、アイデンティティの保持、リアルな動き。
例:
Locked-off medium shot of a tired astronaut sitting alone inside a dim spacecraft cockpit.
At the start, only the soft instrument panel glow lights their face. After three seconds, a red warning light begins pulsing.
The astronaut slowly turns toward the window as distant debris taps against the hull.
Audio: low spacecraft hum, faint alarm pulse, subtle breathing inside the helmet, no music.
Cinematic realism, shallow depth of field, no text, no extra characters.
3. 最初のテストはシンプルに保つ
初期のFLUX生成では、複雑な演出が必要なシーンは避けてください。1つの被写体、1つのカメラアイデア、1つの音のアイデアを使用します。
最初のテストに適したもの:
- 雨の中を歩く人物と同期した足音。
- ドアが閉まる音と一致する衝撃音。
- 点滅する赤いライトを伴う宇宙船のコックピット警報。
- 低いうなり声と環境音を伴って霧から現れるモンスター。
- ルームトーンを伴う静かな対話のリアクションショット。
- エンジン音とタイヤ音を伴ってカメラを通過する車。
リスクの高いテスト:
- 正確なリップシンクを伴う複数人の対話。
- 複雑な格闘シーンの演出。
- 読み取れる看板やインターフェイステキスト。
- 1つのプロンプトでの複数ロケーションのシーケンス。
- 正確なブランドロゴ。
- パフォーマンスの連続性が必要な長い感情表現。
4. バリエーションを生成し、シーケンス価値で比較する
「どのクリップが最も見栄えが良いか?」だけでなく、「どのクリップが最も編集しやすいか?」を問いかけてください。
バリエーションを確認する際は、以下をチェックしてください:
- 最初のフレームは前のシーンと一致しているか?
- 最後のフレームは有用なカットポイントを作成しているか?
- 音は編集を助けているか、それとも妨げているか?
- アクションは説明なしで明確に読み取れるか?
- クリップは被写体のアイデンティティを保持しているか?
- 動きは物理的に妥当に感じられるか?
最高のFLUX出力は、最も派手なものとは限りません。他のショットと並べて配置できるものです。
5. より明瞭な場合は短い出力を使用する
FLUX 3は最大20秒と宣伝していますが、すべてのクリップが20秒である必要はありません。AI映像は、ショットに明確で具体的な目的がある場合に最も強力に見えることがよくあります。
5〜8秒を使用する場合:
- エスタブリッシングショット。
- カットアウェイ。
- インサートショット。
- リアクションショット。
- 音を伴うテクスチャショット。
- モーションテスト。
10〜20秒を使用する場合:
- 被写体は安定しています。
- アクションには始まり、中間、終わりがあります。
- 音声のパフォーマンスが重要です。
- ショットには余韻が必要です。
- クリップは完結したマイクロシーンとして意図されています。
FLUX動画プロンプトテンプレート
この構造を使用してください:
[Shot type / camera movement] of [subject] in [setting].
[Subject action over time].
[Environmental motion over time].
Audio: [dialogue, ambience, effects, silence, music direction].
Style: [cinematic style, lens, lighting, texture].
Constraints: [identity, no text, no logos, no extra characters, realistic motion].
例:
Slow handheld tracking shot behind a detective walking down a narrow motel hallway at midnight.
The detective moves cautiously, one hand near the wall, then stops when a door creaks open at the end of the hall.
Fluorescent lights flicker overhead, dust floats in the air, rain runs down the window at the far end.
Audio: soft footsteps on carpet, low motel electricity hum, distant rain, one sharp door creak, no music.
1970s neo-noir, 35mm film grain, warm green fluorescent cast, realistic motion.
No readable text, no logos, no extra people.
FLUX 3動画のプロンプト例
対話シーン
Close-up of an exhausted pilot in a dim cockpit, helmet visor half raised.
The pilot looks down, breathes once, then says quietly: "We are not going back."
Warning lights pulse across their face as the camera slowly pushes in.
Audio: cockpit hum, soft alarm beeps, intimate dry dialogue, no music.
Cinematic sci-fi realism, shallow depth of field, preserve face, no text.
サウンド重視のホラーショット
Locked-off wide shot of an empty farmhouse hallway at night.
At first nothing moves. After four seconds, a floorboard creaks off-screen, then the hanging light swings slightly.
Audio: deep room tone, distant wind, single floorboard creak, faint chain movement, no music.
Natural darkness, practical bulb light, realistic horror atmosphere, no visible monster.
プロダクトスタイルのモーション
Slow studio orbit around a matte black cinema camera on a reflective table.
Light sweeps across the lens glass as the camera rotates, revealing subtle dust particles in the air.
Audio: quiet mechanical rotation, soft room tone, no music.
Premium commercial lighting, crisp reflections, minimal background.
No logos, no text, keep object shape consistent.
壮大な屋外シーン
Wide cinematic shot of ancient ships cutting through dark water at dawn.
Oars move in rhythm, sails snap in the wind, mist wraps around rocky cliffs.
Audio: waves against wood, distant sailcloth snapping, low wind, subtle drum pulse.
Historical epic realism, warm sunrise, 70mm texture, grounded scale.
No modern objects, no fantasy creatures, no readable text.
静かなキャラクタービート
Medium close-up of a young inventor sitting alone at a cluttered workbench before sunrise.
They tighten one small screw, stop, and smile when the machine begins to hum.
Dust floats in the first blue morning light through the window.
Audio: tiny metal screw turn, soft electric hum, morning birds outside, no music.
Naturalistic indie film style, gentle lens softness, realistic hands.
FlickでFLUXを使用する方法
FLUX 3アクセスは現在アーリーアクセス段階のため、正確なFlickネイティブ統合は公開前に確認する必要があります。ただし、FLUXの出力は標準的な動画であるため、FLUXクリップをすでにFlickの映画ワークフローの一部として扱うことができます。クリップをキャンバスに配置し、リファレンスと並べて整理し、他のモデルの生成と比較し、シーケンスにカットすることができます。
FlickでFLUX対応プロジェクトを構築するには:
- 新しいキャンバスを開く。新しいFlickプロジェクトを作成し、最終配信用のアスペクト比を選択します:16:9、9:16、または1:1。
- シーンを視覚的に構築する。テキストノードをプロンプトメモとして使用し、シーンのスチルを生成し、リファレンスを収集し、ショットプランをキャンバス上に保持します。
- 繰り返し登場するキャラクターを最初に固定する。動画モデルに依存する前に、Flickのキャラクターリファレンスワークフローを使用して、スチルでキャラクターを固定します。これは、すべての動画モデルがショット間でずれる可能性があるため重要です。
- FLUXクリップを生成またはインポートする。ワークスペースでFLUXが利用可能な場合は、画像と同期した音声を一度に必要とするときに直接使用します。アーリーアクセス中に他の場所でFLUXを生成した場合は、動画ファイルをキャンバスにインポートします。
- モデルの出力を比較する。音声対応ショットにはFLUXを、リファレンス重視または長いクリップにはSeedanceを、強いモーションにはKlingを、洗練されたシネマティックなリアリズムにはVeoを使用します。映画はキャンバス上に残り、ショットごとにモデルが変わります。
- 有用なフレームを抽出する。FLUXクリップが強力な最終フレームを生成した場合は、そのフレームを保存または抽出し、次のショットのリファレンスとして使用します。
- 一緒にグレーディングと編集を行う。FLUXクリップ、無音のAI動画クリップ、音声クリップ、音楽、編集を同じプロジェクトに配置し、シーケンスが一つの映画のように感じられるようにします。
FLUXがAI映画制作ワークフローをどのように変えるか
同期AI動画が登場する前は、通常のワークフローは次のようなものでした:
- 無音のクリップを生成します。
- ベストテイクを選びます。
- TTSまたは音声モデルで対話を追加します。
- 音響ライブラリからフォーリーを追加します。
- 環境音を追加します。
- 音楽を追加します。
- すべてが同じ部屋で起こったように感じられるようにします。
FLUX 3は、こうした作業の一部を生成そのものに統合します。ドアはドアの音とともに閉まります。コックピットの警報は赤いライトとともに点滅します。カメラが動くショットの中でキャラクターが話すことができます。
これはポストプロダクションが不要になるという意味ではありません。最初の段階がより映画的になるということです。編集、ミキシング、グレーディング、そして洗練は引き続き必要ですが、生の生成結果がすでにタイミングや音のキューを伴って届く可能性があります。
FLUX 3と現在のAI動画モデルの比較
| モデル/ワークフロー | 最大クリップ | ネイティブ音声 | テキストから動画 | リファレンス/一貫性 | ステータス |
| FLUX 3 | 最大20秒 | あり、同期 | あり | 一般提供時に確認 | アーリーアクセス |
| Seedance 2.5 | 最大30秒 | 音声リファレンスがペースを形成 | あり | 最大50のリファレンスアセット | ロールアウト/ベータ |
| Kling O3 | 現在の上限を確認 | 現在のサポートを確認 | あり | Omni Reference | 稼働中 |
| Grok Imagine 1.5 | 最大15秒 | 未記載 | プレビューAPIでは非対応 | リファレンスから動画 | 稼働中 |
| Veo | モデル/バージョンに依存 | サポートされているバージョンではネイティブ音声あり | あり | Ingredients/リファレンス | アクセスは変動 |
| Flickキャンバス | プロジェクトレベルのワークフロー | プロジェクトの一部として音声をサポート | マルチモデル | モデル間のキャラクターリファレンス | 稼働中のワークフローレイヤー |
Seedanceはリファレンスパックワークフローにおいて依然として重要です。Klingはモーションの多いショットにおいて依然として重要です。Veoは洗練されたリアリズムと、サポートされているバージョンでのネイティブオーディオにおいて依然として重要です。Grokは高速な画像から動画への探索において依然として重要です。FLUX 3の差別化要因は、映像と音が一緒にデザインされる単一のマルチモーダル生成です。
FLUX 3がまだ証明できていないこと
FLUX 3は有望ですが、アーリーアクセスの段階では重要な疑問が未解決のままです:
- オーディオを正確に指示できるか? プロンプトが対話、フォーリー、環境音、音楽をどの程度制御できるかを知る必要があります。
- 同じパフォーマンスを維持したまま映像を再生成できるか? 映画制作者にはテイクレベルの制御が必要です。
- ショット間で声を一致させられるか? キャラクターが声の一貫性を保てる場合、ネイティブサウンドが最も重要になります。
- リファレンスはどれほど強力か? キャラクター、衣装、ロケーションの一貫性が、実際の映画制作で機能するかどうかを決定します。
- 反復のコストはどれくらいか? 価格設定により、実験に使うのか本番制作に使うのかが決まります。
- 約束されたウェイトはどれほどオープンか? 開発者バージョンは、長期的にはホスト版リリースよりも重要になる可能性があります。
これらの答えが公開されるまでは、FLUX 3を解決済みのエンドツーエンド制作システムではなく、重要な新機能として扱ってください。
より良いFLUX動画のためのベストプラクティス
- 一度に1つのショットをプロンプトします。
- 視覚的な指示だけでなく、オーディオの指示も含めます。
- カメラの動きを明確に指定します。
- 初期のテストはシンプルに保ちます。
- 読み取り可能なテキストやロゴは避けます。
- 安定性が重要な場合は短めのクリップを使用します。
- 優れたフレームをリファレンスとして保存します。
- 音が編集に役立つかどうかを確認します。
- 1つのモデルがすべてのショットで勝つと仮定せず、FLUXクリップを他のモデルと比較します。
- モデルを入れ替えてもプロジェクトを失わないよう、Flickで映画を整理しておきます。
よくある間違い
- プロンプトでオーディオを無視する。 FLUX 3の差別化要因は同期サウンドなので、それを指示してください。
- 1回の生成で完全なシーンを求める。 1つのクリップは1つのショットであるべきです。
- 20秒をフルに使いすぎる。 長いクリップは、アクションが一貫性を保つ場合にのみ優れています。
- 映像だけで判断する。 タイミング、サウンドデザイン、環境音、パフォーマンスを聴いてください。
- ベンダーのベンチマークが最終的なものだと思い込む。 独立した比較が重要になります。
- 連続性を忘れる。 美しいクリップでも、キャラクター、ロケーション、シークエンスと一致する必要があります。
- 1つの完璧なモデルを待つ。 実際には、ショットごとに最適なモデルを使用し、1つのワークフロー内で映画を組み立ててください。
よくある質問
FLUX 3は動画を生成できますか?
はい。FLUX 3 Videoはテキストから最大20秒の動画クリップを生成でき、オプションでネイティブの同期音声も可能です。
FLUXで動画を生成するにはどうすればよいですか?
カメラの動き、被写体の動き、環境の動き、スタイル、制約、音声を説明するショット重視のプロンプトを書きます。バリエーションを生成し、最適にカットできるクリップを選択し、シーケンスの残りの部分と整理します。
FLUX 3は音声を生成しますか?
はい。FLUX 3は同じパスで動画と同期した音声を生成できます。つまり、後から音声を追加するのではなく、映像と音声が一緒に作成されます。
FLUX 3はオープンソースですか?
まだです。FLUX 3はアーリーアクセスとして申請制で公開されました。Black Forest Labsによると、オープンウェイトの開発者向けバージョンは2026年後半に計画されているとのことです。
FLUX 3とFLUX 2の違いは何ですか?
FLUX 2は主に画像モデルです。FLUX 3は画像、動画、音声、アクション予測にまたがるマルチモーダルアーキテクチャです。
FLUX 3の価格はいくらですか?
価格は未発表です。現在のアクセスはBlack Forest Labsのアーリーアクセスプロセスを通じて行われています。
FLUX 3はRunwayより優れていますか?
Black Forest Labsの報告によると、ベンチマーク比較の77%でFLUX 3がRunway Gen-4.5よりも好まれました。独立したテストはまだ必要です。
FlickでFLUX 3を使用できますか?
Flickワークスペースで FLUXが利用可能な場合は、動画モデルとして直接使用できます。アーリーアクセス期間中に別の場所でFLUXクリップを生成した場合は、Flickキャンバスにインポートし、リファレンスの横に整理し、プロジェクトの残りの部分と一緒にカットします。
FLUX を最初に何に使用すべきですか?
短い音響を意識したショットから始めましょう:雨の中の足音、ドアが閉まる音、対話のビート、コックピットの警報、車の通過音、または雰囲気のあるエスタブリッシングショット。これらは同期音声が実際にシーケンスに役立つかどうかを明らかにします。