2026年版:AI映画制作にBlenderを使う方法 完全ガイド

· Flickの社内映画制作者 · LinkedIn

Jun 2026

2026年、AI画像・動画生成ツールはこれまでになく美しく精密な結果を生み出せるようになっています。モデルがより強力になるにつれ、ユーザーがそれをディレクションできることがますます重要になっています。AI動画モデルを最も確実にディレクションする方法は、まずBlenderでショットをブロッキングすることです。3Dでキャラクターとカメラのラフなバージョンをアニメーションさせ、そのレンダリングをモーションリファレンスとしてエクスポートし、開始フレームとともに動画モデルに入力します。モデルはあなたのカメラワークとキャラクターの動きを正確に再現しながら、最終的なキャラクターシーンのディテールを生成します。

Flickの社内フィルムメイカーとして、Jaimeはラフな3Dブロッキングをキャラクターの一貫性を保った完成度の高いショットへと変換する、Blenderから始まるAIパイプラインの構築に膨大な時間を費やしてきました。このガイドでは、その仕組みと理由、そしてFlickでこのワークフロー全体をご自身で実行する方法を詳しくご紹介します。

AI映画制作にBlenderを使う方法のポイント

手早く概要を知りたい方のために、簡潔な答えをご紹介します。

AI動画を最も確実にディレクションする方法は、まずBlenderでショットを定義し、その3Dブロッキングをモデルのリファレンスとして使うことです。Blender内でキャラクターとカメラのラフなバージョンをアニメーションさせます——細かいモデルやテクスチャは不要です——レンダリングをモーションリファレンスとしてエクスポートし、開始フレームとともに動画モデルに入力します。モデルはあなたのカメラワークと動きを正確に再現しながら、最終ショットのためのキャラクターとシーンのディテールを生成します。

Flickでは、これは3つのステップで完結します。

  1. Blenderでショットをブロッキングする — シンプルな形状でもいいので、キャラクターの動きとカメラワークをアニメーションさせ、動画とその最初のフレームをエクスポートします。
  2. 最初のフレームをレンダリングする — Nano Bananaを使って、レンダリングの最初のフレームを最終ショットの最初のフレームへと変換します。構図とポーズはそのまま維持されます。
  3. 最終的な動画を生成する — レンダリングしたフレームを開始フレームとして、Blenderのクリップをモーションリファレンスとして、Omni Reference経由でSeedanceに入力します。

これは、純粋なテキスト動画生成や画像動画生成では実現できない、本物の映画的コントロールを求めるクリエイターにとって、最も効果の高いテクニックです。

Blenderで精密にブロッキングされたショット。
同じショットをFlickでAIレンダリングしたもの。

なぜBlenderでのブロッキングが効果的なのか

Blenderがなぜこれほど多くのクリエイティブなコントロールを提供できるのかを理解するには、AI動画モデルの能力と限界を理解することが役立ちます。

本質的に、Seedance 2.0、Kling 3.0Veo 3.1のようなAI動画モデルは、優れたレンダラーではありますが、監督としては非常に不得手です。これらのモデルには3D空間の持続的な理解がありません——固定されたカメラも、安定したジオメトリも、シーンの各要素が生成ごとにどう動くかの記憶もないのです。テキストのみで動画モデルにプロンプトを与えると、モデルはカメラの動き、タイミング、空間的な配置を毎回ゼロから作り出します。だからこそ、同じプロンプトでも生成のたびに違うショットになり、最初にプロンプトを入力したときに思い描いた通りの結果を得るのが難しいのです。

そこでBlenderの出番です。Blenderは、モデルに欠けている構造と方向性を与えてくれます。Blenderでは、正確な焦点距離と精密な動きの軌道を持つ本物のカメラ、置いた場所に留まり続けるオブジェクト、意図通りにポーズをつけて動かせるキャラクターを扱うことができます。そのシーンをレンダリングしてリファレンスとして入力すれば、もはや言葉でショットを近似するのではなく、モデルに追従してほしい正確な動きとフレーミングを与えることになります。

AIフィルムメイキングでBlenderを使う際の重要なポイントの一つは、ディテールは少ないほうがよいことが多いという点です。Blenderでのブロッキングには、完成したモデル、マテリアル、ライティングは必要ありません。実際、キャラクターの代わりとなる立方体のような大まかな形状だけでも、空間的な演出、カメラの動き、タイミングをモデルに保持させるには十分です。ディテールが多すぎると、モデルを混乱させてしまうことがあります。逆に、シンプルで分かりやすいブロックアウトなら、入力した動きを保持しながら、キャラクター、セットデザイン、ライティングといったシーンの最終的なディテールの生成に集中させることができます。要するに、ブロックアウトは美しさのためではなく、空間的なリファレンスのためのものなのです。

Blenderを使ってAIモデルをコントロールする各手法の比較

手法仕組み最適な用途手間コントロール性
モーションリファレンス(動画→動画)Blenderのブロックアウトクリップを、動画モデル用のモーション/カメラリファレンスとして書き出すカメラの動きとキャラクターの動作の固定低~中
レンダーパス(デプス、ポーズ、エッジ)Blenderからコントロールマップを書き出し、ComfyUI/ControlNetグラフの条件付けに使用ローカルパイプラインでのフレーム単位の構造的コントロール非常に高い
開始フレームコントロールBlenderのフレームをレンダリングし、スタイルを変更して動画の最初のフレームとして使用構図とショットの冒頭の固定中~高
グレーボックス+キャラクターリグラフな3Dキャラクターにポーズをつけ、ショット間でプロポーションとカメラアングルを固定複数アングルにわたるキャラクターの一貫性
バーチャルセットとしての3DシーンBlenderで環境を構築またはスキャンし、安定した再利用可能な背景を作成カット間でロケーションの一貫性を保つ中~高

大半のナラティブ作品においては、モーションリファレンス手法が最適なバランスを提供します。最小限のセットアップで精密なカメラと動作のコントロールを実現し、後述するJaimeのテクニックの土台にもなっています。フレーム単位の構造的コントロールを求めていて、ローカルのComfyUI環境に慣れているなら、ControlNetに流し込むレンダーパス(デプス、OpenPose、Canny)が最大限のクリエイティブなコントロールを可能にします——これについては後ほど詳しく説明します。

Blenderがパイプラインの各段階にどう活かされるか

Blenderは、ショットの3つの異なる段階で動画生成モデルをコントロールできます。それぞれを理解することで、あるショットにどれだけ3D作業を投じる価値があるかを判断しやすくなります。

カメラとモーションのコントロール

正直に言うと、これこそがBlender最大の強みです。あなたのBlenderカメラそのものがカメラの動きになります。焦点距離、パス、手ブレ、タイミングのすべてが、モーションリファレンスとしてそのままモデルに転送されます。「わずかな手持ちの揺れを加えたゆっくりとしたドリーイン」と言葉で説明してモデルが正しく解釈してくれることを期待する代わりに、Blenderで一度アニメーションを付ければ、モデルはそれを正確に再現します。

構図とファーストフレームのコントロール

レンダリングしたBlenderのフレームは、そのまま動画の最初のフレームとして使うことができます。3D空間内であらゆる要素の配置を正確にコントロールできるため、構図も自在に決められます。あとはGPT Image 2やNano Banana Proのような画像編集モデルを使って、そのフレームをアニメーション化する前に最終的なルックへとスタイルを変えるだけです。fSpyのようなツールを使えば、Blenderのカメラを既存の生成フレームに合わせることもでき、AI生成のプレートに完璧に一致するブロッキングを実現できます。

レンダーパスによる構造的なコントロール(上級者向け)

最大限の精度を求める場合、Blenderはdepth、normal、Canny edge、OpenPoseスケルトンを含むコントロールマップをエクスポートでき、これらはローカルのComfyUIパイプラインでControlNetに供給されます。depthはシーン構造を捉え、OpenPoseはキャラクターのポーズを固定し、Cannyはシルエットを固定します。このためのコミュニティ標準リグはtoyxyz氏の「Character bones that look like OpenPose for Blender」で、1回のレンダリングでポーズを取ったリグからdepth、Canny、OpenPose、normal、segmentationの各パスを出力します。さらに、Wan 2.2 VACEのようなオープンソースモデルを使えば、depthとポーズ情報をフレームごとに尊重しながら、Blenderのブロックアウトを最終的な映像へとリスタイルできます。このルートは間違いなく最も技術的ですが、クラウドモデルに頼ることなく、フレームごとの精密な構造制御が可能になります。

キャラクター一貫性を備えたエンドツーエンドのBlenderワークフロー

社内フィルムメーカーのJaimeが、粗いBlenderブロックアウトを完全なキャラクター一貫性のあるショットへと変える3段階のワークフローを、すべてFlick内で紹介します。カメラとアクションを最初に3Dで定義しているため、動画モデルのための下準備をすでに済ませていることになり、モーションとアイデンティティの両方において最良のコンテキストを提供できます。

ステージ1 — Blenderリファレンスを準備する

まずBlenderでショットのブロッキングを行います。細部まで作り込む必要はありません — 基本的な形状だけで、カメラワーク、キャラクターの動き、タイミングを表現できます。

  1. Blenderでキャラクターの動きとカメラワークを作成します。
  2. Blenderの動画をエクスポートします。
  3. Blenderの動画の最初のフレームを画像としてエクスポートします。
  4. Blenderの動画と最初のフレーム画像の両方をFlickにアップロードします。

Flickはこれら2つのファイルを、後続のステップにおけるモーションとフレーミングのリファレンスとして使用します。

大まかなBlenderブロックアウト——シンプルな人物モデルがカメラの動きとタイミングを担っている。

ステージ2 — 最初のフレームをレンダリングする

ここでは、Blenderで丁寧に組み立てた構図を損なうことなく、大まかな最初のフレームを最終的なルックへと仕上げます。

  1. Nano Bananaを使って最初のフレームを編集し、構図とキャラクターのポーズを変えずに保ちます。
  2. キャラクターの一貫性を保つために、プロンプトを最適化します。

「提供された画像を構図とポーズのリファレンスとして使用してください。構図は提供されたスケッチと100%完全に一致させてください。カメラ位置は100%変更しないでください。フレーミングは100%変更しないでください。キャラクターのポーズが提供されたスケッチと100%一致することを確認してください。」

Flickは、元のレイアウトとアクションを保持したまま、フレームを完全にレンダリングしたバージョンを生成します。このレンダリング済みフレームが最終動画のビジュアルの出発点となり、最終的なキャラクターデザインとスタイルを反映しながら、3Dでブロッキングした通りの正確な構図に固定されます。

同じフレームをNano Bananaでレンダリングしたもの——構図とポーズはそのままに、最終的なルックが適用されている。
同じフレームをNano Bananaでレンダリングしたもの——構図とポーズはそのままに、最終的なルックが適用されている。

ステージ3 — 最終動画を生成する

最後に、Blenderのクリップを使ってモーションを駆動しながら、レンダリング済みフレームをアニメーション化します。

  1. レンダリング済みフレームをクリックし、Videoを選択します。
  2. Omni Referenceを選択します。
  3. Seedanceを選択します。
  4. レンダリング済みフレームを開始フレームとして使用します。
  5. Blenderの動画を動画リファレンスとして使用します。
  6. プロンプトに次のように記述します:
@Videoからキャラクターの動作とカメラワークを参照してください。
Seedance 2.0を使って動画を生成し、開始フレームとモーション動画をリファレンスとして入力する。
Seedance 2.0を使って動画を生成し、開始フレームとモーション動画をリファレンスとして入力する。

Flickはレンダリング済みフレームをビジュアルの出発点として使用し、Blenderの動画リファレンスからモーションに従います。結果として、あなたが意図した通りのカメラワークとキャラクターの動きに正確に一致する、完成度の高いショットが得られます — Blenderで演出し、AIでレンダリングする、というわけです。

プロンプトがいかに短いかに注目してください — それこそがポイントです。モデルに与える情報のほとんどは、2つのリファレンスに含まれています。レンダリング済みの開始フレームが見た目と構図を定義し、Blenderのクリップがモーションを定義します。以下が最終結果です:

最終結果——生成モデルがBlenderのカメラの動きとアクションを正確に再現している。

なぜこの手法がAI映像制作においてテキストtoビデオより優れているのか

このワークフローが、単純にテキストで動画モデルにプロンプトを与える方法と比べて何を提供するのか、正確に理解しておく価値があります:

  • 正確なカメラコントロール。Blenderのカメラワークがそのまま反映され、揺れ、速度、正確な軌道まで含まれます。テキストプロンプトではこれらの要素を曖昧にしか記述できません。
  • 再現可能で一貫性のあるショット。カメラとブロッキングが実際の3Dシーンに存在するため、複数のショットにわたって同じフレーミングを再現できます。
  • キャラクターの一貫性キャラクターは、意図したデザインとポーズのまま開始フレームに固定され、クリップ全体を通して維持されます。
  • 無駄な生成の削減モーションと構図をあらかじめ定義しているため、モデルが意図から逸脱する余地がはるかに少なくなり、使えるテイクを得るための高コストな試行錯誤を減らせます。

さらに深く:高度なローカルパイプライン

フレーム単位で正確な構造制御を求め、技術的な作業にも抵抗がないなら、BlenderのレンダーパスをローカルのComfyUI環境に直接流し込んでAI生成を駆動することもできます。流れは以下の通りです。

  1. Blenderでシーンをブロッキング・ポージングします。キャラクターにはtoyxyzのOpenPoseリグのようなリグを使用します。
  2. EEVEEまたはWorkbenchエンジンを使い、深度、OpenPose、必要に応じてCannyやノーマルなどのコントロールパスをレンダリングします。
  3. ComfyUIでAIを条件付けします。これらのパスをControlNet(深度+ポーズ)に入力し、IP-Adapterや学習済みのキャラクターLoRAでキャラクターリファレンスを追加して生成します。
  4. Wan 2.2 VACEのような動画モデルでクリップ全体をリスタイルします。このモデルは深度とポーズのコントロール動画を受け付け、フレームごとに動きと構造を固定できます。
  5. 結果をBlenderのコンポジターやお使いの編集ソフトに戻し、合成します。

この工程をシームレスにする架け橋となるのが、AIGODLIKEのComfyUI-BlenderAI-nodeアドオンです。これを使えば、Blender内でComfyUIのグラフ全体を実行し、ビューポートやカメラをライブ入力として使うことができます。この方法には十分な性能のGPUが必要で、画像作業には実質16GBのVRAMが下限、Wanのような動画モデルには通常24GB、あるいはクラウドGPUが求められます。ハードウェア要件はあるものの、per-generationのクラウド費用なしで、最大限のコントロールを手に入れられます。

ただし、そのトレードオフを理解しておくことが重要です。Blenderでのコントロールを強めるほど、出力の予測性は高まります。これはつまり、モデルが生み出す生成的な"マジック"が減るということですが、より高いクリエイティブコントロールを得るためには十分な代償と言えます。AIフィルムメイキングの醍醐味は、どこまで制約を課し、どこまでモデルに最終的なショットへの貢献を委ねるか、そのバランスを見極めていく過程にあります。

AIフィルムメイキングにおけるBlender活用 よくある質問

AIフィルムメイキングにBlenderを使うには、Blenderが得意である必要がありますか?

いいえ。このワークフローの要点は、ブロッキングが大まかでよいという点にあります。基本的な形状とシンプルなカメラアニメーションがあれば十分です。Blenderは詳細で完成度の高い3Dシーンを作るためではなく、空間的な演出とカメラワークのために使います。むしろディテールが少ないほど、良い結果が得られることが多いです。

なぜ動画モデルに直接プロンプトを入力するだけでなく、Blenderを使うのですか?

テキストプロンプトでは、カメラの動きやタイミング、空間的なレイアウトを正確にコントロールできません。モデルが毎回それらを独自に作り出してしまいます。Blenderでブロッキングを行えば、正確なカメラワークとキャラクターの動きを自分で演出し、それをリファレンスとしてAIに渡せるので、狙い通りのショットに仕上がります。

Blenderから実際に何を書き出せばよいのですか?

Flickの基本的なワークフローでは、2つだけです。ブロックアウト動画(モーションとカメラのリファレンスになります)と、その最初のフレームの画像(構図のリファレンスになります)です。より高度なローカルパイプラインでは、深度やOpenPoseなどのコントロールパスも書き出すことができます。

このワークフローで使える動画モデルはどれですか?

Flickでは、SeedanceとKling O3の両方がOmni Referenceに対応しており、Blenderのモーションリファレンスにもよく追従します。ローカルのオープンモデルパイプラインでは、Wan 2.2 VACEが深度とポーズのコントロール動画を直接受け付け、フレーム単位で正確なリスタイルが可能です。

これによってキャラクターの一貫性はどのように保たれますか?

キャラクターは、意図した通りのデザインとポーズでレンダリングされた開始フレームに固定され、Blenderのリファレンスがモーションを安定させます。そのためモデルは、テキスト説明から毎回作り直すのではなく、ショット全体を通してひとつの固定されたアイデンティティを保持します。

高価なGPUが必要ですか?

Flickのワークフローでは不要です。生成はクラウド上で実行されるため、ローカルで動くのはBlenderだけで、その負荷も軽いものです。高性能なGPU(16GB以上のVRAM)が必要になるのは、高度なローカルComfyUIパイプラインを自分で運用したい場合のみです。

数分で最初のAIショットを撮影しよう。

Flickのチャットを開き、Blenderのブロックアウト動画と最初のフレームをドロップして、以下のプロンプトのいずれかから始めましょう。

チャットにBlenderの動画を添付