2026 年如何運用 Blender 進行 AI 影像製作:完整指南

· Flick 內部影片製作人 · LinkedIn

Jun 2026

來到 2026 年,AI 影像與影片生成工具在製作精美、精準成果方面的能力比以往任何時候都強大。隨著模型能力不斷提升,使用者能否有效引導它們也變得越來越重要。要指導 AI 影片模型最可靠的方式,就是先在 Blender 中編排你的鏡頭。你先在 3D 中為角色與攝影機製作一個粗略動畫版本,將算圖匯出作為動作參考,再搭配起始畫面輸入到影片模型中。模型會精確依照你的攝影機運鏡與角色動作,同時生成最終角色場景細節。

身為 Flick 的內部影片創作者,Jaime 花費無數時間打磨一套 Blender 到 AI 的工作流程,將粗略的 3D 分鏡轉化為角色一致、完成度高的鏡頭。在這篇指南中,我將帶你逐步了解它的運作方式、原理,以及如何在 Flick 中親自執行完整的工作流程。

如何運用 Blender 進行 AI 影像製作 快速總覽

如果你想快速了解重點,這裡有簡短的答案:

指導 AI 影片最可靠的方式,就是先在 Blender 中定義你的鏡頭,再將這個 3D 分鏡作為模型的參考。你在 Blender 中為角色與攝影機製作一個粗略動畫版本——不需要精細的模型或材質貼圖——將算圖匯出作為動作參考,再搭配起始畫面輸入到影片模型中。模型會精準對應你的攝影機運鏡與動作,同時為最終鏡頭生成角色與場景細節。

在 Flick 中,這只需要三個步驟:

  1. 在 Blender 中編排鏡頭——為角色動作與攝影機運鏡製作動畫,即使只用基本形狀也可以,並匯出影片及其第一格畫面。
  2. 算圖出第一格畫面——使用 Nano Banana 將你算圖的第一格畫面,轉換成最終鏡頭的第一格畫面,同時保持構圖與姿勢不變。
  3. 生成最終影片——將算圖出的畫面作為起始畫面,並透過 Omni Reference 將 Blender 影片片段作為動作參考,輸入到 Seedance。

對於需要真正電影級運鏡控制的創作者來說,這是槓桿效益最高的技巧,純文字轉影片與圖片轉影片根本無法提供這種控制力。

在 Blender 中精確分鏡的鏡頭。
同一個鏡頭在 Flick 中以 AI 算圖呈現。

為什麼在 Blender 中走位有效

要理解為什麼 Blender 能提供如此強大的創作控制力,我們得先了解 AI 影片模型的能力與限制。

基本上,像 Seedance 2.0、Kling 3.0Veo 3.1 這類 AI 影片模型,算圖表現極為出色,但導演能力卻很薄弱。它們對 3D 空間沒有持續性的理解——沒有固定的攝影機、沒有穩定的幾何結構,也不記得場景中不同元素在不同生成之間如何移動。當你只用文字向影片模型下提示詞時,它每次都要從零開始編造攝影機運動、時間節奏與空間佈局。這就是為什麼同一個提示詞在不同次生成會產出不同的鏡頭,也是為什麼你很難得到當初下提示詞時腦中所想的精確結果。

這時候 Blender 就派上用場了。Blender 為模型補上了它所欠缺的結構與方向。在 Blender 中,你擁有一台具備精確焦距與精準運動路徑的真實攝影機、物件會固定在你放置的位置,還有一個你可以刻意擺姿與移動的角色。當你將該場景算圖並輸入作為參考時,你不再是用文字去近似描述你的鏡頭,而是直接把你想要的精確運鏡與構圖交給模型去依循。

使用 Blender 進行 AI 電影製作時,一個關鍵洞察是:細節往往越少越好。你的 Blender 走位並不需要完成的模型、材質或燈光。事實上,粗略的形狀——甚至用方塊來代替角色——就足以讓模型保留空間調度、攝影機運動與時間節奏。細節過多反而會讓模型混淆。相反地,乾淨、直截了當的走位能讓模型保留你輸入的動態,同時專注於生成場景最終的細節,像是角色、場景設計與燈光。簡而言之,走位是用來提供空間參考,而非追求美觀。

用 Blender 控制 AI 模型的各種方法比較

方法運作原理最適合投入程度控制力
運動參考(影片 → 影片)將 Blender 走位片段匯出,作為影片模型的運動/攝影機參考鎖定攝影機運動與角色動作低~中
算圖通道(深度、姿勢、邊緣)從 Blender 匯出控制圖,用於在 ComfyUI/ControlNet 流程中設定條件本地端流程中逐幀精確的結構控制極高
起始畫面控制算圖出 Blender 畫面、重新風格化,作為影片的第一幀鎖定構圖與鏡頭開場中~高
灰模+角色骨架擺出粗略 3D 角色的姿勢,在多個鏡頭間鎖定比例與攝影機角度多角度下的角色一致性
3D 場景作為虛擬場景在 Blender 中建立或掃描環境,得到穩定、可重複使用的背景在不同鏡頭剪接間保持場景一致中~高

對於大多數敘事性作品而言,運動參考模型是最理想的甜蜜點。它以最少的前置作業,提供精確的攝影機與動作控制,也是下文 Jaime 技巧的基礎。如果你想要逐幀精確的結構控制,並且熟悉本地端 ComfyUI 設置,那麼將算圖通道(深度、OpenPose、Canny)輸入 ControlNet,能給你最大限度的創作控制力——這部分我們稍後會詳談。

Blender 如何為流程中的每個環節提供輸入

Blender 可以在鏡頭的三個不同階段控制影片生成模型。了解每個階段,能幫助你判斷特定鏡頭值得投入多少 3D 製作工夫。

攝影機與運動控制

老實說,這就是 Blender 最大的優勢。你在 Blender 中的攝影機動態就是實際的鏡頭運動——它的焦距、路徑、晃動與時間點都會直接轉換為模型的動態參考。你不需要用文字描述「緩慢推近並帶有輕微手持晃動」然後祈禱模型能理解,只要在 Blender 中完成一次動畫設定,模型就能精準匹配。

構圖與首幀控制

經過算圖的 Blender 畫面,可以直接成為你影片的第一幀。由於你能在 3D 中精確控制每個元素的位置,構圖也完全由你掌控——接著再使用像 GPT Image 2 或 Nano Banana Pro 這樣的影像編輯模型,將該畫面重新調整為最終風格,之後再以此為基礎進行動畫製作。像 fSpy 這類工具,甚至能將你的 Blender 攝影機與現有的生成畫面對齊,讓你的分鏡與 AI 生成的底圖完美吻合。

利用算圖分層進行結構化控制(進階)

為了達到最高精確度,Blender 可以匯出控制圖,其中包含深度、法線、Canny 邊緣以及 OpenPose 骨架資訊,這些資料可輸入你本機 ComfyUI 流程中的 ControlNet。深度圖負責鎖定場景結構,OpenPose 鎖定角色姿勢,Canny 則鎖定輪廓。此類流程中社群最常用的骨架工具是 toyxyz 的「Character bones that look like OpenPose for Blender」,它能在單次算圖中,從單一已擺姿勢的骨架輸出深度、Canny、OpenPose、法線與分割等多種通道。此外,你還可以使用像 Wan 2.2 VACE 這類開源模型,在保留每一幀深度與姿勢資訊的前提下,將你的 Blender 粗剪重新風格化為最終影片。這條路線是目前技術門檻最高的做法,但它能讓你在不依賴雲端模型的情況下,逐幀進行精確的結構控制。

具備角色一致性的完整 Blender 工作流程

我們內部的影片創作者 Jaime 說明了一套工作流程,能將粗略的 Blender 分鏡,透過三個階段轉化為一個完整、角色一致的鏡頭——全程都在 Flick 內完成。由於你已預先在 3D 中定義好攝影機與動作,等於為影片模型完成了大部分繁重的工作,為動態與角色身分都提供了最佳的參考依據。

階段一——準備你的 Blender 參考

首先在 Blender 中為鏡頭進行分鏡設計。請記住,這不需要做得很細緻——簡單的基本形狀就足以呈現攝影機運動、角色動作與時間節奏。

  1. 在 Blender 中製作角色動作與攝影機運動。
  2. 匯出 Blender 影片。
  3. 將 Blender 影片的第一幀匯出為圖片。
  4. 將 Blender 影片與第一幀圖片都上傳到 Flick。

Flick 會將這兩個檔案作為後續步驟的動態與構圖參考。

粗略的 Blender 分鏡草稿——一個基本人物承載著攝影機運動與節奏。

階段二——算圖你的第一幀

接下來,我們會在不破壞你在 Blender 中精心設計的構圖前提下,將粗略的第一幀轉化為最終樣貌。

  1. 使用 Nano Banana 編輯第一幀,保持構圖與角色姿勢不變。
  2. 優化你的提示詞,以維持角色一致性:

「使用提供的圖片作為構圖與姿勢參考。保持構圖與提供的草圖100%完全一致。保持相機位置100%不變。保持取景100%不變。確保角色姿勢與提供的草圖保持100%一致。」

Flick 會生成該畫面的完整算圖版本,同時保留原始的佈局與動作。這個算圖畫面將成為你最終影片的視覺起點——它承載著你最終的角色設計與風格,並鎖定在你於 3D 中預先安排好的精確構圖裡。

同一個畫面,以 Nano Banana 算圖——保留了構圖與姿勢,套用最終視覺風格。
同一個畫面,以 Nano Banana 算圖——保留了構圖與姿勢,套用最終視覺風格。

階段 3——生成最終影片

最後,我們使用 Blender 影片來驅動動作,為算圖畫面注入動態。

  1. 點擊算圖畫面並選擇影片
  2. 選擇 Omni Reference
  3. 選擇 Seedance
  4. 將算圖畫面用作起始畫面
  5. 將 Blender 影片用作影片參考
  6. 在你的提示詞中,寫下:
參考 @Video 中角色的動作與運鏡語言。
使用 Seedance 2.0 生成影片,並輸入起始畫面與動態影片作為參考。
使用 Seedance 2.0 生成影片,並輸入起始畫面與動態影片作為參考。

Flick 使用算圖畫面作為視覺起點,並依循 Blender 影片參考中的動作。最終成果是一個與你精確的運鏡與角色動作完全吻合的完整鏡頭——由 Blender 執導,由 AI 算圖。

注意這個提示詞有多簡短——這正是重點所在。你給予模型的大部分資訊,其實都蘊含在你的兩個參考素材中:算圖起始畫面定義了外觀與構圖,而 Blender 片段則定義了動作。以下是最終成果:

最終成果——生成模型精確跟隨 Blender 的攝影機運動與動作。

為什麼這個方法在 AI 電影製作上勝過文字轉影片

值得清楚說明的是,相較於單純用文字提示影片模型,這個工作流程能帶來哪些優勢:

  • 精確的運鏡控制。你的 Blender 相機運動會直接轉移過去,包括晃動、速度與精確路徑。文字提示只能模糊地描述這些面向。
  • 可重複、一致的鏡頭。因為相機與場面調度存在於真實的 3D 場景中,你可以在多個鏡頭之間重現相同的取景。
  • 角色一致性你的角色以你想要的精確設計與姿勢鎖定在起始畫面中,並貫穿整段片段。
  • 更少的浪費生成因為你已預先定義好動作與構圖,模型偏離需求的空間就大大減少,這意味著要得到可用的成果,需要的昂貴迭代次數更少。

更進一步:進階本地端流程

如果你想要精確到每一格畫面的結構控制,並且不排斥動手鑽研技術細節,你可以透過本地的 ComfyUI 設置,直接以 Blender 的渲染通道來驅動 AI 生成。流程如下:

  1. 在 Blender 中對場景進行分鏡與擺姿,角色部分可使用 toyxyz 的 OpenPose 骨架。
  2. 使用 EEVEE 或 Workbench 引擎,渲染出控制通道 —— 深度、OpenPose,以及選擇性的 Canny 或法線貼圖。
  3. 在 ComfyUI 中對 AI 進行條件設定:將這些通道輸入 ControlNet(深度 + 姿勢),透過 IP-Adapter 或訓練好的角色 LoRA 加入角色參考,然後生成。
  4. 使用如 Wan 2.2 VACE 這類影片模型來重新製作整段影片風格,它能接受深度與姿勢控制影片,確保動作與結構在每一格畫面都保持一致。
  5. 將結果合成回 Blender 的合成器或你所使用的剪輯軟體中。

讓這個流程無縫串接的關鍵,是 AIGODLIKE 的 ComfyUI-BlenderAI-node 附加元件,它讓你能在 Blender 內執行完整的 ComfyUI 圖表,並將你的視窗或攝影機畫面作為即時輸入來源。這條路線對 GPU 的要求較高 —— 影像處理至少需要 16GB VRAM 才夠實用,而像 Wan 這類影片模型通常需要 24GB,或改用雲端 GPU。儘管硬體門檻不低,但它能給你目前所能取得的最大控制權,且無需為每次生成支付雲端費用。

然而,這其中的取捨至關重要,必須認清。Blender 的控制力越強,輸出結果就越可預測。這也意味著模型本身的生成「魔力」會相對減少 —— 但若你追求更高的創作控制力,這其實無妨。AI 電影製作的藝術,正在於掌握你要限制多少、又要讓模型在最終畫面中發揮多少創意的那個平衡點。

Blender 應用於 AI 電影製作常見問題

我需要很會用 Blender 才能拿它來做 AI 電影製作嗎?

不需要。這套工作流程的重點就在於,你的分鏡可以很粗略 —— 基本形狀加上簡單的攝影機動畫就足夠了。你使用 Blender 是為了空間編排與攝影機運動,而不是打造精細完整的 3D 場景。往往細節越少,效果反而越好。

為什麼要用 Blender,而不是直接對影片模型下提示詞?

文字提示詞無法精確控制攝影機運動、時間點或空間佈局 —— 模型每次都會自行編造這些細節。在 Blender 中做分鏡,能讓你精準掌控攝影機語言與角色動作,再將其作為參考交給 AI,讓畫面呈現出你真正想要的樣子。

我實際上需要從 Blender 匯出什麼?

對於 Flick 的核心工作流程來說,只需要兩項:分鏡影片(作為你的動作與攝影機參考)以及它的第一格畫面截圖(作為你的構圖參考)。若是進階的本地流程,你也可以匯出深度、OpenPose 等控制通道。

哪些影片模型適用於這個工作流程?

在 Flick 中,Seedance 與 Kling O3 都支援 Omni Reference,並能很好地跟隨 Blender 動作參考。若是本地的開源模型流程,Wan 2.2 VACE 可直接接受深度與姿勢控制影片,實現精確到每一格畫面的風格重製。

這如何確保我的角色保持一致?

你的角色會被固定在渲染出的起始畫面上,擁有你想要的精確外觀與姿勢,而 Blender 參考則穩定維持動作 —— 這樣模型就能在整個鏡頭中延續同一個固定身分,而不是每次都根據文字描述重新生成。

我需要昂貴的 GPU 嗎?

使用 Flick 的工作流程不需要 —— 生成過程在雲端執行,Blender 是唯一在本地運行的軟體,而且相當輕量。只有當你想自行執行進階的本地 ComfyUI 流程時,才需要一張夠強的 GPU(16GB 以上 VRAM)。

幾分鐘內執行你的第一個 AI 鏡頭。

開啟 Flick 聊天,放入你的 Blender 粗剪影片和第一幀畫面,並從以下提示詞中挑一個開始。

在聊天中附上你的 Blender 影片