
如何在 2026 年打造一致的 AI 角色:完整指南
Jun 2026
圖生圖角色一致性是指為同一個角色生成新的圖像,置於新場景與新角度中,同時保留其精確的視覺身分。你不必每次都用文字重新描述角色,只要提供一張參考圖給模型,它就能在每個鏡頭中都比對出相符的臉部、髮型與服裝。
如果你曾經創造過一個角色,卻眼睜睜看著它在不同場景、不同鏡位、不同細節設定下逐漸「走樣」,那你就親身體驗過角色漂移(character drift)。這是AI 影片製作中最普遍的挑戰之一。本指南將精確解釋角色漂移發生的原因,以及可用來解決它的具體方法,幫助你在 Flick、Midjourney、Veo 3、Sora 和 ComfyUI 中維持角色的一致性。
2026 年如何打造一致的 AI 角色一覽
如果你只想快速了解,這裡是簡短答案:
要用 AI 打造一致角色,最可靠的方法是先在單一參考圖中鎖定角色的身分特徵,然後在每個新鏡頭中重複使用這張參考圖。這種方法比從零重新下提示詞更一致、更精準、更可靠,這也是它在 2026 年成為預設工作流程的原因。
在 Flick 中,這就是Character Reference 工具,只需要三個步驟:
- 生成或上傳一張你角色的圖片——乾淨、光線充足、正面角度的肖像效果最好
- 選取該圖片,並點擊 Character Reference
- 自由地為新場景下提示詞(例如「走過夜晚霓虹燈閃爍的市集,電影感」),你的參考圖會讓角色保持穩定。
對幾乎所有創作者來說,這是槓桿效益最高的技巧,因為它不需要訓練、不需要寫程式碼、也不需要 GPU——只要一張好的參考圖就夠了。觀看我們的教學影片:Nano Banana Pro 角色一致性教學
立即開始,打造你的角色。
角色跑版發生的原因
要修正角色跑掉的問題,了解成因會很有幫助。當你生成一張圖片時,模型會從隨機噪點開始。它會依照你的提示詞,逐步去除這些噪點,直到浮現出清晰的圖像。這個過程稱為擴散(diffusion)。
當你在提示詞中描述一個角色時,你並不是在指向某個特定的人。「一位三十多歲、留鬍子的男人」符合模型在訓練時看過的數百萬張圖片。你的提示詞會落在這整個可能性空間中的某個位置。輸出結果是從這整個圖像空間中得出的通用結果——是許多符合你描述的不同臉孔的平均值。
因此,即使你重複使用完全相同的提示詞來描述一個角色,模型仍會從一組全新的隨機噪點開始,最終落在該空間中略有不同的位置。這會導致每次輸出的結果略有不同,即使提示詞完全相同。對提示詞的細微改動,例如加入新的角度、新角色,或不同的背景,都會加劇這種效應。一個鏡頭接著一個鏡頭,這些差異會逐漸累積,最終你原本的角色就會跑掉,變成另一個人。
這正是 Flick 的 Character Reference 功能所要解決的問題。Character Reference 工具不會把你的角色儲存在提示詞裡,而是以參考圖片的形式儲存你的主角。如此一來,即使你修改場景的不同面向,每一次新的生成都能重現你原本的角色。
你所定義的角色,代表的是模型在訓練過程中看過的許多圖片的通用化版本。每一次圖像生成都是全新的一次,都是從隨機噪點開始的。模型會逐步去除這些噪點(擴散),直到出現符合你所描述提示詞的圖像。你所定義的角色,代表的是模型在訓練過程中看過的許多圖片的通用化版本。每一次生成都是從隨機噪點開始的,並在這個範圍內產生略有不同的臉孔。因此,經過多次生成後,尤其是當你在提示詞中加入更多內容時,你最初呈現的角色就會逐漸跑掉,變成完全不同的樣子。
用 Flick 打造一致的角色

The Herder,鎖定為單一角色參考。觀看完整影片。
首先,創建一個角色——The Herder:不是英雄,也不是巫師——只是一位工匠,他的手藝在發揮作用的那一刻便悄然無形。他是來自「現代歐洲」(大約 1800 年代至 1900 年代初)的一位工匠。為了讓他從正面到背面(以及鏡頭與鏡頭之間)都保持一致,請使用 Flick 的 Character Reference 工具。
從單一張參考圖片開始。從這張初始圖片出發,繪製多張角色轉身圖——正面/側面/背面——呈現不同狀態:戴帽子、不戴帽子、撐傘、雙手空著、外套濕透、裝備變化。


接著,將這些轉身圖與 Flick 的 Character Reference 工具結合,讓角色的正面/側面/背面輪廓在不同鏡頭之間都保持穩定。
5 種打造一致 AI 角色的方法比較
並沒有單一「正確」的工具或模型,但確實有適合你技能程度與所需控制程度的正確方法。以下總結了 5 種最佳的 img2img 角色一致性做法,以及各自最適合哪些人:
| 方法 | 運作方式 | 最適合對象 | 所需心力 | 一致性 |
|---|---|---|---|---|
| Character Reference (img2img) | 上傳一張參考圖片;模型會在新場景中比對該身份 | 幾乎適合所有人——打造一致角色最快的途徑 | 低 | 高 |
| 角色/轉身圖 | 生成正面、側面、背面與 3/4 側面視角,作為多角度參考 | 為影像轉影片工具提供足夠的角度與動作參考資訊 | 低–中 | 高 |
| 提示詞法 | 在多次生成中重複使用相同的種子與逐字角色描述 | 快速呈現單一造型的變化 | 低 | 中 |
| LoRA 訓練 | 使用 15–50 張你角色的圖片訓練一個小型自訂模型 | 數百個鏡頭且幾乎零跑掉 | 高 | 非常高 |
| 換臉(最終清修) | 自由生成,再將你角色的臉替換到每一個畫面上 | 事後修正跑掉的問題 | 中 | 高(僅限臉部) |
如何在各大主要工具中保持角色一致

Midjourney透過 Omni Reference 來處理一致性(即 —oref 參數,並搭配 omni-weight —ow 來控制對參考圖片的貼合程度)。使用適中的權重以取得平衡(預設值為 100),當你想調整角色的某些特徵時,可以降低權重。它能產出令人驚豔的風格與美麗成果,但可能會使雀斑或刺青等細節變得柔和模糊。
Google 的 Veo 3(以及Veo 3.1)透過「Ingredients to Video」參考系統來維持角色的一致性。提供你的參考圖片以鎖定角色的身分,並確保在每個提示詞中都使用完全相同的角色描述。Veo 也能生成原生同步音訊與口型同步,讓你的角色能夠開口說話。
Sora 圍繞著錄製的參考片段(最初稱為「Cameos」,後來改稱「Characters」)建構角色一致性,能在多次生成之間創造可重複使用的形象,並附帶原生音訊。OpenAI 於 2026 年終止了 Sora,但你可以使用 OpenAI 的 img2img 圖像模型 GPT Image 2,在 Flick 中生成有你角色出現的場景。
若想取得絕對的控制權,ComfyUI 讓你能將 PuLID、InstantID 及 IP-Adaptor 等工具與自行訓練的角色 LoRA 結合,再加上姿勢控制與臉部細節調整節點。這是最具挑戰性、也最技術性的路線,但若你追求無限次的本地生成且零漂移,這是最理想的選擇。
端到端工作流程:從角色設計到最終剪輯
若想超越單張圖片、將你的角色整合進完整長片中,以下是 2026 年最優秀的創作者所採用的工作流程:
- 設計你的主角。生成一張你喜愛的強而有力的肖像。
- 建立參考圖集。建立一份轉向圖(正面、側面、背面、四分之三側面)。建立不同服裝、道具與表情的參考圖片。
- 在 Flick 中設定 Character Reference,並生成場景中的每個鏡頭,在每個提示詞中著重定義角色所處的環境與動作。
- 從靜態圖生成動畫。取每張鎖定的圖片,使用圖生影片模型來創建角色的場景。
- 剪輯與調色。在影片編輯器中組合你的場景,產出最終成果。
實用原則:先在靜態圖片中鎖定角色的身分,再進行動畫化。
如何在 Flick 中實現更精準的角色一致性

我們的內部電影製作團隊花費了無數時間,嘗試各種變通方法,以在 Flick 中為 img2img 角色一致性取得最佳成果。在這個過程中,我們發現了幾個進階技巧,能幫助你生成更精準的鏡頭,同時保持角色的一致性。
強大的角色一致性工作流程中,最關鍵的要素之一就是提示詞的撰寫。我們提供了一份完整的提示詞清單,可用於 img2img 角色一致性。以下,我將提供適用於不同工作流程的最佳角色一致性提示詞。
對於第一種方法,讓我們先從單一角色參考圖開始,接著將其轉換為轉向參考圖集,步驟如下:


從這一步開始,我們的目標是生成第一個有角色出場的鏡頭。在這個範例中,讓我們創建一個角色乘坐豪華馬車、望向窗外北歐雪原的鏡頭。
這裡的訣竅是,與其一次生成我們的圖像和角色(這樣精確度較低),不如先生成一張輕量的線稿草圖,並將角色描述嵌入文字中,作為我們理想畫面的初步構圖。這裡務必不要加入太多細節,因為這只是最終畫面的一個輕量示意圖。我們可以建立以下提示詞來生成這張圖像:
建立一張輕量、粗略的鉛筆線稿草圖。目標是呈現粗略的示意結構,不需要太多細節。場景設定在一輛豪華馬車內。馬車內部整體非常昏暗,僅有微弱的環境光。唯一明確的光源來自窗外。馬車的窗戶是完全敞開的窗口,沒有玻璃。厚重的窗簾裝飾著窗戶四周。馬車內部包含雕刻的木質裝飾結構與一個帶軟墊的椅背。窗台上覆蓋著薄薄一層雪,並有少量雪花輕輕飄入馬車內。窗外是北歐的雪原。外部瀰漫著濃密的晨霧。白色的霧非常濃厚,僅能隱約看見覆雪開闊平原、低矮雪丘,以及極遠處山脈的輪廓。角色是一位二十出頭的年輕歐洲女性。她的臉型略窄,呈柔和的橢圓形,額頭光滑,顴骨分明,下顎線條乾淨俐落,下巴微微收尖。她的眉毛顏色深、輪廓清晰,大致呈直線形。她的眼睛是修長的杏眼,上眼瞼輪廓清晰,眼神堅定直視前方。虹膜與瞳孔呈明亮的琥珀金色,眼睛帶有真實感的濕潤反光。她的鼻樑挺直纖細,鼻尖小巧精緻。她的嘴唇輪廓清晰,上唇相對較薄,下唇略豐滿。她的表情平靜而嚴肅。她的皮膚蒼白,帶有一絲冷色調,保留淡淡的雀斑、真實的肌膚紋理、可見的毛孔、眼下的細微紋理、些微的不對稱、真實的嘴唇質感,以及細緻自然的膚色變化。她將下巴靠在手上,靜靜沉思,凝視著眼前一望無際的北歐雪原。
使用 GPT Image 2 生成,結果如下:

既然我們對草圖感到滿意,就可以接著生成最終畫面了。我們可以使用像 Nano Banana Pro 這樣的圖像模型,傳入角色參考圖像與構圖草圖,讓模型清楚了解我們想要的構圖角色應該呈現什麼樣貌。
我們的提示詞首先指示模型將提供的草圖作為構圖參考,並要求角色與我們的角色參考圖像做到 100% 精確匹配,再將草圖轉換成真人實拍照片。以下是完整的提示詞:
僅使用提供的草圖作為構圖參考。僅使用提供的側臉參考作為臉部與髮型參考。僅使用提供的全身參考作為服裝參考。
創作一張賽拉娜(Serana)的真人特寫照片。角色動作、整體構圖與馬車內部結構須與提供的草圖 100% 完全一致。角色身分、側臉輪廓、五官、膚色、琥珀金色眼睛與髮型須與提供的側臉參考 100% 一致。服裝設計、色彩與整體角色造型須與提供的全身參考 100% 一致。
將圖像轉換為真人實拍照片。場景設定在一輛豪華馬車內部。馬車內部整體非常昏暗,僅有微弱的環境光。唯一明確的光源來自窗外。馬車車窗是完全敞開、沒有玻璃的窗口。厚重的窗簾framed了窗戶。馬車內部包含雕花木製裝飾結構與軟墊座椅靠背。窗台上覆著一層薄雪,並有少量雪花輕輕飄入車廂內。
窗外是一片北歐雪原。外部瀰漫著濃密的晨霧。白霧非常濃厚,只能隱約看見覆雪的開闊平原、低矮雪丘,以及極遠處若隱若現的山影輪廓。少量柔和的晨光穿透霧氣,落在賽拉娜的臉龐與髮絲邊緣。明亮區域帶有柔和的光暈效果,特別是在外部霧氣的高光處、窗光沿線,以及她臉上的晨光處。
對焦集中在賽拉娜的臉部。她的眼睛、睫毛、肌膚質感與臉部輪廓是畫面中最清晰的部分,但仍帶有些微真實相機拍攝的自然柔和感與輕微對焦不完美,而非完全精準銳利的效果。外部景象極度失焦,僅呈現非常柔和模糊的層次。馬車內部其餘部分也呈現柔和失焦狀態,同時保留基本結構可辨識度。
保留真實的肌膚質感、可見毛孔、細微雀斑、真實髮絲質感、真實布料質感、真實木質紋理、細微的膠片顆粒感、輕微感光元件雜訊、輕微鏡頭柔化、極細微的色差,以及自然而不完美的真實相機成像效果。
使用 Nano Banana Pro 生成,以下是我們的成果:


在生成最終畫面之前先從構圖草圖開始,只需要多一次圖像生成,卻能對最終鏡頭的構圖提供更出色的創意掌控力。接著,以構圖草圖與角色圖像作為參考再進行第二次生成,就能讓最終鏡頭完美遵循我們想要的構圖,同時完美維持角色一致性。
從角色靜態圖走向影片

到目前為止,這份指南已經帶給你創作出精準且角色一致性極高的鏡頭靜態圖所需的理解。下一步則是以這些鏡頭生成影片,同時避免角色跑掉。這是 AI 電影製作中一項獨特的挑戰,因為你的角色不僅要在單張圖像生成中保持一致,還必須在生成影片的每一幀之間保持一致。此外,每一個新鏡頭都可能讓角色出現偏差。我們的電影創作者發現,從圖像轉為影片時,最常出問題的通常是以下幾個面向:
- 逐幀漂移。尤其是當你將角色animate進入新的姿勢時,角色漂移就會發生。舉例來說,當角色的頭部轉離攝影機又轉回來時,角色的臉部可能會在鏡頭中途變形。
- 側面與背面視角。大多數參考系統都是以正面臉孔訓練而成。當你的角色轉為四分之三側面或完全側面時,這個參考就可能失效。這正是為什麼使用展示角色多個角度(正面、側面、背面、四分之三側面)的旋轉視角圖(turnaround sheet)至關重要。
- 輸出與道具漂移。Image-to-video 模型在生成影片的過程中,往往最專注於維持角色的臉部。因此,服裝與配件在生成過程中受到的關注較少。這正是為什麼在你的參考靜態畫面中鎖定角色的穿著,並在提供給 image to video 模型的提示詞中強化這一點,是非常關鍵的。
- 長度限制與鏡頭串接。大多數image to video模型將單一片段限制在 5-15 秒。這意味著若要生成較長的長篇鏡頭,就必須先生成一個片段,使用 Flick 的 Extract Frame 工具擷取其最後一幀,再將該幀作為下一個片段的起始幀。每一次串接進入新的 image-to-video 生成,都是角色可能發生漂移的新機會。
你在影片生成中實際會用到的參考模式
- Reference-to-video——透過 Flick 與 Kling Omni Reference 及 Seedance Reference to Video 等強大模型的先進整合,提供一張或多張你角色的圖像。
- Start/end frame(起始/結束幀)——在你的 image-to-video 生成中提供第一幀(也可選擇提供最後一幀)。使用具有角色精確渲染與你所需構圖的起始幀與結束幀,並延續我們上方介紹的構圖草稿方法,會帶來最佳效果。
- Character LoRA——若要在整部影片中將漂移降到最低,可使用大量(50 張以上)角色參考圖來訓練一個 LoRA。我們發現像 Wan 2.2 這樣的模型最適合這個用途。在生成時套用這個 LoRA,能讓你在維持角色一致性的同時,產出優質的影片結果。
具備角色一致性的 Flick 影片工作流程
這正是圍繞 Flick 原生 Character Reference 功能所建構的 Character Reference 工作流程發揮價值之處。因為你已經在一張靜態鏡頭中鎖定了角色,並建立了旋轉視角圖,你正在為影片模型提供最佳的參考脈絡,讓它了解你希望角色在最終生成結果中呈現的樣貌。以下是我們內部電影創作者發現最有效的兩種方法:
使用 Omni Reference 達成角色一致性

使用這個方法時,你會先從你想要的場景圖像開始。舉例來說,讓我們生成一個雪山環境,採用我們想要的乾淨藍色調,並具體指定構圖、色彩配置,以及追求更高精準度的攝影機角度。以下是我們的提示詞:
電影感廣角照片,呈現一片廣闊的雪覆高山山坡,畫面中一道平滑純淨的雪坡呈對角線橫貫整個畫面,大量留白空間,未經踐踏的粉雪,雪面上帶有風蝕形成的細膩紋理,遠方岩石稜線從冰川中浮現,極簡主義的風景構圖,柔和的冬日陽光,淡藍色的氛圍色調,寒冷的高山空氣,寧靜的荒野,畫面中無人、無樹木、無建築物。
從高海拔的觀景點拍攝,強調規模感與空曠感。雪與陰影構成乾淨的幾何形狀,柔和的色調過渡,廣闊的冰凍地形延伸至畫面之外。
超寫實攝影,中長焦壓縮效果,國家地理探險攝影風格,高動態範圍,雪面紋理細節清晰,淡淡的大氣朦朧感,自然光線,頂級戶外電影攝影,冰島冰川美學,斯堪地那維亞極簡主義,令人屏息的孤寂與寧靜感。
構圖:強烈的對角線引導線,不對稱構圖,80%的畫面為雪與天空色調,極致的留白空間,極簡主義美術風景攝影。
色調:冰藍色、冰川白、柔灰岩石色、低調冬季色調。
相機:Sony A1,135mm 鏡頭,光圈 f/8,ISO 100,偏光鏡,電影感調色。
使用 Nano Banana Pro 生成,這是我們的結果:


從這一步開始,我們可以使用 Flick 旗艦級的 Omni Reference 模型之一,將角色動畫化融入場景中。Kling 和 Seedance 都能提供出色的成果與精準的角色控制。若要使用 Omni Reference,我們可以將滑鼠移到已生成的場景圖片上,選擇影片,然後選擇 Seedance 2.0。

使用 Seedance 2.0 維持角色一致性

接下來,我們可以提供場景圖片與角色參考圖片作為輸入。由於我們計畫將角色的全身動畫化,讓角色走過場景,因此最好提供角色的全身參考圖片。若要加入對白,我們可以選擇性地附加音訊作為參考,並指示模型讓角色說出該對白。
在這個範例中,讓我們生成一段影片,內容是角色走過場景並說出對白「啊!能在這裡呼吸新鮮空氣真好。」我們也可以指定手持攝影機風格,以產生我們想要的確切影片效果。
Flick 最先進的提及(mentions)系統讓你可以在提示詞中參考特定的輸入內容,讓你能夠精確指示模型該如何在最終生成中運用每一項輸入。舉例來說,我們可以告訴模型將第一張圖片作為起始畫面,然後使用三張角色參考圖來打造角色的外觀。我們指定角色的動作,接著指示模型讓角色說出我們附上的對白。以下是我們的最終提示詞:
將 @Image1 作為起始畫面。角色 Serana 的外觀請參考 @Image2 、@Image3 和 @Image4 。採用手持攝影機風格,Serana 從畫面左下角走入,邊走邊伸展身體,並說出 @Audio1 的內容。


這段提示詞簡短又簡單——這正是重點所在。我們希望模型依賴的大部分資訊,其實是我們的參考圖片。我們可以善用 Seedance 2.0 的能力搭配 Flick 的提及系統,精確指定生成方式,產出精準的最終影片,同時完美維持角色一致性。以下是我們的最終成果:
使用 Kling O3 Pro Omni Reference 維持角色一致性

使用 Kling O3 Pro 實現角色一致性影片,與使用 Seedance 2.0 的步驟大致相同。首先,準備一張場景圖片以及你的角色參考圖片。接著,將滑鼠移到場景參考圖片上,即可使用 Omni Reference。Flick 的 mention 系統同樣支援 Kling Omni Reference,讓你最多可提供 12 張圖片參考,供模型在最終生成時參考。
要在角色參考中使用 Kling O3 Pro Omni Reference,請選取模型選擇器並傳入你想要的起始畫面。在這個範例中,我們將使用場景參考圖片。接著,你可以使用 Flick 的 mention 系統來建立一個 Element。Element 讓你能在單一 mention 中儲存多張參考圖片。當我們將場景圖片設為起始畫面後,即可建立一個 Element 來代表我們的角色。預設情況下,這個 element 會被命名為「Element1」。我們可以將三張全身角色參考圖片附加到這個 element,並在提示詞中引用它。
在提示詞中,我們指示模型從「Element1」參考角色的外觀,並指定手持攝影機風格。我們定義她的動作——她「張開雙臂走進場景,彷彿感受著風的吹拂」,最後告訴模型不要生成背景音樂。以下是我們最終的提示詞:
從 @Element1 參考 Serana 的外觀。手持攝影機風格。Serana 張開雙臂走進場景,彷彿感受著風的吹拂。沒有背景音樂。
同樣地,我們可以讓提示詞保持簡單,因為我們提供給模型的大部分資訊,是透過代表鏡頭場景的起始畫面,以及透過三張參考圖片代表角色的 Element。在輸入場景圖片作為起始畫面、定義代表角色的 Element1,並寫好提示詞後,我們就可以開始生成了:



以下是結果。它完美掌握了角色一致性,完全保留了我們在起始畫面中指定的場景,並精準遵循了我們手持攝影機風格的指示:
在 Flick 中以更高精準度實現角色一致性影片:換臉法
對於這個方法,我們的內部電影製作團隊建議進行兩次獨立的影片生成,而不是將場景、角色設計與提示詞一次生成完成。
在我們生成的第一段影片中,我們不加入任何角色參考。相反地,我們提供想要拍攝場景所在地的圖片,然後使用提示詞詳細描述我們想要呈現的動作。生成這段影片後,我們使用 Flick 的擷取畫面工具提取最後一格畫面。接著,我們將這張圖片傳入 Nano Banana Pro,並以我們的角色參考圖片作為參考重新生成。這樣就會產生一張帶有我們指定角色的最終畫面。
在我們生成的第二段影片中,我們將新生成的、帶有角色的結尾畫面與最初生成的影片一起傳入 Kling O3。這會產生一段最終影片,精準複製最初生成影片的內容,但角色換成了我們指定的角色。第一次生成讓我們能精確掌控場景以及其中發生的動作,而第二次生成則讓我們能替換成我們的角色,從而維持角色一致性。
以下是操作方式:
對於這個方法,我們從單一張角色參考圖片開始,將其製作成一張旋轉參考表,並排展示角色的三個全身視角。以下是我們使用的提示詞:
使用提供的圖片作為精確的角色參考。以手作定格動畫木偶風格,帶有細膩的黏土與戲服人偶質感,創作同一位中國歷史男性角色的角色設計三視圖。並排展示三個全身視角:正面視圖、純側面視圖,以及 3/4 側面視圖。完全保留參考圖片中的服裝設計,包括高聳的黑色帽子、淺灰色外袍、白色內袍、袍子長度、袖型、領口結構、腰帶、垂掛飾品、黑色靴子、長桿武器,以及圓柱形容器。保持服裝輪廓、層次、比例、剪裁、配件位置與整體服裝結構不變。不要重新設計或簡化服裝。唯一的轉換是視覺媒介:手工木偶角色、定格電影美學、略帶質感的布料、略微雕琢的臉部、細膩的黏土質感表面處理、手工戲服細節、寫實的微縮衣裝構造、工作室三視圖呈現。中性素色背景、柔和均勻的光線、全身可見、乾淨的排版、高辨識度的服裝設計圖、精緻的製作角色板、中國民俗奇幻定格動畫美學,細節豐富但克制,較少光澤、較少數位感、觸感真實的手作質地。
這是結果:

我們同時也為場景生成理想設定的圖片。這可以透過兩種方式完成。首先,我們可以在文字轉圖片模型(如 Nano Banana Pro 或 GPT Image 2)中輸入清楚明確的提示詞,來生成我們想要的場景示意圖。
為了追求更高的精準度,我們可以運用第二種方法。與其使用文字轉圖片模型生成,我們可以在像 Microsoft Paint 這樣的工具中手繪出理想的場景分鏡。接著,我們可以讓 Nano Banana Pro 參考我們的草圖來進行最終生成。以這個例子來說,我們來畫一個結冰湖面上的雪覆碼頭,前景飄著一面褪色的紅旗。這是我們的草圖:

接著,我們可以將草圖傳入 Nano Banana Pro,並搭配一段描述性提示詞,詳細說明我們想要呈現的寫實細節,並以草圖作為參考。這是我們的提示詞:
將這張手繪分鏡草圖作為嚴格的版面與構圖參考。100% 保留目前的構圖、鏡頭角度、取景、主體位置與大形設計。中國民俗定格動畫木偶微縮場景,一根光禿的湖畔樹枝斜插在雪地中,綁著一塊褪色的暗紅色布,後方是一座覆雪的小木碼頭,右側岸邊叢生著被雪壓彎的冬季蘆葦與香蒲,觸感真實的手作雪景、手工搭建的碼頭、自然的樹枝質感、帶有細微織紋的布料、冷調藍灰色冬季色調、霧面手工質感、詩意而克制的氛圍。湖面呈現為工作室微縮冰面,柔和的不透明藍灰色冰層,帶有細微的石膏塑形般凹凸不平、霧面樹脂般的質感、淺薄的霜層、隱約的乳白斑塊、細緻的凍結紋理、輕微的手工表面變化,反光極少。
這是我們的結果:

文字轉影片仰賴在提示詞中描述角色,相較之下,Flick 提供了更好的做法。使用你生成的分鏡靜態畫面──每一張都有你想要的精確構圖與角色設計──作為圖片轉影片模型的參考。這能夠固定第一幀畫面,並讓模型在後續影片中維持角色的一致性。
接下來,我們可以使用 Kling O3 Pro 或其他圖片轉影片模型來生成第一段影片。我們可以將場景圖片作為起始幀,並指定角色的動作。由於這裡並未提供角色圖片作為參考,我們可以讓角色描述保持簡短。以這個例子來說,我只需要求一個「定格動畫木偶漁夫」。我們指定他的動作:走過雪地來到碼頭上,並在碼頭盡頭停下。我們設定想要的角色動作,並指示模型讓降雪逐漸增強,吹過整個畫面。這是我們最終的提示詞:
一個身穿草製雨披、頭戴竹笠的定格動畫木偶漁夫,走過雪地來到碼頭上,因寒冷而微微弓著身子,一隻手撐著平衡,另一隻手緊緊裹住外衣。手工微縮攝影機緩緩向前推進,並略微向上傾斜。降雪逐漸增強,變成一場濃密的冬季暴風雪,雪花吹過畫面,逐漸遮蔽結冰的湖面。到了最後,漁夫走到碼頭的盡頭,停下腳步,面向冰面靜靜站立片刻。
以我們的場景圖片作為參考,這產生了精確而優美的結果:
這就是面部替換法的優勢所在。當我們對第一次生成的影片感到滿意後,可以使用 Flick 的擷取畫格工具,擷取這段影片的最後一格。搭配我們稍早生成的角色轉身參考圖,就能將這兩張圖片一起傳入 Nano Banana Pro,並指示模型將最後一格中的角色替換成我們的角色參考,同時保留初始生成的燈光、構圖、攝影機角度與場景設定。以下是我們的提示詞:
以這張雪地碼頭場景作為主要構圖參考,並使用提供的定格動畫木偶角色設計圖作為角色參考。將站在碼頭盡頭的漁夫替換成這個確切的角色。請符合角色設計圖中的背影輪廓、帽子形狀、長袍長度、淺灰色外袍、白色內袍、黑色靴子、腰帶、垂掛飾品、長桿狀物件、圓柱形容器,以及整體身體比例。讓角色維持背對鏡頭、站在碼頭盡頭的姿勢,與目前圖片相同的背向站位方式。保留現有的攝影機角度、構圖、碼頭、結冰的湖面、前景中掛著褪色紅布的樹枝、覆雪的岸邊,以及被雪壓彎的蘆葦。維持中國民俗定格動畫木偶的微縮風格、手工材質質感、觸感十足的積雪、霧面冰層、細膩的木偶比例,以及靜謐的冬日氛圍。新角色應自然融入相同的微縮場景中,維持相同的比例、相同的背向姿勢邏輯,以及相同的內斂電影感氛圍。
結合我們的兩項輸入——角色轉身參考圖與擷取出的最後一格——我們使用 Nano Banana Pro 生成新的最後一格畫面:


以下是我們的結果:

這個方法之所以如此強大,是因為我們可以精準掌控場景構圖的呈現方式。與其一次性指示模型根據場景圖、角色參考與提示詞生成最終影片,我們將這個過程拆分成兩個階段。第一階段,我們先建立場景,暫時不太在意角色本身。接著,我們生成一個包含理想角色的新最後一格畫面,並進行第二階段生成最終影片。
使用我們稍早建立的場景圖作為起始畫格,以及包含角色參考的全新精修結尾畫格,我們生成最終輸出結果。除了嵌入結尾畫格中的角色參考外,我們還使用提示詞提醒模型關於角色的描述、動作、場景設定,以及我們想要的攝影機運動與背景音效。以下是我們的提示詞:
一位中國定格動畫木偶風格的士大夫官員,頭戴高聳的黑帽,身穿淺灰色外袍搭配白色內袍,腳踩黑色靴子,腰間掛著箭袋與橫刀,以克制而沉穩的步伐緩緩走過雪地,踏上碼頭。手工微縮攝影機緩緩向前推進,並略微向上仰起。細雪輕輕飄過畫面。結冰的湖面依舊靜止安寧。最後,士大夫官員走到碼頭盡頭,停下腳步,靜靜面向冰面站立。氛圍極為靜謐,只聽見雪地與木板上輕柔的腳步聲。
以下是我們的最終結果:
這個方法更為進階,能讓你對場景構圖擁有極為精準的掌控,同時維持角色的精確一致性。雖然這需要你使用 Kling 或其他模型分別執行兩次影片生成,成本較高,但這能為你省下原本可能浪費在不精準、不滿意的單次影片生成上的點數。
常見問題
什麼是最適合維持角色一致性的 AI 工具?
沒有所謂最好的單一工具——只有最好的方法。對大多數人來說,img2img 角色參考工作流程(如 Flick 提供的功能)是無需任何訓練、就能維持角色一致性最快速、最可靠的方式。若是需要大量生產且幾乎零偏差的情況,在 ComfyUI 中自訓練的 LoRA 則是黃金標準。
img2img 角色一致性是什麼意思?
圖生圖(img2img)角色一致性指的是在新的場景中、加入新細節、或以全新角度生成主角的新圖像,同時維持你所定義角色完全一致的視覺形象。
如何在 Flick 中實現角色一致性?
你只需提供角色的參考圖片。透過 Character Reference 工具,AI 會生成保留主角視覺特徵的新圖像。你不必用文字描述角色、再祈禱模型能生成相同的結果,而是直接提供參考圖,告訴它:「這個角色,換一個新場景。」
如何在 Midjourney 中製作一致的角色?
使用 Omni Reference(--oref)搭配你角色的參考圖片,並調整 omni-weight(--ow),讓模型在遵循你的場景提示詞的同時,維持角色的一致性。
我能在 AI 影片中保持角色一致嗎?
可以。先在靜態圖片中鎖定角色,再利用影片工具的參考功能為該圖片製作動畫 — 例如 Veo 3 的「Ingredients」、Runway 的 References,或 Kling 的「Elements」。從鎖定的靜態圖片製作動畫,會比文字轉影片獲得更好的一致性。
我需要訓練模型才能獲得一致的角色嗎?
不需要。訓練 LoRA 能提供最緊密的鎖定效果,但對大多數專案來說,一張優質的參考圖片搭配 Character Reference 功能就足夠了。只有在你需要生成數百個鏡頭、且手動修正偏差成本過高時,才需要訓練模型。
為什麼我的 AI 角色一直在變化?
因為每次生成都是從零開始,不會記得上一次的結果,所以微小的差異會逐漸累積成明顯的偏差。解決方法是提供模型一個固定的參考來對照,而不是每次都用文字重新描述角色。
如何開始使用 Flick?
觀看我們的教學影片:Flick 101:入門指南。 建立你的第一個專案,完成新手引導,開啟你的 AI 影片創作之旅!
探索相關教學:
https://flick.art/docs/visual-styles
https://flick.art/docs/voice-consistency
深入了解 The Herder:
https://flick.art/blog/behind-the-herder
為什麼塑造優秀角色如此重要:
https://flick.art/blog/in-the-ai-era-story-is-everything