
2026年に一貫性のあるAIキャラクターを作成する方法:完全ガイド
Jun 2026
画像から画像へのキャラクターの一貫性とは、同じキャラクターの新しい画像を、新しいシーンや新しいアングルで生成しながらも、その正確なビジュアルアイデンティティを維持することを意味します。毎回言葉でキャラクターを説明し直す代わりに、モデルにリファレンス画像を与えることで、すべてのショットで顔、髪型、衣装を一致させることができます。
キャラクターを作成したのに、設定やカメラアングル、細部が変わる新しいショットのたびに崩れていくのを見たことがあるなら、それはキャラクタードリフトを経験したということです。これはAI映画制作における最も根深い課題の一つです。このガイドでは、キャラクタードリフトがなぜ起こるのかを正確に解説し、Flick、Midjourney、Veo 3、Sora、ComfyUIでキャラクターの一貫性を保つための具体的な方法を紹介します。
2026年に一貫性のあるAIキャラクターを作成する方法ひと目でわかる
手早く概要を知りたい方のために、こちらが簡潔な答えです:
AIで一貫性のあるキャラクターを作成する最も確実な方法は、まずキャラクターのアイデンティティを1枚のリファレンス画像に固定し、そのリファレンスを新しいショットごとに使い回すことです。この方法は、ゼロからプロンプトを作り直すよりも一貫性があり、精密で信頼性が高いため、2026年にはデフォルトのワークフローとなりました。
Flickでは、これがCharacter Referenceツールであり、わずか3つのステップで完了します:
- キャラクターの画像を生成またはアップロードします — 明るく整った、正面を向いたポートレートが最良の結果を生みます
- その画像を選択し、Character Referenceをクリックします
- 新しいシーンを自由にプロンプトしてください(例:「夜のネオンに輝く市場を歩く、シネマティック」)。その間、リファレンスがキャラクターを安定させます。
これはほぼすべてのクリエイターにとって最も効果の高いテクニックです。トレーニングもコードもGPUも必要とせず、必要なのは質の良いリファレンス画像1枚だけです。チュートリアルをご覧ください:Nano Banana Pro Tutorial for Character Consistency
今すぐ始めよう。あなたのキャラクターを作ろう。
キャラクタードリフトが起こる理由
キャラクターのブレを解消するには、まずその原因を理解することが役立ちます。画像を生成する際、モデルはランダムなノイズ(静的パターン)から始まります。プロンプトに導かれながら、そのノイズを一段階ずつ取り除いていき、最終的に明瞭な画像が現れます。このプロセスは拡散(ディフュージョン)と呼ばれています。
プロンプトでキャラクターを描写するとき、実際には特定の人物をモデルに指定しているわけではありません。「30代のひげを生やした男性」という表現は、モデルが学習時に見た何百万もの画像に一致します。あなたのプロンプトは、それら無数の可能性の空間のどこかに着地します。出力結果は、その空間全体から導き出された一般化された結果であり、あなたの描写に当てはまる多くの異なる顔の平均のようなものです。
そのため、同じキャラクターを描写するために全く同じプロンプトを再利用しても、モデルは毎回新しいランダムなノイズから始まり、最終的にはその空間内の少し異なる地点に落ち着きます。プロンプトが変わらなくても、出力結果は毎回わずかに異なるものになるのはこのためです。新しいアングルや新しいキャラクター、異なる背景を加えるといった、プロンプトへのわずかな変更は、この効果をさらに増幅させます。カットを重ねるごとにこうしたズレが積み重なり、やがて最初のキャラクターは別人へと変化してしまいます。
これを解決するのが、Flickの Character Reference 機能です。プロンプトにキャラクターを記述する代わりに、Character Reference ツールは主人公をリファレンス画像として保存します。これにより、シーンのさまざまな要素を変更しても、新しく生成するたびに元のキャラクターが再現されます。
定義したキャラクターは、モデルが学習時に見てきた多数の画像を一般化したものを表しています。すべての画像生成は新規に行われ、ランダムなノイズから始まります。モデルはそのノイズを一段階ずつ取り除き(拡散)、記述したプロンプトに一致する画像が現れるまで処理を続けます。定義したキャラクターは、モデルが学習時に見てきた多数の画像を一般化したものを表しています。各生成はランダムなノイズから始まり、この範囲内でわずかに異なる顔を生み出します。その結果、複数回の生成を重ねる中で、特にプロンプトに追加する内容が増えるほど、最初にレンダリングしたキャラクターはまったく別のものへと変化していきます。
Flickで一貫性のあるキャラクターを作成する

The Herderは、単一のキャラクターリファレンスとして固定されています。映画全編をご覧ください。
まず、キャラクターを作成します — The Herder:ヒーローでも魔術師でもなく、その技術が機能した瞬間に見えなくなる、ただの労働者です。彼は「近代ヨーロッパ」(おおよそ1800年代から1900年代初頭)出身の職人です。正面から背面まで(そしてカットごとに)一貫性を保つために、FlickのCharacter Referenceツールを使用します。
まず1枚のリファレンス画像から始めます。この最初の画像をもとに、正面/側面/背面といった複数のターンアラウンドシートを、帽子あり・帽子なし、傘あり、素手、濡れたコート、ギアの切り替えなど、さまざまな状態で作成します。


次に、FlickのCharacter Referenceツールを使ってターンアラウンドシートを組み合わせることで、カットが変わってもキャラクターの正面/側面/背面のシルエットを安定させます。
一貫性のあるAIキャラクターを実現する5つの方法を比較
唯一の「正解」となるツールやモデルは存在しませんが、あなたのスキルレベルと必要なコントロールの度合いに応じた最適な方法はあります。以下は、img2imgによるキャラクターの一貫性を実現する5つの優れたアプローチと、それぞれがどんな人に向いているかをまとめたものです。
| 方法 | 仕組み | 最適な対象 | 手間 | 一貫性 |
|---|---|---|---|---|
| Character Reference(img2img) | 1枚のリファレンス画像をアップロードすると、モデルが新しいシーンでもそのアイデンティティに一致させます | ほぼすべての人 — 一貫したキャラクターを得る最速の方法 | 低い | 高い |
| キャラクター/ターンアラウンドシート | 正面・側面・背面・斜め45度のビューを生成し、複数アングルのリファレンスとして使用します | 画像動画ツールにアングルや動きのための十分なコンテキストを与える場合 | 低~中 | 高い |
| プロンプト | 同じシード値と一言一句同じキャラクター描写を、複数回の生成で使い回します | 1つのルックのクイックなバリエーション | 低い | 中程度 |
| LoRAトレーニング | キャラクターの15~50枚の画像で小規模なカスタムモデルを学習させます | ほぼブレのない数百カットの制作 | 高い | 非常に高い |
| 顔スワップ(最終調整) | 自由に生成した後、すべてのフレームにキャラクターの顔をスワップして適用します | 後からブレを修正する場合 | 中程度 | 高い(顔のみ) |
主要な各ツールでキャラクターの一貫性を保つ方法

Midjourneyは、Omni Reference(—orefパラメータと、リファレンスへの忠実度をコントロールするomni-weightの—ow)によって一貫性を維持します。バランスを取るには中程度のウェイトを使用し(デフォルトは100)、キャラクターの一部を変更したい場合はウェイトを下げましょう。驚くほど美しいスタイルで見事な結果を生み出しますが、そばかすやタトゥーなどの細かいディテールがぼやけてしまうことがあります。
GoogleのVeo 3(およびVeo 3.1)は、「Ingredients to Video」というリファレンスシステムでキャラクターの一貫性を保ちます。リファレンス画像を読み込ませてキャラクターのアイデンティティを固定し、すべてのプロンプトでまったく同じキャラクター描写を使うようにしてください。Veoはネイティブの同期音声とリップシンクにも対応しているため、キャラクターにセリフを話させることもできます。
Soraは、収録されたリファレンスクリップ(当初は「Cameos」、後に「Characters」と呼ばれた)を中心にキャラクターの一貫性を構築し、生成のたびに再利用可能な人物像をネイティブ音声とともに作り出していました。OpenAIは2026年にSoraの提供を終了しましたが、OpenAIのimg2img画像モデルであるGPT Image 2を使えば、Flick内であなたのキャラクターが登場するシーンを生成できます。
徹底的なコントロールを求めるなら、ComfyUIを使えば、PuLIDやInstantID、IP-Adaptorといったツールを、カスタム学習したキャラクターLoRAやポーズ制御、顔ディテール強化ノードと組み合わせられます。最も難易度が高く技術的なアプローチですが、ドリフトゼロで無制限にローカル生成を行いたい場合には最適です。
エンドツーエンドのワークフロー: キャラクターデザインから最終カットまで
画像だけにとどまらず、キャラクターを長編映画に統合するために、2026年に一流のクリエイターたちが実践しているワークフローをご紹介します:
- 主人公をデザインする。 気に入った、力強い1枚のポートレートを生成します。
- リファレンスシートを作成する。ターンアラウンド(正面、側面、背面、3/4)を作成します。異なる衣装、小道具、表情のリファレンスも作成しましょう。
- FlickでCharacter Referenceを設定し、シーン内のすべてのショットを生成します。各プロンプトでキャラクターの状況とアクションを明確に定義することに重点を置いてください。
- 静止画からアニメーション化する。 ロックした各画像を使い、image-to-videoモデルでキャラクターのシーンを作成します。
- 編集とグレーディング。動画編集ツールでシーンを組み合わせ、最終的な作品に仕上げます。
実践的なルール:まず静止画でアイデンティティを固定し、それからアニメーション化すること。
Flickでキャラクターの一貫性をさらに高精度にする方法

私たちの社内映像制作チームは、Flickにおけるimg2imgのキャラクター一貫性で最良の結果を得るために、さまざまな回避策を試行錯誤し、膨大な時間を費やしてきました。その過程で、キャラクターの一貫性を保ちながらより精密なショットを生成するための、高度なコツやテクニックをいくつも発見しました。
強力なキャラクター一貫性ワークフローにおいて最も重要な要素の一つが、プロンプトの書き方です。img2imgのキャラクター一貫性に使える、包括的なプロンプト一覧をご用意しています。以下では、さまざまなワークフローで活用できる、キャラクターの一貫性を保つための最良のプロンプトをご紹介します。
まず1つ目の方法として、単一のキャラクターリファレンスから始め、それを以下のようにターンアラウンドシートへと変換していきましょう:


ここからの目標は、このキャラクターを使って最初のショットを生成することです。今回は、キャラクターが豪華な馬車に乗り、窓の外に広がる北欧の雪原を眺めているショットを作成してみましょう。
ここでのコツは、画像とキャラクターを一度に生成するのではなく(その場合、精度が下がってしまいます)、まずキャラクターの説明をテキストに埋め込んだ、簡易的なステンシルスケッチを生成することです。ここではあまり細かく作り込みすぎないことが重要です。これはあくまで最終フレームの簡易的な下絵にすぎないからです。この画像を生成するプロンプトは、以下のように作成できます。
細部を作り込みすぎない、ラフで軽いアウトラインの鉛筆スケッチを作成してください。目指すのは簡易的な構図の下絵です。舞台は豪華な馬車の内部です。馬車の内部は全体的に薄暗く、わずかな環境光のみが差し込んでいます。唯一のはっきりした光源は窓の外から来ています。馬車の窓はガラスのない全開の開口部です。重厚なカーテンが窓を縁取っています。馬車の内部には彫刻を施した木製の装飾構造とパッド入りのシートバックがあります。窓の縁にはうっすらと雪が積もり、少量の雪が馬車内へ静かに舞い込んでいます。窓の外には北欧の雪原が広がっています。外は濃い朝霧に包まれています。白い霧はとても濃く、雪に覆われた広い平原、低い雪山、そしてはるか遠くの山々の輪郭がかすかに見える程度です。キャラクターは20代前半のヨーロッパ系の若い女性です。顔立ちはやや細めの柔らかい卵型で、滑らかな額、はっきりした頬骨、輪郭のはっきりした顎のライン、そしてわずかに先細った顎を持っています。眉は濃く、はっきりとした形で、ほぼ直線的です。目は切れ長のアーモンドアイで、上まぶたの輪郭がはっきりしており、まっすぐで落ち着いた視線を持っています。虹彩と瞳孔は明るい琥珀金色で、リアルな潤いのある反射があります。鼻筋はまっすぐで細く、鼻先は小さく整っています。唇ははっきりとした形で、上唇はやや薄く、下唇はやや厚みがあります。表情は落ち着いていて真剣です。肌は色白でわずかに青みがかったトーンを持ち、うっすらとしたそばかす、リアルな肌質感、目立つ毛穴、目元の細かなディテール、わずかな左右非対称、リアルな唇の質感、そして自然な肌の色ムラが残されています。彼女は手に顎を乗せ、静かに物思いにふけりながら、雪に覆われた広大な北欧の平原を見つめています。
GPT Image 2で生成すると、結果は次のようになりました。

スケッチには満足できたので、次はいよいよ最終ショットの生成に進みます。Nano Banana Proのような画像モデルを使い、キャラクターのリファレンス画像と構図スケッチを一緒に渡すことで、モデルに完成させたいキャラクターの見た目を正確に伝えることができます。
まずプロンプトでは、提供したスケッチを構図のリファレンスとして使用し、キャラクターのリファレンス画像に100%忠実に一致させたうえで、そのスケッチを実写風の写真へと変換するようモデルに指示します。プロンプトの全文は以下の通りです。
提供されたスケッチを構図の唯一のリファレンスとして使用してください。提供された横顔リファレンスを顔と髪の唯一のリファレンスとして使用してください。提供された全身リファレンスを衣装の唯一のリファレンスとして使用してください。
セラーナの実写クローズアップ写真を作成してください。キャラクターの動作、全体の構図、そして馬車内部の構造は、提供されたスケッチと100%完全に一致させてください。キャラクターのアイデンティティ、横顔の輪郭、顔立ち、肌の色、琥珀金色の瞳、そしてヘアスタイルは、提供された横顔リファレンスと100%一致させてください。衣装のデザイン、色合い、そしてキャラクター全体のスタイリングは、提供された全身リファレンスと100%一致させてください。
画像を実写写真に変換してください。舞台は豪華な馬車の内部です。馬車内部は全体的にとても薄暗く、微かな環境光のみが差し込んでいます。唯一の明確な光源は窓の外から来ています。馬車の窓はガラスのない、完全に開いた窓の開口部です。窓には重厚なカーテンが掛かっています。馬車内部には彫刻の施された木製の装飾構造と、詰め物の入った座席の背もたれがあります。窓枠には薄い雪が積もっており、少量の雪が馬車内へと静かに舞い込んでいます。
窓の外は北欧の雪原が広がっています。外は濃い朝霧で満たされています。白い霧は非常に濃く、雪に覆われた広大な平原、なだらかな雪の丘、そして遠くに霞む山影の輪郭がかすかに見えるのみです。わずかな柔らかい朝の光が霧を通り抜け、セラーナの顔と髪の端にそっと差し込んでいます。明るい部分には柔らかなブルームがかかっており、特に外の霧のハイライト、窓からの光、そして彼女の顔にかかる朝の光にその効果が表れています。
ピントはセラーナの顔に合っています。彼女の瞳、まつ毛、肌の質感、そして顔の輪郭がフレーム内で最も鮮明な部分ですが、それでも完璧に精密なシャープさではなく、実際のカメラらしい自然な柔らかさとわずかなピントのずれを帯びています。外の景色は極端にピントが外れており、非常に柔らかくぼやけた層としてのみ認識できます。馬車内部の残りの部分も基本構造が読み取れる程度に柔らかくぼかされています。
リアルな肌の質感、見える毛穴、微かなそばかす、リアルな髪の質感、リアルな生地の質感、リアルな木材の質感、微かなフィルムグレイン、わずかなセンサーノイズ、軽度のレンズの柔らかさ、ごくわずかな色収差、そして実際のカメラらしい自然で不完全なレンダリングを保持してください。
Nano Banana Proで生成すると、以下のような結果が得られました。


最終フレームを生成する前に構図スケッチから始めることは、画像生成をもう一回追加するだけで済みますが、最終的なショットの構図に対してより優れたクリエイティブなコントロールをもたらします。そして、この構図スケッチとキャラクター画像をリファレンスとして2回目の生成を行うことで、最終ショットは望みどおりの構図に従いながら、キャラクターの一貫性も完璧に保たれます。
キャラクタースチルからビデオへ

これまでのところ、このガイドはキャラクターの一貫性を保ちながら極めて精密なショットのスチルを作成するために必要な理解を提供してきました。次のステップは、キャラクターのブレを避けながら、これらのショットから動画を生成することです。これはAI映像制作において特有の課題です。なぜなら、キャラクターは一度の画像生成内だけでなく、生成された動画のフレームからフレームへと一貫性を保つ必要があるからです。さらに、新しいショットが生まれるたびに、キャラクターがブレる可能性が生じます。私たちの映像作家たちは、画像から動画へ移行する際、以下の要素が最も崩れやすいことを発見しました。
- フレーム間のドリフト。特にキャラクターを新しいポーズにアニメーションさせる際、キャラクタードリフトが発生します。例えば、頭がカメラから離れて再び戻ってくる動きの途中で、キャラクターの顔が変形してしまうことがあります。
- プロフィールとバックビュー。ほとんどのリファレンスシステムは正面を向いた顔で学習されています。キャラクターが斜め45度や真横を向くと、このリファレンスが破綻することがあります。だからこそ、キャラクターの複数アングル(正面、側面、背面、3/4)を示すターンアラウンドシートを使用することが不可欠なのです。
- 出力と小物のドリフト。画像から動画へのモデルは、生成された動画全体を通してキャラクターの顔を維持することに最も注力する傾向があります。その結果、服装やアクセサリーには生成中の注意が少なくなります。だからこそ、リファレンス静止画でワードローブを固定し、画像から動画へのモデルに与えるプロンプトでそれを補強することが重要です。
- 長さの制限とショットのチェイニング。ほとんどの画像から動画のモデルは、1つのクリップを5〜15秒に制限しています。つまり、より長いショットを生成するには、クリップを生成し、Flickの Extract Frame ツールを使ってその最後のフレームを抽出し、そのフレームを次のクリップの開始フレームとして与える必要があります。新しい画像から動画への生成にチェインするたびに、キャラクターがドリフトする新たなリスクが生じます。
動画生成で実際に使うことになるリファレンスモード
- リファレンス・トゥ・ビデオ — Kling Omni Reference や Seedance Reference to Video といった強力なモデルとの Flick の最先端の統合により、キャラクターの画像を1枚以上提供します。
- 開始/終了フレーム — 画像から動画への生成において、最初のフレーム(オプションで最後のフレームも)を提供します。上記で説明した構図スケッチ手法を活用し、キャラクターと希望の構図を精密にレンダリングした開始フレームと終了フレームを使うことで、最良の結果が得られます。
- キャラクターLoRA — 映画全体にわたるドリフトを最小限に抑えるために、豊富な数(50枚以上)のキャラクターリファレンスでLoRAを学習させます。Wan 2.2 のようなモデルが、これに最も適していることがわかっています。生成時にこのLoRAを適用することで、キャラクターの一貫性を保ちながら優れた動画結果を生み出すことができます。
キャラクターの一貫性を保つFlickの動画ワークフロー
ここで、FlickのネイティブなCharacter Reference機能を中心に構築されたCharacter Referenceワークフローが効果を発揮します。すでにショット静止画でキャラクターを固定し、ターンアラウンドシートを作成しているため、最終生成でキャラクターがどのように見えるべきかについて、動画モデルに最良のコンテキストを与えることができます。以下は、社内のフィルムメーカーたちが見つけた最良の2つの方法です。
Omni Referenceを使ってキャラクターの一貫性を実現する

この方法では、まず希望する設定の画像から始めます。例えば、構図、カラーパレット、より高い精度のためのカメラアングルを指定して、希望するクリーンなブルートーンの雪山の環境を生成してみましょう。以下が私たちのプロンプトです:
雄大な雪に覆われたアルプスの山肌を捉えた、シネマティックなワイドアングル写真。フレームを斜めに横切る滑らかで手つかずの雪の斜面、圧倒的な余白、踏み荒らされていないパウダースノー、風が削り出した繊細な雪の模様、氷河から姿を現す遠くの岩稜、ミニマルな風景構図、柔らかな冬の陽光、淡いブルーの色調グレーディング、冷たい山の空気、静謐な大自然、人物なし、木々なし、建造物なし。
高地の展望地点から撮影し、スケール感と空虚さを強調。雪と影が生み出すクリーンな幾何学的形状、なめらかなトーンの移り変わり、フレームの外まで広がる広大な凍った大地。
超写実的な写真表現、中望遠の圧縮効果、ナショナルジオグラフィックの探検写真、ハイダイナミックレンジ、雪の質感の鮮明なディテール、微かな大気のかすみ、自然光、プレミアムなアウトドア映像美、アイスランドの氷河を思わせる美学、北欧的ミニマリズム、息をのむような孤独と静寂。
構図:力強い斜めのリーディングライン、非対称なフレーミング、雪と空のトーンが80%を占める、極端な余白、ミニマルなファインアート風景写真。
カラーパレット:アイスブルー、氷河のホワイト、柔らかなグレーの岩、抑えた冬の色調。
カメラ:Sony A1、135mmレンズ、f/8、ISO 100、偏光フィルター、シネマティックなカラーグレード。
Nano Banana Proで生成した結果がこちらです。


ここから、Flickのフラッグシップとなる2つのOmni Referenceモデルのいずれかを使って、キャラクターをシーンの中でアニメーション化できます。KlingとSeedanceはどちらも優れた結果と正確なキャラクターコントロールを提供します。Omni Referenceを利用するには、生成した設定画像にカーソルを合わせ、動画を選択し、Seedance 2.0を選びます。

Seedance 2.0によるキャラクターの一貫性

ここから、設定画像とキャラクターのリファレンス画像を入力として提供できます。キャラクターの全身がシーンの中を歩く様子をアニメーション化する予定なので、キャラクターの全身が写ったリファレンス画像を用意するのが最適です。セリフを追加するには、任意で音声をリファレンスとして添付し、そのセリフをキャラクターに話させるようモデルに指示できます。
この例では、キャラクターがシーンの中を歩きながら「ああ、ここで息をするのはなんて気持ちがいいんだろう」というセリフを話す動画を生成してみましょう。求めている動画結果を正確に得るために、ハンドヘルドカメラのスタイルを指定することもできます。
Flickの最先端のメンション機能を使えば、プロンプト内で特定の入力を参照できるため、最終的な生成において各入力をどのように使うかをモデルに正確に指示できます。例えば、最初の画像をスタートフレームとして使用し、3枚のキャラクターリファレンス画像を使ってキャラクターの外見を作成するようモデルに伝えることができます。キャラクターの動きを指定し、添付したセリフをキャラクターに話させるようモデルに指示します。以下が最終的なプロンプトです:
@Image1 をスタートフレームとして使用してください。Seranaの外見は @Image2 、@Image3 、@Image4 を参照してください。ハンドヘルドカメラスタイルで、Seranaが画面左下からフレームに入り、歩きながら伸びをして、@Audio1 を話します。


このプロンプトは短くシンプルです——それがポイントです。モデルに頼ってほしい情報のほとんどは、リファレンス画像に含まれています。Seedance 2.0とFlickのメンション機能の力を活用することで、正確な指示ができ、キャラクターの一貫性を完璧に保ちながら、精密な最終動画を生成できます。以下が最終結果です:
Kling O3 Pro Omni Referenceによるキャラクターの一貫性

キャラクターの一貫性を保った映像をKling O3 Proで実現する手順は、Seedance 2.0で行う場合と多くの点で同じです。まずシーンの画像とキャラクターのリファレンス画像を用意しましょう。ここから、シーンのリファレンス画像にマウスを重ねることでOmni Referenceにアクセスできます。FlickのメンションシステムはKling Omni Referenceにも対応しており、モデルが最終生成時に参照できる画像を最大12枚まで指定できます。
Kling O3 Pro Omni Referenceをキャラクターリファレンスと組み合わせて使用するには、モデルセレクターを選択し、希望するスタートフレームを渡します。この例では、シーンのリファレンス画像を使用します。次に、Flickのメンションシステムを使ってElementを作成できます。Elementを使うと、複数のリファレンス画像を1つのメンションにまとめて保存できます。シーンの画像をスタートフレームとして渡したら、キャラクターを表すElementを作成します。デフォルトでは、このElementは「Element1」という名前になります。この1つのElementに、キャラクターの全身リファレンス画像を3枚まとめて添付し、プロンプト内で参照できます。
プロンプトでは、モデルに「Element1」からキャラクターの見た目を参照するよう指示し、ハンドヘルドカメラのスタイルを指定します。彼女の動きについては「風を感じているかのように両手を広げてシーンに入ってくる」と定義し、最後にBGMを生成しないようモデルに伝えます。最終的なプロンプトは以下の通りです。
@Element1 からSeranaの見た目を参照してください。ハンドヘルドカメラのスタイルで。Seranaは風を感じているかのように両手を広げてシーンに入ってきます。BGMなし。
ここでもプロンプトはシンプルに保てます。というのも、モデルに渡す情報の大部分は、ショットのシーンを表すスタートフレームと、提供した3枚のリファレンス画像を通じてキャラクターを表すElementによって伝えられるためです。シーンの画像をスタートフレームとして入力し、キャラクターを表すElement1を定義し、プロンプトを書き終えたら、いよいよ生成の準備が整います。



こちらが結果です。キャラクターの一貫性を完璧に保ちながら、スタートフレームで指定したシーンをそのまま維持し、ハンドヘルドカメラのスタイル指示にも忠実に従っています。
Flickでさらに高い精度でキャラクター一貫性のある映像を実現する:フェイススワップ手法
シーン、キャラクターデザイン、プロンプトを1回の生成でまとめて仕上げるのではなく、この手法ではFlick社内の映像クリエイターは2回に分けて映像を生成することを推奨しています。
最初に生成する映像では、キャラクターへの参照を一切含めません。代わりに、ショットを撮影したいシーンの画像を用意し、プロンプトで表現したいアクションを詳細に指定します。この映像を生成したら、Flickのフレーム抽出ツールを使って最終フレームを取り出します。この画像をNano Banana Proに渡し、キャラクターのリファレンス画像を参照として再生成します。これにより、まさに求めていたキャラクターが反映された最終フレームが完成します。
次に生成する映像では、キャラクターを反映した新しいエンドフレームと最初に生成した映像をKling O3に渡します。これにより、最初の生成映像を精密に再現しつつ、目的のキャラクターが反映された最終映像が完成します。最初の生成ではシーンとその中で起こるアクションを精密にコントロールでき、2回目の生成ではキャラクターを差し替えることで、キャラクターの一貫性を保つことができます。
手順は以下の通りです:
この手法では、まず1枚のキャラクターリファレンス画像から始め、それをターンアラウンドシートに変換します。キャラクターの全身を3方向から並べて表示したものです。以下が使用するプロンプトです。
提供された画像を正確なキャラクターリファレンスとして使用してください。同じ歴史上の中国人男性を、手作りのストップモーションパペットスタイルで表現したキャラクターデザインのターンアラウンドシートを作成してください。粘土や衣装人形のような微細な質感を持たせます。正面、真横、3/4斜めの3つの全身ビューを横に並べて表示してください。衣装デザインはリファレンス画像通りに正確に維持してください。背の高い黒い帽子、淡いグレーの外衣、白い内衣、衣の丈、袖の形、襟の構造、腰帯、下げ飾り、黒いブーツ、長い棒状の武器、円筒形の容器を含みます。衣服のシルエット、重ね着、プロポーション、裁断、アクセサリーの配置、全体的な衣装構成は変更しないでください。衣装を再デザインしたり簡略化したりしないでください。変化させるのは表現媒体のみです。手作りのパペットキャラクター、ストップモーション映画の美学、わずかに質感のある布地、わずかに彫刻的な顔、微細な粘土のような表面処理、手作りの衣装ディテール、リアルなミニチュアワードローブ構成、スタジオでのターンアラウンド提示です。ニュートラルな無地の背景、柔らかく均一な照明、全身が見える構図、すっきりとした余白、読み取りやすい衣装デザインシート、洗練されたプロダクション用キャラクターボード、中国の民間伝承ファンタジー風ストップモーションの美学、細部までこだわりつつも過剰でない、光沢を抑え、デジタル感を抑えた、手作りの質感を感じさせる仕上がり。
こちらが結果です:

シーンに求める設定のイメージも生成します。これには2つの方法があります。まず、Nano Banana ProやGPT Image 2のようなテキストから画像を生成するモデルに、明確に定義したプロンプトを入力し、シーンの見た目のスキーマを生成する方法です。
さらに精度を高めるために、2つ目の方法を活用できます。テキストから画像を生成するモデルを使う代わりに、Microsoft Paintのようなツールで、求める設定を手描きでストーリーボード化することもできます。その後、Nano Banana Proに、このスケッチを最終生成のリファレンスとして参照させます。この例では、手前に色あせた赤い布がはためく、凍った湖の雪に覆われた桟橋をスケッチしてみましょう。こちらが私たちのスケッチです:

次に、求めているリアルな細部を正確に説明した詳細なプロンプトとともに、このスケッチをリファレンスとしてNano Banana Proに渡します。こちらが私たちのプロンプトです:
この手描きのストーリーボードスケッチを、レイアウトと構図の厳密なリファレンスとして使用してください。現在の構図、カメラアングル、フレーミング、被写体の配置、大きな形状デザインを100%維持してください。中国の民間伝承風ストップモーションパペットのミニチュアセット。湖畔の葉のない枝が雪の中に斜めに突き刺さり、色あせた濃い赤の布が結び付けられている。その奥には雪に覆われた小さな木製の桟橋。右側の岸辺には雪の重みでしなった冬の葦やガマの群生。手作り感のある雪の質感、手作りの桟橋、自然な枝の質感、微細な織り目のある布地、冷たい青灰色の冬の配色、マットな手作り仕上げ、詩的で抑制された雰囲気。湖面はスタジオのミニチュアの氷の表面となり、柔らかく不透明な青灰色の氷、石膏のような微細な凹凸、マットな樹脂のような仕上げ、浅い霜の層、かすかな乳白色の斑点、繊細な氷結の粒子感、穏やかな手作りの表面変化、最小限の反射が表現されている。
こちらが結果です:

プロンプトにキャラクターをエンコードすることに頼るテキストから動画への手法よりも、Flickはより優れたアプローチを提供します。求めている構図とキャラクターデザインを正確に反映した生成済みのショット静止画を、画像から動画へのモデルのリファレンスとして使用します。これにより最初のフレームが固定され、モデルはその後もキャラクターの一貫性を保つことができます。
ここから、Kling O3 Proや他の画像から動画へのモデルを使って、最初の動画を生成できます。設定画像を開始フレームとして渡し、キャラクターのアクションを指定します。ここではキャラクター画像をリファレンスとして提供していないため、キャラクターの説明は簡潔にしておくことができます。この例では、単に「ストップモーションパペットの漁師」とだけリクエストします。彼のアクションを指定します。雪の中を歩いて桟橋へ向かい、その先端で立ち止まるというものです。求めるキャラクターの動きを定義し、雪がどんどん激しくなり、フレーム全体に吹き付けるようにモデルに指示します。こちらが最終的なプロンプトです:
わらの雨合羽と竹編みの帽子を身につけたストップモーションパペットの漁師が、雪の中を歩いて桟橋に向かう。寒さに少し前かがみになりながら、片手でバランスを取り、もう片方の手でコートをかき合わせている。手作りのミニチュアカメラはゆっくりと前進し、わずかに上を向く。雪はどんどん激しくなり、やがて濃密な冬の吹雪となる。雪はフレーム全体に吹き付け、次第に凍った湖を覆い隠していく。最後には、漁師は桟橋の先端にたどり着き、立ち止まって、氷に向かってしばらくの間静止する。
設定画像をリファレンスとして使うことで、正確で美しい結果が得られます:
ここで、顔交換手法の強みが活きてきます。最初の動画生成に満足したら、Flickのフレーム抽出ツールを使ってその動画の最終フレームを抽出します。先ほど生成したキャラクターのターンアラウンドシートを使い、この2枚の画像をNano Banana Proに渡して、最終フレームのキャラクターをキャラクターリファレンスに差し替えるようモデルに指示します。その際、最初の生成における照明、構図、カメラアングル、および設定はそのまま維持します。以下がそのプロンプトです:
雪の積もった桟橋のシーンをメインの構図リファレンスとして使用し、提供されたストップモーション人形のキャラクターデザインシートをキャラクターリファレンスとして使用してください。桟橋の先端に立っている漁師を、この正確なキャラクターに置き換えてください。背面シルエット、帽子の形、ローブの丈、淡いグレーの外衣、白い内衣、黒いブーツ、腰帯、垂れ下がる装飾品、長い棒状の物、円筒形の容器、そしてキャラクターシートに基づく全体の体のプロポーションを一致させてください。キャラクターは現在の画像と同じ背面向きのステージングで、桟橋の奥でカメラに背を向けたままにしてください。既存のカメラアングル、構図、桟橋、凍った湖、前景の色褪せた赤い布が結ばれた枝、雪に覆われた岸辺、雪で曲がった葦をそのまま維持してください。中国の民間ストップモーション人形のミニチュアスタイル、手作りの質感、触感のある雪、マットな氷、繊細な人形のプロポーション、静かな冬の雰囲気を保ってください。新しいキャラクターは、同じミニチュアセットに自然に溶け込み、同じスケール、同じ背面向きのポーズのロジック、同じ抑制の効いた映画的な雰囲気を持つ必要があります。
この2つの入力、つまりターンアラウンドシートと抽出した最終フレームを組み合わせて、Nano Banana Proを使い新しい最終フレームを生成します:


こちらが結果です:

この手法が非常に強力な理由は、シーンの構図を思い通りに正確にコントロールできる点にあります。設定画像、キャラクターリファレンス、プロンプトを一度にモデルに渡して最終動画を生成させるのではなく、これを2つのパスに分けます。最初のパスではキャラクターにはあまりこだわらずシーンを作成し、次に望むキャラクターを含む新しい最終フレームを生成し、2回目のパスで最終動画を生成します。
先ほど作成した設定画像を開始フレームとして使い、キャラクターリファレンスを含む新しく仕上げた終了フレームを使用して、最終的な出力を生成します。終了フレームに埋め込まれたキャラクターリファレンスに加えて、プロンプトを使ってモデルにキャラクターの説明、動き、設定、望むカメラワークとバックグラウンドオーディオを再度伝えます。以下がそのプロンプトです:
高い黒い帽子をかぶり、白い内衣の上に淡いグレーの外衣をまとい、黒いブーツを履いた中国のストップモーション人形の文官が、矢筒と横刀を腰に下げ、抑制された慎重な足取りで雪の中を歩き桟橋へと進みます。手作りのミニチュアカメラはゆっくりと前進しながら、わずかに上向きにチルトします。軽い雪がフレームの中を静かに舞います。凍った湖は静かで動きがありません。最後には、文官は桟橋の先端に到達し、立ち止まり、氷の方を向いたまま静止します。非常に静かな雰囲気で、雪や木の上を歩く柔らかな足音だけが聞こえます。
そしてこちらが最終結果です:
この手法はより高度ですが、シーンの構図を極めて精密にコントロールしながら、キャラクターの一貫性を正確に保つことができます。Klingや他のモデルで2回の別々の動画生成を実行する必要があるためコストは高くなりますが、気に入らない不正確な動画1本分を無駄にすることになるクレジットを節約できます。
よくある質問
一貫したキャラクターを作るのに最適なAIツールは何ですか?
唯一無二の最適なツールというものはありません——最適な手法があるだけです。ほとんどの人にとって、(Flickのような)img2imgのキャラクターリファレンスワークフローは、トレーニングなしでキャラクターの一貫性を保つ最速かつ最も信頼できる方法です。ドリフトがほぼゼロの大量制作には、ComfyUIでカスタムトレーニングしたLoRAが最良の選択です。
img2imgキャラクターの一貫性とは何ですか?
画像から画像(img2img)へのキャラクターの一貫性とは、定義したキャラクターの正確なビジュアルアイデンティティを維持しながら、新しい設定、追加のディテール、新しいアングルで主人公の新しい画像を生成することを意味します。
Flickでキャラクターの一貫性を保つにはどうすればいいですか?
キャラクターのリファレンス画像を用意します。Character Referenceツールを使うことで、AIは主人公のビジュアルアイデンティティを保ったまま新しい画像を生成します。キャラクターを言葉で説明してモデルが毎回同じ結果を出してくれることを期待するのではなく、リファレンスを渡して「このキャラクターを、新しいシーンで」と伝えるイメージです。
Midjourneyで一貫性のあるキャラクターを作るには?
キャラクターのリファレンス画像を使ってOmni Reference(--oref)を利用し、omni-weight(--ow)を調整することで、シーンのプロンプトに従いながらもアイデンティティを保持できます。
AI動画でキャラクターの一貫性を保つことはできますか?
はい、できます。まずキャラクターを静止画として固定し、その画像を動画ツールのリファレンス機能でアニメーション化します — Veo 3の「Ingredients」、Runwayの「References」、Klingの「Elements」などです。固定した静止画からアニメーション化する方が、テキストから動画を生成するよりもはるかに高い一貫性が得られます。
一貫性のあるキャラクターを得るためにモデルを学習させる必要はありますか?
いいえ、必要ありません。LoRAを学習させれば最も強固な固定が得られますが、ほとんどのプロジェクトでは、Character Reference機能と質の良いリファレンス画像1枚あれば十分です。モデルの学習が必要になるのは、何百ものショットを生成していて、手動でズレを修正するコストが高くなる場合だけです。
なぜAIキャラクターが変わってしまうのですか?
各生成は前回の記憶を持たずゼロから作られるため、小さなばらつきが積み重なってズレが生じるからです。解決策は、毎回言葉でキャラクターを説明し直すのではなく、モデルに合わせるべき固定のリファレンスを与えることです。
Flickをどう始めればいいですか?
チュートリアルをご覧ください: Flick 101: Getting Started. 最初のプロジェクトを作成し、オンボーディングを完了して、AI映画制作の旅を始めましょう!
関連チュートリアルを見る:
https://flick.art/docs/visual-styles
https://flick.art/docs/voice-consistency
The Herderについて詳しく知る:
https://flick.art/blog/behind-the-herder
優れたキャラクター作りが重要な理由:
https://flick.art/blog/in-the-ai-era-story-is-everything