GPT Image 2.0:完全ガイド

· Flickの社内映画制作者 · LinkedIn

Jul 2026

GPT Image 2.0は、美しい1フレーム以上を必要とするクリエイター向けのOpenAIの画像モデルです。最大2K画像を生成し、以前のOpenAI画像モデルよりも多言語テキストを正確にレンダリングし、Thinkingモードでは1つのプロンプトから最大8つの一貫した画像を生成でき、バッチ全体で同じキャラクターを維持します。

このバッチ一貫性こそが、このガイドが存在する理由です。AI映画制作者にとって、GPT Image 2.0は単なる画像生成ツールではなく、高速なキャラクターシートマシンです。顔、衣装、角度、表情、ポーズのリファレンスを一度生成し、そのシートをFlick内で使用して、Kling、Seedance、Veo、FLUX、そして次に使用するどのモデルでも同じキャラクターの一貫性を保ちます。

GPT Image 2.0、一目で

  • 概要: GPT Image 2.0(APIモデル名gpt-image-2)は、2026年4月21日にリリースされたOpenAIの画像生成・編集モデルです。
  • 最適な用途: レイアウト重視の画像、画像内テキスト、多言語ポスター、商品/シーンの静止画、AI動画用のキャラクターシート。
  • 映画制作の主要機能: Thinkingモードでは1つのプロンプトから最大8枚の統一性のある画像を生成でき、正面/側面/背面/表情リファレンスパックに最適です。
  • モード: 有料プランではThinkingモード、高速な探索とFreeプランアクセスにはInstantモード。
  • 解像度: 最大2K、実験的に2560×1440出力に対応。
  • API: 画像生成、編集、複数画像入力、nバッチ、品質レベル、PNG/JPEG/WebP出力をサポート。
  • ワークフロー: GPT Image 2.0でキャラクターをデザインし、リファレンスシートに変換してFlickにアップロード、その後リファレンス駆動型の動画モデルで同じアイデンティティをアニメーション化。
  • 結論: GPT Image 2.0を美術部門として、Flickを制作キャンバスとして活用してください。
Image

Turn your character sheet into shots

Upload the sheet once. Keep the same face in every generation, every model.

GPT Image 2.0仕様

仕様GPT Image 2.0
リリース日2026年4月21日
APIモデル名gpt-image-2
解像度最大2K; 実験的2560×1440
アスペクト比3:1超ワイドから1:3超縦まで
バッチ生成nパラメータで1プロンプトあたり1〜8画像
最高の連続性機能一貫性のある8画像Thinkingモードバッチ
モードThinkingとInstant
ThinkingモードアクセスPlus、Pro、Business、Enterprise
Instantモードアクセス無料を含むすべてのプラン
テキストレンダリングヒンディー語やベンガル語などの非ラテン文字を含む強力な性能
出力形式圧縮制御付きPNG、JPEG、WebP
知識カットオフ2025年12月
Flickでの最適な用途キャラクターシート、シーンの静止画、ポスター/キーアート、リファレンスパック

ThinkingモードとInstantモードの比較

GPT Image 2.0には2つの実用的な性格があります。

Thinking モードは、レンダリングする前に推論を行います。レイアウトを計画し、利用可能な場合はリファレンスを検索し、詳細を検証し、バッチ全体でキャラクターやオブジェクトの一貫性を保ちます。そのため、キャラクターが複数回登場する場合に使用するモードです。

トレードオフは速度です。Thinking モードは生成あたり15〜30秒かかることがあるため、アイデアを素早くラフ化する最速の方法ではありません。

Instant モードは探索のためのモードです。同じコアビジュアル品質を維持しながら、より深い推論パスをスキップします。より高速で、すべての ChatGPT ティアで利用でき、キャラクターシートに時間や予算を費やす前に外観を見つけるのに便利です。

シンプルなルール:

  • ムードボード、ファーストルック、サムネイル、ビジュアル探索には Instant を使用します。
  • キャラクター、プロダクト、テキスト付きポスター、連続性が必要な画像には Thinking を使用します。
Image

GPT Image 2.0 が AI 動画にとって重要な理由

ほとんどの AI 動画の一貫性の問題は、動画モデルの前から始まります。モデルがドリフトするのは、キャラクターが十分に明確に定義されていなかったためです。

1枚のポートレートは、動画モデルに1つのアングル、1つの表情、1つの照明条件を伝えるだけです。リファレンスシートは、人物の全体を伝えます:

  • 顔の形
  • 衣装
  • プロポーション
  • アクセサリー
  • 正面図
  • 側面図
  • 背面図
  • 全身
  • クローズアップの表情
  • 発話時の口の形
  • 照明のベースライン

GPT Image 2.0 の8画像バッチは、その素材を1つの一貫した実行で提供します。8枚の別々の画像をプロンプトして8人の似ているが異なる人物を得る代わりに、リファレンスパック全体を一度に要求できます。バッチは1つのセットとして計画されるため、自己整合性が保たれる傾向があります。

この整合性こそが、リファレンス駆動の動画モデルが評価するものです。

キャラクターシート手法

Image

これは、GPT Image 2.0 を制作ツールに変えるワークフローです。

ステップ1:アイデンティティフレームをデザインする

Instant モードから始めます。キャラクターが保存する価値のあるものになるまで、明確なポートレートまたは全身フレームを1枚生成します。

曖昧なプロンプトは避けてください。具体的なアイデンティティの詳細を含めます:

  • 年齢層
  • 顔の形
  • 髪の色とカット
  • 肌の詳細
  • 特徴的な印
  • 正確な服装
  • アクセサリーの配置
  • カラーパレット
  • 体型
  • 感情のベースライン
  • 世界観/スタイル

うまく機能するデザインが得られたら、それを保存してください。これがアイデンティティフレームです。正確なアイデンティティフレームのプロンプト例は、下部のプロンプト例セクションに集められています。

ステップ2:8画像Thinking-modeシートを生成する

アイデンティティフレームをリファレンス画像としてフィードバックします。次に、GPT Image 2.0に、動画モデルが必要とするアングルと表情を生成するよう依頼します。

これがGPT Image 2.0の核心的なトリックです:モデルのバッチ一貫性を利用して、下流の動画生成に耐えられるコンタクトシートを作成します。完全な8画像シートのプロンプトは、他の例と一緒に下部に集められています。

ステップ3:リファレンスパックをエクスポートする

バッチをクリーンなリファレンスパックとして保存します。ファイルをアングル別に整理して保管してください:

  • front-neutral
  • left-profile
  • right-profile
  • three-quarter-back
  • full-body
  • seated-hands
  • closeup-smile
  • closeup-speech

より強力なシートが必要な場合は、画像を1つのコンタクトシートに結合し、個別のフレームも保持してください。動画ツールは、モデルによって個別のリファレンスまたは単一のシートのいずれかを好む場合があります。

ステップ4:シートをFlickに取り込む

Flickでは、GPT Image 2.0が美術部門となり、キャンバスがプロダクションボードになります。

実用的なFlickのワークフロー:

  1. 新しいキャンバスまたは映画のプロジェクトキャンバスを開きます。
  2. GPT Image 2.0のアイデンティティフレームとリファレンスシートをアップロードします。
  3. シートをキャラクターのリファレンスとして使用します。
  4. シーンスチルを生成またはアップロードします。
  5. スチルを選択し、動画を生成を選択します。
  6. ショットに適したモデルを選択します:
    • Klingは動きの多いアクションと物理的な詳細に。
    • Seedanceは長いクリップ、マルチリファレンスのワークフロー、対話の多いシーンに。
    • Veoは利用可能な場合、洗練されたシネマティックなリアリズムに。
    • FLUXまたはその他のモデルは、モデル特有のルックに。
  7. すべてのショットで同じキャラクターパックをリファレンスします。
  8. バリエーションを生成し、ドリフトを比較し、アイデンティティを最もよく保持しているクリップを保持します。
  9. 強力なフレームを将来のリファレンスとしてキャンバスに保存します。
  10. 同じキャンバス上でシーケンスをカット、グレーディング、アセンブルします。

目標はGPT Image 2.0にすべてをやらせることではありません。目標は、すべての動画モデルが必要とするリファレンス素材を生成させることです。

Image

FlickスタイルのプロダクションでGPT Image 2.0を使用する方法

完全な静止画から動画へのパイプラインは次のようになります:

1. シーンの前にキャラクターを構築する

複雑なアクションショットから始めないでください。まずは明確なアイデンティティから始めましょう。

GPT Image 2.0でシンプルな背景のポートレートまたは全身のリファレンスをプロンプトします。ライティングはシンプルに保ちます。キャラクターのシルエットを混乱させる可能性のある小道具は避けてください。

2. リファレンスシートを作成する

Thinkingモードを使用して8アングルのバッチを生成します。これにより、FlickのCharacter Referenceワークフローが単一の顔以上のものを扱えるようになります。

3. 最初のシーンの静止画を生成する

キャラクターが確定したら、シーンの静止画を生成します。キャラクターシートで使用したものと同じアイデンティティ保持の表現を使い、新しい設定に適用します。完全なシーン静止画プロンプトは、下部のプロンプト例セクションに含まれています。

4. 静止画とシートをFlickにアップロードする

Flickのキャンバスでは、キャラクターシートとシーンの静止画を近くに配置します。これらをショットキットとして扱います。

5. リファレンス駆動の動画モデルでアニメーション化する

シーンの静止画を選択し、動画を生成し、キャラクターのリファレンスをアタッチします。モデルが画像のリファレンスをサポートしている場合は、シートから最も強力なアイデンティティ画像を使用します:正面、横顔、全身、表情です。

モデルが名前付き参照や要素のリファレンスをサポートしている場合は、安定したハンドルを使用してショットを記述します。正確なFlickスタイルのプロンプトは、下部のプロンプト例に含まれています。

6. ずれの確認

生成後は毎回、以下を確認します:

  • 顔の形
  • 生え際
  • 衣装の色
  • アクセサリー
  • 体のプロポーション
  • 横顔の正確性
  • 該当する場合は音声/発話の整合性

最良のフレームをキャンバスに保存します。質の高い出力フレームは、後のショットでより良いリファレンスになります。

GPT Image 2.0のプロンプト構成

Image

GPT Image 2.0は構造化されたプロンプトに最も良く反応します。次の順序を使用してください:

  1. 成果物のタイプ: 出力が何であるか。
  2. 被写体: 誰または何が登場するか。
  3. レイアウトまたはカメラ: 画像がどのように構成されるか。
  4. 重要な詳細: 保持する必要がある詳細。
  5. スタイルと照明: 視覚的な仕上げ。
  6. 制約: 保持または回避すべきもの。

モデルは早い段階で計画を立てるため、順序が重要です。曖昧な賛辞から始めると、プランナーは注意を無駄にします。成果物とレイアウトから始めれば、何を構築すべきかがわかります。コピー&ペースト可能なプロンプト例はすべてガイドの最後にまとめられています。

GPT Image 2.0と他のモデルの比較

機能GPT Image 2.0Midjourney v8Nano Banana 2
画像内のテキストクラス最高弱い改善済み
レイアウト制御強い中程度強い
美的上限強い単一フレームのベンチマークとして依然最高同等
一貫したバッチプロンプトあたり最大8枚なしなし
API公開公開APIなし利用可能
速度Thinkingモードでは中程度高速1〜3秒
最適な用途テキスト、レイアウト、キャラクターシート美しい単発フレーム低コスト大量生成と高速反復

最もシンプルな使い分け:

  • Midjourneyは美しい静止画1枚に使用。
  • Nano Banana 2は低コスト大量生成と高速バリエーションに使用。
  • GPT Image 2.0はテキスト、レイアウト、編集可能なリファレンス、キャラクターシートに使用。
  • Flickでそれらの静止画を一貫性のある映像ショットに変換。
Image

ベストプラクティス

  • シートを作成する前に、1枚のクリーンなアイデンティティフレームから始める。
  • 連続性が重要な作業にはThinkingモードを使用する。
  • シートは8つの個別のプロンプトではなく、1つのバッチとして生成する。
  • 不変要素を正確に繰り返す:同じ人物、同じ衣装、同じ照明、同じプロポーション。
  • リファレンスにはシンプルな背景を使用する。
  • アクセサリーはシンプルかつ一貫性を保つ。
  • すべての入力画像に役割でラベルを付ける。
  • リファレンスパックには中品質を、最終的なヒーロー画像には高品質を使用する。
  • 質の高いフレームはFlickキャンバスに保存し、将来のリファレンスとして活用する。
  • すべての良い出力を使い捨ての画像ではなく、再利用可能な制作素材として扱う。

よくある間違い

間違い1:1枚のポートレートをリファレンス全体として使用する

ポートレートだけでは複数ショットの動画には不十分です。横顔、後ろ姿、全身、表情のリファレンスを追加してください。

ミス2: リファレンスを1つずつ生成する

個別のプロンプトでは一貫性が失われます。8枚の画像を1回のバッチで生成し、シート全体の統一性を保ちましょう。

ミス3: 保持する表現を変更する

あるプロンプトで「ネイビーのボンバージャケット」と書き、次のプロンプトで「青いジャケット」と書くと、一貫性が失われます。毎回同じアイデンティティブロックを貼り付けましょう。

ミス4: レイアウトなしで正確なテキストを求める

ポスター、タイトルカード、UIの場合は、文字の前にレイアウトを定義してください。モデルはテキストの配置場所を計画する必要があります。

ミス5: アイデンティティを固定する前にアニメーションする

弱い静止画を動画モデルに送ると、固定も弱くなります。まずリファレンスパックを構築してから、アニメーション化しましょう。

制限事項

GPT Image 2.0は強力ですが、魔法ではありません。

  • 知識のカットオフ: 2025年12月のため、それ以降の製品、人物、イベント、ロゴは正確でない可能性があります。
  • ロゴ: 正確なブランドマークはまだ信頼性が低いです。
  • 思考の遅延: 15〜30秒は、高速なアイデア出しには遅く感じる場合があります。
  • 別々のセッション間でのキャラクターの一貫性: バッチ内では強力ですが、リファレンスと同一の保持表現を使用しない限り、無関係なプロンプト間では弱くなります。
  • 小さなテキスト: 大きなタイトルとラベルは、小さな法的文言サイズのテキストよりもうまく機能します。
  • アーキテクチャ: OpenAIは完全なアーキテクチャを公開していないため、ワークフローに関する主張は経験的な制作ガイダンスとして扱うべきです。

プロンプトの例

アイデンティティフレームプロンプト

実際の写真、20代後半の配達員のスタジオリファレンスポートレート、刈り上げた銅色の髪、鼻にそばかす、左耳に銀色のフープピアス、黄色いジッパーのネイビーボンバージャケット、黒いカーゴパンツ、擦れた白いスニーカー、警戒しているが疲れた表情、プレーングレーの背景、柔らかく均一な光、余分なテキストなし。

8枚画像のキャラクターシートプロンプト

画像1の人物のキャラクターリファレンスシート:すべての画像で同じ人物、同じ顔、同じ服装、同じ照明。1回のバッチで8枚の一貫したリファレンス画像を生成:1) 正面、中立的な表情;2) 左横顔;3) 右横顔;4) 斜め後ろ姿;5) 全身立ち姿;6) 手が見える座った姿;7) 笑顔のクローズアップ;8) 話している最中のクローズアップ。プレーングレーの背景、柔らかく均一な光、フォトリアリスティック。キャラクターを再デザインしないこと。服装、髪、顔、プロポーション、アクセサリーを変更しないこと。

一般的なキャラクターシートプロンプト

[キャラクター]のキャラクターリファレンスシート。すべての画像で同じ人物、同じ服装、同じ照明。1回のバッチで8枚の一貫した画像を生成:正面中立、左横顔、右横顔、斜め後ろ姿、全身立ち姿、手が見える座った姿、笑顔のクローズアップ、話している最中のクローズアップ。プレーングレーの背景、柔らかく均一な光、フォトリアリスティック。キャラクターを再デザインしないこと。

プロンプト式の例

キャラクターリファレンスシート、フォトリアリスティック。60代の灯台守、短い白いひげ、折れた鼻、クリーム色のケーブルニットセーター、濃い色のオイルスキンコート、ウールキャップ、重い靴。1回のバッチで8枚の一貫した画像:正面、左横顔、右横顔、斜め後ろ姿、全身立ち姿、手が見える座った姿、笑顔のクローズアップ、話しているクローズアップ。プレーングレーの背景、柔らかく均一なスタジオライト。すべての画像で同じ人物、同じ服装、同じプロポーション、同じ照明。余分なテキストなし。

表情グリッドプロンプト

画像1のキャラクターの表情グリッド。すべてのパネルで同じ顔、同じ髪、同じ服装、同じ照明。4x4グリッドで16パネル:中立、笑顔、笑い、心配、恐怖、怒り、叫び、泣き、疲労、安堵、疑い、集中、驚き、穏やか、話している最中、聞いている。プレーンな背景、バストフレーミング、一貫したアイデンティティ。

シーンスチルプロンプト

画像1はキャラクターリファレンスシート。同じキャラクターが真夜中に雨に濡れた地下鉄ホームに入る映画的な映画スチルを作成。同じ顔、髪、ジャケット、プロポーション、アクセサリーを保持。35mmの質感、動機づけられた頭上の蛍光灯、濡れたタイルの反射、余分なテキストなし。

映画スチルプロンプト

画像1のキャラクターが午前2時に濡れたネオンの路地を横切る映画的な映画スチル。同じ顔、髪、ジャケット、プロポーション、アクセサリーを保持。35mmの質感、浅い被写界深度、青い影、麺屋台からのオレンジ色の実用光、背景の湯気、余分なテキストなし。

Flick動画プロンプト

@CharacterSheetをアイデンティティリファレンスとして、@SceneStillを開始フレームとして使用。同じ配達員がホームに足を踏み入れ、肩越しに振り返り、後ろで電車のライトが点滅する中、速度を落とす。顔、ジャケット、そばかす、ピアス、プロポーション、カラーパレットを保持。

ポスタープロンプト

ミニマルな映画ポスター、縦型。画像1のキャラクターが水浸しの廊下の突き当たりにシルエットで立っている。天井照明が一つ、水面に反射している。タイトル「LAST EXIT」は細い白いセリフ体で、下部3分の1の位置に中央配置。その下に小さなクレジットブロック。余分なテキストなし、タイトルは指定通りに表示。

プロダクト/レイアウトプロンプト

3カラムのフェスティバルポスター。左カラム:太字のコンデンス書体で日程。中央カラム:ダメージ加工されたセリフ体でタイトル「ONE LAST SUMMER」。右カラム:スモールキャップスでラインナップテキスト。背景は夕暮れのビーチ写真、色褪せたプリント質感、暖かいオレンジとクリームのカラーパレット。指定されたコピー以外の余分なテキストなし。

複数画像編集プロンプト

画像1はキャラクターリファレンスシート。画像2はベースシーン。画像1のキャラクターを画像2に配置し、画像2のライティングとカメラアングルに合わせる。キャラクターの顔、衣装、プロポーション、アクセサリーを保持する。シーンのそれ以外は一切変更しない。

よくある質問

GPT Image 2.0とは何ですか?

GPT Image 2.0は、2026年4月21日にリリースされたOpenAIの画像生成・編集モデルです。APIモデル名はgpt-image-2です。

GPT Image 2.0は無料ですか?

Instantモードは、無料プランを含むすべてのChatGPTプランで利用可能です。ThinkingモードはPlus、Pro、Business、Enterpriseなどの有料プランが必要です。API利用は画像/出力設定によって課金されます。

GPT Image 2.0はキャラクターの一貫性を保てますか?

はい、特にThinkingモードの1つのバッチ内では可能です。1つのプロンプトから最大8枚の統一性のある画像を生成できるため、キャラクターシートに便利です。異なるプロンプト間では、リファレンス画像を使用し、同じアイデンティティ制約を一字一句繰り返してください。

GPT Image 2.0でキャラクターシートを作成するにはどうすればよいですか?

1つのアイデンティティフレームをデザインし、Thinkingモードで1バッチに8つのリファレンスビューを生成します:正面、左プロフィール、右プロフィール、斜め後ろ、全身、座って手を見せる、クローズアップ笑顔、クローズアップ会話。同一人物/同一衣装/同一照明の制約を使用してください。

GPT Image 2.0のキャラクターシートの料金はいくらですか?

記事の試算に基づくと、1024×1024の8画像シートは、中品質で約0.42ドル、高品質で約1.69ドルです。

GPT Image 2.0はMidjourneyより優れていますか?

テキスト、レイアウト、APIアクセス、キャラクターシートに関しては優れています。単一の美しいフレームに関しては、Midjourneyの方が美的上限が高い可能性があります。

GPT Image 2.0の画像をAI動画に使用できますか?

はい。最も強力なワークフローは、GPT Image 2.0でキャラクターリファレンスシートを生成し、Flickにアップロードして、同じシートをKling、Seedance、Veo、FLUXなどの動画モデルのキャラクターリファレンスとして使用することです。

FlickでGPT Image 2.0を何に使用すべきですか?

キャラクターシート、シーンの静止画、タイトルカード、ポスター、商品リファレンス、スタイルフレームに使用してください。その後、Flickのキャンバスを使用して静止画をアニメーション化し、モデルを比較し、リファレンスを保存し、シーケンスを組み立てます。