
GPT Image 2.0:完整指南
Jul 2026
GPT Image 2.0 是 OpenAI 為需要超越單一精美影格的創作者打造的圖像模型。它能生成高達 2K 的圖像,相較於早期的 OpenAI 圖像模型更準確地算圖多語言文字,而在 Thinking 模式中,可以從單一提示詞產生多達八張具有一致性的圖像,讓同一個角色出現在整個批次中。
這種批次一致性正是本指南存在的原因。對於 AI 電影製作者來說,GPT Image 2.0 不僅僅是圖像生成器——它是快速的角色設定機器。一次生成臉部、服裝、角度、表情和姿勢參考,然後在 Flick 中使用該設定表,讓同一個角色在 Kling、Seedance、Veo、FLUX 以及你接下來使用的任何模型中保持一致。
GPT Image 2.0,一目了然
- 它是什麼:GPT Image 2.0,API 名稱為
gpt-image-2,是 OpenAI 的圖像生成與編輯模型,於 2026 年 4 月 21 日發布。 - 最佳使用情境:版面密集的圖像、圖像中的文字、多語言海報、產品/場景靜態圖,以及用於 AI 影片的角色設定表。
- 關鍵影視製作功能:思考模式可以從一個提示詞生成多達八張連貫的圖像,非常適合製作正面/側面/背面/表情參考包。
- 模式:付費方案可使用思考模式;即時模式可用於更快速的探索與 Free 方案存取。
- 解析度:最高 2K,並提供實驗性的 2560×1440 輸出。
- API:支援圖像生成、編輯、多圖像輸入、
n批次處理、品質等級,以及 PNG/JPEG/WebP 輸出格式。 - 工作流程:在 GPT Image 2.0 中設計角色,將角色轉換為參考設定表,上傳至 Flick,然後使用參考驅動的影片模型為相同角色製作動畫。
- 結論:將 GPT Image 2.0 用作美術部門,將 Flick 用作製作畫布。

將角色設定表轉換為鏡頭
上傳一次設定表,在每次生成、每個模型中保持相同面孔。
GPT Image 2.0 規格
| 規格 | GPT Image 2.0 |
|---|---|
| 發布日期 | 2026 年 4 月 21 日 |
| API 模型名稱 | gpt-image-2 |
| 解析度 | 高達 2K;實驗性 2560×1440 |
| 長寬比 | 3:1 超寬到 1:3 超高 |
| 批次生成 | 使用 n 參數每個提示詞可生成 1–8 張圖像 |
| 最佳連續性功能 | 具有一致性的 8 張圖像 Thinking 模式批次 |
| 模式 | Thinking 和 Instant |
| Thinking 模式存取權限 | Plus、Pro、Business、Enterprise |
| Instant 模式存取權限 | 所有方案,包括免費 |
| 文字算圖 | 強大,包括印地語和孟加拉語等非拉丁文字 |
| 輸出格式 | PNG、JPEG、WebP,具壓縮控制 |
| 知識截止日期 | 2025 年 12 月 |
| 最佳 Flick 用途 | 角色設定表、場景靜態圖、海報/關鍵美術、參考包 |
Thinking 模式與 Instant 模式
GPT Image 2.0 具有兩種實用特性。
Thinking 模式會在算圖前先進行推理。它能規劃構圖、搜尋可用的參考資料、驗證細節,並在批次中保持角色或物件的一致性。這使它成為當角色會出現多次時應使用的模式。
代價是速度。Thinking 模式每次生成可能需要 15–30 秒,因此不是快速勾勒想法的最快方式。
Instant 模式用於探索。它保持相同的核心視覺品質,但跳過更深層的推理過程。它更快速,在每個 ChatGPT 方案中都可使用,適合在花費時間或點數製作角色表前先找到想要的外觀。
簡單的規則:
- 使用 Instant 進行情緒板、初步外觀、縮圖和視覺探索。
- 使用 Thinking 進行角色、產品、帶文字的海報,以及任何需要連貫性的圖像。

為什麼 GPT Image 2.0 對 AI 影片很重要
大多數 AI 影片一致性問題在影片模型之前就開始了。模型會漂移是因為角色從未被足夠清楚地定義。
單一肖像只告訴影片模型一個角度、一個表情和一個光照條件。參考表則告訴它完整的人物:
- 臉型
- 髮型
- 服裝
- 比例
- 配件
- 正面視角
- 側面視角
- 背面視角
- 全身
- 特寫表情
- 手部
- 說話口型
- 光照基準
GPT Image 2.0 的 8 張圖像批次讓您在一次連貫的執行中獲得這些素材。您不需要提示八張獨立的圖像並得到八個相似但不同的人,而是可以一次要求完整的參考包。批次作為一組來規劃,因此傾向於彼此一致。
這種一致性正是參考驅動的影片模型所需要的。
角色表方法

這是將 GPT Image 2.0 轉變為製作工具的工作流程。
步驟 1:設計身份框架
從 Instant 模式開始。生成一張清晰的肖像或全身框架,直到角色值得保留。
不要使用模糊的提示詞。請包含具體的身分細節:
- 年齡範圍
- 臉型
- 髮色與髮型
- 膚質細節
- 特徵標記
- 精確的服裝
- 配件位置
- 色彩搭配
- 體型
- 情緒基調
- 世界觀/風格
當你獲得一個有效的設計時,請儲存它。這就是身分框架。確切的身分框架提示詞範例收錄在底部的提示詞範例區段中。
步驟 2:生成 8 張影像的思考模式表
將身分框架作為參考影像回饋。然後要求 GPT Image 2.0 產生你的影片模型所需的角度和表情。
這是 GPT Image 2.0 的核心技巧:利用模型的批次一致性來建立一個能夠在下游影片生成中保持穩定的聯絡表。完整的 8 張影像表提示詞收錄在底部的其他範例中。
步驟 3:匯出參考素材包
將批次儲存為乾淨的參考素材包。依角度整理檔案:
front-neutralleft-profileright-profilethree-quarter-backfull-bodyseated-handscloseup-smilecloseup-speech
如果你想要更強大的表單,可以將影像合併成一個聯絡表,同時保留個別的畫面。影片工具可能會根據模型偏好使用個別參考或單一表單。
步驟 4:將表單帶入 Flick
在 Flick 中,GPT Image 2.0 成為美術部門,而畫布則成為製作看板。
實用的 Flick 工作流程:
- 開啟全新的畫布或你影片的專案畫布。
- 上傳 GPT Image 2.0 身分框架和參考表單。
- 將表單作為你的角色參考。
- 生成或上傳場景靜態畫面。
- 選擇靜態畫面並選擇生成影片。
- 選擇適合該鏡頭的模型:
- Kling 適用於動作繁重和物理細節。
- Seedance 適用於較長的片段、多參考工作流程和對話繁重的場景。
- Veo 適用於可用的精緻電影級寫實效果。
- FLUX 或其他模型適用於特定模型外觀。
- 對每個鏡頭參考同一個角色素材包。
- 生成變化版本,比較偏移,並保留最能保持身分的片段。
- 將優秀的畫面儲存回畫布作為未來的參考。
- 在同一畫布上剪輯、調色並組裝序列。
目標不是讓 GPT Image 2.0 做所有事情。目標是讓它產生每個影片模型所需的參考素材。

如何在 Flick 風格製作中使用 GPT Image 2.0
完整的靜態圖轉影片流程如下:
1. 先建立角色再建立場景
不要從複雜的動作鏡頭開始。從清晰的身份開始。
使用 GPT Image 2.0 的提示詞生成簡單背景的肖像或全身參考圖。保持簡單的光線。避免可能混淆角色輪廓的道具。
2. 建立參考表
使用 Thinking 模式並生成八角度批次。這讓 Flick 的角色參考工作流程能夠使用多個面孔而不僅僅是一個。
3. 生成第一張場景靜態圖
鎖定角色後,生成場景靜態圖。使用與角色表相同的身份保留語言,並將其應用於新場景。完整的場景靜態圖提示詞包含在底部的提示詞範例部分。
4. 將靜態圖和角色表上傳至 Flick
在 Flick 畫布上,將角色表和場景靜態圖放在彼此附近。將它們視為您的拍攝工具組。
5. 使用參考驅動的影片模型製作動畫
選擇場景靜態圖,生成影片,並附加角色參考。如果模型支援圖片參考,請使用角色表中最強的身份圖片:正面、側面、全身和表情。
如果模型支援具名提及或元素參考,使用穩定的標識描述鏡頭。確切的 Flick 風格提示詞包含在底部的提示詞範例中。
6. 檢視偏移
每次生成後,請檢查:
- 臉型
- 眼睛
- 髮際線
- 服裝顏色
- 配件
- 身體比例
- 手部
- 側臉準確度
- 語音/對白對齊(如適用)
將最佳畫面儲存回畫布。優秀的輸出畫面可以成為後續鏡頭更好的參考。
GPT Image 2.0 的提示詞公式

GPT Image 2.0 對結構化提示詞反應最佳。請使用以下順序:
- 作品類型:輸出內容是什麼。
- 主體:出現的人或物。
- 佈局或鏡頭:影像的構圖方式。
- 重要細節:必須保留的細節。
- 風格和光照:視覺效果。
- 限制條件:需要保留或避免的內容。
順序很重要,因為模型會提前規劃。如果你以模糊的描述開頭,規劃器會浪費注意力。如果你以作品類型和佈局開頭,它就知道要建構什麼。所有複製貼上的提示詞範例都收集在指南底部。
GPT Image 2.0 與其他模型比較
| 功能 | GPT Image 2.0 | Midjourney v8 | Nano Banana 2 |
|---|---|---|---|
| 圖像中的文字 | 業界最佳 | 較弱 | 已改善 |
| 佈局控制 | 強 | 中等 | 強 |
| 美學上限 | 強 | 仍是單幀基準 | 相當 |
| 一致性批次 | 每個提示詞最多 8 張 | 無 | 無 |
| API | 公開 | 無公開 API | 可用 |
| 速度 | 思考模式下為中等 | 快 | 1–3 秒 |
| 最佳用途 | 文字、佈局、角色設定表 | 精美的單張畫面 | 低成本大量生成和快速迭代 |
最簡單的區分:
- 使用 Midjourney 生成精美的靜態畫面。
- 使用 Nano Banana 2 進行低成本大量生成和快速變化。
- 使用 GPT Image 2.0 處理文字、佈局、可編輯參考和角色設定表。
- 使用 Flick 將這些靜態畫面轉換為連貫的影片鏡頭。

最佳實踐
- 在建立設定表前,先從一張清晰的身份畫面開始。
- 對連續性敏感的工作使用思考模式。
- 將設定表作為一個批次生成,而非八個單獨的提示詞。
- 精確重複不變項目:同一人物、同一服裝、同一光照、同一比例。
- 參考圖使用純色背景。
- 保持配件簡單且一致。
- 為每張輸入圖像標註角色。
- 參考包使用中等品質,最終主視覺使用高品質。
- 將優秀畫面儲存回你的 Flick 畫布作為未來參考。
- 將每個好的輸出視為可重複使用的製作素材,而非一次性圖像。
常見錯誤
錯誤 1:使用單張肖像作為全部參考
單張肖像不足以製作多鏡頭影片。請新增側面、背面、全身和表情參考。
錯誤 2:逐一生成參考圖
分開的提示詞會產生偏差。使用單次 8 張圖批次生成,讓參考圖集保持一致。
錯誤 3:更改保留描述用語
如果一個提示詞說「深藍色飛行夾克」,下一個卻說「藍色外套」,就會引發偏差。每次都要貼上相同的身份描述區塊。
錯誤 4:未定義版面就要求精確文字
對於海報、片頭字卡和使用者介面,請在文案之前先定義版面。模型需要先規劃文字的位置。
錯誤 5:在鎖定身份前就開始製作動畫
如果你將品質不佳的靜態圖送入影片模型,會得到不穩定的鎖定效果。請先建立參考圖包,再製作動畫。
限制
GPT Image 2.0 功能強大,但並非萬能。
- 知識截止日期:2025 年 12 月,因此較新的產品、人物、事件和標誌可能不準確。
- 標誌:精確的品牌標記仍不可靠。
- 思考延遲:15–30 秒的等待時間可能讓快速發想感覺緩慢。
- 跨獨立工作階段的角色一致性:在單次批次中表現強勁,但在不相關的提示詞之間較弱,除非使用參考圖和完全相同的保留描述用語。
- 極小文字:大標題和標籤的效果優於法律條款大小的文字。
- 架構:OpenAI 尚未公開完整架構,因此工作流程建議應視為實務經驗指引。
提示詞範例
身分參考影格提示詞
真實照片,工作室參考肖像,一位快遞員,年約二十多歲後期,銅色短髮,鼻樑上有雀斑,左耳戴銀色圓環耳環,深藍色飛行員夾克配黃色拉鍊,黑色工裝褲,磨損的白色運動鞋,機警但疲憊的表情,純灰色背景,柔和均勻光線,無額外文字。
8 張圖片角色設定表提示詞
圖片 1 中人物的角色參考設定表:同一人物、同一面孔、同一服裝、同一光線在每張圖片中。一次生成 8 張連貫的參考圖片:1) 正面視角,中性表情;2) 左側面;3) 右側面;4) 四分之三背面視角;5) 全身站立;6) 坐姿且雙手可見;7) 微笑特寫;8) 說話中特寫。純灰色背景,柔和均勻光線,照片寫實風格。不要重新設計角色。不要改變服裝、髮型、面孔、比例或配飾。
通用角色設定表提示詞
[角色] 的角色參考設定表。同一人物、同一服裝、同一光線在每張圖片中。一次生成 8 張連貫圖片:正面中性、左側面、右側面、四分之三背面、全身站立、坐姿且雙手可見、微笑特寫、說話中特寫。純灰色背景,柔和均勻光線,照片寫實風格。不要重新設計角色。
提示詞公式範例
角色參考設定表,照片寫實風格。一位六十多歲的燈塔守護員,蓄短白鬍,鼻樑曾斷裂,米色粗針織毛衣,深色防水外套,羊毛帽,厚重靴子。一次生成八張連貫圖片:正面、左側面、右側面、四分之三背面、全身站立、坐姿且雙手可見、微笑特寫、說話特寫。純灰色背景,柔和均勻的工作室光線。同一人物、同一服裝、同一比例、同一光線在每張圖片中。無額外文字。
表情網格提示詞
圖片 1 中角色的表情網格。同一面孔、同一髮型、同一服裝、同一光線在每個格子中。4x4 網格共 16 個格子:中性、微笑、大笑、擔心、恐懼、憤怒、大喊、哭泣、疲憊、放鬆、懷疑、專注、驚訝、平靜、說話中、聆聽。純色背景,半身構圖,一致的身份特徵。
場景靜態畫面提示詞
圖片 1 是角色參考設定表。創作一個電影靜態畫面,同一角色在午夜時分進入雨水浸濕的地鐵月台。保留同一面孔、髮型、夾克、比例和配飾。35mm 膠片質感,合理的頂部螢光燈光,濕潤磁磚反射,無額外文字。
影片靜態畫面提示詞
圖片 1 中角色的電影靜態畫面,凌晨 2 點穿越濕潤的霓虹巷弄。保留同一面孔、髮型、夾克、比例和配飾。35mm 膠片質感,淺景深,藍色陰影,來自麵攤的橙色實用光源,背景中的蒸汽,無額外文字。
Flick 影片提示詞
使用 @CharacterSheet 作為身份參考,@SceneStill 作為起始畫面。同一位快遞員踏上月台,回頭望向肩後,當列車燈光在身後閃爍時放慢腳步。保留面孔、夾克、雀斑、耳環、比例和色彩調色盤。
海報提示詞
極簡電影海報,直式。來自圖片 1 的角色以剪影形式站在淹水走廊的盡頭,一盞頂燈倒映在水面上。標題「LAST EXIT」以細白襯線字母呈現,位於下三分之一處居中。下方有小型製作人員名單區塊。不添加額外文字,標題需逐字呈現。
產品/版面提示詞
三欄式音樂節海報。左欄:以粗體窄字體顯示日期。中欄:標題「ONE LAST SUMMER」以做舊襯線字體呈現。右欄:演出陣容以小型大寫字母顯示。背景為夕陽海灘照片,帶有褪色印刷質感,暖橘與奶油色調配色。除指定文案外不添加額外文字。
多圖編輯提示詞
圖片 1 是角色參考圖。圖片 2 是基礎場景。將圖片 1 中的角色放入圖片 2,並配合圖片 2 的光線和鏡頭角度。保留角色的面部、服裝、比例和配件。場景中的其他元素不做任何更改。
常見問題
什麼是 GPT Image 2.0?
GPT Image 2.0 是 OpenAI 的圖像生成與編輯模型,於 2026 年 4 月 21 日發布。其 API 模型名稱為 gpt-image-2。
GPT Image 2.0 免費嗎?
即時模式適用於所有 ChatGPT 方案,包括 Free。思考模式需要付費方案,例如 Plus、Pro、Business 或 Enterprise。API 使用費用依圖像/輸出設定計價。
GPT Image 2.0 能保持角色一致性嗎?
可以,特別是在單一思考模式批次中。它可以從一個提示詞生成多達八張連貫的圖像,這使其非常適合製作角色設定表。在不同提示詞之間,請使用參考圖像並逐字重複相同的身分限制條件。
如何使用 GPT Image 2.0 製作角色設定表?
先設計一個身分框架,然後使用思考模式在一個批次中生成八個參考視角:正面、左側面、右側面、四分之三背面、全身、坐姿手部、微笑特寫、說話特寫。使用相同人物/相同服裝/相同光線的限制條件。
GPT Image 2.0 角色設定表的費用是多少?
根據文章的估算,一張 8 圖 1024×1024 的設定表在中等品質下約需 $0.42,高品質下約需 $1.69。
GPT Image 2.0 比 Midjourney 更好嗎?
在文字、版面、API 存取和角色設定表方面,是的。若要製作單一精美畫面,Midjourney 可能仍具有更高的美學上限。
我可以將 GPT Image 2.0 圖像用於 AI 影片嗎?
可以。最強大的工作流程是使用 GPT Image 2.0 生成角色參考設定表,將其上傳至 Flick,並將相同設定表作為角色參考用於 Kling、Seedance、Veo 和 FLUX 等影片模型。
在 Flick 中我應該將 GPT Image 2.0 用於什麼?
將其用於角色設定表、場景靜態圖、標題卡、海報、產品參考和風格框架。然後使用 Flick 的畫布為靜態圖製作動畫、比較模型、儲存參考並組合序列。