
GPT Image 2.0:完整指南
Jul 2026
GPT Image 2.0 是 OpenAI 为需要不止一帧精美图像的创作者提供的图像模型。它可以生成高达 2K 的图像,比早期的 OpenAI 图像模型更准确地渲染多语言文本,并且在思考模式下可以从一个提示词生成多达八张连贯的图像,在整个批次中保持相同的角色。
这种批次一致性正是本指南存在的原因。对于 AI 电影制作者来说,GPT Image 2.0 不仅仅是一个图像生成器——它是一个快速的角色设定表机器。一次性生成面部、服装、角度、表情和姿势参考,然后在 Flick 中使用该设定表,在 Kling、Seedance、Veo、FLUX 以及您下次使用的任何模型中保持相同角色的一致性。
GPT Image 2.0,概览
- 它是什么:GPT Image 2.0,API 名称为
gpt-image-2,是 OpenAI 于 2026 年 4 月 21 日发布的图像生成和编辑模型。 - 最佳用例:布局密集的图像、图像中的文字、多语言海报、产品/场景静帧,以及用于 AI 视频的角色设定表。
- 关键影片制作功能:思考模式可以从一个提示词生成多达八张连贯的图像,这使它非常适合制作正面/侧面/背面/表情参考包。
- 模式:付费套餐可使用思考模式;即时模式用于更快速的探索和 Free 套餐访问。
- 分辨率:最高 2K,实验性 2560×1440 输出。
- API:支持图像生成、编辑、多图像输入、
n批次、质量级别,以及 PNG/JPEG/WebP 输出。 - 工作流程:在 GPT Image 2.0 中设计一个角色,将该角色转换为参考表,上传到 Flick,然后使用参考驱动的视频模型为同一身份制作动画。
- 结论:将 GPT Image 2.0 用作美术部门,将 Flick 用作制作画布。

将角色设定表转换为镜头
只需上传一次设定表。在每次生成、每个模型中保持相同面孔。
GPT Image 2.0 规格
| 规格 | GPT Image 2.0 |
|---|---|
| 发布日期 | 2026 年 4 月 21 日 |
| API 模型名称 | gpt-image-2 |
| 分辨率 | 高达 2K;实验性 2560×1440 |
| 宽高比 | 3:1 超宽到 1:3 超高 |
| 批量生成 | 使用 n 参数每个提示词生成 1-8 张图像 |
| 最佳连续性功能 | 连贯的 8 图像思考模式批次 |
| 模式 | 思考和即时 |
| 思考模式访问权限 | Plus、Pro、Business、Enterprise |
| 即时模式访问权限 | 所有层级,包括 Free |
| 文本渲染 | 强大,包括非拉丁文字如印地语和孟加拉语 |
| 输出格式 | PNG、JPEG、WebP,支持压缩控制 |
| 知识截止日期 | 2025 年 12 月 |
| 在 Flick 中的最佳用途 | 角色设定表、场景静帧、海报/主视觉、参考包 |
思考模式与即时模式
GPT Image 2.0 有两种实用特性。
思考模式会在渲染前进行推理。它可以规划布局、搜索可用的参考、验证细节,并在批量生成中保持角色或对象的一致性。这使它成为角色需要多次出现时的首选模式。
代价是速度。思考模式每次生成可能需要 15-30 秒,因此它不是快速构思想法的最快方式。
即时模式用于探索。它保持相同的核心视觉质量,但跳过更深层的推理过程。它速度更快,在 ChatGPT 的所有订阅层级上都可用,适合在花费时间或预算制作角色表之前寻找视觉效果。
简单的规则:
- 使用即时模式制作情绪板、初步效果、缩略图和视觉探索。
- 使用思考模式制作角色、产品、带文字的海报,以及任何需要连续性的图像。

为什么 GPT Image 2.0 对 AI 视频很重要
大多数 AI 视频一致性问题在视频模型之前就已经开始了。模型会产生偏移,因为角色从未被足够清晰地定义。
单张肖像只能告诉视频模型一个角度、一个表情和一种光照条件。而参考表能告诉它完整的人物:
- 脸型
- 发型
- 服装
- 比例
- 配饰
- 正面视图
- 侧面视图
- 背面视图
- 全身
- 特写表情
- 手部
- 说话口型
- 光照基准
GPT Image 2.0 的 8 张图像批量生成功能让你在一次连贯的运行中获得这些素材。你无需单独生成八张图像而得到八个相似但不同的人物,而是可以一次性要求整套参考包。批量生成是作为一个整体进行规划的,因此往往能保持自身的一致性。
这种一致性正是参考驱动的视频模型所需要的。
角色表方法

这是将 GPT Image 2.0 转化为制作工具的工作流程。
步骤 1:设计身份帧
从即时模式开始。生成一张清晰的肖像或全身帧,直到角色值得保留。
不要使用模糊的提示词。应包含具体的身份细节:
- 年龄范围
- 脸型
- 发色和发型
- 皮肤细节
- 明显标记
- 具体服装
- 配饰位置
- 色彩搭配
- 体型
- 情绪基调
- 世界观/风格
当你得到一个有效的设计时,请保存它。这就是身份帧。具体的身份帧提示词示例收录在底部的提示词示例部分。
步骤 2:生成 8 张图的 Thinking 模式参考表
将身份帧作为参考图像反馈回去。然后让 GPT Image 2.0 生成你的视频模型所需的角度和表情。
这是 GPT Image 2.0 的核心技巧:利用模型的批量一致性来创建一个能够在后续视频生成中保持稳定的参考表。完整的 8 张图参考表提示词与其他示例一起收录在底部。
步骤 3:导出参考包
将批量图像保存为一个完整的参考包。按角度整理文件:
front-neutralleft-profileright-profilethree-quarter-backfull-bodyseated-handscloseup-smilecloseup-speech
如果你想要更强大的参考表,可以将这些图像合并成一个参考表,同时保留单独的帧。根据模型的不同,视频工具可能更偏好单独的参考图或单一的参考表。
步骤 4:将参考表导入 Flick
在 Flick 中,GPT Image 2.0 成为美术部门,而画布则成为制作看板。
实用的 Flick 工作流程:
- 打开一个新画布或你影片的项目画布。
- 上传 GPT Image 2.0 身份帧和参考表。
- 将参考表用作你的角色参考。
- 生成或上传一个场景静帧。
- 选择该静帧并选择生成视频。
- 选择适合该镜头的模型:
- Kling 适用于动作密集和物理细节丰富的镜头。
- Seedance 适用于较长片段、多参考工作流程和对话密集的场景。
- Veo 适用于精致的电影级真实感(如果可用)。
- FLUX 或其他模型适用于特定模型的视觉效果。
- 在每个镜头中引用相同的角色包。
- 生成变体,比较偏移,保留最能保持身份一致性的片段。
- 将优质帧保存回画布作为未来的参考。
- 在同一画布上进行剪辑、调色和序列组装。
目标不是让 GPT Image 2.0 完成所有工作。目标是让它生成每个视频模型所需的参考素材。

如何在 Flick 风格制作中使用 GPT Image 2.0
完整的静态图到视频流程如下:
1. 先构建角色,再制作场景
不要从复杂的动作镜头开始。从清晰的身份开始。
使用 GPT Image 2.0 提示词生成纯背景的肖像或全身参考图。保持光照简单。避免可能混淆角色轮廓的道具。
2. 创建参考设定表
使用 Thinking 模式并生成八角度批次。这为 Flick 的角色参考工作流提供了不止一张面孔。
3. 生成第一个场景静态图
角色锁定后,生成场景静态图。使用角色设定表中相同的身份保持语言,并将其应用到新场景中。完整的场景静态图提示词包含在底部的提示词示例部分。
4. 将静态图和设定表上传到 Flick
在 Flick 画布上,将角色设定表和场景静态图放置在相近位置。将它们视为你的镜头工具包。
5. 使用参考驱动的视频模型进行动画制作
选择场景静态图,生成视频,并附加角色参考。如果模型支持图像参考,使用设定表中最强的身份图像:正面、侧面、全身和表情。
如果模型支持命名提及或元素参考,使用稳定的标识符描述镜头。确切的 Flick 风格提示词包含在底部的提示词示例中。
6. 检查偏移
每次生成后,检查:
- 脸型
- 眼睛
- 发际线
- 服装颜色
- 配饰
- 身体比例
- 手部
- 侧面准确性
- 语音/语言对齐(如适用)
将最佳帧保存回画布。优质的输出帧可以成为后续镜头更好的参考。
GPT Image 2.0 提示词公式

GPT Image 2.0 对结构化提示词响应最佳。使用以下顺序:
- 输出类型:输出是什么。
- 主体:出现的人或物。
- 布局或镜头:图像的构图方式。
- 重要细节:必须保留的细节。
- 风格和光照:视觉效果。
- 约束条件:需要保留或避免的内容。
顺序很重要,因为模型会提前规划。如果你以模糊的描述开头,规划器会浪费注意力。如果你以输出类型和布局开头,它就知道要构建什么。所有可复制的提示词示例都收集在指南底部。
GPT Image 2.0 与其他工具对比
| 功能 | GPT Image 2.0 | Midjourney v8 | Nano Banana 2 |
|---|---|---|---|
| 图像文字 | 业界最佳 | 较弱 | 已改进 |
| 布局控制 | 强 | 中等 | 强 |
| 美学上限 | 强 | 仍是单帧基准 | 相当 |
| 批次一致性 | 每个提示词最多8张 | 无 | 无 |
| API | 公开 | 无公开API | 可用 |
| 速度 | Thinking模式中等 | 快 | 1-3秒 |
| 最佳用途 | 文字、布局、角色设定表 | 精美单帧画面 | 低成本批量和快速迭代 |
最简单的划分:
- 使用Midjourney生成单张精美静态图。
- 使用Nano Banana 2进行低成本批量和快速变体。
- 使用GPT Image 2.0处理文字、布局、可编辑参考和角色设定表。
- 使用Flick将这些静态图转化为一致的视频镜头。

最佳实践
- 在构建设定表之前,先从一个清晰的身份帧开始。
- 对于需要连贯性的工作使用 Thinking 模式。
- 将设定表作为一个批次生成,而不是八个独立的提示词。
- 精确重复不变要素:同一个人、同一套服装、同一种光照、同一种比例。
- 使用纯色背景作为参考。
- 保持配饰简单且一致。
- 按角色标注每个输入图像。
- 对参考包使用中等质量,对最终主要图像使用高质量。
- 将优质帧保存回你的 Flick 画布作为未来参考。
- 将每个好的输出视为可重用的制作素材,而不是一次性图像。
常见错误
错误 1:将单张肖像作为整个参考
单张肖像不足以制作多镜头视频。请添加侧面、背面、全身和表情参考。
错误 2:逐个生成参考图像
分开的提示词会产生偏差。使用一次 8 张图像批量生成,以确保参考表的一致性。
错误 3:更改保持一致性的描述语言
如果一个提示词说"深蓝色飞行员夹克",下一个说"蓝色外套",就会引发偏差。每次都粘贴相同的身份描述块。
错误 4:在没有布局的情况下要求精确文本
对于海报、标题卡和 UI,请在文案之前定义布局。模型需要先规划文本的位置。
错误 5:在锁定身份之前进行动画制作
如果将较弱的静态图像发送到视频模型,会得到较弱的锁定。请先构建参考包,然后再制作动画。
局限性
GPT Image 2.0 功能强大,但并非万能。
- 知识截止日期:2025 年 12 月,因此较新的产品、人物、事件和徽标可能不准确。
- 徽标:精确的品牌标识仍然不可靠。
- 思考延迟:15-30 秒的等待时间对于快速构思可能会感觉较慢。
- 跨不同会话的角色一致性:在批量生成中表现强劲,但在不相关的提示词之间较弱,除非使用参考图像和相同的保持描述语言。
- 微小文本:大标题和标签比法律文本大小的文字效果更好。
- 架构:OpenAI 尚未公开完整架构,因此工作流程建议应被视为经验性的生产指导。
提示词示例
身份框架提示词
真实照片,工作室参考肖像,一位二十多岁的快递员,铜色寸头,鼻梁上有雀斑,左耳戴银色圆环耳环,深蓝色飞行员夹克配黄色拉链,黑色工装裤,磨损的白色运动鞋,警觉但疲惫的表情,纯灰色背景,柔和均匀光线,无额外文字。
8 张图像角色表提示词
图像 1 中人物的角色参考表:同一个人,同一张脸,同一套服装,每张图像中相同的光线。一次生成 8 张连贯的参考图像:1) 正面视角,中性表情;2) 左侧轮廓;3) 右侧轮廓;4) 四分之三背面视角;5) 全身站立;6) 坐姿且手部可见;7) 微笑特写;8) 说话中特写。纯灰色背景,柔和均匀光线,照片级真实感。不要重新设计角色。不要改变服装、发型、面部、比例或配饰。
通用角色表提示词
[角色]的角色参考表。同一个人,同一套服装,每张图像中相同的光线。一次生成 8 张连贯图像:正面中性表情、左侧轮廓、右侧轮廓、四分之三背面、全身站立、坐姿且手部可见、微笑特写、说话中特写。纯灰色背景,柔和均匀光线,照片级真实感。不要重新设计角色。
提示词公式示例
角色参考表,照片级真实感。一位 60 多岁的灯塔看守人,留着短白胡须,鼻梁断过,奶油色麻花针织毛衣,深色油布外套,羊毛帽,厚重靴子。一次生成八张连贯图像:正面、左侧轮廓、右侧轮廓、四分之三背面、全身站立、坐姿且手部可见、微笑特写、说话特写。纯灰色背景,柔和均匀的影棚光线。每张图像中同一个人、同一套服装、同样的比例、相同的光线。无额外文字。
表情网格提示词
图像 1 中角色的表情网格。每个面板中同一张脸、同样的发型、同一套服装、相同的光线。4x4 网格中的 16 个面板:中性、微笑、大笑、担忧、恐惧、愤怒、呐喊、哭泣、疲惫、释然、怀疑、专注、惊讶、平静、说话中、倾听。纯色背景,半身构图,保持身份一致。
场景静帧提示词
图像 1 是角色参考表。创建一个电影静帧画面,同一个角色在午夜时分进入雨水浸湿的地铁站台。保持相同的面部、发型、夹克、比例和配饰。35mm 胶片感,顶部荧光灯作为主光源,湿润瓷砖的倒影,无额外文字。
影片静帧提示词
图像 1 中角色的电影静帧画面,凌晨 2 点穿过湿漉漉的霓虹小巷。保持相同的面部、发型、夹克、比例和配饰。35mm 胶片感,浅景深,蓝色阴影,面摊的橙色实际光源,背景中的蒸汽,无额外文字。
Flick 视频提示词
使用 @CharacterSheet 作为身份参考,使用 @SceneStill 作为起始帧。同一个快递员走上站台,回头张望,随着身后列车灯光闪烁而放慢脚步。保持面部、夹克、雀斑、耳环、比例和色彩调性。
海报提示词
极简电影海报,竖版。图片1中的角色以剪影形式站在积水走廊的尽头,一盏顶灯倒映在水面上。标题"LAST EXIT"使用细体白色衬线字母,居中放置在下三分之一处。下方有小字演职员表。不要添加额外文字,严格还原标题。
产品/布局提示词
三栏音乐节海报。左栏:粗体紧缩字体日期。中栏:做旧衬线字体标题"ONE LAST SUMMER"。右栏:小型大写字母阵容文字。日落海滩照片背景,褪色印刷质感,温暖的橙色和奶油色调色板。除指定文案外不要添加额外文字。
多图片编辑提示词
图片1是角色参考表。图片2是基础场景。将图片1中的角色放入图片2,匹配图片2的光照和相机角度。保留角色的面部、服装、比例和配饰。场景中的其他内容不做任何改动。
常见问题
什么是 GPT Image 2.0?
GPT Image 2.0 是 OpenAI 于 2026 年 4 月 21 日发布的图像生成和编辑模型。其 API 模型名称为 gpt-image-2。
GPT Image 2.0 免费吗?
即时模式在每个 ChatGPT 套餐上都可用,包括 Free。思考模式需要付费套餐,如 Plus、Pro、Business 或 Enterprise。API 使用根据图像/输出设置定价。
GPT Image 2.0 能保持角色一致性吗?
可以,尤其是在一个思考模式批次内。它可以从一个提示词生成多达八张连贯的图像,这使它非常适合制作角色设定表。对于不同的提示词,请使用参考图像并逐字重复相同的身份约束。
如何使用 GPT Image 2.0 制作角色设定表?
设计一个身份帧,然后使用思考模式在一个批次中生成八个参考视图:正面、左侧面、右侧面、四分之三背面、全身、坐姿手部、微笑特写和说话特写。使用相同人物/相同服装/相同光照约束。
GPT Image 2.0 角色表的成本是多少?
根据文章的估算,一个 8 张 1024×1024 图像的角色表在中等质量下约需 0.42 美元,在高质量下约需 1.69 美元。
GPT Image 2.0 比 Midjourney 更好吗?
在文字、布局、API 访问和角色设定表方面,是的。对于单张精美帧,Midjourney 可能仍然拥有更高的美学上限。
我可以将 GPT Image 2.0 图像用于 AI 视频吗?
可以。最强的工作流程是使用 GPT Image 2.0 生成角色参考表,将其上传到 Flick,并将同一设定表用作 Kling、Seedance、Veo 和 FLUX 等视频模型的角色参考。
在 Flick 中我应该将 GPT Image 2.0 用于什么?
将其用于角色设定表、场景静帧、标题卡、海报、产品参考和风格帧。然后使用 Flick 的画布为静帧制作动画、比较模型、保存参考并组装序列。