
GPT Image 2.0: O Guia Completo
Jul 2026
GPT Image 2.0 é o modelo de imagem da OpenAI para criadores que precisam de mais do que um quadro bonito. Ele gera imagens até 2K, renderiza texto multilíngue com mais precisão do que modelos de imagem anteriores da OpenAI e, no modo Thinking, pode produzir até oito imagens coerentes a partir de um prompt com o mesmo personagem em todo o lote.
Essa consistência em lote é a razão deste guia existir. Para cineastas de IA, GPT Image 2.0 não é apenas um gerador de imagens — é uma máquina rápida de folha de personagem. Gere o rosto, figurino, ângulos, expressões e referências de pose uma vez, depois use essa folha dentro do Flick para manter o mesmo personagem consistente em Kling, Seedance, Veo, FLUX e qualquer modelo que você use depois.
GPT Image 2.0, em resumo
- O que é: GPT Image 2.0, nome da API
gpt-image-2, é o modelo de geração e edição de imagens da OpenAI, lançado em 21 de abril de 2026. - Melhor caso de uso: imagens com muito layout, texto em imagens, pôsteres multilíngues, stills de produtos/cenas e fichas de personagens para vídeo com IA.
- Recurso principal para cinema: o modo Thinking pode gerar até oito imagens coerentes a partir de um único prompt, o que o torna ideal para pacotes de referência frontal/lateral/traseira/expressões.
- Modos: modo Thinking para planos pagos; modo Instant para exploração mais rápida e acesso no plano Free.
- Resolução: até 2K, com saída experimental de 2560×1440.
- API: suporta geração de imagens, edições, múltiplas imagens de entrada, lotes
n, níveis de qualidade e saídas PNG/JPEG/WebP. - Fluxo de trabalho: crie um personagem no GPT Image 2.0, transforme esse personagem em uma ficha de referência, faça upload para o Flick e depois anime a mesma identidade com modelos de vídeo orientados por referência.
- Veredito: use o GPT Image 2.0 como o departamento de arte e o Flick como o canvas de produção.

Transforme sua ficha de personagem em cenas
Faça upload da ficha uma vez. Mantenha o mesmo rosto em cada geração, em todos os modelos.
Especificações do GPT Image 2.0
| Especificação | GPT Image 2.0 |
|---|---|
| Data de lançamento | 21 de abril de 2026 |
| Nome do modelo na API | gpt-image-2 |
| Resolução | Até 2K; 2560×1440 experimental |
| Proporções de aspecto | 3:1 ultra-largo até 1:3 ultra-alto |
| Geração em lote | 1–8 imagens por prompt com o parâmetro n |
| Melhor recurso de continuidade | Lotes coerentes de 8 imagens no modo Thinking |
| Modos | Thinking e Instant |
| Acesso ao modo Thinking | Plus, Pro, Business, Enterprise |
| Acesso ao modo Instant | Todos os planos, incluindo Free |
| Renderização de texto | Forte, incluindo scripts não latinos como hindi e bengali |
| Formatos de saída | PNG, JPEG, WebP com controle de compressão |
| Limite de conhecimento | Dezembro de 2025 |
| Melhor uso no Flick | Folhas de personagem, stills de cena, pôster/arte-chave, pacotes de referências |
Modo Thinking vs modo Instant
GPT Image 2.0 tem duas personalidades práticas.
O modo Thinking raciocina antes de renderizar. Ele pode planejar o layout, buscar referências quando disponíveis, verificar detalhes e manter personagens ou objetos coerentes em um lote. Isso o torna o modo ideal quando um personagem aparecerá mais de uma vez.
A contrapartida é a velocidade. O modo Thinking pode levar de 15 a 30 segundos por geração, então não é a maneira mais rápida de esboçar ideias.
O modo Instant é para exploração. Ele mantém a mesma qualidade visual central, mas pula a etapa de raciocínio mais profunda. É mais rápido, disponível em todos os planos do ChatGPT e útil para encontrar uma estética antes de gastar tempo ou orçamento em uma ficha de personagem.
A regra simples:
- Use o Instant para moodboards, primeiras versões, miniaturas e exploração visual.
- Use o Thinking para personagens, produtos, pôsteres com texto e qualquer imagem que precise de continuidade.

Por que o GPT Image 2.0 é importante para vídeo com IA
A maioria dos problemas de consistência em vídeo com IA começa antes do modelo de vídeo. O modelo desvia porque o personagem nunca foi definido com clareza suficiente.
Um único retrato informa ao modelo de vídeo um ângulo, uma expressão e uma condição de iluminação. Uma ficha de referência informa a pessoa completa:
- formato do rosto
- cabelo
- guarda-roupa
- proporções
- acessórios
- vista frontal
- vistas laterais
- vista traseira
- corpo inteiro
- expressões em close-up
- mãos
- formatos de fala
- linha de base de iluminação
O lote de 8 imagens do GPT Image 2.0 fornece esse material em uma execução coerente. Em vez de solicitar oito imagens separadas e obter oito pessoas semelhantes, mas diferentes, você pode pedir o pacote completo de referência de uma vez. O lote é planejado como um conjunto único, então tende a concordar consigo mesmo.
Essa concordância é exatamente o que os modelos de vídeo baseados em referência recompensam.
O método da ficha de personagem

Este é o fluxo de trabalho para transformar o GPT Image 2.0 em uma ferramenta de produção.
Etapa 1: projete o quadro de identidade
Comece no modo Instant. Gere um retrato claro ou quadro de corpo inteiro até que o personagem valha a pena preservar.
Não use prompts vagos. Inclua detalhes concretos de identidade:
- faixa etária
- formato do rosto
- cor e corte do cabelo
- detalhes da pele
- marcas distintas
- guarda-roupa exato
- posicionamento de acessórios
- paleta de cores
- tipo de corpo
- base emocional
- mundo/estilo
Quando conseguir um design que funcione, salve-o. Este é o quadro de identidade. O exemplo exato de prompt do quadro de identidade está coletado na seção de exemplos de prompt no final.
Passo 2: gerar a folha de 8 imagens no modo Thinking
Use o quadro de identidade como imagem de referência. Então peça ao GPT Image 2.0 para produzir os ângulos e expressões que seus modelos de vídeo precisam.
Este é o truque central do GPT Image 2.0: use a coerência de lote do modelo para criar uma folha de contato que possa sobreviver à geração de vídeo subsequente. O prompt completo da folha de 8 imagens está coletado no final com os outros exemplos.
Passo 3: exportar o pacote de referência
Salve o lote como um pacote de referência limpo. Mantenha os arquivos organizados por ângulo:
frontal-neutroperfil-esquerdoperfil-direitotres-quartos-costascorpo-inteirosentado-maoscloseup-sorrisocloseup-fala
Se quiser uma folha mais forte, combine as imagens em uma única folha de contato e mantenha os quadros individuais também. As ferramentas de vídeo podem preferir referências individuais ou uma única folha dependendo do modelo.
Passo 4: trazer a folha para o Flick
No Flick, o GPT Image 2.0 se torna o departamento de arte e o canvas se torna o quadro de produção.
Um fluxo de trabalho prático no Flick:
- Abra um canvas novo ou o canvas do projeto para seu filme.
- Faça upload do quadro de identidade e da folha de referência do GPT Image 2.0.
- Use a folha como sua referência de personagem.
- Gere ou faça upload de uma imagem de cena.
- Selecione a imagem e escolha Gerar Vídeo.
- Escolha o modelo que se adequa à tomada:
- Kling para ação com muito movimento e detalhes físicos.
- Seedance para clipes mais longos, fluxos de trabalho com múltiplas referências e cenas com muito diálogo.
- Veo para realismo cinematográfico refinado, quando disponível.
- FLUX ou outros modelos para visuais específicos do modelo.
- Use o mesmo pacote de personagem como referência para cada tomada.
- Gere variações, compare desvios e mantenha o clipe que preserva melhor a identidade.
- Salve os melhores quadros de volta no canvas como referências futuras.
- Corte, faça a gradação de cor e monte a sequência no mesmo canvas.
O objetivo não é fazer o GPT Image 2.0 fazer tudo. O objetivo é fazê-lo produzir o material de referência que todo modelo de vídeo precisa.

Como usar GPT Image 2.0 na produção estilo Flick
Um pipeline completo de imagem para vídeo funciona assim:
1. Construa o personagem antes da cena
Não comece com uma cena de ação complexa. Comece com uma identidade limpa.
Crie um prompt no GPT Image 2.0 para um retrato ou referência de corpo inteiro com fundo simples. Mantenha a iluminação simples. Evite adereços que possam confundir a silhueta do personagem.
2. Crie a folha de referência
Use o modo Thinking e gere o lote de oito ângulos. Isso dá ao fluxo de trabalho de Referência de Personagem do Flick mais do que apenas um rosto para trabalhar.
3. Gere a primeira imagem de cena
Depois que o personagem estiver definido, gere a imagem da cena. Use a mesma linguagem de preservação de identidade da sua folha de personagem e aplique-a ao novo cenário. O prompt completo da imagem de cena está incluído na seção de exemplos de prompts no final.
4. Faça upload da imagem e da folha no Flick
No canvas do Flick, mantenha a folha de personagem e a imagem da cena próximas uma da outra. Trate-as como seu kit de cenas.
5. Anime com um modelo de vídeo baseado em referência
Selecione a imagem da cena, gere o vídeo e anexe a referência do personagem. Se o modelo suportar referências de imagem, use as imagens de identidade mais fortes da folha: frente, perfil, corpo inteiro e expressão.
Se o modelo suportar menções nomeadas ou referências de elementos, descreva a cena usando identificadores estáveis. O prompt exato no estilo Flick está incluído nos exemplos de prompts no final.
6. Revisar desvios
Após cada geração, verifique:
- formato do rosto
- olhos
- linha do cabelo
- cor da roupa
- acessórios
- proporções corporais
- mãos
- precisão do perfil lateral
- alinhamento de voz/fala, se aplicável
Salve os melhores quadros de volta ao canvas. Quadros de saída fortes podem se tornar melhores referências para cenas posteriores.
Fórmula de prompt para GPT Image 2.0

O GPT Image 2.0 responde melhor a prompts estruturados. Use esta ordem:
- Tipo de artefato: o que é a saída.
- Sujeito: quem ou o que aparece.
- Layout ou câmera: como a imagem é composta.
- Detalhes importantes: os detalhes que devem sobreviver.
- Estilo e iluminação: o acabamento visual.
- Restrições: o que preservar ou evitar.
A ordem importa porque o modelo planeja cedo. Se você começar com elogios vagos, o planejador desperdiça atenção. Se você começar com o artefato e o layout, ele sabe o que construir. Todos os exemplos de prompt para copiar e colar estão reunidos no final do guia.
GPT Image 2.0 vs. o mercado
| Recurso | GPT Image 2.0 | Midjourney v8 | Nano Banana 2 |
|---|---|---|---|
| Texto em imagens | O melhor da categoria | Fraco | Melhorado |
| Controle de layout | Forte | Médio | Forte |
| Limite estético | Forte | Ainda a referência para quadros únicos | Comparável |
| Lotes consistentes | Até 8 por prompt | Não | Não |
| API | Pública | Sem API pública | Disponível |
| Velocidade | Média no modo Thinking | Rápida | 1–3s |
| Melhor uso | Texto, layout, fichas de personagens | Quadros únicos lindos | Volume barato e iteração rápida |
A divisão mais simples:
- Use Midjourney para uma bela imagem estática.
- Use Nano Banana 2 para volume barato e variantes rápidas.
- Use GPT Image 2.0 para texto, layout, referências editáveis e fichas de personagens.
- Use Flick para transformar essas imagens estáticas em cenas de vídeo consistentes.

Melhores práticas
- Comece com um quadro de identidade limpo antes de construir uma ficha.
- Use o modo Thinking para trabalhos sensíveis à continuidade.
- Gere a ficha como um lote único, não oito prompts separados.
- Repita invariantes exatamente: mesma pessoa, mesma roupa, mesma iluminação, mesmas proporções.
- Use fundos simples para referências.
- Mantenha os acessórios simples e consistentes.
- Identifique cada imagem de entrada por função.
- Use qualidade média para pacotes de referência e alta qualidade para imagens finais principais.
- Salve quadros fortes de volta ao seu canvas do Flick como referências futuras.
- Trate cada boa saída como material de produção reutilizável, não como uma imagem descartável.
Erros comuns
Erro 1: usar um retrato como toda a referência
Um retrato não é suficiente para vídeo com múltiplas cenas. Adicione referências de perfil, costas, corpo inteiro e expressões.
Erro 2: gerar referências uma por vez
Prompts separados criam inconsistências. Use um lote de 8 imagens para que a folha concorde consigo mesma.
Erro 3: mudar a linguagem de preservação
Se um prompt diz "jaqueta bomber azul-marinho" e o próximo diz "jaqueta azul," você convida inconsistências. Cole o mesmo bloco de identidade toda vez.
Erro 4: pedir texto preciso sem layout
Para pôsteres, cartelas de título e interface, defina o layout antes do texto. O modelo precisa planejar onde o texto vai.
Erro 5: animar antes de fixar a identidade
Se você envia uma imagem estática fraca para um modelo de vídeo, você obtém uma fixação fraca. Construa o pacote de referências primeiro, depois anime.
Limitações
GPT Image 2.0 é poderoso, mas não é mágica.
- Corte de conhecimento: dezembro de 2025, então produtos, pessoas, eventos e logos mais recentes podem não ser precisos.
- Logos: marcas precisas ainda são pouco confiáveis.
- Latência de processamento: 15–30 segundos podem parecer lentos para ideação rápida.
- Consistência de personagem entre sessões separadas: forte em um lote, mais fraca entre prompts não relacionados, a menos que você use referências e linguagem de preservação idêntica.
- Texto pequeno: títulos e rótulos grandes funcionam melhor do que texto em tamanho de texto legal.
- Arquitetura: a OpenAI não divulgou a arquitetura completa, então alegações de fluxo de trabalho devem ser tratadas como orientação de produção empírica.
Exemplos de prompt
Prompt de quadro de identidade
Fotografia real, retrato de referência de estúdio de um entregador no final dos 20 anos, cabelo cobre raspado, sardas no nariz, argola de prata na orelha esquerda, jaqueta bomber azul marinho com zíper amarelo, calça cargo preta, tênis branco gasto, expressão alerta mas cansada, fundo cinza liso, luz suave e uniforme, sem texto extra.
Prompt de ficha de personagem com 8 imagens
Ficha de referência de personagem da pessoa na Imagem 1: mesma pessoa, mesmo rosto, mesma roupa, mesma iluminação em todas as imagens. Gere 8 imagens de referência coerentes em um único lote: 1) vista frontal, expressão neutra; 2) perfil esquerdo; 3) perfil direito; 4) vista três quartos de costas; 5) corpo inteiro em pé; 6) sentado com as mãos visíveis; 7) close-up sorrindo; 8) close-up falando. Fundo cinza liso, luz suave e uniforme, fotorrealista. Não redesenhe o personagem. Não altere roupa, cabelo, rosto, proporções ou acessórios.
Prompt geral de ficha de personagem
Ficha de referência de personagem de [CHARACTER]. Mesma pessoa, mesma roupa, mesma iluminação em todas as imagens. Gere 8 imagens coerentes em um único lote: frontal neutro, perfil esquerdo, perfil direito, três quartos de costas, corpo inteiro em pé, sentado com as mãos visíveis, close-up sorrindo, close-up falando. Fundo cinza liso, luz suave e uniforme, fotorrealista. Não redesenhe o personagem.
Exemplo de fórmula de prompt
Ficha de referência de personagem, fotorrealista. Um faroleiro na faixa dos 60 anos com barba branca curta, nariz quebrado, suéter creme de tricô trançado, casaco escuro impermeável, gorro de lã, botas pesadas. Oito imagens coerentes em um único lote: frontal, perfil esquerdo, perfil direito, três quartos de costas, corpo inteiro em pé, sentado com as mãos visíveis, close-up sorrindo, close-up falando. Fundo cinza liso, luz suave e uniforme de estúdio. Mesma pessoa, mesma roupa, mesmas proporções, mesma iluminação em todas as imagens. Sem texto extra.
Prompt de grade de expressões
Grade de expressões do personagem na Imagem 1. Mesmo rosto, mesmo cabelo, mesma roupa, mesma iluminação em todos os painéis. 16 painéis em uma grade 4x4: neutro, sorriso, riso, preocupação, medo, raiva, gritando, chorando, exausto, aliviado, desconfiado, focado, surpreso, calmo, falando, ouvindo. Fundo liso, enquadramento de busto, identidade consistente.
Prompt de frame de cena
A Imagem 1 é a ficha de referência do personagem. Crie um frame cinematográfico do mesmo personagem entrando em uma plataforma de metrô encharcada pela chuva à meia-noite. Preserve o mesmo rosto, cabelo, jaqueta, proporções e acessórios. Estética 35mm, luz fluorescente motivada vinda do teto, reflexos em azulejos molhados, sem texto extra.
Prompt de frame de filme
Frame cinematográfico do personagem na Imagem 1 atravessando um beco molhado com neon às 2h da manhã. Preserve o mesmo rosto, cabelo, jaqueta, proporções e acessórios. Estética 35mm, profundidade de campo rasa, sombras azuis, luz prática laranja de uma barraca de macarrão, vapor ao fundo, sem texto extra.
Prompt de vídeo Flick
Use @CharacterSheet como a referência de identidade e @SceneStill como o frame inicial. O mesmo entregador pisa na plataforma, olha por cima do ombro e desacelera enquanto as luzes do trem piscam atrás dele. Preserve rosto, jaqueta, sardas, brincos, proporções e paleta de cores.
Prompt de pôster
Pôster de filme minimalista, vertical. O personagem da Imagem 1 está em silhueta no final de um corredor inundado, uma luz suspensa refletida na água. Título "LAST EXIT" em letras serifadas brancas finas, centralizado no terço inferior. Pequeno bloco de créditos abaixo. Sem texto extra, renderização literal do título.
Prompt de produto/layout
Pôster de festival em três colunas. Coluna esquerda: datas em tipo condensado negrito. Coluna central: título "ONE LAST SUMMER" em serifada desgastada. Coluna direita: texto de lineup em versalete. Fundo com foto de praia ao pôr do sol, textura de impressão desbotada, paleta laranja quente e creme. Sem texto extra além do especificado.
Prompt de edição multi-imagem
Imagem 1 é a folha de referência do personagem. Imagem 2 é a cena base. Coloque o personagem da Imagem 1 na Imagem 2, combinando com a iluminação e ângulo de câmera da Imagem 2. Preserve o rosto, roupa, proporções e acessórios do personagem. Não altere nada mais na cena.
Perguntas Frequentes
O que é o GPT Image 2.0?
O GPT Image 2.0 é o modelo de geração e edição de imagens da OpenAI, lançado em 21 de abril de 2026. O nome do modelo na API é gpt-image-2.
O GPT Image 2.0 é gratuito?
O modo Instant está disponível em todos os planos do ChatGPT, incluindo o Free. O modo Thinking requer um plano pago como Plus, Pro, Business ou Enterprise. O uso da API é precificado por imagem/configurações de saída.
O GPT Image 2.0 pode manter personagens consistentes?
Sim, especialmente dentro de um lote do modo Thinking. Ele pode gerar até oito imagens coerentes a partir de um único prompt, o que o torna útil para fichas de personagens. Entre prompts separados, use imagens de referência e repita as mesmas restrições de identidade literalmente.
Como faço uma ficha de personagem com o GPT Image 2.0?
Crie um quadro de identidade, depois use o modo Thinking para gerar oito visualizações de referência em um lote: frontal, perfil esquerdo, perfil direito, três quartos de trás, corpo inteiro, mãos sentadas, close-up sorrindo e close-up falando. Use a restrição mesma-pessoa/mesma-roupa/mesma-iluminação.
Quanto custa uma folha de personagem do GPT Image 2.0?
Com base nas estimativas de trabalho do artigo, uma folha de 8 imagens 1024×1024 custa cerca de $0,42 em qualidade média e cerca de $1,69 em qualidade alta.
O GPT Image 2.0 é melhor que o Midjourney?
Para texto, layout, acesso à API e fichas de personagens, sim. Para um único quadro bonito, o Midjourney ainda pode ter um teto estético mais alto.
Posso usar imagens do GPT Image 2.0 para vídeo com IA?
Sim. O fluxo de trabalho mais forte é gerar uma ficha de referência de personagem com o GPT Image 2.0, fazer upload para o Flick e usar a mesma ficha como referência de personagem para modelos de vídeo como Kling, Seedance, Veo e FLUX.
Para que devo usar o GPT Image 2.0 no Flick?
Use-o para fichas de personagens, stills de cena, cartelas de título, pôsteres, referências de produtos e quadros de estilo. Depois use o canvas do Flick para animar os stills, comparar modelos, salvar referências e montar a sequência.