GPT Image 2.0: O Guia Completo

· Filmmaker interno no Flick · LinkedIn

Jul 2026

GPT Image 2.0 é o modelo de imagem da OpenAI para criadores que precisam de mais do que um quadro bonito. Ele gera imagens até 2K, renderiza texto multilíngue com mais precisão do que modelos de imagem anteriores da OpenAI e, no modo Thinking, pode produzir até oito imagens coerentes a partir de um prompt com o mesmo personagem em todo o lote.

Essa consistência em lote é a razão deste guia existir. Para cineastas de IA, GPT Image 2.0 não é apenas um gerador de imagens — é uma máquina rápida de folha de personagem. Gere o rosto, figurino, ângulos, expressões e referências de pose uma vez, depois use essa folha dentro do Flick para manter o mesmo personagem consistente em Kling, Seedance, Veo, FLUX e qualquer modelo que você use depois.

GPT Image 2.0, em resumo

  • O que é: GPT Image 2.0, nome da API gpt-image-2, é o modelo de geração e edição de imagens da OpenAI, lançado em 21 de abril de 2026.
  • Melhor caso de uso: imagens com muito layout, texto em imagens, pôsteres multilíngues, stills de produtos/cenas e fichas de personagens para vídeo com IA.
  • Recurso principal para cinema: o modo Thinking pode gerar até oito imagens coerentes a partir de um único prompt, o que o torna ideal para pacotes de referência frontal/lateral/traseira/expressões.
  • Modos: modo Thinking para planos pagos; modo Instant para exploração mais rápida e acesso no plano Free.
  • Resolução: até 2K, com saída experimental de 2560×1440.
  • API: suporta geração de imagens, edições, múltiplas imagens de entrada, lotes n, níveis de qualidade e saídas PNG/JPEG/WebP.
  • Fluxo de trabalho: crie um personagem no GPT Image 2.0, transforme esse personagem em uma ficha de referência, faça upload para o Flick e depois anime a mesma identidade com modelos de vídeo orientados por referência.
  • Veredito: use o GPT Image 2.0 como o departamento de arte e o Flick como o canvas de produção.
Image

Transforme sua ficha de personagem em cenas

Faça upload da ficha uma vez. Mantenha o mesmo rosto em cada geração, em todos os modelos.

Especificações do GPT Image 2.0

EspecificaçãoGPT Image 2.0
Data de lançamento21 de abril de 2026
Nome do modelo na APIgpt-image-2
ResoluçãoAté 2K; 2560×1440 experimental
Proporções de aspecto3:1 ultra-largo até 1:3 ultra-alto
Geração em lote1–8 imagens por prompt com o parâmetro n
Melhor recurso de continuidadeLotes coerentes de 8 imagens no modo Thinking
ModosThinking e Instant
Acesso ao modo ThinkingPlus, Pro, Business, Enterprise
Acesso ao modo InstantTodos os planos, incluindo Free
Renderização de textoForte, incluindo scripts não latinos como hindi e bengali
Formatos de saídaPNG, JPEG, WebP com controle de compressão
Limite de conhecimentoDezembro de 2025
Melhor uso no FlickFolhas de personagem, stills de cena, pôster/arte-chave, pacotes de referências

Modo Thinking vs modo Instant

GPT Image 2.0 tem duas personalidades práticas.

O modo Thinking raciocina antes de renderizar. Ele pode planejar o layout, buscar referências quando disponíveis, verificar detalhes e manter personagens ou objetos coerentes em um lote. Isso o torna o modo ideal quando um personagem aparecerá mais de uma vez.

A contrapartida é a velocidade. O modo Thinking pode levar de 15 a 30 segundos por geração, então não é a maneira mais rápida de esboçar ideias.

O modo Instant é para exploração. Ele mantém a mesma qualidade visual central, mas pula a etapa de raciocínio mais profunda. É mais rápido, disponível em todos os planos do ChatGPT e útil para encontrar uma estética antes de gastar tempo ou orçamento em uma ficha de personagem.

A regra simples:

  • Use o Instant para moodboards, primeiras versões, miniaturas e exploração visual.
  • Use o Thinking para personagens, produtos, pôsteres com texto e qualquer imagem que precise de continuidade.
Image

Por que o GPT Image 2.0 é importante para vídeo com IA

A maioria dos problemas de consistência em vídeo com IA começa antes do modelo de vídeo. O modelo desvia porque o personagem nunca foi definido com clareza suficiente.

Um único retrato informa ao modelo de vídeo um ângulo, uma expressão e uma condição de iluminação. Uma ficha de referência informa a pessoa completa:

  • formato do rosto
  • cabelo
  • guarda-roupa
  • proporções
  • acessórios
  • vista frontal
  • vistas laterais
  • vista traseira
  • corpo inteiro
  • expressões em close-up
  • mãos
  • formatos de fala
  • linha de base de iluminação

O lote de 8 imagens do GPT Image 2.0 fornece esse material em uma execução coerente. Em vez de solicitar oito imagens separadas e obter oito pessoas semelhantes, mas diferentes, você pode pedir o pacote completo de referência de uma vez. O lote é planejado como um conjunto único, então tende a concordar consigo mesmo.

Essa concordância é exatamente o que os modelos de vídeo baseados em referência recompensam.

O método da ficha de personagem

Image

Este é o fluxo de trabalho para transformar o GPT Image 2.0 em uma ferramenta de produção.

Etapa 1: projete o quadro de identidade

Comece no modo Instant. Gere um retrato claro ou quadro de corpo inteiro até que o personagem valha a pena preservar.

Não use prompts vagos. Inclua detalhes concretos de identidade:

  • faixa etária
  • formato do rosto
  • cor e corte do cabelo
  • detalhes da pele
  • marcas distintas
  • guarda-roupa exato
  • posicionamento de acessórios
  • paleta de cores
  • tipo de corpo
  • base emocional
  • mundo/estilo

Quando conseguir um design que funcione, salve-o. Este é o quadro de identidade. O exemplo exato de prompt do quadro de identidade está coletado na seção de exemplos de prompt no final.

Passo 2: gerar a folha de 8 imagens no modo Thinking

Use o quadro de identidade como imagem de referência. Então peça ao GPT Image 2.0 para produzir os ângulos e expressões que seus modelos de vídeo precisam.

Este é o truque central do GPT Image 2.0: use a coerência de lote do modelo para criar uma folha de contato que possa sobreviver à geração de vídeo subsequente. O prompt completo da folha de 8 imagens está coletado no final com os outros exemplos.

Passo 3: exportar o pacote de referência

Salve o lote como um pacote de referência limpo. Mantenha os arquivos organizados por ângulo:

  • frontal-neutro
  • perfil-esquerdo
  • perfil-direito
  • tres-quartos-costas
  • corpo-inteiro
  • sentado-maos
  • closeup-sorriso
  • closeup-fala

Se quiser uma folha mais forte, combine as imagens em uma única folha de contato e mantenha os quadros individuais também. As ferramentas de vídeo podem preferir referências individuais ou uma única folha dependendo do modelo.

Passo 4: trazer a folha para o Flick

No Flick, o GPT Image 2.0 se torna o departamento de arte e o canvas se torna o quadro de produção.

Um fluxo de trabalho prático no Flick:

  1. Abra um canvas novo ou o canvas do projeto para seu filme.
  2. Faça upload do quadro de identidade e da folha de referência do GPT Image 2.0.
  3. Use a folha como sua referência de personagem.
  4. Gere ou faça upload de uma imagem de cena.
  5. Selecione a imagem e escolha Gerar Vídeo.
  6. Escolha o modelo que se adequa à tomada:
    • Kling para ação com muito movimento e detalhes físicos.
    • Seedance para clipes mais longos, fluxos de trabalho com múltiplas referências e cenas com muito diálogo.
    • Veo para realismo cinematográfico refinado, quando disponível.
    • FLUX ou outros modelos para visuais específicos do modelo.
  7. Use o mesmo pacote de personagem como referência para cada tomada.
  8. Gere variações, compare desvios e mantenha o clipe que preserva melhor a identidade.
  9. Salve os melhores quadros de volta no canvas como referências futuras.
  10. Corte, faça a gradação de cor e monte a sequência no mesmo canvas.

O objetivo não é fazer o GPT Image 2.0 fazer tudo. O objetivo é fazê-lo produzir o material de referência que todo modelo de vídeo precisa.

Image

Como usar GPT Image 2.0 na produção estilo Flick

Um pipeline completo de imagem para vídeo funciona assim:

1. Construa o personagem antes da cena

Não comece com uma cena de ação complexa. Comece com uma identidade limpa.

Crie um prompt no GPT Image 2.0 para um retrato ou referência de corpo inteiro com fundo simples. Mantenha a iluminação simples. Evite adereços que possam confundir a silhueta do personagem.

2. Crie a folha de referência

Use o modo Thinking e gere o lote de oito ângulos. Isso dá ao fluxo de trabalho de Referência de Personagem do Flick mais do que apenas um rosto para trabalhar.

3. Gere a primeira imagem de cena

Depois que o personagem estiver definido, gere a imagem da cena. Use a mesma linguagem de preservação de identidade da sua folha de personagem e aplique-a ao novo cenário. O prompt completo da imagem de cena está incluído na seção de exemplos de prompts no final.

4. Faça upload da imagem e da folha no Flick

No canvas do Flick, mantenha a folha de personagem e a imagem da cena próximas uma da outra. Trate-as como seu kit de cenas.

5. Anime com um modelo de vídeo baseado em referência

Selecione a imagem da cena, gere o vídeo e anexe a referência do personagem. Se o modelo suportar referências de imagem, use as imagens de identidade mais fortes da folha: frente, perfil, corpo inteiro e expressão.

Se o modelo suportar menções nomeadas ou referências de elementos, descreva a cena usando identificadores estáveis. O prompt exato no estilo Flick está incluído nos exemplos de prompts no final.

6. Revisar desvios

Após cada geração, verifique:

  • formato do rosto
  • olhos
  • linha do cabelo
  • cor da roupa
  • acessórios
  • proporções corporais
  • mãos
  • precisão do perfil lateral
  • alinhamento de voz/fala, se aplicável

Salve os melhores quadros de volta ao canvas. Quadros de saída fortes podem se tornar melhores referências para cenas posteriores.

Fórmula de prompt para GPT Image 2.0

Image

O GPT Image 2.0 responde melhor a prompts estruturados. Use esta ordem:

  1. Tipo de artefato: o que é a saída.
  2. Sujeito: quem ou o que aparece.
  3. Layout ou câmera: como a imagem é composta.
  4. Detalhes importantes: os detalhes que devem sobreviver.
  5. Estilo e iluminação: o acabamento visual.
  6. Restrições: o que preservar ou evitar.

A ordem importa porque o modelo planeja cedo. Se você começar com elogios vagos, o planejador desperdiça atenção. Se você começar com o artefato e o layout, ele sabe o que construir. Todos os exemplos de prompt para copiar e colar estão reunidos no final do guia.

GPT Image 2.0 vs. o mercado

RecursoGPT Image 2.0Midjourney v8Nano Banana 2
Texto em imagensO melhor da categoriaFracoMelhorado
Controle de layoutForteMédioForte
Limite estéticoForteAinda a referência para quadros únicosComparável
Lotes consistentesAté 8 por promptNãoNão
APIPúblicaSem API públicaDisponível
VelocidadeMédia no modo ThinkingRápida1–3s
Melhor usoTexto, layout, fichas de personagensQuadros únicos lindosVolume barato e iteração rápida

A divisão mais simples:

  • Use Midjourney para uma bela imagem estática.
  • Use Nano Banana 2 para volume barato e variantes rápidas.
  • Use GPT Image 2.0 para texto, layout, referências editáveis e fichas de personagens.
  • Use Flick para transformar essas imagens estáticas em cenas de vídeo consistentes.
Image

Melhores práticas

  • Comece com um quadro de identidade limpo antes de construir uma ficha.
  • Use o modo Thinking para trabalhos sensíveis à continuidade.
  • Gere a ficha como um lote único, não oito prompts separados.
  • Repita invariantes exatamente: mesma pessoa, mesma roupa, mesma iluminação, mesmas proporções.
  • Use fundos simples para referências.
  • Mantenha os acessórios simples e consistentes.
  • Identifique cada imagem de entrada por função.
  • Use qualidade média para pacotes de referência e alta qualidade para imagens finais principais.
  • Salve quadros fortes de volta ao seu canvas do Flick como referências futuras.
  • Trate cada boa saída como material de produção reutilizável, não como uma imagem descartável.

Erros comuns

Erro 1: usar um retrato como toda a referência

Um retrato não é suficiente para vídeo com múltiplas cenas. Adicione referências de perfil, costas, corpo inteiro e expressões.

Erro 2: gerar referências uma por vez

Prompts separados criam inconsistências. Use um lote de 8 imagens para que a folha concorde consigo mesma.

Erro 3: mudar a linguagem de preservação

Se um prompt diz "jaqueta bomber azul-marinho" e o próximo diz "jaqueta azul," você convida inconsistências. Cole o mesmo bloco de identidade toda vez.

Erro 4: pedir texto preciso sem layout

Para pôsteres, cartelas de título e interface, defina o layout antes do texto. O modelo precisa planejar onde o texto vai.

Erro 5: animar antes de fixar a identidade

Se você envia uma imagem estática fraca para um modelo de vídeo, você obtém uma fixação fraca. Construa o pacote de referências primeiro, depois anime.

Limitações

GPT Image 2.0 é poderoso, mas não é mágica.

  • Corte de conhecimento: dezembro de 2025, então produtos, pessoas, eventos e logos mais recentes podem não ser precisos.
  • Logos: marcas precisas ainda são pouco confiáveis.
  • Latência de processamento: 15–30 segundos podem parecer lentos para ideação rápida.
  • Consistência de personagem entre sessões separadas: forte em um lote, mais fraca entre prompts não relacionados, a menos que você use referências e linguagem de preservação idêntica.
  • Texto pequeno: títulos e rótulos grandes funcionam melhor do que texto em tamanho de texto legal.
  • Arquitetura: a OpenAI não divulgou a arquitetura completa, então alegações de fluxo de trabalho devem ser tratadas como orientação de produção empírica.

Exemplos de prompt

Prompt de quadro de identidade

Fotografia real, retrato de referência de estúdio de um entregador no final dos 20 anos, cabelo cobre raspado, sardas no nariz, argola de prata na orelha esquerda, jaqueta bomber azul marinho com zíper amarelo, calça cargo preta, tênis branco gasto, expressão alerta mas cansada, fundo cinza liso, luz suave e uniforme, sem texto extra.

Prompt de ficha de personagem com 8 imagens

Ficha de referência de personagem da pessoa na Imagem 1: mesma pessoa, mesmo rosto, mesma roupa, mesma iluminação em todas as imagens. Gere 8 imagens de referência coerentes em um único lote: 1) vista frontal, expressão neutra; 2) perfil esquerdo; 3) perfil direito; 4) vista três quartos de costas; 5) corpo inteiro em pé; 6) sentado com as mãos visíveis; 7) close-up sorrindo; 8) close-up falando. Fundo cinza liso, luz suave e uniforme, fotorrealista. Não redesenhe o personagem. Não altere roupa, cabelo, rosto, proporções ou acessórios.

Prompt geral de ficha de personagem

Ficha de referência de personagem de [CHARACTER]. Mesma pessoa, mesma roupa, mesma iluminação em todas as imagens. Gere 8 imagens coerentes em um único lote: frontal neutro, perfil esquerdo, perfil direito, três quartos de costas, corpo inteiro em pé, sentado com as mãos visíveis, close-up sorrindo, close-up falando. Fundo cinza liso, luz suave e uniforme, fotorrealista. Não redesenhe o personagem.

Exemplo de fórmula de prompt

Ficha de referência de personagem, fotorrealista. Um faroleiro na faixa dos 60 anos com barba branca curta, nariz quebrado, suéter creme de tricô trançado, casaco escuro impermeável, gorro de lã, botas pesadas. Oito imagens coerentes em um único lote: frontal, perfil esquerdo, perfil direito, três quartos de costas, corpo inteiro em pé, sentado com as mãos visíveis, close-up sorrindo, close-up falando. Fundo cinza liso, luz suave e uniforme de estúdio. Mesma pessoa, mesma roupa, mesmas proporções, mesma iluminação em todas as imagens. Sem texto extra.

Prompt de grade de expressões

Grade de expressões do personagem na Imagem 1. Mesmo rosto, mesmo cabelo, mesma roupa, mesma iluminação em todos os painéis. 16 painéis em uma grade 4x4: neutro, sorriso, riso, preocupação, medo, raiva, gritando, chorando, exausto, aliviado, desconfiado, focado, surpreso, calmo, falando, ouvindo. Fundo liso, enquadramento de busto, identidade consistente.

Prompt de frame de cena

A Imagem 1 é a ficha de referência do personagem. Crie um frame cinematográfico do mesmo personagem entrando em uma plataforma de metrô encharcada pela chuva à meia-noite. Preserve o mesmo rosto, cabelo, jaqueta, proporções e acessórios. Estética 35mm, luz fluorescente motivada vinda do teto, reflexos em azulejos molhados, sem texto extra.

Prompt de frame de filme

Frame cinematográfico do personagem na Imagem 1 atravessando um beco molhado com neon às 2h da manhã. Preserve o mesmo rosto, cabelo, jaqueta, proporções e acessórios. Estética 35mm, profundidade de campo rasa, sombras azuis, luz prática laranja de uma barraca de macarrão, vapor ao fundo, sem texto extra.

Prompt de vídeo Flick

Use @CharacterSheet como a referência de identidade e @SceneStill como o frame inicial. O mesmo entregador pisa na plataforma, olha por cima do ombro e desacelera enquanto as luzes do trem piscam atrás dele. Preserve rosto, jaqueta, sardas, brincos, proporções e paleta de cores.

Prompt de pôster

Pôster de filme minimalista, vertical. O personagem da Imagem 1 está em silhueta no final de um corredor inundado, uma luz suspensa refletida na água. Título "LAST EXIT" em letras serifadas brancas finas, centralizado no terço inferior. Pequeno bloco de créditos abaixo. Sem texto extra, renderização literal do título.

Prompt de produto/layout

Pôster de festival em três colunas. Coluna esquerda: datas em tipo condensado negrito. Coluna central: título "ONE LAST SUMMER" em serifada desgastada. Coluna direita: texto de lineup em versalete. Fundo com foto de praia ao pôr do sol, textura de impressão desbotada, paleta laranja quente e creme. Sem texto extra além do especificado.

Prompt de edição multi-imagem

Imagem 1 é a folha de referência do personagem. Imagem 2 é a cena base. Coloque o personagem da Imagem 1 na Imagem 2, combinando com a iluminação e ângulo de câmera da Imagem 2. Preserve o rosto, roupa, proporções e acessórios do personagem. Não altere nada mais na cena.

Perguntas Frequentes

O que é o GPT Image 2.0?

O GPT Image 2.0 é o modelo de geração e edição de imagens da OpenAI, lançado em 21 de abril de 2026. O nome do modelo na API é gpt-image-2.

O GPT Image 2.0 é gratuito?

O modo Instant está disponível em todos os planos do ChatGPT, incluindo o Free. O modo Thinking requer um plano pago como Plus, Pro, Business ou Enterprise. O uso da API é precificado por imagem/configurações de saída.

O GPT Image 2.0 pode manter personagens consistentes?

Sim, especialmente dentro de um lote do modo Thinking. Ele pode gerar até oito imagens coerentes a partir de um único prompt, o que o torna útil para fichas de personagens. Entre prompts separados, use imagens de referência e repita as mesmas restrições de identidade literalmente.

Como faço uma ficha de personagem com o GPT Image 2.0?

Crie um quadro de identidade, depois use o modo Thinking para gerar oito visualizações de referência em um lote: frontal, perfil esquerdo, perfil direito, três quartos de trás, corpo inteiro, mãos sentadas, close-up sorrindo e close-up falando. Use a restrição mesma-pessoa/mesma-roupa/mesma-iluminação.

Quanto custa uma folha de personagem do GPT Image 2.0?

Com base nas estimativas de trabalho do artigo, uma folha de 8 imagens 1024×1024 custa cerca de $0,42 em qualidade média e cerca de $1,69 em qualidade alta.

O GPT Image 2.0 é melhor que o Midjourney?

Para texto, layout, acesso à API e fichas de personagens, sim. Para um único quadro bonito, o Midjourney ainda pode ter um teto estético mais alto.

Posso usar imagens do GPT Image 2.0 para vídeo com IA?

Sim. O fluxo de trabalho mais forte é gerar uma ficha de referência de personagem com o GPT Image 2.0, fazer upload para o Flick e usar a mesma ficha como referência de personagem para modelos de vídeo como Kling, Seedance, Veo e FLUX.

Para que devo usar o GPT Image 2.0 no Flick?

Use-o para fichas de personagens, stills de cena, cartelas de título, pôsteres, referências de produtos e quadros de estilo. Depois use o canvas do Flick para animar os stills, comparar modelos, salvar referências e montar a sequência.