
GPT Image 2.0: La Guía Completa
Jul 2026
GPT Image 2.0 es el modelo de imagen de OpenAI para creadores que necesitan más que un cuadro hermoso. Genera imágenes de hasta 2K, renderiza texto multilingüe con mayor precisión que los modelos de imagen anteriores de OpenAI, y en modo Thinking puede producir hasta ocho imágenes coherentes a partir de un solo prompt con el mismo personaje en todo el lote.
Esa consistencia de lote es la razón por la que existe esta guía. Para cineastas de IA, GPT Image 2.0 no es solo un generador de imágenes — es una máquina rápida de hojas de personaje. Genera el rostro, vestuario, ángulos, expresiones y referencias de pose una vez, luego usa esa hoja dentro de Flick para mantener el mismo personaje consistente a través de Kling, Seedance, Veo, FLUX y cualquier modelo que uses después.
GPT Image 2.0, de un vistazo
- Qué es: GPT Image 2.0, nombre de API
gpt-image-2, es el modelo de generación y edición de imágenes de OpenAI, lanzado el 21 de abril de 2026. - Mejor caso de uso: imágenes con diseños complejos, texto en imágenes, pósteres multilingües, fotogramas de productos/escenas y hojas de personajes para vídeo con IA.
- Característica clave para cine: el modo Thinking puede generar hasta ocho imágenes coherentes desde un único prompt, lo que lo hace ideal para paquetes de referencia frontal/lateral/trasera/expresiones.
- Modos: modo Thinking para niveles de pago; modo Instant para exploración más rápida y acceso en nivel Free.
- Resolución: hasta 2K, con salida experimental de 2560×1440.
- API: soporta generación de imágenes, ediciones, entradas de múltiples imágenes, lotes
n, niveles de calidad y salidas PNG/JPEG/WebP. - Flujo de trabajo: diseña un personaje en GPT Image 2.0, conviértelo en una hoja de referencia, súbelo a Flick y luego anima la misma identidad con modelos de vídeo basados en referencia.
- Veredicto: usa GPT Image 2.0 como el departamento de arte y Flick como el lienzo de producción.

Convierte tu hoja de personaje en tomas
Sube la hoja una vez. Mantén el mismo rostro en cada generación, en cada modelo.
Especificaciones de GPT Image 2.0
| Especificación | GPT Image 2.0 |
|---|---|
| Fecha de lanzamiento | 21 de abril de 2026 |
| Nombre del modelo API | gpt-image-2 |
| Resolución | Hasta 2K; experimental 2560×1440 |
| Relaciones de aspecto | Ultra ancho 3:1 hasta ultra alto 1:3 |
| Generación por lotes | 1–8 imágenes por prompt con el parámetro n |
| Mejor característica de continuidad | Lotes coherentes de 8 imágenes en modo Thinking |
| Modos | Thinking e Instant |
| Acceso al modo Thinking | Plus, Pro, Business, Enterprise |
| Acceso al modo Instant | Todos los niveles, incluido el gratuito |
| Renderizado de texto | Fuerte, incluidos scripts no latinos como hindi y bengalí |
| Formatos de salida | PNG, JPEG, WebP con control de compresión |
| Límite de conocimiento | Diciembre de 2025 |
| Mejor uso en Flick | Hojas de personaje, fotogramas de escena, póster/arte clave, paquetes de referencia |
Modo Thinking vs modo Instant
GPT Image 2.0 tiene dos personalidades prácticas.
El modo Thinking razona antes de renderizar. Puede planificar la composición, buscar referencias donde estén disponibles, verificar detalles y mantener personajes u objetos coherentes a lo largo de un lote. Esto lo convierte en el modo a usar cuando un personaje aparecerá más de una vez.
El inconveniente es la velocidad. El modo Thinking puede tardar 15–30 segundos por generación, por lo que no es la forma más rápida de esbozar ideas.
El modo Instant es para exploración. Mantiene la misma calidad visual central pero omite el paso de razonamiento profundo. Es más rápido, está disponible en todos los niveles de ChatGPT y es útil para encontrar una estética antes de invertir tiempo o presupuesto en una hoja de personaje.
La regla simple:
- Usa Instant para moodboards, primeros bocetos, miniaturas y exploración visual.
- Usa Thinking para personajes, productos, pósters con texto y cualquier imagen que necesite continuidad.

Por qué GPT Image 2.0 importa para el video con IA
La mayoría de los problemas de consistencia en video con IA comienzan antes del modelo de video. El modelo se desvía porque el personaje nunca fue definido con suficiente claridad.
Un solo retrato le indica al modelo de video un ángulo, una expresión y una condición de iluminación. Una hoja de referencia le indica la persona completa:
- forma del rostro
- cabello
- vestuario
- proporciones
- accesorios
- vista frontal
- vistas laterales
- vista trasera
- cuerpo completo
- expresiones en primer plano
- manos
- formas del habla
- línea base de iluminación
El lote de 8 imágenes de GPT Image 2.0 te proporciona ese material en una ejecución coherente. En lugar de generar ocho imágenes separadas y obtener ocho personas similares pero diferentes, puedes solicitar el paquete de referencia completo de una vez. El lote se planifica como un conjunto, por lo que tiende a ser consistente consigo mismo.
Esa consistencia es exactamente lo que recompensan los modelos de video basados en referencias.
El método de la hoja de personaje

Este es el flujo de trabajo para convertir GPT Image 2.0 en una herramienta de producción.
Paso 1: diseña el cuadro de identidad
Comienza en modo Instant. Genera un retrato claro o un cuadro de cuerpo completo hasta que el personaje valga la pena preservar.
No uses prompts vagos. Incluye detalles concretos de identidad:
- rango de edad
- forma del rostro
- color y corte de cabello
- detalles de la piel
- marcas distintivas
- vestuario exacto
- ubicación de accesorios
- paleta de colores
- tipo de cuerpo
- línea emocional base
- mundo/estilo
Cuando obtengas un diseño que funcione, guárdalo. Este es el cuadro de identidad. El ejemplo exacto del prompt del cuadro de identidad se encuentra en la sección de ejemplos de prompts al final.
Paso 2: genera la hoja de modo pensante de 8 imágenes
Ingresa el cuadro de identidad de vuelta como imagen de referencia. Luego pídele a GPT Image 2.0 que produzca los ángulos y expresiones que tus modelos de video necesitan.
Este es el truco central de GPT Image 2.0: usa la coherencia por lotes del modelo para crear una hoja de contacto que pueda sobrevivir a la generación de video posterior. El prompt completo de la hoja de 8 imágenes se encuentra al final con los demás ejemplos.
Paso 3: exporta el paquete de referencia
Guarda el lote como un paquete de referencia limpio. Mantén los archivos organizados por ángulo:
frente-neutralperfil-izquierdoperfil-derechotres-cuartos-traserocuerpo-completosentado-manosprimer-plano-sonrisaprimer-plano-habla
Si quieres una hoja más robusta, combina las imágenes en una sola hoja de contacto y conserva también los cuadros individuales. Las herramientas de video pueden preferir referencias individuales o una sola hoja dependiendo del modelo.
Paso 4: lleva la hoja a Flick
En Flick, GPT Image 2.0 se convierte en el departamento de arte y el lienzo se convierte en el tablero de producción.
Un flujo de trabajo práctico en Flick:
- Abre un lienzo nuevo o el lienzo del proyecto para tu película.
- Sube el cuadro de identidad de GPT Image 2.0 y la hoja de referencia.
- Usa la hoja como referencia de tu personaje.
- Genera o sube una imagen fija de la escena.
- Selecciona la imagen fija y elige Generar Video.
- Elige el modelo que se ajuste a la toma:
- Kling para acción con mucho movimiento y detalle físico.
- Seedance para clips más largos, flujos de trabajo con múltiples referencias y escenas con mucho diálogo.
- Veo para realismo cinematográfico pulido donde esté disponible.
- FLUX u otros modelos para estilos específicos del modelo.
- Referencia el mismo paquete de personaje para cada toma.
- Genera variaciones, compara la desviación y conserva el clip que mejor preserve la identidad.
- Guarda los cuadros fuertes de vuelta en el lienzo como referencias futuras.
- Corta, ajusta el color y ensambla la secuencia en el mismo lienzo.
El objetivo no es hacer que GPT Image 2.0 lo haga todo. El objetivo es hacer que produzca el material de referencia que cada modelo de video necesita.

Cómo usar GPT Image 2.0 en la producción al estilo Flick
Un flujo de trabajo completo de imagen fija a video se ve así:
1. Construye el personaje antes de la escena
No comiences con una toma de acción compleja. Comienza con una identidad clara.
Solicita a GPT Image 2.0 un retrato con fondo plano o una referencia de cuerpo completo. Mantén la iluminación simple. Evita accesorios que puedan confundir la silueta del personaje.
2. Crea la hoja de referencia
Usa el modo Thinking y genera el lote de ocho ángulos. Esto le da al flujo de trabajo de Character Reference de Flick más que un solo rostro con el que trabajar.
3. Genera la primera imagen fija de la escena
Una vez que el personaje esté fijado, genera la imagen fija de la escena. Usa el mismo lenguaje de preservación de identidad de tu hoja de personaje y aplícalo al nuevo entorno. El prompt completo de la imagen de la escena está incluido en la sección de ejemplos de prompts al final.
4. Sube la imagen fija y la hoja a Flick
En el lienzo de Flick, mantén la hoja de personaje y la imagen fija de la escena cerca una de la otra. Trátalas como tu kit de tomas.
5. Anima con un modelo de video guiado por referencia
Selecciona la imagen fija de la escena, genera video y adjunta la referencia del personaje. Si el modelo soporta referencias de imagen, usa las imágenes de identidad más fuertes de la hoja: frente, perfil, cuerpo completo y expresión.
Si el modelo soporta menciones nombradas o referencias de elementos, describe la toma usando identificadores estables. El prompt exacto al estilo Flick está incluido con los ejemplos de prompts al final.
6. Revisar la desviación
Después de cada generación, verifica:
- forma del rostro
- ojos
- línea del cabello
- color de la vestimenta
- accesorios
- proporciones corporales
- manos
- precisión del perfil lateral
- alineación de voz/habla si aplica
Guarda los mejores fotogramas de vuelta al lienzo. Los fotogramas de salida sólidos pueden convertirse en mejores referencias para tomas posteriores.
Fórmula de prompt para GPT Image 2.0

GPT Image 2.0 responde mejor a prompts estructurados. Usa este orden:
- Tipo de artefacto: qué es la salida.
- Sujeto: quién o qué aparece.
- Disposición o cámara: cómo está compuesta la imagen.
- Detalles importantes: los detalles que deben permanecer.
- Estilo e iluminación: el acabado visual.
- Restricciones: qué preservar o evitar.
El orden importa porque el modelo planifica temprano. Si comienzas con elogios vagos, el planificador desperdicia atención. Si comienzas con el artefacto y la disposición, sabe qué construir. Todos los ejemplos de prompts para copiar y pegar están recopilados al final de la guía.
GPT Image 2.0 vs la competencia
| Característica | GPT Image 2.0 | Midjourney v8 | Nano Banana 2 |
|---|---|---|---|
| Texto en imágenes | Mejor de su clase | Débil | Mejorado |
| Control de disposición | Fuerte | Medio | Fuerte |
| Techo estético | Fuerte | Sigue siendo el punto de referencia de fotograma único | Comparable |
| Lotes consistentes | Hasta 8 por prompt | No | No |
| API | Pública | Sin API pública | Disponible |
| Velocidad | Media en modo Thinking | Rápida | 1–3s |
| Mejor uso | Texto, disposición, hojas de personajes | Fotogramas únicos hermosos | Volumen económico e iteración rápida |
La división más simple:
- Usa Midjourney para una imagen fija hermosa.
- Usa Nano Banana 2 para volumen económico y variantes rápidas.
- Usa GPT Image 2.0 para texto, disposición, referencias editables y hojas de personajes.
- Usa Flick para convertir esas imágenes fijas en tomas de video consistentes.

Mejores prácticas
- Comienza con un fotograma de identidad limpio antes de construir una hoja.
- Usa el modo Thinking para trabajo sensible a la continuidad.
- Genera la hoja como un lote, no ocho prompts separados.
- Repite las invariantes exactamente: misma persona, misma vestimenta, misma iluminación, mismas proporciones.
- Usa fondos simples para referencias.
- Mantén los accesorios simples y consistentes.
- Etiqueta cada imagen de entrada por su función.
- Usa calidad media para paquetes de referencia y alta calidad para imágenes finales principales.
- Guarda fotogramas sólidos de vuelta a tu lienzo de Flick como referencias futuras.
- Trata cada buena salida como material de producción reutilizable, no como una imagen desechable.
Errores comunes
Error 1: usar un solo retrato como la referencia completa
Un retrato no es suficiente para un vídeo con múltiples tomas. Añade referencias de perfil, espalda, cuerpo completo y expresiones.
Error 2: generar referencias de una en una
Los prompts separados se desvían. Usa un lote de 8 imágenes para que la hoja sea coherente consigo misma.
Error 3: cambiar el lenguaje de preservación
Si un prompt dice "chaqueta bomber azul marino" y el siguiente dice "chaqueta azul," invitas a la desviación. Pega el mismo bloque de identidad cada vez.
Error 4: pedir texto preciso sin diseño
Para pósters, tarjetas de título e interfaces, define el diseño antes del texto. El modelo necesita planificar dónde va el texto.
Error 5: animar antes de fijar la identidad
Si envías una imagen fija débil a un modelo de vídeo, obtienes un bloqueo débil. Primero construye el paquete de referencias, luego anima.
Limitaciones
GPT Image 2.0 es potente, pero no es mágico.
- Fecha límite de conocimiento: diciembre de 2025, por lo que productos, personas, eventos y logotipos más recientes pueden no ser precisos.
- Logotipos: las marcas precisas siguen siendo poco fiables.
- Latencia de pensamiento: 15–30 segundos pueden sentirse lentos para la ideación rápida.
- Consistencia de personajes entre sesiones separadas: fuerte en un lote, más débil entre prompts no relacionados a menos que uses referencias y lenguaje de preservación idéntico.
- Texto diminuto: los títulos y etiquetas grandes funcionan mejor que el texto de tamaño legal.
- Arquitectura: OpenAI no ha divulgado la arquitectura completa, por lo que las afirmaciones sobre el flujo de trabajo deben tratarse como orientación de producción empírica.
Ejemplos de prompts
Prompt de encuadre de identidad
Fotografía real, retrato de referencia de estudio de un mensajero de casi 30 años, cabello cobrizo rapado, pecas en la nariz, aro de plata en la oreja izquierda, chaqueta bomber azul marino con cierre amarillo, pantalones cargo negros, zapatillas blancas desgastadas, expresión alerta pero cansada, fondo gris liso, luz suave y uniforme, sin texto adicional.
Prompt para hoja de personaje de 8 imágenes
Hoja de referencia de personaje de la persona en la Imagen 1: misma persona, mismo rostro, mismo atuendo, misma iluminación en cada imagen. Genera 8 imágenes de referencia coherentes en un solo lote: 1) vista frontal, expresión neutra; 2) perfil izquierdo; 3) perfil derecho; 4) vista trasera de tres cuartos; 5) cuerpo completo de pie; 6) sentado con manos visibles; 7) primer plano sonriendo; 8) primer plano hablando. Fondo gris liso, luz suave y uniforme, fotorrealista. No rediseñes el personaje. No cambies el atuendo, cabello, rostro, proporciones o accesorios.
Prompt general para hoja de personaje
Hoja de referencia de personaje de [PERSONAJE]. Misma persona, mismo atuendo, misma iluminación en cada imagen. Genera 8 imágenes coherentes en un solo lote: frontal neutral, perfil izquierdo, perfil derecho, trasera de tres cuartos, cuerpo completo de pie, sentado con manos visibles, primer plano sonriendo, primer plano hablando. Fondo gris liso, luz suave y uniforme, fotorrealista. No rediseñes el personaje.
Ejemplo de fórmula de prompt
Hoja de referencia de personaje, fotorrealista. Un farero de unos 60 años con barba blanca corta, nariz rota, suéter crema de punto trenzado, abrigo oscuro encerado, gorra de lana, botas pesadas. Ocho imágenes coherentes en un solo lote: frontal, perfil izquierdo, perfil derecho, trasera de tres cuartos, cuerpo completo de pie, sentado con manos visibles, primer plano sonriendo, primer plano hablando. Fondo gris liso, luz de estudio suave y uniforme. Misma persona, mismo atuendo, mismas proporciones, misma iluminación en cada imagen. Sin texto adicional.
Prompt para cuadrícula de expresiones
Cuadrícula de expresiones del personaje en la Imagen 1. Mismo rostro, mismo cabello, mismo atuendo, misma iluminación en cada panel. 16 paneles en una cuadrícula de 4x4: neutral, sonrisa, risa, preocupación, miedo, enojo, gritando, llorando, exhausto, aliviado, sospechoso, concentrado, sorprendido, calmado, hablando, escuchando. Fondo liso, encuadre de busto, identidad consistente.
Prompt para fotograma de escena
La Imagen 1 es la hoja de referencia del personaje. Crea un fotograma cinematográfico del mismo personaje entrando a un andén de metro empapado por la lluvia a medianoche. Preserva el mismo rostro, cabello, chaqueta, proporciones y accesorios. Sensación de 35mm, luz fluorescente cenital motivada, reflejos en azulejo mojado, sin texto adicional.
Prompt para fotograma de película
Fotograma cinematográfico del personaje en la Imagen 1 cruzando un callejón de neón mojado a las 2am. Preserva el mismo rostro, cabello, chaqueta, proporciones y accesorios. Sensación de 35mm, poca profundidad de campo, sombras azules, luz práctica naranja de un puesto de fideos, vapor en el fondo, sin texto adicional.
Prompt de video en Flick
Usa @CharacterSheet como referencia de identidad y @SceneStill como fotograma inicial. El mismo mensajero pisa el andén, mira por encima de su hombro y se detiene mientras las luces del tren parpadean detrás de él. Preserva rostro, chaqueta, pecas, aretes, proporciones y paleta de colores.
Prompt de póster
Póster de película minimalista, vertical. El personaje de la Imagen 1 aparece en silueta al final de un pasillo inundado, una luz cenital reflejada en el agua. Título "LAST EXIT" en letras serif blancas delgadas, centrado en el tercio inferior. Pequeño bloque de créditos debajo. Sin texto adicional, renderizado del título textual.
Prompt de producto/diseño
Póster de festival de tres columnas. Columna izquierda: fechas en tipografía condensada negrita. Columna central: título "ONE LAST SUMMER" en serif desgastado. Columna derecha: texto de lineup en versalitas. Fondo de foto de playa al atardecer, textura de impresión desvanecida, paleta naranja cálido y crema. Sin texto adicional más allá del texto especificado.
Prompt de edición multi-imagen
La Imagen 1 es la hoja de referencia del personaje. La Imagen 2 es la escena base. Coloca el personaje de la Imagen 1 en la Imagen 2, coincidiendo con la iluminación y el ángulo de cámara de la Imagen 2. Preserva el rostro, vestimenta, proporciones y accesorios del personaje. No cambies nada más en la escena.
Preguntas frecuentes
¿Qué es GPT Image 2.0?
GPT Image 2.0 es el modelo de generación y edición de imágenes de OpenAI, lanzado el 21 de abril de 2026. Su nombre de modelo API es gpt-image-2.
¿Es GPT Image 2.0 gratuito?
El modo Instant está disponible en todos los niveles de ChatGPT, incluyendo Free. El modo Thinking requiere un nivel de pago como Plus, Pro, Business o Enterprise. El uso de la API se cobra según la configuración de imagen/salida.
¿Puede GPT Image 2.0 mantener la consistencia de los personajes?
Sí, especialmente dentro de un mismo lote del modo Thinking. Puede generar hasta ocho imágenes coherentes desde un único prompt, lo que lo hace útil para hojas de personajes. Entre prompts separados, usa imágenes de referencia y repite las mismas restricciones de identidad textualmente.
¿Cómo hago una hoja de personaje con GPT Image 2.0?
Diseña un fotograma de identidad, luego usa el modo Thinking para generar ocho vistas de referencia en un solo lote: frontal, perfil izquierdo, perfil derecho, tres cuartos trasero, cuerpo completo, manos sentadas, sonrisa en primer plano y habla en primer plano. Usa la restricción de misma-persona/misma-vestimenta/misma-iluminación.
¿Cuánto cuesta una hoja de personaje con GPT Image 2.0?
Según las estimaciones del artículo, una hoja de 8 imágenes de 1024×1024 cuesta aproximadamente $0.42 en calidad media y aproximadamente $1.69 en calidad alta.
¿Es GPT Image 2.0 mejor que Midjourney?
Para texto, diseño, acceso API y hojas de personajes, sí. Para un solo fotograma hermoso, Midjourney puede seguir teniendo el techo estético más alto.
¿Puedo usar imágenes de GPT Image 2.0 para vídeo con IA?
Sí. El flujo de trabajo más efectivo es generar una hoja de referencia de personaje con GPT Image 2.0, subirla a Flick y usar la misma hoja como referencia de personaje para modelos de vídeo como Kling, Seedance, Veo y FLUX.
¿Para qué debo usar GPT Image 2.0 en Flick?
Úsalo para hojas de personajes, fotogramas de escenas, tarjetas de título, pósteres, referencias de productos y fotogramas de estilo. Luego usa el lienzo de Flick para animar los fotogramas, comparar modelos, guardar referencias y ensamblar la secuencia.