
GPT Image 2.0: La Guida Completa
Jul 2026
GPT Image 2.0 è il modello di immagini di OpenAI per i creatori che hanno bisogno di più di un singolo fotogramma bellissimo. Genera immagini fino a 2K, renderizza testo multilingue in modo più accurato rispetto ai precedenti modelli di immagini OpenAI e in modalità Thinking può produrre fino a otto immagini coerenti da un solo prompt con lo stesso personaggio in tutto il batch.
Questa coerenza del batch è il motivo per cui esiste questa guida. Per i filmmaker AI, GPT Image 2.0 non è solo un generatore di immagini — è una macchina veloce per le schede personaggio. Genera il volto, il guardaroba, le angolazioni, le espressioni e i riferimenti delle pose una volta sola, poi usa quella scheda dentro Flick per mantenere lo stesso personaggio coerente attraverso Kling, Seedance, Veo, FLUX e qualsiasi modello userai dopo.
GPT Image 2.0, in sintesi
- Cos'è: GPT Image 2.0, nome API
gpt-image-2, è il modello di generazione e modifica di immagini di OpenAI, rilasciato il 21 aprile 2026. - Miglior caso d'uso: immagini ricche di layout, testo nelle immagini, poster multilingue, still di prodotti/scene e character sheet per video AI.
- Funzionalità chiave per il filmmaking: la modalità Thinking può generare fino a otto immagini coerenti da un singolo prompt, il che la rende ideale per pacchetti di riferimento frontale/laterale/posteriore/espressioni.
- Modalità: modalità Thinking per i livelli a pagamento; modalità Instant per un'esplorazione più rapida e accesso al livello gratuito.
- Risoluzione: fino a 2K, con output sperimentale 2560×1440.
- API: supporta generazione di immagini, modifiche, input multi-immagine, batch
n, livelli di qualità e output PNG/JPEG/WebP. - Workflow: progetta un personaggio in GPT Image 2.0, trasformalo in una scheda di riferimento, caricala su Flick, quindi anima la stessa identità con modelli video basati su riferimenti.
- Verdetto: usa GPT Image 2.0 come reparto artistico e Flick come canvas di produzione.

Trasforma la tua scheda personaggio in inquadrature
Carica la scheda una volta. Mantieni lo stesso volto in ogni generazione, ogni modello.
Specifiche GPT Image 2.0
| Spec | GPT Image 2.0 |
|---|---|
| Data di rilascio | 21 aprile 2026 |
| Nome modello API | gpt-image-2 |
| Risoluzione | Fino a 2K; sperimentale 2560×1440 |
| Formati | 3:1 ultra-largo fino a 1:3 ultra-alto |
| Generazione batch | 1–8 immagini per prompt con il parametro n |
| Migliore funzionalità di continuità | Batch coerenti da 8 immagini in modalità Thinking |
| Modalità | Thinking e Instant |
| Accesso modalità Thinking | Plus, Pro, Business, Enterprise |
| Accesso modalità Instant | Tutti i livelli, incluso free |
| Rendering testo | Forte, inclusi script non latini come hindi e bengalese |
| Formati di output | PNG, JPEG, WebP con controllo della compressione |
| Knowledge cutoff | Dicembre 2025 |
| Migliore uso in Flick | Schede personaggio, scene fisse, poster/key art, pacchetti di riferimenti |
Modalità Thinking contro modalità Instant
GPT Image 2.0 ha due personalità pratiche.
La modalità Thinking ragiona prima di generare il render. Può pianificare il layout, cercare riferimenti quando disponibili, verificare i dettagli e mantenere personaggi o oggetti coerenti in un'intera serie. Questo la rende la modalità da usare quando un personaggio apparirà più di una volta.
Il compromesso è la velocità. La modalità Thinking può richiedere 15–30 secondi per generazione, quindi non è il modo più veloce per abbozzare idee.
La modalità Instant è per l'esplorazione. Mantiene la stessa qualità visiva di base ma salta il passaggio di ragionamento più profondo. È più veloce, disponibile su ogni livello ChatGPT, e utile per trovare un look prima di spendere tempo o budget su una scheda personaggio.
La regola semplice:
- Usa Instant per moodboard, primi look, miniature ed esplorazione visiva.
- Usa Thinking per personaggi, prodotti, poster con testo e qualsiasi immagine che richieda continuità.

Perché GPT Image 2.0 è importante per i video AI
La maggior parte dei problemi di coerenza nei video AI inizia prima del modello video. Il modello si discosta perché il personaggio non è mai stato definito in modo abbastanza chiaro.
Un singolo ritratto comunica al modello video un'angolazione, un'espressione e una condizione di illuminazione. Una scheda di riferimento gli comunica la persona completa:
- forma del viso
- capelli
- vestiario
- proporzioni
- accessori
- vista frontale
- viste laterali
- vista posteriore
- corpo intero
- espressioni in primo piano
- mani
- forme del parlato
- illuminazione di base
La serie di 8 immagini di GPT Image 2.0 ti fornisce quel materiale in un'unica esecuzione coerente. Invece di generare otto immagini separate ottenendo otto persone simili ma diverse, puoi richiedere l'intero pacchetto di riferimento in una volta. La serie è pianificata come un unico set, quindi tende ad essere coerente con se stessa.
Questa coerenza è esattamente ciò che i modelli video basati su riferimenti premiano.
Il metodo della scheda personaggio

Questo è il flusso di lavoro per trasformare GPT Image 2.0 in uno strumento di produzione.
Passaggio 1: progetta il frame d'identità
Inizia in modalità Instant. Genera un ritratto chiaro o un frame a corpo intero finché il personaggio non vale la pena preservare.
Non usare prompt vaghi. Includi dettagli concreti sull'identità:
- fascia d'età
- forma del viso
- colore e taglio dei capelli
- dettagli della pelle
- segni distintivi
- guardaroba esatto
- posizionamento degli accessori
- palette di colori
- tipo di corporatura
- espressione emotiva di base
- mondo/stile
Quando ottieni un design che funziona, salvalo. Questo è il frame di identità. L'esempio esatto di prompt del frame di identità è raccolto nella sezione esempi di prompt in fondo.
Step 2: generare il foglio di 8 immagini in modalità Thinking
Reinserisci il frame di identità come immagine di riferimento. Poi chiedi a GPT Image 2.0 di produrre le angolazioni e le espressioni di cui hanno bisogno i tuoi modelli video.
Questo è il trucco principale di GPT Image 2.0: usa la coerenza batch del modello per creare un foglio di contatto che può sopravvivere alla generazione video successiva. Il prompt completo del foglio di 8 immagini è raccolto in fondo con gli altri esempi.
Step 3: esportare il pacchetto di riferimento
Salva il batch come pacchetto di riferimento pulito. Mantieni i file organizzati per angolazione:
front-neutralleft-profileright-profilethree-quarter-backfull-bodyseated-handscloseup-smilecloseup-speech
Se vuoi un foglio più forte, combina le immagini in un unico foglio di contatto e mantieni anche i singoli frame. Gli strumenti video potrebbero preferire riferimenti individuali o un singolo foglio a seconda del modello.
Step 4: portare il foglio in Flick
In Flick, GPT Image 2.0 diventa il dipartimento artistico e il canvas diventa la tavola di produzione.
Un flusso di lavoro pratico in Flick:
- Apri un canvas nuovo o il canvas del progetto per il tuo film.
- Carica il frame di identità di GPT Image 2.0 e il foglio di riferimento.
- Usa il foglio come riferimento per il personaggio.
- Genera o carica un fermo immagine della scena.
- Seleziona il fermo immagine e scegli Genera Video.
- Scegli il modello adatto all'inquadratura:
- Kling per azioni ricche di movimento e dettaglio fisico.
- Seedance per clip più lunghe, flussi di lavoro multi-riferimento e scene ricche di dialoghi.
- Veo per realismo cinematografico raffinato dove disponibile.
- FLUX o altri modelli per look specifici del modello.
- Fai riferimento allo stesso pacchetto di personaggio per ogni inquadratura.
- Genera variazioni, confronta le differenze e mantieni la clip che preserva meglio l'identità.
- Salva i frame migliori di nuovo sul canvas come riferimenti futuri.
- Taglia, colora e assembla la sequenza sullo stesso canvas.
L'obiettivo non è far fare tutto a GPT Image 2.0. L'obiettivo è fargli produrre il materiale di riferimento di cui ogni modello video ha bisogno.

Come utilizzare GPT Image 2.0 nella produzione in stile Flick
Una pipeline completa da immagine a video si presenta così:
1. Costruisci il personaggio prima della scena
Non iniziare con una ripresa d'azione complessa. Inizia con un'identità pulita.
Usa GPT Image 2.0 per creare un ritratto su sfondo semplice o un riferimento a figura intera. Mantieni l'illuminazione semplice. Evita oggetti di scena che possano confondere la sagoma del personaggio.
2. Crea la reference sheet
Usa la modalità Thinking e genera il set di otto angolazioni. Questo fornisce al workflow Character Reference di Flick più di un singolo volto con cui lavorare.
3. Genera la prima immagine di scena
Una volta che il personaggio è definito, genera l'immagine della scena. Usa lo stesso linguaggio di preservazione dell'identità della tua character sheet e applicalo al nuovo contesto. Il prompt completo per l'immagine di scena è incluso nella sezione degli esempi di prompt in fondo.
4. Carica l'immagine e la sheet su Flick
Sul canvas di Flick, tieni la character sheet e l'immagine della scena vicine tra loro. Trattale come il tuo kit di ripresa.
5. Anima con un modello video basato su riferimenti
Seleziona l'immagine della scena, genera il video e allega il riferimento del personaggio. Se il modello supporta riferimenti immagine, usa le immagini di identità più forti dalla sheet: frontale, profilo, figura intera ed espressione.
Se il modello supporta menzioni nominate o riferimenti a elementi, descrivi la ripresa utilizzando identificatori stabili. Il prompt esatto in stile Flick è incluso con gli esempi di prompt in fondo.
6. Verifica della deriva
Dopo ogni generazione, controlla:
- forma del viso
- occhi
- attaccatura dei capelli
- colore dell'abbigliamento
- accessori
- proporzioni del corpo
- mani
- precisione del profilo laterale
- allineamento voce/parlato se applicabile
Salva i fotogrammi migliori nel canvas. I fotogrammi di output migliori possono diventare riferimenti più efficaci per le riprese successive.
Formula dei prompt per GPT Image 2.0

GPT Image 2.0 risponde meglio a prompt strutturati. Usa questo ordine:
- Tipo di artefatto: cos'è l'output.
- Soggetto: chi o cosa appare.
- Layout o inquadratura: come è composta l'immagine.
- Dettagli importanti: i dettagli che devono essere preservati.
- Stile e illuminazione: la finitura visiva.
- Vincoli: cosa preservare o evitare.
L'ordine è importante perché il modello pianifica in anticipo. Se inizi con elogi vaghi, il pianificatore spreca attenzione. Se inizi con l'artefatto e il layout, sa cosa costruire. Tutti gli esempi di prompt copia-incolla sono raccolti in fondo alla guida.
GPT Image 2.0 a confronto
| Funzionalità | GPT Image 2.0 | Midjourney v8 | Nano Banana 2 |
|---|---|---|---|
| Testo nelle immagini | Il migliore della categoria | Debole | Migliorato |
| Controllo del layout | Forte | Medio | Forte |
| Qualità estetica massima | Forte | Ancora il benchmark per fotogrammi singoli | Comparabile |
| Lotti consistenti | Fino a 8 per prompt | No | No |
| API | Pubblica | Nessuna API pubblica | Disponibile |
| Velocità | Media in modalità Thinking | Veloce | 1–3s |
| Uso ottimale | Testo, layout, schede personaggi | Fotogrammi singoli bellissimi | Volume economico e iterazione veloce |
La distinzione più semplice:
- Usa Midjourney per un singolo fotogramma bellissimo.
- Usa Nano Banana 2 per volume economico e varianti veloci.
- Usa GPT Image 2.0 per testo, layout, riferimenti modificabili e schede personaggi.
- Usa Flick per trasformare quei fotogrammi in riprese video consistenti.

Best practice
- Inizia con un fotogramma di identità pulito prima di costruire una scheda.
- Usa la modalità Thinking per lavori sensibili alla continuità.
- Genera la scheda come un unico lotto, non otto prompt separati.
- Ripeti le invarianti esattamente: stessa persona, stesso abbigliamento, stessa illuminazione, stesse proporzioni.
- Usa sfondi semplici per i riferimenti.
- Mantieni gli accessori semplici e consistenti.
- Etichetta ogni immagine di input in base al ruolo.
- Usa qualità media per i pacchetti di riferimento e qualità alta per le immagini finali principali.
- Salva i fotogrammi migliori nel tuo canvas Flick come riferimenti futuri.
- Tratta ogni buon output come materiale di produzione riutilizzabile, non come un'immagine usa e getta.
Errori comuni
Errore 1: usare un solo ritratto come unico riferimento
Un ritratto non è sufficiente per video multi-shot. Aggiungi riferimenti di profilo, retro, figura intera ed espressioni.
Errore 2: generare riferimenti uno alla volta
Prompt separati si discostano. Usa un singolo batch da 8 immagini in modo che il foglio sia coerente con se stesso.
Errore 3: cambiare il linguaggio di preservazione
Se un prompt dice "bomber blu navy" e il successivo dice "giacca blu," inviti al discostamento. Incolla lo stesso blocco di identità ogni volta.
Errore 4: chiedere testo accurato senza layout
Per poster, schede titolo e UI, definisci il layout prima del testo. Il modello deve pianificare dove va il testo.
Errore 5: animare prima di bloccare l'identità
Se invii un'immagine statica debole a un modello video, ottieni un blocco debole. Costruisci prima il pacchetto di riferimenti, poi anima.
Limitazioni
GPT Image 2.0 è potente, ma non è magia.
- Limite di conoscenza: dicembre 2025, quindi prodotti, persone, eventi e loghi più recenti potrebbero non essere accurati.
- Loghi: i marchi precisi sono ancora inaffidabili.
- Latenza di elaborazione: 15–30 secondi possono sembrare lenti per l'ideazione rapida.
- Coerenza dei personaggi tra sessioni separate: forte in un batch, più debole tra prompt non correlati a meno che non usi riferimenti e linguaggio di preservazione identico.
- Testo minuscolo: titoli e etichette grandi funzionano meglio del testo di dimensioni legali.
- Architettura: OpenAI non ha divulgato l'architettura completa, quindi le indicazioni sul flusso di lavoro dovrebbero essere trattate come linee guida di produzione empiriche.
Esempi di prompt
Prompt per frame di identità
Fotografia reale, ritratto di riferimento in studio di un corriere sui vent'anni, capelli color rame rasati, lentiggini sul naso, anello d'argento all'orecchio sinistro, giubbotto bomber blu navy con cerniera gialla, pantaloni cargo neri, sneaker bianche consumate, espressione vigile ma stanca, sfondo grigio uniforme, luce morbida e uniforme, nessun testo aggiuntivo.
Prompt per scheda personaggio da 8 immagini
Scheda di riferimento del personaggio della persona nell'Immagine 1: stessa persona, stesso volto, stesso outfit, stessa illuminazione in ogni immagine. Genera 8 immagini di riferimento coerenti in un unico batch: 1) vista frontale, espressione neutra; 2) profilo sinistro; 3) profilo destro; 4) vista tre quarti da dietro; 5) corpo intero in piedi; 6) seduto con mani visibili; 7) primo piano sorridente; 8) primo piano mentre parla. Sfondo grigio uniforme, luce morbida e uniforme, fotorealistico. Non ridisegnare il personaggio. Non cambiare outfit, capelli, volto, proporzioni o accessori.
Prompt generale per scheda personaggio
Scheda di riferimento del personaggio di [CHARACTER]. Stessa persona, stesso outfit, stessa illuminazione in ogni immagine. Genera 8 immagini coerenti in un unico batch: frontale neutro, profilo sinistro, profilo destro, tre quarti da dietro, corpo intero in piedi, seduto con mani visibili, primo piano sorridente, primo piano mentre parla. Sfondo grigio uniforme, luce morbida e uniforme, fotorealistico. Non ridisegnare il personaggio.
Esempio di formula per prompt
Scheda di riferimento del personaggio, fotorealistica. Un guardiano del faro sui sessant'anni con barba bianca corta, naso rotto, maglione color crema a trecce, cappotto cerato scuro, berretto di lana, stivali pesanti. Otto immagini coerenti in un unico batch: frontale, profilo sinistro, profilo destro, tre quarti da dietro, corpo intero in piedi, seduto con mani visibili, primo piano sorridente, primo piano mentre parla. Sfondo grigio uniforme, luce morbida e uniforme da studio. Stessa persona, stesso outfit, stesse proporzioni, stessa illuminazione in ogni immagine. Nessun testo aggiuntivo.
Prompt per griglia di espressioni
Griglia di espressioni del personaggio nell'Immagine 1. Stesso volto, stessi capelli, stesso outfit, stessa illuminazione in ogni pannello. 16 pannelli in una griglia 4x4: neutro, sorriso, risata, preoccupazione, paura, rabbia, grido, pianto, esausto, sollevato, sospettoso, concentrato, sorpreso, calmo, mentre parla, in ascolto. Sfondo uniforme, inquadratura a mezzo busto, identità coerente.
Prompt per scena fissa
L'Immagine 1 è la scheda di riferimento del personaggio. Crea un fermo immagine cinematografico dello stesso personaggio che entra in una piattaforma della metropolitana bagnata dalla pioggia a mezzanotte. Preserva lo stesso volto, capelli, giubbotto, proporzioni e accessori. Atmosfera da 35mm, luce fluorescente motivata dall'alto, riflessi sulle piastrelle bagnate, nessun testo aggiuntivo.
Prompt per fermo immagine cinematografico
Fermo immagine cinematografico del personaggio nell'Immagine 1 che attraversa un vicolo bagnato illuminato al neon alle 2 del mattino. Preserva lo stesso volto, capelli, giubbotto, proporzioni e accessori. Atmosfera da 35mm, profondità di campo ridotta, ombre blu, luce pratica arancione da una bancarella di noodles, vapore sullo sfondo, nessun testo aggiuntivo.
Prompt video Flick
Usa @CharacterSheet come riferimento di identità e @SceneStill come frame iniziale. Lo stesso corriere sale sulla piattaforma, guarda alle sue spalle e rallenta mentre le luci del treno tremolano dietro di loro. Preserva volto, giubbotto, lentiggini, orecchini, proporzioni e palette di colori.
Prompt poster
Poster cinematografico minimalista, verticale. Il personaggio dell'Immagine 1 è in controluce alla fine di un corridoio allagato, con una luce sopra la testa riflessa nell'acqua. Titolo "LAST EXIT" in caratteri serif bianchi sottili, centrato nel terzo inferiore. Piccolo blocco di crediti sotto. Nessun testo aggiuntivo, rendering del titolo letterale.
Prompt prodotto/layout
Poster festival a tre colonne. Colonna sinistra: date in caratteri condensati grassetti. Colonna centrale: titolo "ONE LAST SUMMER" in serif usurato. Colonna destra: testo lineup in maiuscoletto. Sfondo foto spiaggia al tramonto, texture stampa sbiadita, palette arancione caldo e crema. Nessun testo aggiuntivo oltre a quello specificato.
Prompt modifica multi-immagine
L'Immagine 1 è il riferimento del personaggio. L'Immagine 2 è la scena base. Posiziona il personaggio dell'Immagine 1 nell'Immagine 2, rispettando l'illuminazione e l'angolazione della camera dell'Immagine 2. Preserva il viso, l'outfit, le proporzioni e gli accessori del personaggio. Non modificare nient'altro nella scena.
Domande frequenti
Cos'è GPT Image 2.0?
GPT Image 2.0 è il modello di generazione e modifica di immagini di OpenAI, rilasciato il 21 aprile 2026. Il suo nome modello API è gpt-image-2.
GPT Image 2.0 è gratuito?
La modalità Instant è disponibile su tutti i livelli ChatGPT, incluso quello gratuito. La modalità Thinking richiede un livello a pagamento come Plus, Pro, Business o Enterprise. L'utilizzo tramite API è tariffato in base alle impostazioni di immagine/output.
GPT Image 2.0 può mantenere i personaggi coerenti?
Sì, specialmente all'interno di un singolo batch in modalità Thinking. Può generare fino a otto immagini coerenti da un singolo prompt, il che lo rende utile per le character sheet. Tra prompt separati, usa immagini di riferimento e ripeti esattamente gli stessi vincoli di identità.
Come creo una character sheet con GPT Image 2.0?
Progetta un frame identitario, quindi usa la modalità Thinking per generare otto viste di riferimento in un unico batch: frontale, profilo sinistro, profilo destro, tre quarti posteriore, corpo intero, mani sedute, sorriso in primo piano e parlato in primo piano. Usa il vincolo stessa-persona/stesso-outfit/stessa-illuminazione.
Quanto costa un character sheet con GPT Image 2.0?
Secondo le stime dell'articolo, uno sheet da 8 immagini 1024×1024 costa circa $0.42 a qualità media e circa $1.69 a qualità alta.
GPT Image 2.0 è meglio di Midjourney?
Per testo, layout, accesso API e character sheet, sì. Per un singolo frame esteticamente eccellente, Midjourney potrebbe ancora avere il limite estetico più alto.
Posso usare le immagini GPT Image 2.0 per video AI?
Sì. Il workflow più efficace è generare una character sheet di riferimento con GPT Image 2.0, caricarla su Flick e usare la stessa scheda come riferimento per i modelli video come Kling, Seedance, Veo e FLUX.
Per cosa dovrei usare GPT Image 2.0 in Flick?
Usalo per character sheet, still di scene, title card, poster, riferimenti di prodotto e frame di stile. Quindi usa il canvas di Flick per animare gli still, confrontare i modelli, salvare i riferimenti e assemblare la sequenza.