GPT Image 2.0 : Le Guide Complet

· Cinéaste interne chez Flick · LinkedIn

Jul 2026

GPT Image 2.0 est le modèle d'image d'OpenAI pour les créateurs qui ont besoin de plus qu'une belle image. Il génère des images jusqu'à 2K, rend le texte multilingue plus précisément que les modèles d'image OpenAI précédents, et en mode Thinking peut produire jusqu'à huit images cohérentes à partir d'un seul prompt avec le même personnage dans tout le lot.

Cette cohérence de lot est la raison pour laquelle ce guide existe. Pour les cinéastes IA, GPT Image 2.0 n'est pas qu'un générateur d'images — c'est une machine rapide de création de fiches de personnage. Générez le visage, la garde-robe, les angles, les expressions et les références de pose une fois, puis utilisez cette fiche dans Flick pour garder le même personnage cohérent à travers Kling, Seedance, Veo, FLUX, et quel que soit le modèle que vous utilisez ensuite.

GPT Image 2.0, en un coup d'œil

  • Ce que c'est : GPT Image 2.0, nom d'API gpt-image-2, est le modèle de génération et d'édition d'images d'OpenAI, publié le 21 avril 2026.
  • Meilleur cas d'usage : images à mise en page complexe, texte dans les images, affiches multilingues, plans de produits/scènes et planches de personnages pour la vidéo IA.
  • Fonctionnalité clé pour le cinéma : le mode Thinking peut générer jusqu'à huit images cohérentes à partir d'un seul prompt, ce qui le rend idéal pour les packs de référence face/profil/dos/expression.
  • Modes : mode Thinking pour les niveaux payants ; mode Instant pour une exploration plus rapide et l'accès au niveau gratuit.
  • Résolution : jusqu'à 2K, avec sortie expérimentale 2560×1440.
  • API : prend en charge la génération d'images, les modifications, les entrées multi-images, les lots n, les niveaux de qualité et les sorties PNG/JPEG/WebP.
  • Workflow : concevoir un personnage dans GPT Image 2.0, transformer ce personnage en planche de référence, l'uploader sur Flick, puis animer la même identité avec des modèles vidéo pilotés par référence.
  • Verdict : utiliser GPT Image 2.0 comme département artistique et Flick comme canvas de production.
Image

Transformez votre fiche personnage en plans

Téléchargez la fiche une fois. Gardez le même visage dans chaque génération, chaque modèle.

Spécifications GPT Image 2.0

SpécificationGPT Image 2.0
Date de sortie21 avril 2026
Nom du modèle APIgpt-image-2
RésolutionJusqu'à 2K ; expérimental 2560×1440
Formats d'image3:1 ultra-large à 1:3 ultra-vertical
Génération par lot1–8 images par prompt avec le paramètre n
Meilleure fonctionnalité de continuitéLots cohérents de 8 images en mode Thinking
ModesThinking et Instant
Accès mode ThinkingPlus, Pro, Business, Enterprise
Accès mode InstantTous les niveaux, y compris gratuit
Rendu de texteFort, y compris les scripts non latins comme l'hindi et le bengali
Formats de sortiePNG, JPEG, WebP avec contrôle de compression
Date limite de connaissanceDécembre 2025
Meilleur usage FlickFiches de personnage, images de scène, affiche/art clé, packs de références

Mode Thinking vs mode Instant

GPT Image 2.0 a deux personnalités pratiques.

Le mode Thinking réfléchit avant de générer le rendu. Il peut planifier la composition, rechercher des références lorsque disponibles, vérifier les détails et maintenir la cohérence des personnages ou objets dans un lot. C'est donc le mode à utiliser lorsqu'un personnage apparaît plusieurs fois.

Le compromis porte sur la vitesse. Le mode Thinking peut prendre 15 à 30 secondes par génération, ce n'est donc pas la méthode la plus rapide pour esquisser des idées.

Le mode Instant est fait pour l'exploration. Il conserve la même qualité visuelle de base mais ignore l'étape de raisonnement approfondi. Il est plus rapide, disponible sur tous les niveaux ChatGPT, et utile pour trouver un style avant d'investir du temps ou du budget dans une planche de personnage.

La règle simple :

  • Utilisez Instant pour les planches d'ambiance, les premières ébauches, les vignettes et l'exploration visuelle.
  • Utilisez Thinking pour les personnages, les produits, les affiches avec texte et toute image nécessitant de la continuité.
Image

Pourquoi GPT Image 2.0 est important pour la vidéo IA

La plupart des problèmes de cohérence en vidéo IA commencent avant le modèle vidéo. Le modèle dérive parce que le personnage n'a jamais été défini avec suffisamment de clarté.

Un simple portrait indique au modèle vidéo un angle, une expression et une condition d'éclairage. Une planche de référence lui décrit la personne complète :

  • forme du visage
  • cheveux
  • garde-robe
  • proportions
  • accessoires
  • vue de face
  • vues de profil
  • vue de dos
  • corps entier
  • expressions en gros plan
  • mains
  • formes de parole
  • éclairage de référence

Le lot de 8 images de GPT Image 2.0 vous fournit ce matériel en une seule génération cohérente. Au lieu de demander huit images séparées et d'obtenir huit personnes similaires mais différentes, vous pouvez demander l'ensemble complet de références d'un coup. Le lot est planifié comme un ensemble unique, il tend donc à être cohérent avec lui-même.

Cette cohérence est exactement ce que récompensent les modèles vidéo basés sur des références.

La méthode de la planche de personnage

Image

Voici le workflow pour transformer GPT Image 2.0 en outil de production.

Étape 1 : concevoir le cadre d'identité

Commencez en mode Instant. Générez un portrait clair ou un plan en pied jusqu'à ce que le personnage mérite d'être conservé.

Ne formulez pas de prompt vague. Incluez des détails d'identité concrets :

  • tranche d'âge
  • forme du visage
  • couleur et coupe de cheveux
  • détails de la peau
  • signes distinctifs
  • garde-robe exacte
  • placement des accessoires
  • palette de couleurs
  • morphologie
  • état émotionnel de base
  • univers/style

Lorsque vous obtenez un design qui fonctionne, enregistrez-le. C'est l'image d'identité de référence. L'exemple de prompt exact pour l'image d'identité est rassemblé dans la section des exemples de prompts en bas.

Étape 2 : générer la planche de 8 images en mode Thinking

Réinjectez l'image d'identité comme image de référence. Demandez ensuite à GPT Image 2.0 de produire les angles et expressions dont vos modèles vidéo ont besoin.

C'est l'astuce clé de GPT Image 2.0 : utilisez la cohérence de lot du modèle pour créer une planche contact qui peut survivre à la génération vidéo en aval. Le prompt complet de la planche de 8 images est rassemblé en bas avec les autres exemples.

Étape 3 : exporter le pack de références

Enregistrez le lot comme un pack de références propre. Gardez les fichiers organisés par angle :

  • front-neutral
  • left-profile
  • right-profile
  • three-quarter-back
  • full-body
  • seated-hands
  • closeup-smile
  • closeup-speech

Si vous voulez une planche plus robuste, combinez les images en une seule planche contact et conservez également les images individuelles. Les outils vidéo peuvent préférer soit des références individuelles soit une seule planche selon le modèle.

Étape 4 : importer la planche dans Flick

Dans Flick, GPT Image 2.0 devient le département artistique et le canvas devient le tableau de production.

Un workflow Flick pratique :

  1. Ouvrez un canvas vierge ou le canvas du projet pour votre film.
  2. Téléchargez l'image d'identité GPT Image 2.0 et la planche de références.
  3. Utilisez la planche comme référence de personnage.
  4. Générez ou téléchargez un plan de scène.
  5. Sélectionnez le plan et choisissez Générer une vidéo.
  6. Choisissez le modèle qui correspond au plan :
    • Kling pour l'action riche en mouvement et les détails physiques.
    • Seedance pour les clips plus longs, les workflows multi-références et les scènes riches en dialogue.
    • Veo pour un réalisme cinématographique soigné lorsque disponible.
    • FLUX ou d'autres modèles pour des rendus spécifiques au modèle.
  7. Référencez le même pack de personnage pour chaque plan.
  8. Générez des variations, comparez la dérive, et conservez le clip qui préserve le mieux l'identité.
  9. Enregistrez les images fortes sur le canvas comme références futures.
  10. Montez, étalonner et assemblez la séquence sur le même canvas.

L'objectif n'est pas de faire tout faire par GPT Image 2.0. L'objectif est de lui faire produire le matériel de référence dont chaque modèle vidéo a besoin.

Image

Comment utiliser GPT Image 2.0 dans la production de style Flick

Un pipeline complet d'image fixe vers vidéo ressemble à ceci :

1. Construire le personnage avant la scène

Ne commencez pas par un plan d'action complexe. Commencez par une identité claire.

Utilisez GPT Image 2.0 pour créer un portrait ou une référence en pied sur fond uni. Gardez l'éclairage simple. Évitez les accessoires qui pourraient brouiller la silhouette du personnage.

2. Créer la planche de référence

Utilisez le mode Thinking et générez le lot à huit angles. Cela donne au workflow de référence de personnage de Flick plus qu'un seul visage avec lequel travailler.

3. Générer l'image fixe de la première scène

Une fois le personnage verrouillé, générez l'image fixe de la scène. Utilisez le même langage de préservation d'identité de votre planche de personnage et appliquez-le au nouveau décor. Le prompt complet pour l'image de scène est inclus dans la section d'exemples de prompts en bas.

4. Importer l'image fixe et la planche dans Flick

Sur le canvas Flick, gardez la planche de personnage et l'image de scène proches l'une de l'autre. Traitez-les comme votre kit de plan.

5. Animer avec un modèle vidéo piloté par référence

Sélectionnez l'image de scène, générez la vidéo et attachez la référence de personnage. Si le modèle prend en charge les références d'image, utilisez les images d'identité les plus fortes de la planche : face, profil, corps entier et expression.

Si le modèle prend en charge les mentions nommées ou les références d'éléments, décrivez le plan en utilisant des identifiants stables. Le prompt exact de style Flick est inclus avec les exemples de prompts en bas.

6. Vérifier la dérive

Après chaque génération, vérifiez :

  • forme du visage
  • yeux
  • ligne des cheveux
  • couleur de la tenue
  • accessoires
  • proportions du corps
  • mains
  • précision du profil latéral
  • alignement voix/parole si applicable

Enregistrez les meilleures images sur le canvas. Les images de qualité peuvent devenir de meilleures références pour les plans ultérieurs.

Formule de prompt pour GPT Image 2.0

Image

GPT Image 2.0 répond mieux aux prompts structurés. Utilisez cet ordre :

  1. Type d'artefact : ce qu'est le résultat.
  2. Sujet : qui ou quoi apparaît.
  3. Composition ou caméra : comment l'image est composée.
  4. Détails importants : les détails qui doivent perdurer.
  5. Style et éclairage : la finition visuelle.
  6. Contraintes : ce qu'il faut préserver ou éviter.

L'ordre compte car le modèle planifie dès le début. Si vous commencez par des éloges vagues, le planificateur gaspille son attention. Si vous commencez par l'artefact et la composition, il sait quoi construire. Tous les exemples de prompts copiables sont rassemblés en bas du guide.

GPT Image 2.0 face à la concurrence

FonctionnalitéGPT Image 2.0Midjourney v8Nano Banana 2
Texte dans les imagesMeilleur de sa catégorieFaibleAmélioré
Contrôle de la compositionFortMoyenFort
Plafond esthétiqueFortToujours la référence pour les images uniquesComparable
Lots cohérentsJusqu'à 8 par promptNonNon
APIPubliquePas d'API publiqueDisponible
VitesseMoyenne en mode ThinkingRapide1–3s
Meilleur usageTexte, composition, fiches personnagesBelles images uniquesVolume économique et itération rapide

La distinction la plus simple :

  • Utilisez Midjourney pour une belle image fixe.
  • Utilisez Nano Banana 2 pour du volume économique et des variantes rapides.
  • Utilisez GPT Image 2.0 pour le texte, la composition, les références modifiables et les fiches personnages.
  • Utilisez Flick pour transformer ces images en plans vidéo cohérents.
Image

Bonnes pratiques

  • Commencez par une image d'identité claire avant de construire une fiche.
  • Utilisez le mode Thinking pour les travaux sensibles à la continuité.
  • Générez la fiche en un seul lot, pas huit prompts séparés.
  • Répétez les invariants exactement : même personne, même tenue, même éclairage, mêmes proportions.
  • Utilisez des arrière-plans simples pour les références.
  • Gardez les accessoires simples et cohérents.
  • Étiquetez chaque image d'entrée par rôle.
  • Utilisez la qualité moyenne pour les packs de référence et la haute qualité pour les images finales principales.
  • Enregistrez les images de qualité sur votre canvas Flick comme références futures.
  • Traitez chaque bon résultat comme du matériel de production réutilisable, pas comme une image jetable.

Erreurs courantes

Erreur 1 : utiliser un seul portrait comme référence complète

Un portrait ne suffit pas pour une vidéo multi-plans. Ajoutez des références de profil, de dos, en pied et d'expressions.

Erreur 2 : générer les références une par une

Les prompts séparés dérivent. Utilisez un lot de 8 images pour que la planche soit cohérente.

Erreur 3 : changer le langage de préservation

Si un prompt dit « blouson bleu marine » et le suivant dit « veste bleue », vous invitez la dérive. Collez le même bloc d'identité à chaque fois.

Erreur 4 : demander du texte précis sans mise en page

Pour les affiches, cartons de titre et interfaces, définissez la mise en page avant le texte. Le modèle doit planifier où placer le texte.

Erreur 5 : animer avant de verrouiller l'identité

Si vous envoyez une image fixe faible dans un modèle vidéo, vous obtenez un verrouillage faible. Créez d'abord le pack de référence, puis animez.

Limites

GPT Image 2.0 est puissant, mais ce n'est pas magique.

  • Limite de connaissances : décembre 2025, donc les produits, personnes, événements et logos plus récents peuvent ne pas être exacts.
  • Logos : les marques précises restent peu fiables.
  • Latence de réflexion : 15 à 30 secondes peuvent sembler lentes pour l'idéation rapide.
  • Cohérence des personnages entre sessions séparées : forte dans un lot, plus faible entre prompts non liés sauf si vous utilisez des références et un langage de préservation identique.
  • Texte minuscule : les grands titres et étiquettes fonctionnent mieux que le texte de petite taille.
  • Architecture : OpenAI n'a pas divulgué l'architecture complète, donc les affirmations sur le flux de travail doivent être traitées comme des conseils de production empiriques.

Exemples de prompts

Prompt d'image d'identité

Photographie réelle, portrait de référence en studio d'un coursier d'environ 28 ans, cheveux courts cuivrés, taches de rousseur sur le nez, anneau argenté à l'oreille gauche, blouson aviateur bleu marine avec fermeture éclair jaune, pantalon cargo noir, baskets blanches usées, expression alerte mais fatiguée, fond gris uni, lumière douce uniforme, pas de texte supplémentaire.

Prompt pour planche de personnage à 8 images

Planche de référence de personnage de la personne dans l'Image 1 : même personne, même visage, même tenue, même éclairage dans chaque image. Générer 8 images de référence cohérentes en un seul lot : 1) vue de face, expression neutre ; 2) profil gauche ; 3) profil droit ; 4) vue trois-quarts arrière ; 5) corps entier debout ; 6) assis avec mains visibles ; 7) gros plan souriant ; 8) gros plan en train de parler. Fond gris uni, lumière douce uniforme, photoréaliste. Ne pas réinventer le personnage. Ne pas changer la tenue, les cheveux, le visage, les proportions ou les accessoires.

Prompt général pour planche de personnage

Planche de référence de personnage de [CHARACTER]. Même personne, même tenue, même éclairage dans chaque image. Générer 8 images cohérentes en un seul lot : face neutre, profil gauche, profil droit, trois-quarts arrière, corps entier debout, assis avec mains visibles, gros plan souriant, gros plan en train de parler. Fond gris uni, lumière douce uniforme, photoréaliste. Ne pas réinventer le personnage.

Exemple de formule de prompt

Planche de référence de personnage, photoréaliste. Un gardien de phare d'environ 60 ans avec une courte barbe blanche, nez cassé, pull torsadé crème, manteau ciré foncé, bonnet de laine, bottes lourdes. Huit images cohérentes en un seul lot : face, profil gauche, profil droit, trois-quarts arrière, corps entier debout, assis avec mains visibles, gros plan souriant, gros plan en train de parler. Fond gris uni, lumière douce uniforme de studio. Même personne, même tenue, mêmes proportions, même éclairage dans chaque image. Pas de texte supplémentaire.

Prompt pour grille d'expressions

Grille d'expressions du personnage dans l'Image 1. Même visage, mêmes cheveux, même tenue, même éclairage dans chaque case. 16 cases en grille 4x4 : neutre, sourire, rire, inquiétude, peur, colère, cri, pleurs, épuisé, soulagé, soupçonneux, concentré, surpris, calme, en train de parler, à l'écoute. Fond uni, cadrage buste, identité cohérente.

Prompt pour plan de scène

L'Image 1 est la planche de référence du personnage. Créer un plan de film cinématographique du même personnage entrant sur un quai de métro trempé de pluie à minuit. Conserver le même visage, les mêmes cheveux, le même blouson, les mêmes proportions et les mêmes accessoires. Esthétique 35mm, lumière fluorescente motivée venant du plafond, reflets sur les carreaux mouillés, pas de texte supplémentaire.

Prompt pour plan de film

Plan de film cinématographique du personnage dans l'Image 1 traversant une ruelle néon mouillée à 2h du matin. Conserver le même visage, les mêmes cheveux, le même blouson, les mêmes proportions et les mêmes accessoires. Esthétique 35mm, faible profondeur de champ, ombres bleues, lumière pratique orange d'un stand de nouilles, vapeur en arrière-plan, pas de texte supplémentaire.

Prompt vidéo Flick

Utiliser @CharacterSheet comme référence d'identité et @SceneStill comme image de départ. Le même coursier monte sur le quai, regarde par-dessus son épaule et ralentit tandis que les lumières du train clignotent derrière lui. Conserver le visage, le blouson, les taches de rousseur, les boucles d'oreilles, les proportions et la palette de couleurs.

Prompt d'affiche

Affiche de film minimaliste, verticale. Le personnage de l'Image 1 se tient en silhouette au bout d'un couloir inondé, une lumière au plafond se reflétant dans l'eau. Titre « LAST EXIT » en lettres serif blanches fines, centré dans le tiers inférieur. Petit bloc de crédits en dessous. Aucun texte supplémentaire, rendu exact du titre.

Prompt de produit/mise en page

Affiche de festival en trois colonnes. Colonne de gauche : dates en caractères gras condensés. Colonne centrale : titre « ONE LAST SUMMER » en serif usé. Colonne de droite : texte de programmation en petites capitales. Photo de plage au coucher de soleil en arrière-plan, texture d'impression fanée, palette orange chaud et crème. Aucun texte supplémentaire au-delà du texte spécifié.

Prompt de modification multi-images

L'Image 1 est la feuille de référence du personnage. L'Image 2 est la scène de base. Placez le personnage de l'Image 1 dans l'Image 2, en respectant l'éclairage et l'angle de caméra de l'Image 2. Préservez le visage, la tenue, les proportions et les accessoires du personnage. Ne changez rien d'autre dans la scène.

Questions fréquentes

Qu'est-ce que GPT Image 2.0 ?

GPT Image 2.0 est le modèle de génération et d'édition d'images d'OpenAI, publié le 21 avril 2026. Son nom de modèle API est gpt-image-2.

GPT Image 2.0 est-il gratuit ?

Le mode Instant est disponible sur tous les niveaux ChatGPT, y compris gratuit. Le mode Thinking nécessite un niveau payant tel que Plus, Pro, Business ou Enterprise. L'utilisation de l'API est facturée selon les paramètres d'image/sortie.

GPT Image 2.0 peut-il maintenir la cohérence des personnages ?

Oui, particulièrement au sein d'un même lot en mode Thinking. Il peut générer jusqu'à huit images cohérentes à partir d'un seul prompt, ce qui le rend utile pour les planches de personnages. Entre des prompts séparés, utilisez des images de référence et répétez les mêmes contraintes d'identité mot pour mot.

Comment créer une planche de personnage avec GPT Image 2.0 ?

Concevez une image d'identité, puis utilisez le mode Thinking pour générer huit vues de référence en un seul lot : face, profil gauche, profil droit, trois-quarts dos, corps entier, mains assises, sourire en gros plan et parole en gros plan. Utilisez la contrainte même-personne/même-tenue/même-éclairage.

Combien coûte une feuille de personnage GPT Image 2.0 ?

D'après les estimations de travail de l'article, une feuille de 8 images en 1024×1024 coûte environ 0,42 $ en qualité moyenne et environ 1,69 $ en haute qualité.

GPT Image 2.0 est-il meilleur que Midjourney ?

Pour le texte, la mise en page, l'accès API et les planches de personnages, oui. Pour une seule image magnifique, Midjourney peut encore avoir le plafond esthétique le plus élevé.

Puis-je utiliser les images GPT Image 2.0 pour la vidéo IA ?

Oui. Le workflow le plus puissant consiste à générer une planche de référence de personnage avec GPT Image 2.0, l'uploader sur Flick, et utiliser la même planche comme référence de personnage pour les modèles vidéo comme Kling, Seedance, Veo et FLUX.

Pour quoi devrais-je utiliser GPT Image 2.0 dans Flick ?

Utilisez-le pour les planches de personnages, les plans de scène, les cartons de titre, les affiches, les références de produits et les images de style. Ensuite, utilisez le canvas de Flick pour animer les plans, comparer les modèles, sauvegarder les références et assembler la séquence.