
Comment créer des personnages IA cohérents en 2026 : le guide complet
Jun 2026
La cohérence des personnages en image à image consiste à générer de nouvelles images du même personnage, dans de nouvelles scènes et sous de nouveaux angles, tout en préservant exactement son identité visuelle. Plutôt que de redécrire le personnage avec des mots à chaque fois, vous fournissez au modèle une image de référence, et il reproduit le visage, la coiffure et la tenue dans chaque plan.
Si vous avez déjà créé un personnage puis l’avez vu se déliter d’un plan à l’autre, avec des décors, des angles de caméra et des détails différents, vous avez fait l’expérience du character drift (dérive du personnage). C’est l’un des défis les plus répandus dans le cinéma généré par IA. Ce guide explique précisément pourquoi la dérive du personnage se produit et les méthodes exactes pour la corriger, afin de garder des personnages cohérents dans Flick, Midjourney, Veo 3, Sora et ComfyUI.
Comment créer des personnages IA cohérents en 2026 en un coup d’œil
Pour ceux qui veulent un aperçu rapide, voici la réponse courte :
La méthode la plus fiable pour créer un personnage cohérent avec l’IA consiste à d’abord verrouiller l’identité du personnage dans une seule image de référence, puis à réutiliser cette référence pour chaque nouveau plan. Cette méthode est plus cohérente, plus précise et plus fiable que de reformuler le prompt à chaque fois, ce qui explique pourquoi elle est devenue le flux de travail par défaut en 2026.
Dans Flick, c’est l’outil Character Reference, et il ne nécessite que trois étapes :
- Générez ou téléversez une image de votre personnage — un portrait net, bien éclairé et de face donne les meilleurs résultats
- Sélectionnez cette image, puis cliquez sur Character Reference
- Décrivez librement votre nouvelle scène (« marchant dans le marché éclairé au néon la nuit, cinématographique »), pendant que votre référence maintient votre personnage stable.
C’est la technique la plus efficace pour presque tous les créateurs, car elle ne nécessite ni entraînement, ni code, ni GPU — juste une bonne image de référence. Regardez notre tutoriel : Tutoriel Nano Banana Pro pour la cohérence des personnages
Commencez dès maintenant. Créez votre personnage.
Pourquoi la dérive de personnage se produit
Pour corriger la dérive de personnage, il est utile de comprendre ce qui la cause. Lorsque vous générez une image, le modèle commence par du bruit aléatoire. Il supprime ce bruit étape par étape, guidé par votre prompt, jusqu'à ce qu'une image claire émerge. C'est ce qu'on appelle la diffusion.
Lorsque vous décrivez un personnage dans un prompt, vous ne pointez pas réellement le modèle vers une personne spécifique. « Un homme barbu d'une trentaine d'années » correspond à des millions d'images vues par les modèles lors de l'entraînement. Votre prompt atterrit quelque part dans l'espace de toutes ces possibilités. Le résultat est une généralisation issue de l'ensemble de cet espace d'images — une moyenne de nombreux visages différents correspondant à votre description.
Par conséquent, même lorsque vous réutilisez exactement le même prompt pour décrire un personnage, le modèle repart d'un nouveau bruit aléatoire et finit par se poser sur un point légèrement différent de cet espace. Cela fait que le résultat est légèrement différent à chaque fois, même si le prompt reste identique. De légères variations de votre prompt, comme l'ajout de nouveaux angles, d'un nouveau personnage, ou d'un arrière-plan différent, amplifient cet effet. Plan après plan, ces variations s'accumulent, et finalement votre personnage d'origine dérive vers quelqu'un d'autre.
C'est exactement ce que corrige la fonctionnalité Character Reference de Flick. Au lieu de stocker votre personnage dans un prompt, l'outil Character Reference conserve votre protagoniste sous forme d'image de référence. Ainsi, chaque nouvelle génération reproduit votre personnage d'origine, même lorsque vous modifiez différents aspects de la scène.
Le personnage que vous définissez représente une version généralisée de nombreuses images rencontrées par le modèle lors de l'entraînement. Chaque génération d'image est nouvelle, et commence par du bruit aléatoire. Le modèle supprime ce bruit étape par étape (diffusion) jusqu'à ce qu'apparaisse une image correspondant au prompt que vous avez décrit. Le personnage que vous définissez représente une version généralisée de nombreuses images rencontrées par le modèle lors de l'entraînement. Chaque génération part d'un bruit aléatoire, et produit un visage légèrement différent à l'intérieur de cette plage. Par conséquent, au fil de plusieurs générations, surtout à mesure que vous ajoutez du contenu à votre prompt, votre rendu initial du personnage dérive vers quelque chose de totalement nouveau.
Créer des personnages cohérents avec Flick

The Herder, verrouillé sur une référence de personnage unique. Regardez le film complet.
D'abord, créez un personnage — The Herder : pas un héros, pas un magicien, juste un travailleur dont le savoir-faire devient invisible dès qu'il fonctionne. C'est un artisan de « l'Europe moderne » (à peu près 1800–début des années 1900). Pour le garder cohérent de face comme de dos (et d'un plan à l'autre), utilisez l'outil Character Reference de Flick.
Commencez avec une seule image de référence. À partir de cette image initiale, générez plusieurs planches de rotation — de face, de profil, de dos — dans différents états : avec chapeau, sans chapeau, avec parapluie, mains libres, manteau mouillé, changement d'équipement.


Combinez ensuite les planches de rotation avec l'outil Character Reference de Flick, afin que la silhouette de face/profil/dos du personnage reste stable d'un plan à l'autre.
5 méthodes pour des personnages IA cohérents, comparées
Il n'existe pas un seul outil ou modèle « idéal », mais il existe une méthode adaptée à votre niveau de compétence et au degré de contrôle dont vous avez besoin. Voici un résumé des 5 meilleures approches de cohérence de personnage en img2img et à qui elles conviennent le mieux :
| Méthode | Fonctionnement | Idéal pour | Effort | Cohérence |
|---|---|---|---|---|
| Character Reference (img2img) | Téléchargez une image de référence ; le modèle reproduit cette identité dans de nouvelles scènes | Presque tout le monde — le chemin le plus rapide vers un personnage cohérent | Faible | Élevée |
| Planche de personnage / de rotation | Générez des vues de face, de profil, de dos et de 3/4 à utiliser comme références multi-angles | Donner aux outils d'image et de vidéo suffisamment de contexte pour les angles et les mouvements | Faible à moyen | Élevée |
| Prompting | Réutilisez la même seed et une description de personnage identique à chaque génération | Variations rapides sur un seul look | Faible | Moyenne |
| Entraînement LoRA | Entraînez un petit modèle personnalisé sur 15 à 50 images de votre personnage | Des centaines de plans avec une dérive quasi nulle | Élevé | Très élevée |
| Face swap (nettoyage final) | Générez librement, puis remplacez le visage de votre personnage sur chaque image | Corriger la dérive après coup | Moyen | Élevée (visage uniquement) |
Comment garder un personnage cohérent dans chaque outil majeur

Midjourney gère la cohérence grâce à Omni Reference (le paramètre —oref, avec un poids omni —ow pour contrôler l'intensité de l'attachement à votre référence). Utilisez un poids modéré pour un bon équilibre (100 par défaut), et réduisez-le lorsque vous modifiez certains aspects de votre personnage. Cela produit de superbes résultats, avec des styles incroyables, mais cela peut atténuer les détails fins comme les taches de rousseur ou les tatouages.
Veo 3 de Google (et Veo 3.1) maintient la cohérence des personnages grâce à son système de référence « Ingredients to Video ». Fournissez-lui vos images de référence pour verrouiller l'identité de votre personnage, et veillez à utiliser exactement la même description de personnage dans chaque prompt. Veo produit également un audio synchronisé natif et un lip-sync, pour que votre personnage puisse parler.
Sora a construit sa cohérence des personnages autour de clips de référence enregistrés (initialement appelés « Cameos », puis renommés « Characters ») qui créaient une ressemblance réutilisable d'une génération à l'autre, avec audio natif. OpenAI a mis fin à Sora en 2026, mais vous pouvez utiliser le modèle img2img d'OpenAI, GPT Image 2, pour générer des scènes avec votre personnage dans Flick.
Pour un contrôle absolu, ComfyUI vous permet de combiner des outils comme PuLID, InstantID et IP-Adaptor avec un LoRA de personnage entraîné sur mesure, ainsi que des nœuds de contrôle de pose et d'affinage du visage. C'est la voie la plus exigeante et la plus technique, mais idéale si vous recherchez une génération locale illimitée sans aucune dérive.
Le workflow de bout en bout : de la création du personnage au montage final
Pour aller au-delà des images et intégrer vos personnages dans vos films complets, voici le workflow utilisé par les meilleurs créateurs en 2026 :
- Concevez votre protagoniste. Générez un portrait unique et fort que vous adorez.
- Constituez une planche de référence. Créez un turnaround (face, profil, dos, 3/4). Créez des références avec différentes tenues, accessoires et expressions.
- Définissez la Character Reference dans Flick et générez chaque plan de votre scène, en veillant à bien définir le décor et l'action de votre personnage dans chaque prompt.
- Animez à partir de l'image fixe. Prenez chaque image verrouillée et utilisez un modèle image-to-video pour créer des scènes avec votre personnage.
- Montez et étalonnez. Assemblez vos scènes dans l'éditeur vidéo pour produire votre résultat final.
La règle pratique : ancrez d'abord l'identité dans une image fixe, puis animez-la.
Comment obtenir encore plus de précision avec la cohérence des personnages dans Flick

Notre équipe interne de réalisation a passé d'innombrables heures à expérimenter différentes solutions pour obtenir les meilleurs résultats en matière de cohérence des personnages en img2img dans Flick. En cours de route, nous avons découvert plusieurs astuces avancées que vous pouvez utiliser pour générer des plans plus précis, tout en gardant vos personnages cohérents.
L'un des aspects les plus cruciaux d'un workflow de cohérence des personnages solide est le prompting. Nous vous proposons une liste complète de prompts que vous pouvez utiliser pour la cohérence des personnages en img2img. Ci-dessous, je vous présente les meilleurs prompts pour la cohérence des personnages, utilisables dans différents workflows.
Pour la première méthode, commençons sans notre référence de personnage unique, que nous transformons en planche de turnaround, comme suit :


À partir de là, notre objectif est de générer notre premier plan avec notre personnage. Dans ce cas, créons un plan de notre personnage voyageant dans un carrosse luxueux, regardant par la fenêtre une plaine enneigée nordique à l'extérieur.
Le truc ici, plutôt que de générer notre image et notre personnage en une seule fois, ce qui offre moins de précision, c’est de d’abord générer un léger croquis schématique au pochoir de l’image souhaitée, avec la description de notre personnage intégrée dans le texte. Il est important de ne pas entrer dans trop de détails ici, car il ne s’agit que d’un schéma léger de notre plan final. Nous pouvons créer un prompt pour générer cette image, comme suit :
Crée un croquis au crayon léger et sommaire, aux contours simples. Vise un schéma grossier, sans trop de détails. Le décor se situe à l’intérieur d’un carrosse luxueux. L’intérieur du carrosse est globalement très sombre, avec seulement une faible lumière ambiante. La seule source de lumière nette provient de l’extérieur, par la fenêtre. La fenêtre du carrosse est une ouverture entièrement dégagée, sans vitre. De lourds rideaux encadrent la fenêtre. L’intérieur du carrosse comprend une structure décorative en bois sculpté et un dossier de siège rembourré. Une fine couche de neige repose sur le rebord de la fenêtre, et un peu de neige s’infiltre doucement à l’intérieur du carrosse. À l’extérieur de la fenêtre s’étend une plaine enneigée nordique. L’extérieur est envahi par un épais brouillard matinal. Le brouillard blanc est très dense, et l’on ne distingue que de vagues formes : une plaine enneigée dégagée, de basses collines enneigées et de très lointaines silhouettes de montagnes. Le personnage est une jeune femme européenne d’une vingtaine d’années. Son visage est un ovale doux et légèrement étroit, avec un front lisse, des pommettes marquées, une mâchoire nette et un menton subtilement effilé. Ses sourcils sont foncés, bien dessinés et globalement droits. Ses yeux sont en amande, allongés, avec des paupières supérieures clairement définies et un regard stable et direct. Les iris et les pupilles sont d’un ambre doré éclatant, et les yeux présentent des reflets humides réalistes. L’arête de son nez est droite et fine, avec un petit bout de nez raffiné. Ses lèvres sont bien dessinées, avec une lèvre supérieure relativement fine et une lèvre inférieure légèrement plus pulpeuse. Son expression est calme et sérieuse. Sa peau est pâle, avec une légère sous-tonalité froide, conservant de légères taches de rousseur, une texture de peau réaliste, des pores visibles, un léger détail sous les yeux, de minuscules asymétries, une texture de lèvres réaliste et de subtiles variations naturelles de la peau. Elle appuie son menton sur sa main, plongée dans une contemplation silencieuse, le regard porté sur un vaste paysage vide de plaine enneigée nordique.
En générant avec GPT Image 2, voici notre résultat :

Comme nous sommes satisfaits de notre croquis, nous pouvons passer à la génération de notre plan final. Nous pouvons utiliser un modèle d’image comme Nano Banana Pro pour générer notre plan final, en fournissant nos images de Character Reference et notre croquis de composition afin que le modèle sache exactement à quoi doit ressembler notre personnage dans la composition.
Notre prompt commence par demander au modèle d’utiliser le croquis fourni comme référence de composition, de faire correspondre nos images de Character Reference avec une précision de 100 %, et de transformer le croquis en une photographie en prise de vue réelle. Voici le prompt complet :
Utilisez le croquis fourni comme seule référence de composition. Utilisez la référence de profil fournie comme seule référence pour le visage et les cheveux. Utilisez la référence en pied fournie comme seule référence pour la tenue.
Créez une photographie en prise de vue réelle en gros plan de Serana. L’action du personnage, la composition générale et la structure intérieure du carrosse correspondent à 100 % exactement au croquis fourni. L’identité du personnage, le contour facial de profil, les traits du visage, le teint de peau, les yeux ambre-doré et la coiffure correspondent à 100 % à la référence de profil fournie. Le design de la tenue, les couleurs et le style général du personnage correspondent à 100 % à la référence en pied fournie.
Transformez l’image en photographie en prise de vue réelle. La scène se déroule à l’intérieur d’un carrosse luxueux. L’intérieur du carrosse est globalement très sombre, avec seulement une faible lumière ambiante. La seule source de lumière claire provient de l’extérieur, par la fenêtre. La fenêtre du carrosse est une ouverture entièrement dégagée, sans vitre. De lourds rideaux encadrent la fenêtre. L’intérieur du carrosse comprend une structure décorative en bois sculpté et un dossier de siège rembourré. Une fine couche de neige repose sur le rebord de la fenêtre, et un peu de neige s’infiltre doucement à l’intérieur du carrosse.
À l’extérieur de la fenêtre s’étend une plaine enneigée nordique. L’extérieur est empli d’un épais brouillard matinal. Le brouillard blanc est très dense, et l’on ne distingue que de vagues formes d’une plaine ouverte enneigée, de basses collines enneigées et des silhouettes de montagnes très lointaines. Une faible lumière matinale traverse le brouillard et vient effleurer le visage de Serana et les bords de sa chevelure. Les zones lumineuses présentent un léger halo, en particulier dans les hautes lumières brumeuses à l’extérieur, le long de la lumière de la fenêtre, et sur la lumière matinale qui traverse son visage.
La mise au point est centrée sur le visage de Serana. Ses yeux, ses cils, la texture de sa peau et son contour facial sont les éléments les plus nets de l’image, mais ils conservent tout de même une légère douceur naturelle propre à une vraie caméra et une légère imperfection de mise au point, plutôt qu’une netteté parfaitement clinique. La vue extérieure est extrêmement floue et ne se lit que comme des couches très douces et estompées. Le reste de l’intérieur du carrosse est également doucement flou, tout en conservant une structure lisible.
Préservez une texture de peau réaliste, des pores visibles, de subtiles taches de rousseur, une texture de cheveux réaliste, une texture de tissu réaliste, une texture de bois réaliste, un léger grain de film, un léger bruit de capteur, une légère douceur d’objectif, une très subtile aberration chromatique, et un rendu naturel et imparfait typique d’une vraie caméra.
En générant avec Nano Banana Pro, voici notre résultat :


Commencer par un croquis de composition avant de générer l’image finale ne nécessite qu’une génération d’image supplémentaire, mais offre un contrôle créatif supérieur sur la composition de notre plan final. Ensuite, en effectuant une seconde génération avec notre croquis de composition et nos images de personnage comme références, notre plan final suit la composition souhaitée tout en conservant une cohérence parfaite du personnage.
Passer des images fixes de personnage à la vidéo

Jusqu’ici, ce guide vous a donné les connaissances nécessaires pour créer des images fixes de plans extrêmement précises avec une cohérence de personnage. La prochaine étape consiste à générer des vidéos à partir de ces plans, tout en évitant la dérive du personnage. Il s’agit d’un défi unique dans le cinéma génératif par IA, car votre personnage doit rester cohérent non seulement au sein d’une seule génération d’image, mais aussi d’une image à l’autre au sein de votre vidéo générée. De plus, chaque nouveau plan est une occasion pour votre personnage de dériver. Nos cinéastes ont constaté que, le plus souvent, les aspects suivants se dégradent lors du passage de l’image à la vidéo :
- Dérive d'une image à l'autre. En particulier lorsque vous animez votre personnage dans de nouvelles poses, une dérive du personnage se produit. Le visage de votre personnage, par exemple, peut se déformer en plein plan lorsque la tête pivote en s'éloignant puis en revenant vers la caméra.
- Vues de profil et de dos. La plupart des systèmes de référence sont entraînés sur des visages de face. Lorsque votre personnage se tourne de trois quarts ou de profil complet, cette référence peut ne plus fonctionner. C'est pourquoi il est impératif d'utiliser une planche de rotation, présentant plusieurs angles de votre personnage (face, profil, dos, 3/4).
- Dérive des résultats et des accessoires. Les modèles image-to-video ont tendance à se concentrer principalement sur le maintien du visage de votre personnage tout au long d'une vidéo générée. Les vêtements et accessoires, par conséquent, reçoivent moins d'attention pendant la génération. C'est pourquoi il est essentiel de verrouiller votre garde-robe dans votre image de référence, et de le renforcer dans le prompt que vous fournissez au modèle image-to-video.
- Limites de durée et enchaînement des plans. La plupart des modèles image-to-video limitent un clip unique à 5-15 secondes. Cela signifie que la génération de plans plus longs nécessite de générer un clip, d'extraire sa dernière image à l'aide de l'outil Extract Frame de Flick, puis d'utiliser cette image comme image de départ du clip suivant. Chaque nouvelle étape de la chaîne vers une nouvelle génération image-to-video est une nouvelle occasion pour votre personnage de dériver.
Les modes de référence que vous utiliserez réellement pour la génération de vidéos
- Reference-to-video — fournissez une ou plusieurs images de votre personnage grâce à l'intégration à la pointe de la technologie de Flick avec des modèles puissants comme Kling Omni Reference et Seedance Reference to Video.
- Start/end frame — fournissez la première image (et éventuellement la dernière) dans votre génération image-to-video. L'utilisation d'images de début et de fin avec des rendus précis de votre personnage et de la composition souhaitée, en s'appuyant sur la méthode du croquis de composition décrite ci-dessus, donne les meilleurs résultats.
- Character LoRA — pour minimiser la dérive sur l'ensemble d'un film, entraînez un LoRA sur vos références de personnage en utilisant un grand nombre d'images (50+). Les modèles comme Wan 2.2, avons-nous constaté, sont les meilleurs pour cela. Appliquer ce LoRA lors de la génération vous permet de produire d'excellents résultats vidéo tout en maintenant la cohérence des personnages.
Le workflow vidéo Flick avec cohérence des personnages
C'est là que le workflow Character Reference, conçu autour de la fonctionnalité native Character Reference de Flick, porte ses fruits. Comme vous avez déjà verrouillé votre personnage dans une image fixe et créé une planche de rotation, vous fournissez au modèle vidéo le meilleur contexte possible sur l'apparence souhaitée de votre personnage dans la génération finale. Voici les deux meilleures méthodes que nos réalisateurs internes ont trouvées :
Utiliser Omni Reference pour obtenir une cohérence des personnages

Pour cette méthode, vous commencez avec une image du décor souhaité. Par exemple, générons un environnement de montagne enneigée dans la tonalité bleue épurée souhaitée, en spécifiant la composition, la palette de couleurs, l'angle de caméra pour une précision supérieure. Voici notre prompt :
Photographie cinématographique grand angle d'un vaste versant alpin recouvert de neige, présentant une pente de neige immaculée et lisse traversant le cadre en diagonale, un immense espace négatif, une poudreuse intacte, de subtiles textures sculptées par le vent dans la neige, une crête rocheuse lointaine émergeant du glacier, une composition paysagère minimaliste, une douce lumière hivernale, un étalonnage colorimétrique bleu pâle et atmosphérique, un air de montagne froid, une nature sauvage sereine, sans personnage, sans arbre, sans structure.
Photographié depuis un point de vue alpin élevé, mettant l'accent sur l'échelle et le vide. Formes géométriques épurées créées par la neige et l'ombre, transitions tonales douces, terrain gelé étendu s'étirant au-delà du cadre.
Photographie ultra-réaliste, compression téléobjectif moyen, photographie d'expédition National Geographic, grande plage dynamique, détails nets dans la texture de la neige, subtile brume atmosphérique, éclairage naturel, cinématographie extérieure premium, esthétique glacier islandais, minimalisme scandinave, sens à couper le souffle de l'isolement et du calme.
Composition : ligne directrice diagonale forte, cadrage asymétrique, 80 % de tons de neige et de ciel, espace négatif extrême, photographie paysagère minimaliste d'art.
Palette de couleurs : bleu glace, blanc glacier, gris pierre doux, tons hivernaux sourds.
Caméra : Sony A1, objectif 135mm, f/8, ISO 100, filtre polarisant, étalonnage colorimétrique cinématographique.
En générant avec Nano Banana Pro, voici notre résultat :


À partir de là, nous pouvons utiliser l'un des modèles phares Omni Reference de Flick pour animer notre personnage dans la scène. Kling comme Seedance offrent d'excellents résultats et un contrôle précis du personnage. Pour accéder à Omni Reference, il suffit de survoler notre image générée de notre décor, de sélectionner vidéo, puis de choisir Seedance 2.0.

Cohérence des personnages avec Seedance 2.0

À partir de là, nous pouvons fournir notre image de décor ainsi que nos images de référence du personnage en tant qu'entrées. Puisque nous prévoyons d'animer notre personnage marchant en pied à travers la scène, il est préférable de fournir des images de référence en pied de notre personnage. Pour ajouter du dialogue, nous pouvons éventuellement joindre un fichier audio en référence et demander au modèle de faire prononcer ce dialogue par notre personnage.
Pour cet exemple, générons une vidéo de notre personnage marchant à travers notre scène et prononçant notre dialogue « Ah ! Ça fait du bien de respirer ici. » Nous pouvons également préciser un style de caméra portée à l'épaule pour obtenir exactement le rendu vidéo recherché.
Le système de mentions à la pointe de la technologie de Flick vous permet de référencer des entrées spécifiques dans votre prompt, afin d'indiquer précisément au modèle comment utiliser chaque entrée dans la génération finale. Par exemple, nous pouvons dire au modèle d'utiliser la première image comme image de départ, puis d'utiliser nos trois images de référence du personnage pour créer l'apparence de notre personnage. Nous précisons le mouvement de notre personnage, puis demandons au modèle de faire prononcer notre dialogue joint par notre personnage. Voici notre prompt final :
Prends @Image1 comme image de départ. Reprends l'apparence de Serana à partir de @Image2, @Image3 et @Image4. Style caméra portée à l'épaule, Serana entre dans le cadre par le coin inférieur gauche, s'étire en marchant, et prononce @Audio1.


Ce prompt est court et simple — et c'est précisément l'idée. La majeure partie des informations sur lesquelles nous voulons que notre modèle s'appuie provient de nos images de référence. Nous pouvons exploiter les capacités de Seedance 2.0 et le système de mentions de Flick pour préciser exactement comment procéder, produisant une génération vidéo finale précise, tout en maintenant une cohérence irréprochable du personnage. Voici notre résultat final :
Cohérence des personnages avec Kling O3 Pro Omni Reference

Obtenir des vidéos avec une cohérence de personnage grâce à Kling O3 Pro repose sur bon nombre des mêmes étapes qu'avec Seedance 2.0. Commencez par une image de votre décor et vos images de référence de personnage. À partir de là, nous pouvons survoler notre image de référence de décor et accéder à Omni Reference. Le système de mention de Flick s'étend également à Kling Omni Reference, qui vous permet de fournir jusqu'à 12 images de référence que le modèle peut utiliser dans la génération finale.
Pour utiliser Kling O3 Pro Omni Reference avec une référence de personnage, sélectionnez le sélecteur de modèle et transmettez l'image de départ souhaitée. Pour cet exemple, nous utiliserons notre image de référence de décor. Ensuite, vous pouvez utiliser le système de mention de Flick pour créer un Élément. Les Éléments vous permettent de stocker plusieurs images de référence dans une seule mention. Une fois notre image de décor transmise comme image de départ, nous pouvons créer un Élément pour représenter notre personnage. Par défaut, cet élément s'appellera « Element1 ». Nous pouvons attacher nos trois images de référence de personnage en pied à cet unique élément, et le référencer dans le prompt.
Dans le prompt, nous demandons au modèle de reprendre l'apparence de notre personnage à partir d'« Element1 », et précisons un style de caméra à l'épaule. Nous définissons son mouvement : elle « entre dans la scène les bras ouverts, comme si elle sentait le vent », et enfin nous indiquons au modèle d'éviter de générer de la musique de fond. Voici notre prompt final :
Reference Serana's appearance from @Element1 . Handheld camera style. Serana walks into the scene with her arms open, like she's feeling the wind. No background music.
Là encore, nous pouvons garder notre prompt simple, car la majorité des informations fournies au modèle passent par notre Start Frame, qui représente le décor du plan, et un Élément, qui représente notre personnage grâce à nos trois images de référence fournies. Après avoir renseigné notre image de décor comme image de départ, défini Element1 pour représenter notre personnage, et rédigé notre prompt, nous sommes prêts à générer :



Voici le résultat. Il assure parfaitement la cohérence du personnage, conserve notre décor exactement tel que spécifié dans l'image de départ, et suit précisément notre instruction de style caméra à l'épaule :
Obtenir des vidéos avec une cohérence de personnage encore plus précise dans Flick : la méthode Face Swap
Plutôt que de générer votre vidéo, y compris votre scène, le design de votre personnage et le prompt en une seule génération, pour cette méthode, nos réalisateurs internes recommandent deux générations vidéo distinctes.
Dans la première vidéo que nous générons, nous excluons toute référence à notre personnage. Nous fournissons plutôt une image du décor dans lequel nous voulons que le plan se déroule, puis utilisons notre prompt pour détailler l'action que nous voulons voir. Une fois cette vidéo générée, nous extrayons la dernière image à l'aide de l'outil d'extraction d'image de Flick. Nous transmettons cette image à Nano Banana Pro, et la régénérons en utilisant notre image de référence de personnage comme référence. Cela produit une image finale avec notre personnage exact.
Dans la deuxième vidéo que nous générons, nous transmettons la nouvelle image de fin générée avec notre personnage ainsi que la vidéo initiale générée à Kling O3. Cela produit une vidéo finale qui reproduit précisément la vidéo de génération initiale, mais avec notre personnage exact. La première génération nous permet d'avoir un contrôle précis sur la scène et l'action qui s'y déroule, tandis que la seconde génération nous permet d'intégrer notre personnage, assurant ainsi la cohérence du personnage.
Voici comment procéder :
Pour cette méthode, nous commençons avec une seule image de référence de personnage que nous transformons en fiche de rotation, affichant trois vues en pied du personnage disposées côte à côte. Voici le prompt que nous utilisons :
Utilisez l'image fournie comme référence exacte du personnage. Créez une planche de conception de personnage (turnaround sheet) représentant le même personnage historique masculin chinois dans un style de marionnette d'animation en volume artisanale, avec une texture subtile d'argile et de poupée de costume. Montrez trois vues en pied disposées côte à côte : vue de face, vue de profil pur et vue de trois quarts. Préservez le design du costume exactement comme dans l'image de référence, y compris le grand chapeau noir, la robe extérieure gris pâle, la robe intérieure blanche, la longueur de la robe, la forme des manches, la structure du col, la ceinture, les ornements suspendus, les bottes noires, la longue arme en forme de perche, et le récipient cylindrique. Conservez inchangés la silhouette du vêtement, la superposition, les proportions, la coupe des vêtements, le placement des accessoires et la construction générale de la tenue. Ne redessinez pas et ne simplifiez pas le costume. La seule transformation concerne le medium visuel : personnage marionnette fait à la main, esthétique de film d'animation en volume, tissu légèrement texturé, visage légèrement sculpté, traitement de surface subtilement semblable à de l'argile, détails de costume artisanaux, construction de garde-robe miniature réaliste, présentation de type turnaround en studio. Fond neutre uni, éclairage doux et uniforme, corps entier visible, espacement propre, planche de costume hautement lisible, planche de personnage de production soignée, esthétique de film d'animation en volume de fantaisie populaire chinoise, détaillé mais maîtrisé, moins brillant, moins numérique, sensation artisanale tactile.
Voici le résultat :

Nous générons également une image du décor souhaité pour notre scène. Nous pouvons procéder de deux façons. D'abord, nous pouvons saisir un prompt bien défini dans un modèle texte-image comme Nano Banana Pro ou GPT Image 2 pour générer le schéma de l'apparence souhaitée de notre scène.
Pour encore plus de précision, nous pouvons exploiter notre deuxième méthode. Plutôt que de générer avec un modèle texte-image, nous pouvons esquisser à la main notre décor souhaité dans un outil comme Microsoft Paint. Ensuite, nous pouvons demander à Nano Banana Pro de se référer à notre esquisse lors de la génération finale. Pour cet exemple, esquissons un ponton enneigé sur un lac gelé, avec un drapeau rouge délavé flottant au premier plan. Voici notre esquisse :

Ensuite, nous pouvons transmettre notre esquisse à Nano Banana Pro avec un prompt descriptif, détaillant précisément les éléments réalistes que nous recherchons, en utilisant notre esquisse comme référence. Voici notre prompt :
Utilisez cette esquisse de storyboard dessinée à la main comme référence stricte de mise en page et de composition. Préservez à 100 % la composition actuelle, l'angle de caméra, le cadrage, le placement des sujets et le design des formes principales. Décor miniature de marionnette d'animation en volume folklorique chinoise, une branche nue de bord de lac plantée en diagonale dans la neige avec un tissu rouge foncé délavé noué autour, un petit ponton en bois enneigé derrière, des touffes de roseaux et de massettes hivernaux courbés par la neige le long de la rive droite, neige artisanale tactile, ponton construit à la main, texture naturelle de branche, tissu avec un tissage subtil, palette hivernale bleu-gris froide, finition mate artisanale, atmosphère poétique et retenue. La surface du lac devient une surface de glace miniature de studio avec une glace bleu-gris opaque et douce, une irrégularité subtile en forme de plâtre, une finition mate semblable à de la résine, de fines couches de givre, de faibles taches laiteuses, un grain gelé délicat, une variation de surface artisanale douce, un reflet minimal.
Voici notre résultat :

Plutôt que le texte-vers-vidéo, qui repose sur l'encodage de votre personnage dans un prompt, Flick propose une meilleure approche. Utilisez vos images fixes de plans générées, chacune avec la composition et le design de personnage exacts que vous recherchez, comme références pour le modèle image-vers-vidéo. Cela ancre la première image, et permet au modèle de maintenir la cohérence de votre personnage tout au long du reste.
À partir de là, nous pouvons générer notre première vidéo avec Kling O3 Pro, ou un autre modèle image-vers-vidéo. Nous pouvons transmettre notre image de décor comme image de départ, et spécifier l'action de notre personnage. Comme nous ne fournissons pas ici l'image de notre personnage comme référence, nous pouvons garder sa description brève. Pour cet exemple, je vais simplement demander un « pêcheur marionnette d'animation en volume ». Nous précisons son action : marcher dans la neige jusqu'au ponton et s'arrêter à son extrémité. Nous définissons le mouvement souhaité du personnage et dirigeons le modèle pour que la chute de neige devienne de plus en plus intense, soufflant à travers l'image. Voici notre prompt final :
Un pêcheur marionnette d'animation en volume, vêtu d'une cape de pluie en paille et d'un chapeau de bambou, marche dans la neige jusqu'au ponton, légèrement voûté contre le froid, une main se stabilisant, l'autre tenant son manteau serré. La caméra miniature artisanale avance lentement et s'incline légèrement vers le haut. La chute de neige s'intensifie de plus en plus jusqu'à devenir une dense tempête hivernale, la neige soufflant à travers l'image et obscurcissant progressivement le lac gelé. À la fin, le pêcheur atteint l'extrémité du ponton, s'arrête, et reste immobile un bref instant face à la glace.
Avec notre image de décor comme référence, cela produit un résultat précis et magnifique :
C’est là que l’avantage de la méthode de face swap entre en jeu. Une fois satisfaits de notre première génération vidéo, nous pouvons extraire la dernière frame de cette vidéo grâce à l’outil d’extraction de frame de Flick. En utilisant la fiche de rotation de notre personnage générée précédemment, nous pouvons transmettre les deux images à Nano Banana Pro, et demander au modèle de remplacer le personnage dans la dernière frame par notre référence de personnage, tout en conservant l’éclairage, la composition, l’angle de caméra, et le décor de notre génération initiale. Voici notre prompt :
Utilisez la scène du quai enneigé comme référence de composition principale et utilisez la fiche de conception du personnage marionnette en stop-motion fournie comme référence de personnage. Remplacez le pêcheur debout au bout du quai par ce personnage exact. Faites correspondre la silhouette vue de dos, la forme du chapeau, la longueur de la robe, la robe extérieure gris pâle, la robe intérieure blanche, les bottes noires, la ceinture, les accessoires suspendus, l’objet en forme de long bâton, le récipient cylindrique, ainsi que les proportions corporelles globales de la fiche de personnage. Gardez le personnage tourné dos à la caméra, à l’extrémité du quai, dans la même mise en scène de dos que l’image actuelle. Préservez l’angle de caméra existant, la composition, le quai, le lac gelé, la branche avec le tissu rouge délavé au premier plan, le rivage enneigé, et les roseaux courbés par la neige. Conservez le style miniature de marionnette folklorique chinoise en stop-motion, les matériaux artisanaux, la neige tactile, la glace mate, les proportions subtiles de marionnette, et l’atmosphère hivernale paisible. Le nouveau personnage doit sembler naturellement intégré au même décor miniature, avec la même échelle, la même logique de pose de dos, et la même ambiance cinématographique retenue.
Avec nos deux entrées, notre fiche de rotation et la dernière frame extraite, nous utilisons Nano Banana Pro pour générer notre nouvelle frame finale :


Voici notre résultat :

Ce qui rend cette méthode si puissante, c’est que nous pouvons être précis sur l’apparence exacte que nous voulons donner à la composition de notre scène. Plutôt que de demander au modèle de générer notre vidéo finale avec notre image de décor, nos références de personnage et notre prompt en une seule fois, nous divisons cela en deux passes. Dans la première, nous créons notre scène, en accordant peu d’attention au personnage pour l’instant. Ensuite, nous générons une nouvelle frame finale avec le personnage souhaité, puis effectuons une seconde passe pour générer notre vidéo finale.
En utilisant notre image de décor créée précédemment comme frame de départ, et notre nouvelle frame de fin affinée incluant notre référence de personnage, nous générons notre résultat final. En plus de notre référence de personnage intégrée dans la frame de fin, nous utilisons un prompt pour rappeler au modèle la description de notre personnage, son mouvement, le décor, ainsi que le mouvement de caméra et l’audio d’ambiance souhaités. Voici notre prompt :
Un lettré-fonctionnaire marionnette chinoise en stop-motion, coiffé d’un haut chapeau noir, vêtu d’une robe extérieure gris pâle par-dessus une robe intérieure blanche, portant des bottes noires, avec un carquois et une épée hengdao suspendus à son côté, marche lentement dans la neige jusqu’au quai avec des pas mesurés et retenus. La caméra miniature artisanale avance lentement et s’incline légèrement vers le haut. De légers flocons de neige dérivent doucement dans le cadre. Le lac gelé reste calme et immobile. À la fin, le lettré-fonctionnaire atteint l’extrémité du quai, s’arrête, et se tient immobile face à la glace. Atmosphère très silencieuse, seuls de légers pas résonnent dans la neige et sur le bois.
Et voici notre résultat final :
Cette méthode est plus avancée, mais offre un contrôle extrêmement précis sur la composition de notre scène, tout en maintenant une cohérence exacte du personnage. Bien qu’elle nécessite d’exécuter deux générations vidéo distinctes avec Kling ou un autre modèle, ce qui est plus coûteux, elle vous permet d’économiser des crédits que vous auriez autrement gaspillés sur une seule vidéo imprécise qui ne vous conviendrait pas.
Questions fréquentes
Quel est le meilleur outil IA pour des personnages cohérents ?
Il n'existe pas un seul meilleur outil, mais une meilleure méthode. Pour la plupart des gens, un flux de travail img2img avec Character Reference (comme celui de Flick) est la façon la plus rapide et la plus fiable de garder un personnage cohérent sans aucun entraînement. Pour une production à grand volume avec une dérive quasi nulle, un LoRA entraîné sur mesure dans ComfyUI reste la référence absolue.
Que signifie la cohérence de personnage img2img ?
La cohérence de personnage image à image (img2img) signifie générer de nouvelles images de votre protagoniste — dans un nouveau décor, avec des détails ajoutés, sous un angle inédit — tout en conservant exactement l’identité visuelle de votre personnage défini.
Comment puis-je obtenir une cohérence de personnage dans Flick ?
Vous fournissez une image de référence de votre personnage. Grâce à l'outil Character Reference, l'IA génère de nouvelles images qui préservent l'identité visuelle de votre protagoniste. Plutôt que de décrire votre personnage avec des mots en espérant que le modèle produise deux fois le même résultat, vous lui donnez la référence et lui dites : « ce personnage, maintenant dans une nouvelle scène ».
Comment créer un personnage cohérent dans Midjourney ?
Utilisez Omni Reference (--oref) avec l'image de référence de votre personnage, et ajustez l'omni-weight (--ow) pour que le modèle conserve l'identité tout en suivant votre prompt de scène.
Puis-je garder un personnage cohérent en vidéo IA ?
Oui. Fixez d'abord le personnage dans une image fixe, puis animez cette image avec la fonctionnalité de référence d'un outil vidéo — « Ingredients » de Veo 3, References de Runway, ou « Elements » de Kling. Animer à partir d'une image fixe verrouillée offre une bien meilleure cohérence que le texte vers vidéo.
Dois-je entraîner un modèle pour obtenir un personnage cohérent ?
Non. Entraîner un LoRA offre le verrouillage le plus précis possible, mais pour la plupart des projets, une seule bonne image de référence avec une fonctionnalité Character Reference suffit. N'entraînez un modèle que lorsque vous générez des centaines de plans et que la dérive devient coûteuse à corriger manuellement.
Pourquoi mon personnage IA continue-t-il de changer ?
Parce que chaque génération est créée à partir de zéro, sans mémoire de la précédente, de sorte que de petites variations s'accumulent en dérive. La solution consiste à donner au modèle une référence fixe à respecter plutôt que de redécrire le personnage avec des mots à chaque fois.
Comment débuter avec Flick ?
Regardez notre tutoriel : Flick 101 : Bien démarrer. Créez votre premier projet, terminez l'intégration, et commencez votre aventure de réalisation de films IA !
Découvrez des tutoriels associés :
https://flick.art/docs/visual-styles
https://flick.art/docs/voice-consistency
En savoir plus sur The Herder :
https://flick.art/blog/behind-the-herder
Pourquoi créer de bons personnages est essentiel :
https://flick.art/blog/in-the-ai-era-story-is-everything