
Cómo crear personajes de IA consistentes en 2026: la guía completa
Jun 2026
La consistencia de personajes de imagen a imagen significa generar nuevas imágenes del mismo personaje, en nuevas escenas y desde nuevos ángulos, preservando su identidad visual exacta. En lugar de volver a describir al personaje con palabras cada vez, le das al modelo una imagen de referencia y este iguala el rostro, el cabello y el vestuario en cada toma.
Si alguna vez has creado un personaje y lo has visto desmoronarse en nuevas tomas con distintos ajustes, ángulos de cámara y detalles finos, has experimentado la deriva del personaje. Este es uno de los desafíos más comunes en el cine con IA. Esta guía explica con precisión por qué ocurre la deriva del personaje y los métodos exactos que puedes usar para solucionarla, permitiéndote mantener personajes consistentes en Flick, Midjourney, Veo 3, Sora y ComfyUI.
Cómo crear personajes de IA consistentes en 2026 de un vistazo
Para quienes quieran un resumen rápido, aquí está la respuesta corta:
La forma más confiable de crear un personaje consistente con IA es fijar la identidad del personaje en una única imagen de referencia primero, y reutilizar esa referencia para cada nueva toma. Este método es más consistente, preciso y confiable que volver a escribir el prompt desde cero, razón por la cual se ha convertido en el flujo de trabajo predeterminado en 2026.
En Flick, esta es la herramienta Character Reference y solo requiere tres pasos:
- Genera o sube una imagen de tu personaje: un retrato limpio, bien iluminado y de frente produce los mejores resultados
- Selecciona esa imagen y haz clic en Character Reference
- Describe libremente tu nueva escena (”caminando por el mercado iluminado de neón por la noche, cinematográfico”), mientras tu referencia mantiene a tu personaje estable.
Esta es la técnica de mayor impacto para casi todos los creadores porque no requiere entrenamiento, ni código, ni GPU, solo una buena imagen de referencia. Mira nuestro tutorial: Tutorial de Nano Banana Pro para la consistencia de personajes
Empieza ahora. Crea tu personaje.
Por qué ocurre la deriva del personaje
Para solucionar la deriva de personaje, ayuda entender qué la causa. Cuando generas una imagen, el modelo comienza con estática aleatoria. Va eliminando esa estática paso a paso, guiado por tu prompt, hasta que surge una imagen clara. Esto se llama difusión.
Cuando describes un personaje en un prompt, en realidad no estás señalando al modelo una persona específica. "Un hombre barbudo de unos treinta años" coincide con millones de imágenes que los modelos vieron durante el entrenamiento. Tu prompt cae en algún punto dentro del espacio de todas esas posibilidades. El resultado es un promedio generalizado extraído de todo el conjunto de esas imágenes: una combinación de muchos rostros distintos que encajan con tu descripción.
Como resultado, incluso cuando reutilizas exactamente el mismo prompt para describir un personaje, el modelo comienza con un nuevo fragmento aleatorio de estática y finalmente se asienta en un punto ligeramente distinto dentro de ese espacio. Esto hace que el resultado sea un poco diferente cada vez, aunque el prompt se mantenga igual. Pequeñas variaciones en tu prompt, como agregar nuevos ángulos, un nuevo personaje o un fondo diferente, agravan este efecto. Toma tras toma, estas variaciones se acumulan, y finalmente tu personaje original va derivando hasta convertirse en otra persona.
Esto es justo lo que soluciona la función Character Reference de Flick. En lugar de almacenar tu personaje en un prompt, la herramienta Character Reference guarda a tu protagonista como una imagen de referencia. De esta manera, cada nueva generación reproduce a tu personaje original, incluso mientras modificas distintos aspectos de la escena.
El personaje que defines representa una versión generalizada de muchas imágenes que el modelo ha visto durante el entrenamiento. Cada generación de imagen es nueva y comienza con estática aleatoria. El modelo elimina esa estática paso a paso (difusión) hasta que aparece una imagen que coincide con el prompt que has descrito. El personaje que defines representa una versión generalizada de muchas imágenes que el modelo ha visto durante el entrenamiento. Cada generación parte de una estática aleatoria distinta y produce un rostro ligeramente diferente dentro de ese rango. Como resultado, a lo largo de varias generaciones, especialmente a medida que agregas más contenido a tu prompt, la representación inicial de tu personaje va derivando hacia algo totalmente nuevo.
Crea personajes consistentes con Flick

The Herder, fijado como una única referencia de personaje. Mira la película completa.
Primero, crea un personaje — The Herder: no es un héroe, no es un mago, solo un trabajador cuyo oficio se vuelve invisible en el momento en que funciona. Es un artesano de la "Europa moderna" (aproximadamente entre 1800 y principios de 1900). Para mantenerlo consistente de frente a atrás (y de toma a toma), usa la herramienta Character Reference de Flick.
Comienza con una única imagen de referencia. A partir de esta imagen inicial, crea múltiples hojas de rotación (turnaround sheets) —frente/lateral/espalda— en diferentes estados: con sombrero, sin sombrero, con paraguas, manos libres, abrigo mojado, cambio de vestuario.


Luego combina las hojas de rotación con la herramienta Character Reference de Flick, para que la silueta de frente/lateral/espalda del personaje se mantenga estable en todas las tomas.
5 métodos para personajes de IA consistentes, comparados
No existe una única herramienta o modelo "correcto", pero sí hay un método adecuado según tu nivel de habilidad y cuánto control necesitas. Aquí tienes un resumen de los 5 mejores enfoques de consistencia de personajes img2img y para quién son más adecuados:
| Método | Cómo funciona | Ideal para | Esfuerzo | Consistencia |
|---|---|---|---|---|
| Character Reference (img2img) | Sube una imagen de referencia; el modelo replica esa identidad en nuevas escenas | Casi todo el mundo — el camino más rápido hacia un personaje consistente | Bajo | Alta |
| Hoja de rotación de personaje (turnaround sheet) | Genera vistas de frente, lateral, espalda y 3/4 para usarlas como referencias multiángulo | Dar a las herramientas de imagen a video suficiente contexto para ángulos y movimiento | Bajo–medio | Alta |
| Prompting | Reutiliza la misma seed y una descripción de personaje idéntica en todas las generaciones | Variaciones rápidas sobre un mismo aspecto | Bajo | Media |
| Entrenamiento LoRA | Entrena un pequeño modelo personalizado con 15–50 imágenes de tu personaje | Cientos de tomas con una deriva casi nula | Alto | Muy alta |
| Intercambio de rostro (limpieza final) | Genera libremente y luego intercambia el rostro de tu personaje en cada fotograma | Corregir la deriva después de generar | Medio | Alta (solo el rostro) |
Cómo mantener un personaje consistente en cada herramienta principal

Midjourney gestiona la consistencia mediante Omni Reference (el parámetro —oref, con un omni-weight —ow para controlar la fuerza con la que se ajusta a tu referencia). Usa un peso moderado para lograr equilibrio (100 es el valor predeterminado) y redúcelo cuando estés modificando aspectos de tu personaje. Produce resultados hermosos, con estilos increíbles, pero puede suavizar detalles finos como pecas o tatuajes.
Veo 3 de Google (y Veo 3.1) mantiene la consistencia de los personajes con su sistema de referencia "Ingredients to Video". Aliméntalo con tus imágenes de referencia para fijar la identidad de tu personaje, y asegúrate de usar la misma descripción del personaje en cada prompt. Veo también genera audio sincronizado nativo y sincronización labial, para que tu personaje pueda hablar.
Sora construyó la consistencia de personajes en torno a clips de referencia grabados (originalmente "Cameos", más tarde llamados "Characters") que creaban una apariencia reutilizable a lo largo de las generaciones, con audio nativo. OpenAI descontinuó Sora en 2026, pero puedes usar el modelo de imagen img2img de OpenAI, GPT Image 2, para generar escenas con tu personaje en Flick.
Para un control absoluto, ComfyUI te permite combinar herramientas como PuLID, InstantID e IP-Adaptor con un LoRA de personaje entrenado a medida, además de nodos de control de pose y de detalle facial. Es la ruta más desafiante y técnica, pero ideal si buscas generación local ilimitada sin ninguna deriva.
El flujo de trabajo de principio a fin: del diseño del personaje al corte final
Para ir más allá de las imágenes e integrar tus personajes en tus películas completas, este es el proceso de trabajo que usan los mejores creadores en 2026:
- Diseña a tu protagonista. Genera un único retrato sólido que te encante.
- Crea una hoja de referencia. Genera un giro completo (frente, perfil, espalda, 3/4). Crea referencias con distintos atuendos, accesorios y expresiones.
- Configura la Character Reference en Flick y genera cada plano de tu escena, centrándote en definir el entorno y la acción de tu personaje en cada prompt.
- Anima a partir de la imagen fija. Toma cada imagen fijada y usa un modelo de imagen a video para crear escenas de tu personaje.
- Edita y colorea. Ensambla tus escenas en el editor de video para producir tu resultado final.
La regla práctica: ancla primero la identidad en una imagen fija y luego anímala.
Cómo lograr aún más precisión con la consistencia de personajes en Flick

Nuestro equipo interno de cineastas ha invertido incontables horas experimentando con diferentes soluciones para lograr los mejores resultados en la consistencia de personajes img2img en Flick. En el camino, hemos descubierto varios consejos y trucos avanzados que puedes usar para generar planos más precisos, manteniendo siempre la consistencia de tus personajes.
Uno de los aspectos más cruciales de un flujo de trabajo sólido de consistencia de personajes es la redacción de prompts. Te ofrecemos una lista completa de prompts que puedes usar para la consistencia de personajes en img2img. A continuación, te presento los mejores prompts para la consistencia de personajes que puedes usar en distintos flujos de trabajo.
Para el primer método, comencemos sin nuestra referencia de personaje único, que convertimos en una hoja de giro, de la siguiente manera:


A partir de aquí, nuestro objetivo es generar nuestro primer plano con nuestro personaje. En este caso, creemos un plano de nuestro personaje viajando en un lujoso carruaje, mirando por la ventana hacia una llanura nevada nórdica en el exterior.
El truco aquí es que, en lugar de generar nuestra imagen y nuestro personaje en una sola toma, lo cual ofrece menos precisión, primero generemos un boceto ligero tipo esténcil de la imagen deseada, con la descripción del personaje incorporada en el texto. Es importante no usar demasiado detalle aquí, ya que esto solo ofrece un esquema ligero de nuestro fotograma final. Podemos crear un prompt para generar esta imagen, de la siguiente manera:
Crea un boceto a lápiz ligero y de contorno tosco. Apunta a un esquema tosco, sin demasiado detalle. El escenario es el interior de un carruaje lujoso. El interior del carruaje es, en general, muy tenue, con solo una tenue luz ambiental dentro. La única fuente de luz clara proviene del exterior, desde la ventana. La ventana del carruaje es una abertura completamente abierta, sin vidrio. Cortinas pesadas enmarcan la ventana. El interior del carruaje incluye una estructura decorativa de madera tallada y un respaldo de asiento acolchado. Una fina capa de nieve descansa en el alféizar de la ventana, y una pequeña cantidad de nieve entra suavemente flotando al carruaje. Fuera de la ventana hay una llanura nevada nórdica. El exterior está lleno de una densa niebla matutina. La niebla blanca es muy espesa, y solo pueden verse formas tenues de una llanura abierta cubierta de nieve, colinas bajas nevadas y siluetas de montañas muy distantes. El personaje es una joven mujer europea de poco más de veinte años. Su rostro es un óvalo suave ligeramente estrecho, con una frente lisa, pómulos definidos, una mandíbula limpia y un mentón sutilmente afinado. Sus cejas son oscuras, claramente delineadas y en su mayoría rectas. Sus ojos son almendrados y alargados, con párpados superiores claramente definidos y una mirada fija y directa. Los iris y las pupilas son de un dorado ámbar brillante, y los ojos tienen reflejos húmedos realistas. El puente de su nariz es recto y delgado, con una punta de nariz pequeña y refinada. Sus labios están claramente delineados, con un labio superior relativamente fino y un labio inferior ligeramente más lleno. Su expresión es calmada y seria. Su piel es pálida con un tono subyacente ligeramente frío, conservando pecas tenues, textura de piel realista, poros visibles, ligero detalle bajo los ojos, pequeñas asimetrías, textura labial realista y variaciones naturales sutiles en la piel. Ella apoya la barbilla en su mano en silenciosa contemplación, mirando a través de un vasto paisaje vacío de llanura nevada nórdica.
Generando con GPT Image 2, aquí está nuestro resultado:

Como estamos contentos con nuestro boceto, podemos avanzar a generar nuestra toma final. Podemos usar un modelo de imagen como Nano Banana Pro para generar nuestro fotograma final, pasando nuestras imágenes de referencia del personaje y nuestro boceto de composición para que el modelo sepa exactamente cómo queremos que se vea nuestro personaje en la composición.
Nuestro prompt inicialmente indica al modelo que use el boceto proporcionado como referencia de composición, que coincida con nuestras imágenes de referencia del personaje con una precisión del 100% y que transforme el boceto en una fotografía de acción real. Aquí está el prompt completo:
Usa el boceto proporcionado como única referencia de composición. Usa la referencia de perfil lateral proporcionada como única referencia de rostro y cabello. Usa la referencia de cuerpo completo proporcionada como única referencia de vestuario.
Crea una fotografía de acción real en primer plano de Serana. La acción del personaje, la composición general y la estructura interior del carruaje coinciden 100% exactamente con el boceto proporcionado. La identidad del personaje, el contorno facial de perfil lateral, los rasgos faciales, el tono de piel, los ojos ámbar dorados y el peinado coinciden 100% con la referencia de perfil lateral proporcionada. El diseño del vestuario, los colores y el estilismo general del personaje coinciden 100% con la referencia de cuerpo completo proporcionada.
Transforma la imagen en una fotografía de acción real. El escenario es el interior de un lujoso carruaje. El interior del carruaje es, en general, muy tenue, con solo una débil luz ambiental en su interior. La única fuente de luz clara proviene del exterior de la ventana. La ventana del carruaje es una abertura completamente abierta, sin cristal. Pesadas cortinas enmarcan la ventana. El interior del carruaje incluye una estructura decorativa de madera tallada y un respaldo de asiento acolchado. Una fina capa de nieve reposa en el alféizar de la ventana, y una pequeña cantidad de nieve se cuela suavemente hacia el interior del carruaje.
Fuera de la ventana hay una llanura nevada nórdica. El exterior está lleno de una densa niebla matutina. La niebla blanca es muy espesa, y solo pueden verse tenues formas de una llanura abierta cubierta de nieve, colinas nevadas bajas y siluetas de montañas muy distantes. Una pequeña cantidad de suave luz matutina atraviesa la niebla y cae sobre el rostro de Serana y los bordes de su cabello. Las zonas brillantes presentan un suave resplandor (bloom), especialmente en los puntos de niebla iluminados del exterior, a lo largo de la luz de la ventana y en la luz matutina que cruza su rostro.
El enfoque se centra en el rostro de Serana. Sus ojos, pestañas, textura de piel y contorno facial son las partes más nítidas del encuadre, pero aun así conservan una ligera suavidad natural propia de una cámara real y una leve imperfección de enfoque, en lugar de una nitidez perfectamente clínica. La vista exterior está extremadamente desenfocada y se lee solo como capas muy suaves y borrosas. El resto del interior del carruaje también está suavemente desenfocado, aunque manteniendo legible su estructura básica.
Conserva una textura de piel realista, poros visibles, sutiles pecas, textura de cabello realista, textura de tela realista, textura de madera realista, sutil grano de película, un leve ruido de sensor, ligera suavidad de lente, una aberración cromática muy sutil, y un renderizado natural e imperfecto propio de una cámara real.
Generando con Nano Banana Pro, este es nuestro resultado:


Comenzar con un boceto de composición antes de generar el fotograma final solo requiere una generación de imagen adicional, pero ofrece un control creativo superior sobre la composición de nuestra toma final. Luego, hacer una segunda generación usando nuestro boceto de composición y las imágenes de los personajes como referencias hace que nuestra toma final siga la composición deseada mientras mantiene la consistencia del personaje de forma impecable.
Pasando de fotos fijas de personajes a video

Hasta ahora, esta guía te ha dado los conocimientos necesarios para crear fotos fijas de escenas excepcionalmente precisas con consistencia de personaje. El siguiente paso es generar videos con estas tomas, evitando al mismo tiempo la deriva del personaje. Este es un reto único en el cine con IA, porque tu personaje debe mantenerse consistente no solo en una única generación de imagen, sino de fotograma a fotograma dentro de tu video generado. Además, cada nueva toma es una oportunidad para que tu personaje se desvíe. Nuestros cineastas han descubierto que, la mayoría de las veces, los siguientes aspectos se deterioran al pasar de imagen a video:
- Deriva de fotograma a fotograma. Especialmente al animar a tu personaje en nuevas poses, se produce la deriva del personaje. El rostro de tu personaje, por ejemplo, puede transformarse a mitad de la toma cuando la cabeza gira alejándose y volviendo hacia la cámara.
- Vistas de perfil y de espaldas. La mayoría de los sistemas de referencia están entrenados con rostros de frente. Cuando tu personaje gira en tres cuartos o de perfil completo, esta referencia puede fallar. Por eso es imprescindible usar una hoja de giro que muestre varios ángulos de tu personaje (frente, lateral, espalda, 3/4).
- Deriva de salida y accesorios. Los modelos de imagen a video tienden a centrarse principalmente en mantener el rostro de tu personaje a lo largo de un video generado. Como resultado, la ropa y los accesorios reciben menos atención durante la generación. Por eso es fundamental fijar el vestuario en tu imagen fija de referencia y reforzarlo en el prompt que le proporcionas al modelo de imagen a video.
- Límites de duración y encadenamiento de tomas. La mayoría de los modelos de imagen a video limitan un solo clip a 5-15 segundos. Esto significa que generar tomas más largas requiere generar un clip, extraer su último fotograma con la herramienta Extract Frame de Flick, y usar ese fotograma como fotograma inicial del siguiente clip. Cada salto en la cadena hacia una nueva generación de imagen a video es una nueva oportunidad para que tu personaje se desvíe.
Los modos de referencia que realmente usarás para la generación de video
- Reference-to-video: proporciona una o más imágenes de tu personaje con la integración de vanguardia de Flick con modelos potentes como Kling Omni Reference y Seedance Reference to Video.
- Start/end frame: proporciona el primer fotograma (y opcionalmente el último) en tu generación de imagen a video. Usar fotogramas iniciales y finales con representaciones precisas de tu personaje y la composición deseada, aprovechando el método de boceto de composición que describimos anteriormente, ofrece los mejores resultados.
- Character LoRA: para minimizar la deriva a lo largo de toda una película, entrena una LoRA con tus referencias de personaje usando una gran cantidad de imágenes (más de 50). Hemos comprobado que modelos como Wan 2.2 son los mejores para esto. Aplicar esta LoRA durante la generación te permite obtener excelentes resultados en video manteniendo la consistencia del personaje.
El flujo de trabajo de video de Flick con consistencia de personaje
Aquí es donde el flujo de trabajo de Character Reference, construido alrededor de la función nativa Character Reference de Flick, da sus frutos. Como ya has fijado a tu personaje en una imagen fija de la toma y has creado una hoja de giro, le estás proporcionando al modelo de video el mejor contexto sobre cómo quieres que se vea tu personaje en la generación final. Estos son los dos mejores métodos que han encontrado nuestros cineastas internos:
Usar Omni Reference para lograr la consistencia del personaje

Para este método, comienzas con una imagen del entorno deseado. Por ejemplo, generemos un entorno de montaña nevada en el tono azul limpio que deseamos, especificando la composición, la paleta de colores y el ángulo de cámara para lograr mayor precisión. Aquí está nuestro prompt:
Fotografía cinematográfica gran angular de una vasta ladera montañosa alpina cubierta de nieve, con una pendiente de nieve prístina y suave que atraviesa el cuadro en diagonal, un espacio negativo masivo, nieve polvo intacta, sutiles texturas talladas por el viento en la nieve, una cresta rocosa distante que emerge del glaciar, composición paisajística minimalista, suave luz solar invernal, gradación de color atmosférica en azul pálido, aire frío de montaña, naturaleza serena, sin personas, sin árboles, sin estructuras.
Fotografiada desde un mirador alpino elevado, enfatizando la escala y el vacío. Formas geométricas limpias creadas por la nieve y la sombra, transiciones tonales suaves, un terreno helado y expansivo que se extiende más allá del cuadro.
Fotografía ultrarrealista, compresión de teleobjetivo medio, fotografía de expedición estilo National Geographic, alto rango dinámico, textura de nieve con detalle nítido, sutil bruma atmosférica, iluminación natural, cinematografía outdoor premium, estética de glaciar islandés, minimalismo escandinavo, una sensación sobrecogedora de aislamiento y calma.
Composición: fuerte línea diagonal principal, encuadre asimétrico, 80% de tonos de nieve y cielo, espacio negativo extremo, fotografía paisajística minimalista de bellas artes.
Paleta de colores: azul hielo, blanco glaciar, gris roca suave, tonos invernales apagados.
Cámara: Sony A1, lente 135mm, f/8, ISO 100, filtro polarizador, gradación de color cinematográfica.
Generando con Nano Banana Pro, aquí está nuestro resultado:


A partir de aquí, podemos usar cualquiera de los modelos Omni Reference insignia de Flick para animar a nuestro personaje dentro de la escena. Tanto Kling como Seedance ofrecen resultados excelentes y un control preciso del personaje. Para acceder a Omni Reference, pasamos el cursor sobre nuestra imagen generada de la escena, seleccionamos video y elegimos Seedance 2.0.

Consistencia de personaje con Seedance 2.0

A partir de aquí, podemos proporcionar nuestra imagen de la escena y nuestras imágenes de referencia del personaje como entrada. Dado que planeamos animar el cuerpo completo de nuestro personaje caminando por la escena, es mejor proporcionar imágenes de referencia de cuerpo completo del personaje. Para añadir diálogo, opcionalmente podemos adjuntar audio como referencia e indicarle al modelo que haga que nuestro personaje diga ese diálogo.
Para este ejemplo, generemos un video de nuestro personaje caminando por la escena y diciendo el diálogo “¡Ah! Qué bien se respira aquí afuera.” También podemos especificar un estilo de cámara en mano para producir el resultado de video exacto que buscamos.
El sistema de menciones de última generación de Flick te permite hacer referencia a entradas específicas en tu prompt, para que puedas indicarle al modelo exactamente cómo usar cada entrada en la generación final. Por ejemplo, podemos decirle al modelo que use la primera imagen como fotograma inicial, y luego use nuestras tres imágenes de referencia del personaje para crear su apariencia. Especificamos el movimiento de nuestro personaje y luego indicamos al modelo que haga que nuestro personaje diga el diálogo adjunto. Aquí está nuestro prompt final:
Toma @Image1 como fotograma inicial. Referencia la apariencia de Serana a partir de @Image2, @Image3 y @Image4. Estilo de cámara en mano, Serana entra en el cuadro desde la esquina inferior izquierda, se estira mientras camina, y dice @Audio1.


Este prompt es corto y simple, y esa es la idea. La mayor parte de la información en la que queremos que se base nuestro modelo son nuestras imágenes de referencia. Podemos aprovechar las capacidades de Seedance 2.0 y el sistema de menciones de Flick para especificar exactamente cómo, produciendo una generación de video final precisa, manteniendo la consistencia del personaje a la perfección. Aquí está nuestro resultado final:
Consistencia de personaje con Kling O3 Pro Omni Reference

Lograr videos con consistencia de personaje con Kling O3 Pro implica muchos de los mismos pasos que hacerlo con Seedance 2.0. Comienza con una imagen de tu ambientación y tus imágenes de referencia de personaje. A partir de aquí, podemos pasar el cursor sobre nuestra imagen de referencia de ambientación y acceder a Omni Reference. El sistema de menciones de Flick también se extiende a Kling Omni Reference, lo que te permite proporcionar hasta 12 imágenes de referencia que el modelo puede utilizar en la generación final.
Para usar Kling O3 Pro Omni Reference con referencia de personaje, selecciona el selector de modelo y pasa el fotograma inicial deseado. Para este ejemplo, usaremos nuestra imagen de referencia de ambientación. Luego, puedes usar el sistema de menciones de Flick para crear un Elemento. Los Elementos te permiten almacenar múltiples imágenes de referencia en una sola mención. Una vez que hemos pasado nuestra imagen de ambientación como fotograma inicial, podemos crear un Elemento para representar a nuestro personaje. Por defecto, este elemento se llamará "Element1". Podemos adjuntar nuestras tres imágenes de referencia de cuerpo completo del personaje a este único elemento y referenciarlo en el prompt.
En el prompt, indicamos al modelo que tome la apariencia de nuestro personaje de "Element1" y especificamos un estilo de cámara en mano. Definimos su movimiento: ella "camina hacia la escena con los brazos abiertos, como si sintiera el viento", y finalmente le decimos al modelo que evite generar música de fondo. Aquí está nuestro prompt final:
Reference Serana's appearance from @Element1 . Handheld camera style. Serana walks into the scene with her arms open, like she's feeling the wind. No background music.
De nuevo, podemos mantener nuestro prompt simple, porque la mayor parte de la información que le damos al modelo la proporcionamos mediante nuestro Start Frame, que representa la ambientación de la toma, y un Elemento, que representa a nuestro personaje a través de nuestras tres imágenes de referencia proporcionadas. Habiendo ingresado nuestra imagen de ambientación como fotograma inicial, definido Element1 para representar a nuestro personaje y escrito nuestro prompt, estamos listos para generar:



Aquí está el resultado. Logra la consistencia del personaje a la perfección, mantiene nuestra ambientación exactamente como la especificamos en el fotograma inicial, y sigue nuestra instrucción de estilo de cámara en mano con precisión:
Logra videos con consistencia de personaje con aún más precisión en Flick: el método de intercambio de rostro
En lugar de generar tu video, incluyendo tu escena, diseño de personaje y prompt en una sola toma, para este método, nuestros cineastas internos recomiendan dos generaciones de video separadas.
En el primer video que generamos, excluimos cualquier referencia a nuestro personaje. Más bien, proporcionamos una imagen de la ambientación en la que queremos que ocurra la toma, y luego usamos nuestro prompt para detallar la acción que queremos ver. Una vez que hemos generado este video, extraemos el fotograma final usando la herramienta de extracción de fotogramas de Flick. Pasamos esta imagen a Nano Banana Pro y la regeneramos con nuestra imagen de referencia de personaje como referencia. Esto produce un fotograma final con nuestro personaje exacto.
En el segundo video que generamos, pasamos el nuevo fotograma final que generamos con nuestro personaje y el video inicial que generamos a Kling O3. Esto produce un video final que replica con precisión el video de generación inicial pero con nuestro personaje exacto. La primera generación nos permite tener un control preciso sobre la escena y la acción que ocurre dentro de ella, mientras que la segunda generación nos permite intercambiar a nuestro personaje, manteniendo así la consistencia del personaje.
Así es como se hace:
Para este método, comenzamos con una sola imagen de referencia de personaje que convertimos en una hoja de rotación (turnaround sheet), mostrando tres vistas de cuerpo completo del personaje dispuestas una al lado de la otra. Aquí está el prompt que usamos:
Utiliza la imagen proporcionada como la referencia exacta del personaje. Crea una hoja de diseño de personaje (turnaround) del mismo personaje histórico chino masculino con un estilo de marioneta de stop-motion hecha a mano, con una textura sutil de arcilla y muñeco de vestuario. Muestra tres vistas de cuerpo completo colocadas una al lado de la otra: vista frontal, vista de perfil puro y vista de 3/4. Conserva el diseño del vestuario exactamente como en la imagen de referencia, incluyendo el sombrero negro alto, la túnica exterior gris pálido, la túnica interior blanca, el largo de la túnica, la forma de las mangas, la estructura del cuello, el cinturón, los adornos colgantes, las botas negras, el arma de vara larga y el contenedor cilíndrico. Mantén sin cambios la silueta de la ropa, las capas, las proporciones, el corte de las prendas, la ubicación de los accesorios y la construcción general del atuendo. No rediseñes ni simplifiques el vestuario. La única transformación es el medio visual: personaje de marioneta hecha a mano, estética de película en stop-motion, tela ligeramente texturizada, rostro ligeramente esculpido, tratamiento sutil de superficie similar a la arcilla, detalles de vestuario hechos a mano, construcción de vestuario en miniatura realista, presentación de turnaround de estudio. Fondo neutro liso, iluminación suave y uniforme, cuerpo completo visible, espaciado limpio, hoja de diseño de vestuario altamente legible, ficha de personaje de producción pulida, estética de fantasía folclórica china en stop-motion, detallado pero controlado, menos brillante, menos digital, sensación táctil hecha a mano.
Aquí está el resultado:

También generamos una imagen de la ambientación deseada para nuestra escena. Podemos hacerlo de dos maneras. Primero, podemos ingresar un prompt bien definido en un modelo de texto a imagen como Nano Banana Pro o GPT Image 2 para generar el esquema de cómo queremos que se vea nuestra escena.
Para lograr aún más precisión, podemos recurrir a nuestro segundo método. En lugar de generar con un modelo de texto a imagen, podemos storyboardear a mano la ambientación deseada en una herramienta como Microsoft Paint. Luego, podemos hacer que Nano Banana Pro tome nuestro boceto como referencia en la generación final. Para este ejemplo, dibujemos un muelle nevado en un lago congelado, con una tela roja deslucida ondeando en primer plano. Aquí está nuestro boceto:

Luego, podemos pasar nuestro boceto a Nano Banana Pro con un prompt descriptivo, detallando exactamente los aspectos realistas que buscamos, y usando nuestro boceto como referencia. Aquí está nuestro prompt:
Usa este boceto de storyboard dibujado a mano como la referencia estricta de composición y diseño. Conserva al 100% la composición actual, el ángulo de cámara, el encuadre, la ubicación de los sujetos y el diseño de las formas principales. Set en miniatura de marioneta de stop-motion folclórico chino, una rama desnuda junto al lago clavada en diagonal en la nieve con una tela roja oscura desteñida atada alrededor, un pequeño muelle de madera cubierto de nieve detrás, grupos de juncos y espadañas invernales doblados por la nieve a lo largo de la orilla derecha, nieve táctil hecha a mano, muelle construido a mano, textura natural de rama, tela con tejido sutil, paleta invernal fría en azul grisáceo, acabado mate hecho a mano, atmósfera poética y contenida. La superficie del lago se convierte en una superficie de hielo en miniatura de estudio con un azul grisáceo suave y opaco, una sutil irregularidad de yeso moldeado, acabado mate similar a la resina, capas leves de escarcha, manchas lechosas tenues, grano helado delicado, suave variación de superficie hecha a mano, reflejo mínimo.
Aquí está nuestro resultado:

En lugar de texto a video, que depende de codificar tu personaje en un prompt, Flick ofrece un mejor enfoque. Usa las imágenes fijas de tus planos generados, cada una con la composición exacta y el diseño de personaje que buscas, como referencias para el modelo de imagen a video. Esto ancla el primer fotograma y permite que el modelo mantenga a tu personaje consistente durante el resto.
A partir de aquí, podemos generar nuestro primer video con Kling O3 Pro, u otro modelo de imagen a video. Podemos pasar nuestra imagen de ambientación como fotograma inicial y especificar la acción de nuestro personaje. Como no estamos proporcionando la imagen de nuestro personaje como referencia aquí, podemos mantener breve la descripción del personaje. Para este ejemplo, simplemente pediré un "pescador marioneta de stop-motion". Especificamos su acción: caminando por la nieve hacia el muelle y deteniéndose al final de este. Definimos el movimiento deseado del personaje y dirigimos al modelo para que la nevada se vuelva cada vez más intensa, soplando a través del encuadre. Aquí está nuestro prompt final:
Un pescador marioneta de stop-motion con una capa de paja para la lluvia y un sombrero de bambú camina por la nieve hacia el muelle, ligeramente encorvado contra el frío, con una mano sosteniéndose y la otra sujetando su abrigo cerca del cuerpo. La cámara en miniatura hecha a mano se mueve lentamente hacia adelante e inclina ligeramente hacia arriba. La nevada se vuelve cada vez más intensa hasta convertirse en una densa tormenta invernal, con nieve soplando a través del encuadre y ocultando gradualmente el lago congelado. Al final, el pescador llega al extremo del muelle, se detiene y permanece quieto por un breve momento frente al hielo.
Con nuestra imagen de ambientación como referencia, esto produce un resultado preciso y hermoso:
Aquí es donde entra en juego la ventaja del método de intercambio de rostro (face swap). Cuando estamos satisfechos con nuestra primera generación de video, podemos extraer el fotograma final de este video usando la herramienta de extracción de fotogramas de Flick. Usando la hoja de referencia de nuestro personaje que generamos anteriormente, podemos pasar ambas imágenes a Nano Banana Pro, e indicarle al modelo que intercambie el personaje en el fotograma final con nuestra referencia de personaje, manteniendo la iluminación, la composición, el ángulo de cámara y la ambientación de nuestra generación inicial. Aquí está nuestro prompt:
Usa la escena del muelle nevado como referencia principal de composición y utiliza la hoja de diseño del personaje de marioneta stop-motion proporcionada como referencia de personaje. Reemplaza al pescador que está de pie al final del muelle con este personaje exacto. Haz coincidir la silueta vista desde atrás, la forma del sombrero, el largo de la túnica, la túnica exterior gris pálido, la túnica interior blanca, las botas negras, el cinturón, los accesorios colgantes, el objeto tipo vara larga, el recipiente cilíndrico y las proporciones corporales generales de la hoja del personaje. Mantén al personaje de espaldas a la cámara, en el extremo lejano del muelle, con la misma disposición de espaldas que en la imagen actual. Conserva el ángulo de cámara, la composición, el muelle, el lago congelado, la rama con tela roja desteñida en primer plano, la orilla cubierta de nieve y los juncos doblados por la nieve existentes. Mantén el estilo de marioneta stop-motion folclórico chino en miniatura, los materiales artesanales, la nieve táctil, el hielo mate, las proporciones sutiles de marioneta y la atmósfera invernal tranquila. El nuevo personaje debe sentirse colocado de forma natural en el mismo set en miniatura, con la misma escala, la misma lógica de pose de espaldas y el mismo ánimo cinematográfico contenido.
Junto con nuestras dos entradas, la hoja de referencia y el fotograma final extraído, usamos Nano Banana Pro para generar nuestro nuevo fotograma final:


Aquí está nuestro resultado:

Lo que hace tan poderoso a este método es que podemos ser exactos sobre cómo queremos que se vea la composición de nuestra escena. En lugar de indicarle al modelo que genere nuestro video final con la imagen de ambientación, las referencias de personaje y el prompt en un solo paso, dividimos esto en dos pasadas. En la primera, creamos nuestra escena, prestando poca atención al personaje por ahora. Luego, generamos un nuevo fotograma final con el personaje deseado, y hacemos una segunda pasada para generar nuestro video final.
Usando la imagen de ambientación que creamos anteriormente como fotograma inicial, y nuestro nuevo fotograma final refinado que incluye nuestra referencia de personaje, generamos nuestro resultado final. Además de nuestra referencia de personaje incorporada en el fotograma final, usamos un prompt para recordarle al modelo la descripción de nuestro personaje, su movimiento, la ambientación, y el movimiento de cámara y audio de fondo deseados. Aquí está nuestro prompt:
Un funcionario-erudito marioneta de stop-motion chino con un sombrero negro alto, túnica exterior gris pálido sobre una túnica interior blanca, botas negras, con un carcaj y una espada hengdao colgando a su costado, camina lentamente por la nieve hacia el muelle con pasos contenidos y deliberados. La cámara artesanal en miniatura se mueve lentamente hacia adelante e inclina ligeramente hacia arriba. Nieve ligera flota suavemente por el cuadro. El lago congelado permanece quieto y silencioso. Al final, el funcionario-erudito llega al extremo lejano del muelle, se detiene y permanece inmóvil frente al hielo. Atmósfera muy tranquila, solo suaves pasos en la nieve y sobre la madera.
Y aquí está nuestro resultado final:
Este método es más avanzado, pero ofrece un control extremadamente preciso sobre la composición de nuestra escena, manteniendo una consistencia exacta del personaje. Aunque requiere ejecutar dos generaciones de video separadas con Kling u otro modelo, lo cual es más costoso, te ahorra créditos que de otro modo desperdiciarías en un solo video impreciso que no sea de tu agrado.
Preguntas frecuentes
¿Cuál es la mejor herramienta de IA para personajes consistentes?
No existe una única mejor herramienta, existe un mejor método. Para la mayoría de las personas, un flujo de trabajo de Character Reference img2img (como el de Flick) es la forma más rápida y confiable de mantener un personaje consistente sin necesidad de entrenamiento. Para producción de gran volumen con una desviación casi nula, un LoRA entrenado a medida en ComfyUI es el estándar de referencia.
¿Qué significa la consistencia de personaje img2img?
La consistencia de personaje de imagen a imagen (img2img) significa generar nuevas imágenes de tu protagonista —en una nueva ambientación, con detalles añadidos, desde un ángulo diferente— manteniendo la identidad visual exacta de tu personaje definido.
¿Cómo puedo lograr consistencia de personaje en Flick?
Proporcionas una imagen de referencia de tu personaje. Usando la herramienta Character Reference, la IA genera nuevas imágenes que preservan la identidad visual de tu protagonista. En lugar de describir a tu personaje con palabras y esperar que el modelo produzca el mismo resultado dos veces, le entregas la referencia y le dices: “este personaje, ahora en una nueva escena”.
¿Cómo hago un personaje consistente en Midjourney?
Usa Omni Reference (--oref) con la imagen de referencia de tu personaje, y ajusta el omni-weight (--ow) para que el modelo mantenga la identidad mientras sigue tu prompt de escena.
¿Puedo mantener un personaje consistente en video con IA?
Sí. Fija primero al personaje en una imagen estática, luego anima esa imagen con la función de referencia de una herramienta de video — “Ingredients” de Veo 3, References de Runway, o “Elements” de Kling. Animar a partir de una imagen fija ofrece una consistencia mucho mejor que texto a video.
¿Necesito entrenar un modelo para obtener un personaje consistente?
No. Entrenar un LoRA proporciona el bloqueo más preciso posible, pero para la mayoría de los proyectos una sola buena imagen de referencia con una función de Character Reference es suficiente. Solo entrena un modelo cuando estés generando cientos de tomas y la deriva se vuelva costosa de corregir manualmente.
¿Por qué mi personaje de IA sigue cambiando?
Porque cada generación se crea desde cero sin memoria de la anterior, por lo que pequeñas variaciones se acumulan hasta convertirse en deriva. La solución es darle al modelo una referencia fija a la cual ajustarse en lugar de volver a describir al personaje con palabras cada vez.
¿Cómo empiezo en Flick?
Mira nuestro tutorial: Flick 101: Primeros pasos. Crea tu primer proyecto, completa la incorporación y comienza tu viaje de creación cinematográfica con IA!
Explora tutoriales relacionados:
https://flick.art/docs/visual-styles
https://flick.art/docs/voice-consistency
Aprende más sobre The Herder:
https://flick.art/blog/behind-the-herder
Por qué crear grandes personajes importa:
https://flick.art/blog/in-the-ai-era-story-is-everything