
Cómo hice una película vikinga fotorrealista con IA (flujo de trabajo completo)
Aug 2026

I made a photorealistic Viking short film called Ulysses entirely with AI. No camera, no crew, no actors, no set. Just over four hundred shots, built in about eight days, that look like real footage. This is the full workflow, start to finish, exactly the way it happened on the canvas. Watch the finished film on Flick TV first if you want; everything below is how it got made.
Es un cortometraje sobre dos NPCs de videojuego aparentemente ordinarios esperando en un espacio vacío de espera, solo para que gradualmente nos demos cuenta de que pueden estar más vivos que el jugador que los controla. En lugar de ver a los NPCs como código de fondo inactivo, imaginamos que continúan existiendo incluso cuando no son vistos, llevando su propia conciencia, incertidumbre y presencia. La historia comienza como un juego de espera absurdo, pero lentamente se convierte en una reflexión sobre lo que significa ser visible, actuar y tener vida interior.
1. Primero la historia, luego los planos
Ulysses es una historia de la era vikinga: un guardián de salón de hidromiel, un joven guardia, un guerrero con armadura y un dragón. Antes de generar nada, lo dividí en tomas, de la misma manera que harías un storyboard para cualquier película. Cada toma recibió un plan básico de quién está en ella, dónde se sitúa la cámara y qué sucede.
Make your own AI film
Start with one image and build a whole film, shot by shot.
2. Elige los personajes como hojas de referencia
Este es el paso más importante. Para cada personaje generé una hoja de referencia limpia de tres vistas, frontal, perfil y tres cuartos, sobre un fondo gris liso, como una foto de casting.

La hoja se convierte en el "actor" del personaje. Cada toma posterior de esa persona se construye a partir de ella, para que el rostro nunca cambie. La hoja de mi protagonista se reutilizó como base en setenta y nueve tomas separadas. El vestuario y la armadura reciben el mismo tratamiento: dibujé la armadura a mano, luego convertí el boceto en una vista giratoria fotorrealista completa.

3. Esboza cada toma a mano
Este es el paso que más sorprende a la gente. Antes de generar un fotograma, dibujé un boceto aproximado de la composición, solo formas: dónde está el personaje, dónde se sitúa el horizonte, hacia dónde mira la cámara. En esta película hice eso para cientos de tomas.
El boceto es el bloqueo y la cámara en uno. Es rápido, es desechable, y le da al modelo algo exacto que seguir en lugar de adivinar una composición a partir de palabras.
4. Convierte el boceto en un fotograma fotorrealista
Luego combiné tres cosas en Nano Banana, el boceto de composición, la hoja de referencia del personaje y una instrucción breve, y pedí un fotograma de acción real fotorrealista. El prompt prohíbe que el modelo se desvíe:
Use the provided sketch as the only composition reference, use the provided guard
reference as the guard character reference. Convert the scene into a photorealistic
live-action cinematic image. Composition 100% exactly matches the provided sketch.
Camera position 100% unchanged.
Un boceto aproximado más un personaje fijo sale del otro lado como una toma que parece filmada.

5. Refina editando, no regenerando
Casi nada en esta película provino de un prompt de texto en blanco. De mis generaciones de imágenes, 371 fueron ediciones de un fotograma existente y solo 21 fueron de texto a imagen. Cuando un fotograma estaba ligeramente mal, una mandíbula pesada, una sombra extraña, un detalle incorrecto, edité ese fotograma en lugar de empezar de nuevo. La consistencia proviene de editar sobre una base bloqueada, no de una redacción perfecta.
6. Anima y déjalos hablar
Con las imágenes fijas bloqueadas, animé fotogramas seleccionados en video con Kling. Algunas tomas son movimiento simple; otras son diálogos, con el personaje hablando directamente a la cámara. Esos prompts son específicos sobre la actuación:
Handheld camera, extreme close-up of his face. His eyes stay locked on the camera,
no drift. He says, "Still, here." Then a brief pause, still staring, with visible
strain, as if forcing the words out.
La imagen fija mantiene la identidad; el video añade el aliento y la voz.
7. The canvas it all happened on
Every step above lives in one workspace. Here is the actual project, zoomed out: sketch rows on the left feeding photoreal rows on the right, character sheets along the bottom, and the iteration ladders in between. 424 images and 38 video shots, all traceable to their references.

Zoom in anywhere and you see the same pattern repeat: one composition, several takes, one survivor. This is what the two leads look like mid-iteration, the guard in his mail and the keeper in his tunic, same faces in every take because every take points at the same sheets.

8. The numbers behind it
Para tener una idea de la escala, esto es lo que contenía el proyecto terminado:
| Del lienzo de Ulysses | Valor |
|---|---|
| Imágenes generadas / fallos | 424 / 20 |
| Enlaces de imagen de referencia | 653 (92% de todas las conexiones) |
| Ediciones de imagen vs texto a imagen | 371 vs 21 (95% img2img) |
| Una hoja de referencia reutilizada | 79 tomas |
| Tiempo de construcción | aproximadamente 8 días, una persona |
9. What I would tell you before you start
- Construye tus hojas de referencia primero. Son todo el juego. Un personaje sin una hoja se desviará.
- Boceta tus tomas. Un dibujo malo con la composición correcta supera a un párrafo hermoso.
- Edita, no regeneres. Bloquea una imagen base y cambia lo menos posible.
- Espera fallos. Veinte tomas fallaron por completo y muchas más necesitaron corrección. Eso es normal; el flujo de trabajo está construido para absorberlo.
Crea el tuyo propio
Start with one image and build a film shot by shot. The step that matters most is the reference sheet, and our guide to consistent AI characters is the deep dive on exactly that.
Preguntas frecuentes
How long does it take to make an AI film like this?
Ulysses ran 432 generation jobs over about 8 days, one person, no crew. Most of that time is choosing between takes, not waiting on renders.
Which AI models did the film actually use?
Nano Banana for stills and edits (371 of 392 image generations were edits of an existing frame), and Kling for motion: the finished canvas carries 37 Kling video shots, including the spoken dialogue takes.
How do the characters stay consistent for 400 shots?
Reference sheets, wired into everything: the project holds 653 reference-image links, 92 percent of all its connections, and the lead's sheet alone sits under 79 shots. No shot is generated from words alone.
Can the characters actually talk?
Yes. Dialogue shots are animated from a locked still with a performance prompt that specifies the line, the pause, and what the eyes do. The still holds the identity; the video pass adds breath and voice.