
Como Fiz um Filme Viking Fotorrealista com IA (Fluxo de Trabalho Completo)
Aug 2026

I made a photorealistic Viking short film called Ulysses entirely with AI. No camera, no crew, no actors, no set. Just over four hundred shots, built in about eight days, that look like real footage. This is the full workflow, start to finish, exactly the way it happened on the canvas. Watch the finished film on Flick TV first if you want; everything below is how it got made.
É um curta-metragem sobre dois NPCs de jogo aparentemente comuns esperando em um espaço vazio de espera, apenas para gradualmente percebermos que eles podem estar mais vivos do que o jogador que os controla. Em vez de ver NPCs como código de fundo inativo, imaginamos que eles continuam a existir mesmo quando não vistos, carregando sua própria consciência, incerteza e presença. A história começa como um jogo de espera absurdo, mas lentamente se torna uma reflexão sobre o que significa ser visível, performar e ter vida interior.
1. História primeiro, depois as tomadas
Ulysses é uma história da Era Viking: um guardião de salão de hidromel, um jovem guarda, um guerreiro com armadura e um dragão. Antes de gerar qualquer coisa, eu dividi em cenas, da mesma forma que você faria o storyboard de qualquer filme. Cada cena recebeu um plano básico de quem está nela, onde a câmera se posiciona e o que acontece.
Make your own AI film
Start with one image and build a whole film, shot by shot.
2. Escale os personagens como folhas de referência
Este é o passo mais importante. Para cada personagem, eu gerei uma folha de referência limpa com três vistas, frontal, perfil e três quartos, em um fundo cinza simples, como uma foto de elenco.

A folha se torna o "ator" do personagem. Toda cena posterior dessa pessoa é construída a partir dela, então o rosto nunca muda. A folha do meu protagonista foi reutilizada como base em setenta e nove cenas separadas. Figurino e armadura recebem o mesmo tratamento: desenhei a armadura à mão, depois converti o desenho em uma rotação fotorrealista completa.

3. Esboce cada cena à mão
Este é o passo que mais surpreende as pessoas. Antes de gerar um quadro, desenhei um esboço básico da composição, apenas formas: onde o personagem está, onde o horizonte fica, para onde a câmera olha. Neste filme, fiz isso para centenas de cenas.
O esboço é o bloqueio e a câmera em um só. É rápido, é descartável e dá ao modelo algo exato para seguir em vez de adivinhar uma composição a partir de palavras.
4. Transforme o esboço em um quadro fotorrealista
Então combinei três coisas no Nano Banana, o esboço de composição, a folha de referência do personagem e uma instrução curta, e pedi por um quadro fotorrealista de ação ao vivo. O prompt proíbe o modelo de se desviar:
Use the provided sketch as the only composition reference, use the provided guard
reference as the guard character reference. Convert the scene into a photorealistic
live-action cinematic image. Composition 100% exactly matches the provided sketch.
Camera position 100% unchanged.
Um esboço básico mais um personagem fixo resulta em uma cena que parece filmada.

5. Refine editando, não gerando novamente
Quase nada neste filme veio de um prompt de texto em branco. Das minhas gerações de imagem, 371 foram edições de um quadro existente e apenas 21 foram texto-para-imagem. Quando um quadro estava ligeiramente errado, um maxilar pesado, uma sombra estranha, um detalhe incorreto, eu editei aquele quadro em vez de recomeçar. A consistência vem de editar em cima de uma base travada, não de uma redação perfeita.
6. Anime e deixe-os falar
Com as imagens estáticas travadas, animei quadros selecionados em vídeo com Kling. Algumas cenas são movimento simples; outras são diálogos, com o personagem falando diretamente para a câmera. Esses prompts são específicos sobre a performance:
Handheld camera, extreme close-up of his face. His eyes stay locked on the camera,
no drift. He says, "Still, here." Then a brief pause, still staring, with visible
strain, as if forcing the words out.
A imagem estática mantém a identidade; o vídeo adiciona a respiração e a voz.
7. The canvas it all happened on
Every step above lives in one workspace. Here is the actual project, zoomed out: sketch rows on the left feeding photoreal rows on the right, character sheets along the bottom, and the iteration ladders in between. 424 images and 38 video shots, all traceable to their references.

Zoom in anywhere and you see the same pattern repeat: one composition, several takes, one survivor. This is what the two leads look like mid-iteration, the guard in his mail and the keeper in his tunic, same faces in every take because every take points at the same sheets.

8. The numbers behind it
Para ter uma noção de escala, aqui está o que o projeto finalizado continha:
| Do canvas Ulysses | Valor |
|---|---|
| Imagens geradas / falhas | 424 / 20 |
| Links de imagem de referência | 653 (92% de todas as conexões) |
| Edições de imagem vs texto-para-imagem | 371 vs 21 (95% img2img) |
| Uma folha de referência reutilizada | 79 cenas |
| Tempo de produção | cerca de 8 dias, uma pessoa |
9. What I would tell you before you start
- Construa suas folhas de referência primeiro. Elas são o jogo todo. Um personagem sem uma folha vai variar.
- Esboce suas cenas. Um desenho ruim com a composição certa supera um parágrafo bonito.
- Edite, não gere novamente. Trave uma imagem base e mude o mínimo possível.
- Espere erros. Vinte cenas falharam completamente e muitas mais precisaram de correção. Isso é normal; o pipeline foi construído para absorver isso.
Faça o seu próprio
Start with one image and build a film shot by shot. The step that matters most is the reference sheet, and our guide to consistent AI characters is the deep dive on exactly that.
Perguntas Frequentes
How long does it take to make an AI film like this?
Ulysses ran 432 generation jobs over about 8 days, one person, no crew. Most of that time is choosing between takes, not waiting on renders.
Which AI models did the film actually use?
Nano Banana for stills and edits (371 of 392 image generations were edits of an existing frame), and Kling for motion: the finished canvas carries 37 Kling video shots, including the spoken dialogue takes.
How do the characters stay consistent for 400 shots?
Reference sheets, wired into everything: the project holds 653 reference-image links, 92 percent of all its connections, and the lead's sheet alone sits under 79 shots. No shot is generated from words alone.
Can the characters actually talk?
Yes. Dialogue shots are animated from a locked still with a performance prompt that specifies the line, the pause, and what the eyes do. The still holds the identity; the video pass adds breath and voice.