
Como Fiz um Filme Viking Fotorrealista com IA (Fluxo de Trabalho Completo)
Aug 2026

Eu fiz um curta-metragem fotorrealista sobre vikings chamado Ulysses inteiramente com IA. Sem câmera, sem equipe, sem atores, sem cenário. Pouco mais de quatrocentos planos, construídos em cerca de oito dias, que parecem filmagens reais. Este é o fluxo de trabalho completo, do início ao fim, exatamente como aconteceu no canvas. Assista ao filme finalizado na Flick TV primeiro, se quiser; tudo abaixo é como ele foi feito.
É um curta-metragem sobre dois NPCs de jogo aparentemente comuns esperando em um espaço vazio de espera, apenas para gradualmente percebermos que eles podem estar mais vivos do que o jogador que os controla. Em vez de ver NPCs como código de fundo inativo, imaginamos que eles continuam a existir mesmo quando não vistos, carregando sua própria consciência, incerteza e presença. A história começa como um jogo de espera absurdo, mas lentamente se torna uma reflexão sobre o que significa ser visível, performar e ter vida interior.
1. História primeiro, depois as tomadas
Ulysses é uma história da Era Viking: um guardião de salão de hidromel, um jovem guarda, um guerreiro com armadura e um dragão. Antes de gerar qualquer coisa, eu dividi em cenas, da mesma forma que você faria o storyboard de qualquer filme. Cada cena recebeu um plano básico de quem está nela, onde a câmera se posiciona e o que acontece.
Faça seu próprio filme de IA
Comece com uma imagem e construa um filme inteiro, plano por plano.
2. Escale os personagens como folhas de referência
Este é o passo mais importante. Para cada personagem, eu gerei uma folha de referência limpa com três vistas, frontal, perfil e três quartos, em um fundo cinza simples, como uma foto de elenco.

A folha se torna o "ator" do personagem. Toda cena posterior dessa pessoa é construída a partir dela, então o rosto nunca muda. A folha do meu protagonista foi reutilizada como base em setenta e nove cenas separadas. Figurino e armadura recebem o mesmo tratamento: desenhei a armadura à mão, depois converti o desenho em uma rotação fotorrealista completa.

3. Esboce cada cena à mão
Este é o passo que mais surpreende as pessoas. Antes de gerar um quadro, desenhei um esboço básico da composição, apenas formas: onde o personagem está, onde o horizonte fica, para onde a câmera olha. Neste filme, fiz isso para centenas de cenas.
O esboço é o bloqueio e a câmera em um só. É rápido, é descartável e dá ao modelo algo exato para seguir em vez de adivinhar uma composição a partir de palavras.
4. Transforme o esboço em um quadro fotorrealista
Então combinei três coisas no Nano Banana, o esboço de composição, a folha de referência do personagem e uma instrução curta, e pedi por um quadro fotorrealista de ação ao vivo. O prompt proíbe o modelo de se desviar:
Use the provided sketch as the only composition reference, use the provided guard
reference as the guard character reference. Convert the scene into a photorealistic
live-action cinematic image. Composition 100% exactly matches the provided sketch.
Camera position 100% unchanged.
Um esboço básico mais um personagem fixo resulta em uma cena que parece filmada.

5. Refine editando, não gerando novamente
Quase nada neste filme veio de um prompt de texto em branco. Das minhas gerações de imagem, 371 foram edições de um quadro existente e apenas 21 foram texto-para-imagem. Quando um quadro estava ligeiramente errado, um maxilar pesado, uma sombra estranha, um detalhe incorreto, eu editei aquele quadro em vez de recomeçar. A consistência vem de editar em cima de uma base travada, não de uma redação perfeita.
6. Anime e deixe-os falar
Com as imagens estáticas travadas, animei quadros selecionados em vídeo com Kling. Algumas cenas são movimento simples; outras são diálogos, com o personagem falando diretamente para a câmera. Esses prompts são específicos sobre a performance:
Handheld camera, extreme close-up of his face. His eyes stay locked on the camera,
no drift. He says, "Still, here." Then a brief pause, still staring, with visible
strain, as if forcing the words out.
A imagem estática mantém a identidade; o vídeo adiciona a respiração e a voz.
7. O canvas onde tudo aconteceu
Cada etapa acima existe em um único espaço de trabalho. Aqui está o projeto real, com zoom reduzido: fileiras de esboços à esquerda alimentando fileiras fotorrealistas à direita, folhas de personagens na parte inferior e as escadas de iteração no meio. 424 imagens e 38 planos de vídeo, todos rastreáveis até suas referências.

Aumente o zoom em qualquer lugar e você verá o mesmo padrão se repetir: uma composição, várias tomadas, uma sobrevivente. É assim que os dois protagonistas ficam no meio da iteração, o guarda com sua cota de malha e o guardião com sua túnica, mesmos rostos em cada tomada porque cada tomada aponta para as mesmas fichas.

8. Os números por trás disso
Para ter uma noção de escala, aqui está o que o projeto finalizado continha:
| Do canvas Ulysses | Valor |
|---|---|
| Imagens geradas / falhas | 424 / 20 |
| Links de imagem de referência | 653 (92% de todas as conexões) |
| Edições de imagem vs texto-para-imagem | 371 vs 21 (95% img2img) |
| Uma folha de referência reutilizada | 79 cenas |
| Tempo de produção | cerca de 8 dias, uma pessoa |
9. O que eu diria a você antes de começar
- Construa suas folhas de referência primeiro. Elas são o jogo todo. Um personagem sem uma folha vai variar.
- Esboce suas cenas. Um desenho ruim com a composição certa supera um parágrafo bonito.
- Edite, não gere novamente. Trave uma imagem base e mude o mínimo possível.
- Espere erros. Vinte cenas falharam completamente e muitas mais precisaram de correção. Isso é normal; o pipeline foi construído para absorver isso.
Faça o seu próprio
Comece com uma imagem e construa um filme cena por cena. A etapa mais importante é a ficha de referência, e nosso guia para personagens de IA consistentes é o mergulho profundo exatamente nisso.
Perguntas Frequentes
Quanto tempo leva para fazer um filme de IA assim?
Ulysses executou 432 trabalhos de geração ao longo de cerca de 8 dias, uma pessoa, sem equipe. A maior parte desse tempo é escolher entre tomadas, não esperar pelas renderizações.
Quais modelos de IA o filme realmente usou?
Nano Banana para imagens estáticas e edições (371 de 392 gerações de imagem foram edições de um quadro existente), e Kling para movimento: o canvas finalizado contém 37 cenas de vídeo Kling, incluindo as tomadas de diálogo falado.
Como os personagens permanecem consistentes por 400 cenas?
Fichas de referência, conectadas a tudo: o projeto possui 653 links de imagens de referência, 92 por cento de todas as suas conexões, e a ficha do protagonista sozinha está sob 79 cenas. Nenhuma cena é gerada apenas a partir de palavras.
Os personagens podem realmente falar?
Sim. As cenas de diálogo são animadas a partir de uma imagem estática travada com um prompt de performance que especifica a fala, a pausa e o que os olhos fazem. A imagem estática mantém a identidade; a passagem de vídeo adiciona respiração e voz.