Como criar personagens de IA consistentes em 2026: o guia completo

Jack McCain

Jun 2026

Consistência de personagem de imagem para imagem significa gerar novas imagens do mesmo personagem, em novas cenas e em novos ângulos, preservando sua identidade visual exata. Em vez de redescrever o personagem em palavras a cada vez, você fornece ao modelo uma imagem de referência e ele reproduz o rosto, o cabelo e o figurino em cada plano.

Se você já criou um personagem e o viu se desmontar em novas cenas com configurações, ângulos de câmera e detalhes diferentes, você já viveu o character drift. Esse é um dos desafios mais persistentes no AI filmmaking. Este guia explica exatamente por que o character drift acontece e os métodos exatos que você pode usar para corrigi-lo, permitindo manter personagens consistentes no Flick, Midjourney, Veo 3, Sora e ComfyUI.

Como Criar Personagens de IA Consistentes em 2026 em resumo

Para quem quer uma visão rápida, aqui está a resposta curta:

A forma mais confiável de criar um personagem consistente com IA é travar a identidade do personagem em uma única imagem de referência primeiro, e reutilizar essa referência em cada nova cena. Esse método é mais consistente, preciso e confiável do que refazer o prompt do zero, e é por isso que se tornou o fluxo de trabalho padrão em 2026.

No Flick, essa é a ferramenta Character Reference e leva apenas três passos:

  1. Gere ou envie uma imagem do seu personagem — um retrato limpo, bem iluminado e de frente produz os melhores resultados
  2. Selecione essa imagem e clique em Character Reference
  3. Descreva sua nova cena livremente ("caminhando pelo mercado iluminado por neon à noite, cinematográfico"), enquanto sua referência mantém seu personagem estável.

Essa é a técnica de maior alcance para quase todos os criadores, pois não exige treinamento, código ou GPU — apenas uma boa imagem de referência. Assista ao nosso tutorial: Tutorial do Nano Banana Pro para Consistência de Personagem

Comece Agora. Crie Seu Personagem.

Por Que a Deriva de Personagem Acontece

Para corrigir a variação do personagem, ajuda entender o que a causa. Quando você gera uma imagem, o modelo começa com estática aleatória. Ele remove essa estática passo a passo, guiado pelo seu prompt, até que uma imagem clara surja. Isso é chamado de difusão.

Quando você descreve um personagem em um prompt, você não está de fato apontando o modelo para uma pessoa específica. "Um homem barbudo na casa dos trinta" corresponde a milhões de imagens que os modelos viram durante o treinamento. Seu prompt cai em algum ponto do espaço de todas essas possibilidades. O resultado é um resultado generalizado, extraído de todo o espaço dessas imagens — uma média de muitos rostos diferentes que se encaixam na sua descrição.

Como resultado, mesmo quando você reutiliza exatamente o mesmo prompt para descrever um personagem, o modelo começa com um novo trecho aleatório de estática e, no fim, se estabelece em um ponto ligeiramente diferente nesse espaço. Isso faz com que o resultado seja um pouco diferente a cada vez, mesmo que o prompt permaneça o mesmo. Pequenas variações no seu prompt, como adicionar novos ângulos, um novo personagem ou um fundo diferente, potencializam esse efeito. Cena após cena, essas variações se acumulam e, no fim, seu personagem original se transforma em outra pessoa.

É isso que o recurso Character Reference do Flick corrige. Em vez de armazenar seu personagem em um prompt, a ferramenta Character Reference armazena seu protagonista como uma imagem de referência. Assim, cada nova geração reproduz seu personagem original, mesmo quando você modifica diferentes aspectos da cena.

O personagem que você define representa uma versão generalizada de muitas imagens que o modelo encontrou durante o treinamento. Cada geração de imagem é nova e começa com estática aleatória. O modelo remove essa estática passo a passo (difusão) até que surja uma imagem que corresponda ao prompt que você descreveu. O personagem que você define representa uma versão generalizada de muitas imagens que o modelo encontrou durante o treinamento. Cada geração começa a partir de estática aleatória e produz um rosto ligeiramente diferente dentro dessa faixa. Como resultado, ao longo de várias gerações, especialmente à medida que você adiciona mais conteúdo ao seu prompt, sua renderização inicial do personagem se transforma em algo totalmente novo.

Crie personagens consistentes com o Flick

Image

The Herder, fixado como uma única referência de personagem. Assista ao filme completo.

Primeiro, crie um personagemThe Herder: não um herói, não um mago—apenas um trabalhador cujo ofício se torna invisível no momento em que funciona. Ele é um artesão da "Europa moderna" (aproximadamente de 1800 ao início de 1900). Para mantê-lo consistente de frente a costas (e de cena a cena), use a ferramenta Character Reference do Flick.

Comece com uma única imagem de referência. A partir dessa imagem inicial, crie várias folhas de rotação—frente/lado/costas—em diferentes estados: com chapéu, sem chapéu, com guarda-chuva, mãos livres, casaco molhado, mudança de equipamento.

Image
Image

Depois, combine as folhas de rotação com a ferramenta Character Reference do Flick, para que a silhueta de frente/lado/costas do personagem permaneça estável em todas as cenas.

5 métodos para personagens de IA consistentes, comparados

Não existe uma única ferramenta ou modelo "certo", mas existe um método certo para o seu nível de habilidade e o quanto de controle você precisa. Aqui está um resumo das 5 melhores abordagens de consistência de personagens img2img e para quem elas são mais indicadas:

MétodoComo funcionaMelhor paraEsforçoConsistência
Character Reference (img2img)Envie uma imagem de referência; o modelo reproduz essa identidade em novas cenasQuase todo mundo — o caminho mais rápido para um personagem consistenteBaixoAlta
Folha de rotação de personagemGere vistas de frente, lado, costas e 3/4 para usar como referências de múltiplos ângulosDar às ferramentas de vídeo a partir de imagem contexto suficiente para ângulos e movimentoBaixo–médioAlta
PromptingReutilize a mesma seed e uma descrição literal do personagem em todas as geraçõesVariações rápidas de um único visualBaixoMédia
Treinamento de LoRATreine um pequeno modelo personalizado com 15–50 imagens do seu personagemCentenas de cenas com variação quase zeroAltoMuito alta
Troca de rosto (ajuste final)Gere livremente e depois troque o rosto do seu personagem em cada quadroCorrigir a variação depois de já ter ocorridoMédioAlta (apenas rosto)

Como manter um personagem consistente em cada ferramenta principal

Detalhe facial fino mantido com precisão, de Honey, I'm Home. Assista ao filme completo. Conheça o processo de criação.
Detalhe facial fino mantido com precisão, de Honey, I'm Home. Assista ao filme completo. Conheça o processo de criação.

Midjourney lida com a consistência por meio do Omni Reference (o parâmetro —oref, com um omni-weight —ow para controlar o quanto ele se apega à sua referência). Use um peso moderado para equilíbrio (100 é o padrão) e reduza-o quando estiver modificando aspectos do seu personagem. Ele produz resultados lindos, com estilos incríveis, mas pode suavizar detalhes finos como sardas ou tatuagens.

Veo 3 do Google (e o Veo 3.1) mantém os personagens consistentes com seu sistema de referência "Ingredients to Video". Alimente-o com suas imagens de referência para fixar a identidade do seu personagem e garanta usar a mesma descrição de personagem em cada prompt. O Veo também produz áudio sincronizado nativo e sincronia labial, para que seu personagem possa falar.

Sora construiu a consistência de personagens em torno de clipes de referência gravados (originalmente chamados de "Cameos", depois renomeados para "Characters") que criavam uma aparência reutilizável entre gerações, com áudio nativo. A OpenAI descontinuou o Sora em 2026, mas você pode usar o modelo de imagem img2img da OpenAI, GPT Image 2, para gerar cenas com seu personagem no Flick.

Para controle absoluto, o ComfyUI permite combinar ferramentas como PuLID, InstantID e IP-Adaptor com uma LoRA de personagem treinada sob medida, além de nós de controle de pose e de detalhamento facial. É o caminho mais desafiador e técnico, mas ideal se você busca geração local ilimitada com zero desvio.

O fluxo de trabalho completo: do Design de Personagem ao Corte Final

Para ir além das imagens e integrar seus personagens aos seus filmes completos, aqui está o fluxo de trabalho que os melhores criadores usam em 2026:

  1. Desenhe seu protagonista. Gere um único retrato forte que você ame.
  2. Construa uma folha de referência. Crie um turnaround (frente, lado, costas, 3/4). Crie referências com roupas, acessórios e expressões diferentes.
  3. Defina o Character Reference no Flick e gere cada plano da sua cena, focando em definir o cenário e a ação do seu personagem em cada prompt.
  4. Anime a partir da imagem parada. Pegue cada imagem travada e use um modelo de imagem para vídeo para criar cenas do seu personagem.
  5. Edite e faça a correção de cor. Monte suas cenas no editor de vídeo para produzir seu resultado final.

A regra prática: ancore a identidade em uma imagem estática primeiro, depois a anime.

Como Alcançar Ainda Mais Precisão na Consistência de Personagens no Flick

Image

Nossa equipe interna de cinema passou incontáveis horas experimentando diferentes soluções alternativas para alcançar os melhores resultados de consistência de personagens em img2img no Flick. Ao longo do caminho, descobrimos várias dicas e truques avançados que você pode usar para gerar planos mais precisos, mantendo seus personagens consistentes.

Um dos aspectos mais cruciais de um fluxo de trabalho forte de consistência de personagens é o prompting. Fornecemos uma lista abrangente de prompts que você pode usar para consistência de personagens em img2img. Abaixo, apresento os melhores prompts para consistência de personagens que você pode usar em diferentes fluxos de trabalho.

Para o primeiro método, vamos começar com nossa única referência de personagem, que transformamos em uma folha de turnaround, da seguinte forma:

Image
Image

A partir deste ponto, nosso objetivo é gerar nosso primeiro plano com nosso personagem. Neste caso, vamos criar um plano do nosso personagem viajando em uma carruagem luxuosa, olhando pela janela para uma planície nórdica nevada lá fora.

O truque aqui é que, em vez de gerar nossa imagem e nosso personagem em uma única etapa, o que oferece menos precisão, vamos primeiro gerar um esboço leve tipo stencil da imagem desejada com a descrição do personagem incorporada no texto. É importante não usar muitos detalhes aqui, já que isso oferece apenas um esquema leve do nosso quadro final. Podemos criar um prompt para gerar essa imagem, da seguinte forma:

Crie um esboço a lápis leve e rústico, com contorno solto. Busque um esquema simples, sem muitos detalhes. O cenário é o interior de uma carruagem luxuosa. O interior da carruagem é, em geral, muito escuro, com apenas uma leve luz ambiente. A única fonte de luz clara vem de fora da janela. A janela da carruagem é uma abertura totalmente aberta, sem vidro. Cortinas pesadas emolduram a janela. O interior da carruagem inclui uma estrutura decorativa de madeira entalhada e um encosto de assento estofado. Uma fina camada de neve repousa sobre o peitoril da janela, e uma pequena quantidade de neve flutua suavemente para dentro da carruagem. Do lado de fora da janela há uma planície nevada nórdica. O exterior está tomado por uma densa neblina matinal. A névoa branca é muito espessa, e apenas formas tênues de uma planície aberta coberta de neve, colinas nevadas baixas e silhuetas de montanhas muito distantes podem ser vistas. A personagem é uma jovem europeia no início dos vinte anos. Seu rosto é um oval suave e ligeiramente estreito, com testa lisa, maçãs do rosto definidas, mandíbula limpa e queixo sutilmente afilado. Suas sobrancelhas são escuras, claramente delineadas e majoritariamente retas. Seus olhos são amendoados e alongados, com pálpebras superiores claramente definidas e um olhar firme e direto. As íris e pupilas são de um âmbar dourado brilhante, e os olhos apresentam reflexos úmidos realistas. A ponte do nariz é reta e fina, com uma ponta de nariz pequena e refinada. Seus lábios são bem definidos, com o lábio superior relativamente fino e o lábio inferior um pouco mais cheio. Sua expressão é calma e séria. Sua pele é pálida, com um subtom levemente frio, preservando sardas discretas, textura de pele realista, poros visíveis, leve detalhe abaixo dos olhos, pequenas assimetrias, textura labial realista e sutis variações naturais na pele. Ela apoia o queixo na mão em silenciosa contemplação, olhando por uma vasta paisagem vazia de planície nevada nórdica.

Gerando com o GPT Image 2, aqui está nosso resultado:

Image

Como estamos satisfeitos com nosso esboço, podemos avançar para gerar nosso plano final. Podemos usar um modelo de imagem como o Nano Banana Pro para gerar nosso quadro final, informando nossas imagens de referência de personagem e nosso esboço de composição, para que o modelo saiba exatamente como queremos que nosso personagem na composição fique.

Nosso prompt primeiro instrui o modelo a usar o esboço fornecido como referência de composição, a corresponder às nossas imagens de referência de personagem com 100% de precisão e a transformar o esboço em uma fotografia live-action. Aqui está o prompt completo:

Use o sketch fornecido como única referência de composição. Use a referência de perfil lateral fornecida como única referência de rosto e cabelo. Use a referência de corpo inteiro fornecida como única referência de figurino.

Crie uma fotografia live-action em close-up de Serana. A ação da personagem, a composição geral e a estrutura interna da carruagem correspondem 100% exatamente ao sketch fornecido. A identidade da personagem, o contorno facial em perfil lateral, os traços faciais, o tom de pele, os olhos dourado-âmbar e o penteado correspondem 100% à referência de perfil lateral fornecida. O design do figurino, as cores e a estilização geral da personagem correspondem 100% à referência de corpo inteiro fornecida.

Transforme a imagem em uma fotografia live-action. O cenário é dentro de uma carruagem luxuosa. O interior da carruagem é, em geral, muito escuro, com apenas uma luz ambiente fraca lá dentro. A única fonte de luz clara vem de fora da janela. A janela da carruagem é uma abertura totalmente aberta, sem vidro. Cortinas pesadas emolduram a janela. O interior da carruagem inclui uma estrutura decorativa de madeira entalhada e um encosto de assento acolchoado. Uma fina camada de neve repousa sobre o parapeito da janela, e uma pequena quantidade de neve entra suavemente flutuando na carruagem.

Do lado de fora da janela há uma planície nevada nórdica. O exterior está tomado por uma densa neblina matinal. A neblina branca é muito espessa, e apenas formas tênues de uma planície aberta coberta de neve, colinas nevadas baixas e silhuetas de montanhas muito distantes podem ser vistas. Uma pequena quantidade de luz suave da manhã atravessa a neblina e recai sobre o rosto de Serana e as bordas do cabelo. As áreas claras carregam um brilho suave (bloom), especialmente nos realces enevoados do exterior, ao longo da luz da janela e na luz da manhã sobre o rosto dela.

O foco está no rosto de Serana. Seus olhos, cílios, textura de pele e contorno facial são as partes mais nítidas do quadro, mas ainda carregam uma leve suavidade natural típica de câmera real e uma leve imperfeição de foco, em vez de uma nitidez perfeitamente clínica. A vista externa está extremamente fora de foco e se lê apenas como camadas muito suaves e borradas. O restante do interior da carruagem também está suavemente fora de foco, mantendo a estrutura básica legível.

Preserve textura de pele realista, poros visíveis, sardas sutis, textura de cabelo realista, textura de tecido realista, textura de madeira realista, grão de filme sutil, leve ruído de sensor, leve suavidade de lente, aberração cromática muito sutil e uma renderização natural e imperfeita típica de câmera real.

Gerando com o Nano Banana Pro, aqui está o nosso resultado:

Image
Image

Começar com um sketch de composição antes de gerar o quadro final exige apenas mais uma geração de imagem, mas oferece um controle criativo superior sobre a composição do nosso shot final. Depois, fazer uma segunda geração usando nosso sketch de composição e as imagens de personagem como referências faz com que o shot final siga a composição desejada mantendo, ao mesmo tempo, uma consistência de personagem impecável.

Passando de Imagens Estáticas de Personagem para Vídeo

Personagens ancorados em um novo cenário, de Forever Yours. Assista ao filme completo. Conheça o processo de criação.
Personagens ancorados em um novo cenário, de Forever Yours. Assista ao filme completo. Conheça o processo de criação.

Até aqui, este guia forneceu o entendimento necessário para criar imagens estáticas de shot excepcionalmente precisas, com consistência de personagem. O próximo passo é gerar vídeos a partir desses shots, evitando o drift de personagem. Esse é um desafio único no filmmaking com IA, porque sua personagem precisa se manter consistente não apenas em uma única geração de imagem, mas de quadro a quadro dentro do vídeo gerado. Além disso, cada novo shot é uma nova chance de a personagem sofrer drift. Nossos filmmakers descobriram que, na maioria das vezes, os seguintes aspectos se perdem ao passar de imagem para vídeo:

  • Deriva de quadro a quadro. Especialmente ao animar seu personagem em novas poses, ocorre a deriva do personagem. O rosto do seu personagem, por exemplo, pode se deformar no meio de um plano à medida que a cabeça gira para longe da câmera e depois volta a ela.
  • Vistas de perfil e de costas. A maioria dos sistemas de referência é treinada em rostos de frente. Quando seu personagem vira três quartos ou perfil completo, essa referência pode falhar. É por isso que usar uma folha de giro (turnaround sheet), mostrando vários ângulos do seu personagem (frente, lado, costas, 3/4), é fundamental.
  • Deriva de saída e de objetos de cena. Os modelos de imagem para vídeo tendem a focar principalmente em manter o rosto do seu personagem ao longo de um vídeo gerado. Roupas e acessórios, como resultado, recebem menos atenção durante a geração. É por isso que é fundamental fixar o figurino na sua imagem de referência e reforçá-lo no prompt fornecido ao modelo de imagem para vídeo.
  • Limites de duração e encadeamento de planos. A maioria dos modelos de imagem para vídeo limita um único clipe a 5-15 segundos. Isso significa que gerar planos longos de formato extenso exige gerar um clipe, extrair seu último quadro usando a ferramenta Extract Frame do Flick e usar esse quadro como quadro inicial do próximo clipe. Cada salto de encadeamento para uma nova geração de imagem para vídeo é uma nova chance de o seu personagem sofrer deriva.

Os Modos de Referência que Você Realmente Vai Usar para Geração de Vídeo

  • Referência para vídeo — forneça uma ou mais imagens do seu personagem com a integração de última geração do Flick com modelos poderosos como Kling Omni Reference e Seedance Reference to Video.
  • Quadro inicial/final — forneça o primeiro quadro (e, opcionalmente, o último) na sua geração de imagem para vídeo. Usar quadros iniciais e finais com renderizações precisas do seu personagem e da composição desejada, com base no método de esboço de composição que descrevemos acima, oferece os melhores resultados.
  • Character LoRA — para minimizar a deriva ao longo de um filme completo, treine um LoRA nas referências do seu personagem usando uma abundância de imagens (50+). Modelos como o Wan 2.2, descobrimos, são os melhores para isso. Aplicar esse LoRA na geração permite produzir ótimos resultados em vídeo mantendo a consistência dos personagens.

O Fluxo de Trabalho de Vídeo do Flick com Consistência de Personagem

É aqui que o fluxo de trabalho de Character Reference, construído em torno do recurso nativo Character Reference do Flick, compensa. Como você já fixou seu personagem em uma imagem de plano e construiu uma folha de giro, você está fornecendo ao modelo de vídeo o melhor contexto sobre a aparência desejada do seu personagem na geração final. Aqui estão os dois melhores métodos que nossos cineastas internos encontraram:

Usando o Omni Reference para Alcançar Consistência de Personagem

Um protagonista consistente em movimento, de Echoes of the Sun. Assista ao filme completo. Conheça o processo de criação.
Um protagonista consistente em movimento, de Echoes of the Sun. Assista ao filme completo. Conheça o processo de criação.

Para este método, você começa com uma imagem do cenário desejado. Por exemplo, vamos gerar um ambiente de montanha nevada no tom azul limpo que desejamos, especificando composição, paleta de cores e ângulo de câmera para maior precisão. Aqui está nosso prompt:

Fotografia cinematográfica em grande angular de uma vasta encosta montanhosa alpina coberta de neve, com uma encosta de neve lisa e imaculada cortando diagonalmente o quadro, amplo espaço negativo, neve intocada, texturas sutis esculpidas pelo vento na neve, cordilheira rochosa distante emergindo da geleira, composição paisagística minimalista, luz suave de inverno, gradação de cor azul-pálida atmosférica, ar frio de montanha, natureza serena, sem pessoas, sem árvores, sem estruturas.

Fotografada de um ponto de vista alpino elevado, enfatizando escala e vazio. Formas geométricas limpas criadas pela neve e sombra, transições tonais suaves, terreno congelado expansivo se estendendo além do quadro.

Fotografia ultra-realista, compressão de teleobjetiva média, fotografia de expedição estilo National Geographic, alta faixa dinâmica, detalhes nítidos na textura da neve, névoa atmosférica sutil, iluminação natural, cinematografia premium ao ar livre, estética de geleira islandesa, minimalismo escandinavo, sensação de isolamento e calma de tirar o fôlego.

Composição: linha diagonal forte, enquadramento assimétrico, 80% de tons de neve e céu, espaço negativo extremo, fotografia paisagística minimalista de arte fina.

Paleta de cores: azul-gelo, branco-glacial, cinza-rocha suave, tons de inverno amenos.

Câmera: Sony A1, lente 135mm, f/8, ISO 100, filtro polarizador, gradação de cor cinematográfica.

Gerando com Nano Banana Pro, aqui está nosso resultado:

Image
Image

A partir daqui, podemos usar qualquer um dos modelos Omni Reference principais do Flick para animar nosso personagem na cena. Tanto Kling quanto Seedance oferecem ótimos resultados e controle preciso de personagem. Para acessar o Omni Reference, podemos passar o mouse sobre nossa imagem gerada do cenário, selecionar vídeo e escolher Seedance 2.0.

Image

Consistência de personagem com Seedance 2.0

Um personagem mantido consistente ao longo de uma cena inteira, de WITCH. Assista ao filme completo. Conheça o processo de criação.
Um personagem mantido consistente ao longo de uma cena inteira, de WITCH. Assista ao filme completo. Conheça o processo de criação.

A partir daqui, podemos fornecer nossa imagem de cenário e nossas imagens de referência de personagem como entrada. Como planejamos animar o corpo inteiro do nosso personagem caminhando pela cena, o ideal é fornecer imagens de referência de corpo inteiro do nosso personagem. Para adicionar diálogo, podemos opcionalmente anexar áudio como referência e direcionar o modelo para fazer nosso personagem falar aquele diálogo.

Para este exemplo, vamos gerar um vídeo do nosso personagem caminhando pela cena e falando nosso diálogo "Ah! É tão bom respirar aqui fora." Também podemos especificar o estilo de câmera na mão para produzir exatamente os resultados de vídeo que estamos buscando.

O sistema de menções de última geração do Flick permite que você referencie entradas específicas em seu prompt, para que você possa direcionar exatamente como o modelo deve usar cada entrada na geração final. Por exemplo, podemos dizer ao modelo para usar a primeira imagem como quadro inicial, e então usar nossas três imagens de referência de personagem para criar a aparência do nosso personagem. Especificamos o movimento do nosso personagem e, em seguida, direcionamos o modelo para fazer nosso personagem falar o diálogo anexado. Aqui está nosso prompt final:

Use @Image1 como o quadro inicial. Referencie a aparência de Serana a partir de @Image2, @Image3 e @Image4. Estilo de câmera na mão, Serana entra no quadro pelo canto inferior esquerdo, se espreguiça enquanto caminha, e fala @Audio1.
Image
Image

Este prompt é curto e simples — e esse é o ponto. A maior parte da informação que queremos que nosso modelo utilize vem das nossas imagens de referência. Podemos aproveitar as capacidades do Seedance 2.0 e o sistema de menções do Flick para especificar exatamente como, produzindo uma geração de vídeo final precisa, mantendo a consistência do personagem impecavelmente. Aqui está nosso resultado final:

Mesmo personagem, novo plano: Seedance 2.0 com uma referência travada.

Consistência de personagem com Kling O3 Pro Omni Reference

Do nosso blog, In the AI Era, Story Is Everything, escrito pela cofundadora Zoey Zhang. Leia o blog completo.
Do nosso blog, In the AI Era, Story Is Everything, escrito pela cofundadora Zoey Zhang. Leia o blog completo.

Alcançar vídeos com consistência de personagem usando o Kling O3 Pro envolve muitas das mesmas etapas que fazer isso com o Seedance 2.0. Comece com uma imagem do seu cenário e suas imagens de referência de personagem. A partir daqui, podemos passar o cursor sobre nossa imagem de referência de cenário e acessar o Omni Reference. O sistema de menções do Flick também se estende ao Kling Omni Reference, o que permite fornecer até 12 imagens de referência que o modelo pode usar na geração final.

Para usar o Kling O3 Pro Omni Reference com referência de personagem, selecione o seletor de modelo e insira o quadro inicial desejado. Neste exemplo, usaremos nossa imagem de referência de cenário. Em seguida, você pode usar o sistema de menções do Flick para criar um Elemento. Os Elementos permitem armazenar múltiplas imagens de referência em uma única menção. Depois de inserir nossa imagem de cenário como quadro inicial, podemos criar um Elemento para representar nosso personagem. Por padrão, esse elemento será chamado de “Element1”. Podemos anexar nossas três imagens de referência de corpo inteiro do personagem a esse único elemento e referenciá-lo no prompt.

No prompt, instruímos o modelo a referenciar a aparência do nosso personagem a partir de “Element1” e especificamos um estilo de câmera na mão. Definimos seu movimento: ela “entra na cena com os braços abertos, como se estivesse sentindo o vento”, e, por fim, dizemos ao modelo para evitar gerar música de fundo. Aqui está nosso prompt final:

Referencie a aparência de Serana a partir de @Element1 . Estilo de câmera na mão. Serana entra na cena com os braços abertos, como se estivesse sentindo o vento. Sem música de fundo.

Novamente, podemos manter nosso prompt simples, pois a maior parte das informações que fornecemos ao modelo vem por meio do nosso Start Frame, que representa o cenário da cena, e de um Elemento, que representa nosso personagem por meio das três imagens de referência fornecidas. Tendo inserido nossa imagem de cenário como quadro inicial, definido o Element1 para representar nosso personagem e escrito nosso prompt, estamos prontos para gerar:

Image
Image
Image

Aqui está o resultado. Ele acerta a consistência do personagem, mantém nosso cenário exatamente como especificamos no quadro inicial e segue com precisão nossa instrução de estilo de câmera na mão:

Kling O3 Pro Omni Reference mantém o personagem, o cenário e o estilo de câmera na mão.

Alcance Vídeos com Consistência de Personagem com Ainda Mais Precisão no Flick: O Método de Troca de Rosto

Em vez de gerar seu vídeo, incluindo sua cena, design de personagem e prompt em uma única tomada, para este método, nossos cineastas internos recomendam duas gerações de vídeo separadas.

No primeiro vídeo que geramos, excluímos qualquer referência ao nosso personagem. Em vez disso, fornecemos uma imagem do cenário onde queremos que a cena aconteça e, então, usamos nosso prompt para detalhar a ação que queremos ver. Depois de gerar esse vídeo, extraímos o quadro final usando a ferramenta de extração de quadro do Flick. Passamos essa imagem para o Nano Banana Pro e a regeneramos usando nossa imagem de referência de personagem como referência. Isso produz um quadro final com nosso personagem exato.

No segundo vídeo que geramos, passamos o novo quadro final gerado com nosso personagem, junto com o vídeo inicial que geramos, para o Kling O3. Isso produz um vídeo final que replica precisamente o vídeo da geração inicial, mas com nosso personagem exato. A primeira geração nos permite ter controle preciso sobre a cena e a ação que ocorre dentro dela, enquanto a segunda geração nos permite trocar nosso personagem, mantendo assim a consistência do personagem.

Veja como fazer isso:

Para este método, começamos com uma única imagem de referência de personagem, que transformamos em uma folha de rotação (turnaround sheet), exibindo três visões de corpo inteiro do personagem dispostas lado a lado. Aqui está o prompt que usamos:

Use a imagem fornecida como a referência exata do personagem. Crie uma folha de giro de design de personagem da mesma figura histórica masculina chinesa em estilo de boneco de stop-motion artesanal, com textura sutil de argila e boneco de figurino. Mostre três vistas de corpo inteiro dispostas lado a lado: vista frontal, vista lateral pura e vista em 3/4. Preserve o design do figurino exatamente como na imagem de referência, incluindo o chapéu preto alto, o manto externo cinza pálido, o manto interno branco, o comprimento do manto, o formato das mangas, a estrutura da gola, o cinto na cintura, os ornamentos pendurados, as botas pretas, a arma em forma de vara longa e o recipiente cilíndrico. Mantenha a silhueta das roupas, a sobreposição de camadas, as proporções, o corte das peças, o posicionamento dos acessórios e a construção geral do figurino inalterados. Não redesenhe nem simplifique o figurino. A única transformação é o meio visual: personagem em forma de boneco artesanal, estética de filme em stop-motion, tecido levemente texturizado, rosto levemente esculpido, tratamento sutil de superfície semelhante à argila, detalhes de figurino artesanais, construção realista de guarda-roupa em miniatura, apresentação de giro em estúdio. Fundo neutro e liso, iluminação suave e uniforme, corpo inteiro visível, espaçamento limpo, folha de design de figurino altamente legível, prancha de personagem de produção refinada, estética de fantasia folclórica chinesa em stop-motion, detalhado mas controlado, menos brilhante, menos digital, sensação tátil e artesanal.

Aqui está o resultado:

Image

Também geramos uma imagem da ambientação desejada para nossa cena. Podemos fazer isso de duas maneiras. Primeiro, podemos inserir um prompt bem definido em um modelo de texto para imagem, como o Nano Banana Pro ou o GPT Image 2, para gerar o esquema de como queremos que nossa cena fique.

Para ainda mais precisão, podemos recorrer ao nosso segundo método. Em vez de gerar com um modelo de texto para imagem, podemos criar um storyboard da ambientação desejada à mão em uma ferramenta como o Microsoft Paint. Em seguida, podemos fazer com que o Nano Banana Pro use nosso esboço como referência na geração final. Para este exemplo, vamos esboçar um cais nevado em um lago congelado, com um pano vermelho desbotado esvoaçando em primeiro plano. Aqui está nosso esboço:

Image

Em seguida, podemos passar nosso esboço para o Nano Banana Pro com um prompt descritivo, detalhando exatamente os detalhes realistas que buscamos, e usando nosso esboço como referência. Aqui está nosso prompt:

Use este esboço de storyboard desenhado à mão como referência estrita de layout e composição. Preserve 100% a composição atual, o ângulo de câmera, o enquadramento, o posicionamento dos sujeitos e o design das formas principais. Cenário em miniatura de boneco de stop-motion do folclore chinês, um galho nu à beira do lago fincado na diagonal na neve com um pano vermelho escuro desbotado amarrado ao redor dele, um pequeno cais de madeira coberto de neve atrás dele, agrupamentos de juncos e taboas de inverno curvados pela neve ao longo da margem direita, neve artesanal e tátil, cais construído à mão, textura natural de galho, tecido com trama sutil, paleta fria de inverno em azul-acinzentado, acabamento fosco artesanal, atmosfera poética e contida. A superfície do lago se torna uma superfície de gelo em miniatura de estúdio, com gelo opaco e suave em azul-acinzentado, irregularidades sutis semelhantes a gesso moldado, acabamento fosco semelhante a resina, camadas rasas de geada, manchas leitosas sutis, grão congelado delicado, variação de superfície artesanal suave, reflexo mínimo.

Aqui está nosso resultado:

Image

Em vez de texto para vídeo, que depende da codificação do seu personagem em um prompt, o Flick oferece uma abordagem melhor. Use as imagens estáticas das cenas geradas, cada uma com a composição exata e o design de personagem que você busca, como referências para o modelo de imagem para vídeo. Isso ancora o primeiro quadro e permite que o modelo mantenha seu personagem consistente ao longo do restante.

A partir daqui, podemos gerar nosso primeiro vídeo com o Kling O3 Pro, ou outro modelo de imagem para vídeo. Podemos usar nossa imagem de ambientação como quadro inicial e especificar a ação do nosso personagem. Como não estamos fornecendo a imagem do nosso personagem como referência aqui, podemos manter a descrição do personagem breve. Para este exemplo, vou simplesmente pedir um “boneco de stop-motion pescador”. Especificamos sua ação: caminhando pela neve até o cais e parando no final dele. Definimos o movimento desejado do personagem e direcionamos o modelo para fazer a nevasca ficar cada vez mais intensa, soprando pelo quadro. Aqui está nosso prompt final:

Um pescador boneco de stop-motion, com uma capa de chuva de palha e um chapéu de bambu, caminha pela neve até o cais, ligeiramente encurvado contra o frio, uma mão se equilibrando, a outra segurando o casaco junto ao corpo. A câmera em miniatura artesanal se move lentamente para frente e inclina-se levemente para cima. A nevasca fica cada vez mais intensa até se tornar uma densa tempestade de inverno, com neve soprando pelo quadro e cobrindo gradualmente o lago congelado. No final, o pescador chega à extremidade do cais, para e permanece imóvel por um breve momento, de frente para o gelo.

Com nossa imagem de ambientação como referência, isso produz um resultado preciso e belo:

É aqui que entra a vantagem do método de troca de rosto. Quando estivermos satisfeitos com nossa primeira geração de vídeo, podemos extrair o quadro final desse vídeo usando a ferramenta de extração de quadro do Flick. Usando a folha de referência (turnaround sheet) do nosso personagem gerada anteriormente, podemos enviar ambas as imagens para o Nano Banana Pro e instruir o modelo a substituir o personagem no quadro final pela nossa referência de personagem, mantendo a iluminação, a composição, o ângulo de câmera e a ambientação da nossa geração inicial. Aqui está nosso prompt:

Use a cena do píer nevado como principal referência de composição e use a folha de design de personagem em estilo boneco de stop-motion fornecida como referência de personagem. Substitua o pescador de pé na ponta do píer por este personagem exato. Combine a silhueta vista de costas, o formato do chapéu, o comprimento do manto, o manto externo cinza pálido, o manto interno branco, as botas pretas, o cinto na cintura, os acessórios pendurados, o objeto em formato de vara longa, o recipiente cilíndrico e as proporções gerais do corpo a partir da folha de personagem. Mantenha o personagem de costas para a câmera na extremidade distante do píer, na mesma posição de costas da imagem atual. Preserve o ângulo de câmera, a composição, o píer, o lago congelado, o galho com pano vermelho desbotado em primeiro plano, a margem coberta de neve e os juncos curvados pela neve já existentes. Mantenha o estilo de miniatura de boneco de stop-motion do folclore chinês, os materiais artesanais, a neve com textura tátil, o gelo fosco, as proporções sutis de boneco e a atmosfera silenciosa de inverno. O novo personagem deve parecer naturalmente inserido no mesmo cenário em miniatura, com a mesma escala, a mesma lógica de pose de costas e o mesmo clima cinematográfico contido.

Junto com nossas duas entradas, a folha de referência (turnaround sheet) e o quadro final extraído, usamos o Nano Banana Pro para gerar nosso novo quadro final:

Image

Image

Aqui está nosso resultado:

Image

O que torna esse método tão poderoso é que podemos ser exatos sobre como queremos que a composição da nossa cena fique. Em vez de instruir o modelo a gerar nosso vídeo final com a imagem de ambientação, as referências de personagem e o prompt tudo de uma vez, dividimos isso em duas passagens. Na primeira, criamos nossa cena, prestando pouca atenção ao personagem por enquanto. Depois, geramos um novo quadro final com o personagem desejado e fazemos uma segunda passagem para gerar nosso vídeo final.

Usando a imagem de ambientação que criamos anteriormente como nosso quadro inicial, e nosso novo quadro final refinado que inclui a referência do nosso personagem, geramos nosso resultado final. Além da referência de personagem incorporada no quadro final, usamos um prompt para lembrar o modelo da descrição do nosso personagem, seu movimento, a ambientação e o movimento de câmera e áudio de fundo desejados. Aqui está nosso prompt:

Um funcionário-erudito boneco de stop-motion chinês, com um chapéu preto alto, manto externo cinza pálido sobre um manto interno branco, botas pretas, com uma aljava e uma espada hengdao pendurada ao lado, caminha lentamente pela neve até o píer com passos contidos e deliberados. A câmera artesanal em miniatura se move lentamente para frente e inclina-se levemente para cima. Uma leve neve flutua suavemente pelo quadro. O lago congelado permanece quieto e imóvel. Ao final, o funcionário-erudito chega à extremidade distante do píer, para e fica parado, de frente para o gelo. Atmosfera muito silenciosa, apenas passos suaves na neve e na madeira.

E aqui está nosso resultado final:

Resultado do método de troca de rosto: composição exata do plano de cenário, com o personagem travado trocado.

Esse método é mais avançado, mas oferece um controle extremamente preciso sobre a composição da nossa cena, mantendo uma consistência exata do personagem. Embora exija executar duas gerações de vídeo separadas com o Kling ou outro modelo, o que é mais caro, isso economiza créditos que, de outra forma, você desperdiçaria em um único vídeo impreciso que não fica do seu agrado.

Perguntas Frequentes

Qual é a melhor ferramenta de IA para personagens consistentes?

Não existe uma única melhor ferramenta — existe um melhor método. Para a maioria das pessoas, um fluxo de trabalho de Character Reference img2img (como o do Flick) é a maneira mais rápida e confiável de manter um personagem consistente sem nenhum treinamento. Para produção em alto volume com desvio quase zero, uma LoRA treinada sob medida no ComfyUI é o padrão-ouro.

O que significa Consistência de Personagem img2img?

Consistência de personagem de imagem para imagem (img2img) significa gerar novas imagens do seu protagonista — em uma nova ambientação, com detalhes adicionados, em um ângulo inédito — mantendo a identidade visual exata do personagem definido.

Como posso alcançar consistência de personagem no Flick?

Você fornece uma imagem de referência do seu personagem. Usando a ferramenta Character Reference, a IA gera novas imagens que preservam a identidade visual do seu protagonista. Em vez de descrever seu personagem em palavras e torcer para que o modelo produza o mesmo resultado duas vezes, você entrega a referência e diz: “este personagem, agora em uma nova cena.”

Como faço um personagem consistente no Midjourney?

Use o Omni Reference (--oref) com a imagem de referência do seu personagem e ajuste o omni-weight (--ow) para que o modelo mantenha a identidade enquanto ainda segue o seu prompt de cena.

Posso manter um personagem consistente em vídeo com IA?

Sim. Primeiro, fixe o personagem em uma imagem estática, depois anime essa imagem com o recurso de referência de uma ferramenta de vídeo — o “Ingredients” do Veo 3, o References do Runway, ou o “Elements” do Kling. Animar a partir de uma imagem estática fixada oferece uma consistência muito melhor do que texto para vídeo.

Preciso treinar um modelo para obter um personagem consistente?

Não. Treinar um LoRA oferece o travamento mais preciso possível, mas para a maioria dos projetos, uma única boa imagem de referência com um recurso de Character Reference já é suficiente. Só treine um modelo quando você estiver gerando centenas de planos e a variação se tornar custosa de corrigir manualmente.

Por que meu personagem de IA continua mudando?

Porque cada geração é criada do zero, sem memória da anterior, então pequenas variações se acumulam e geram desvios. A solução é fornecer ao modelo uma referência fixa a ser seguida, em vez de redescrever o personagem em palavras a cada vez.

Como começo no Flick?

Assista ao nosso tutorial: Flick 101: Getting Started. Crie seu primeiro projeto, complete o onboarding e comece sua jornada de criação de filmes com IA!



Explore Tutoriais Relacionados:

https://flick.art/docs/visual-styles

https://flick.art/docs/voice-consistency

Saiba Mais Sobre The Herder:

https://flick.art/blog/behind-the-herder

Por Que Criar Ótimos Personagens Importa:

https://flick.art/blog/in-the-ai-era-story-is-everything