GPT-6 Transformou Fotos em Mundos 3D. Agora Vamos Fazer um Filme

Yasushi Oh

Sep 2026

Os fluxos de trabalho do GPT-6 e Seedance 2.5 circulando no X colocam uma ideia cinematográfica familiar em um novo contexto: construa o espaço, bloqueie a ação e depois gere a tomada.

Para um cineasta, a parte empolgante é o controle. Onde a câmera começa? Quando o personagem atravessa a sala? O que o próximo ângulo revela?

Estamos trazendo esse tipo de direção para o Flick, começando com uma única foto.

Insira uma imagem de referência, obtenha um cenário 3D editável e diga ao agente como você quer filmar. Suas tomadas se tornam clipes no seu canvas, prontos para geração de vídeo com IA.

Aqui está o fluxo de trabalho que estamos construindo e como ele se compara com as demos de GPT-6 para Seedance.


Image

Transforme uma foto em um cenário 3D

Comece com uma foto de locação, um still de filme ou uma referência visual para a cena que você tem em mente.

Image

O Flick constrói um cenário 3D a partir dessa imagem. Os objetos têm nomes, você pode selecioná-los e peças relacionadas são agrupadas. Uma câmera já está posicionada para enquadrar a vista da sua referência.

Image

Isso te dá um ponto de partida para dirigir. Você pode olhar para a porta, a distância através da sala ou o espaço entre dois prédios e decidir o que a tomada precisa.

O cenário é cinza, com as formas principais e relações espaciais organizadas para pré-visualização. Você está trabalhando composição, movimento e cobertura antes de se comprometer com o visual final.

Sem configuração do Blender. Sem construir a locação peça por peça antes de poder testar um movimento de câmera.

Descreva a tomada. Deixe o agente construí-la.

Imagine uma fotografia de rua com uma porta ao fundo. Você quer começar acima da rua, descer e se mover em direção à entrada.

Sua direção pode ser simples assim:

Grua descendo para um travelling em direção à porta.

O agente constrói o movimento de câmera no set. Os movimentos se conectam: o travelling começa onde o movimento de grua termina, então você pode projetar um plano com vários tempos.

Você pode pedir uma órbita, um dolly zoom, uma panorâmica, ou uma câmera fixa. Siga um sujeito ou desenhe um caminho para a câmera voar pela cena.

A decisão criativa fica com você. O movimento revela a porta cedo demais? Manter o plano aberto faria a aproximação parecer mais tensa? Você tem um set e uma câmera para trabalhar enquanto responde essas questões.

Coloque a ação onde você quiser

O movimento de câmera é apenas metade do plano. Alguém precisa se mover através dele.

O protótipo do Flick inclui 47 animações de personagens. Desenhe um caminho no chão e faça um personagem andar, correr ou disparar ao longo dele. Outros objetos também podem ser animados: uma porta se abrindo, algo caindo, uma cadeira balançando.

Para a cena de rua, você pode enviar um personagem em direção à entrada enquanto a câmera se move para mais perto. Agora você pode ver como a ação e o enquadramento funcionam juntos.

Essa é a parte útil do previz com IA: tornar sua encenação visível enquanto ainda é fácil de mudar.

Filme a cobertura junto

Coloque várias câmeras no set e grave todas de uma vez.

Um plano aberto estabelece a rua. Um ângulo lateral segue a aproximação. Outra câmera observa a porta. Uma performance te dá cada ângulo como uma tomada.

Você pode comparar a cobertura em torno da mesma ação e decidir qual visão conta melhor a história. O momento em que o personagem alcança a entrada se torna algo que você pode examinar de várias posições.

Leve a pré-visualização direto para o vídeo com IA

Cada tomada gravada chega no seu canvas do Flick como um clipe, pronto para alimentar os modelos de vídeo que você usa lá.

O fluxo proposto é simples:

Foto de referência → cenário 3D editável → câmera e bloqueio → tomada gravada → vídeo com IA.

Sua pré-visualização carrega a encenação e o movimento de câmera para a próxima etapa. Suas referências visuais e direção de vídeo estabelecem o visual que você quer criar.

Você permanece dentro do Flick enquanto passa do planejamento da tomada para a geração. Não há exportação separada de cena para gerenciar ao longo do caminho.

Nosso guia de filmagem com Blender já explica como uma animação 3D básica pode guiar uma tomada de vídeo com IA. Imagem para 3D traz a construção de cena e gravação de tomada para esse mesmo espaço de trabalho.

O que as publicações de GPT-6 para Seedance 2.5 realmente mostram

As demos merecem crédito. Elas já demonstram fluxos de trabalho que chegam ao vídeo, com controle significativo sobre a cena antes da geração.

Em 3 de setembro de 2026, a Higgsfield descreveu uma sequência em museu na qual o GPT-6 Astra planejou a localização, elenco e lista de tomadas. O bloqueio permaneceu na viewport, com o Seedance 2.5 gerando as configurações. Veja o fluxo de trabalho do museu no X.

Em 5 de setembro, a Higgsfield publicou uma cadeia mais completa: desenvolver uma história de luta de espadas, fazer pré-visualização no Blender, gerar tomadas com Seedance 2.5 e montar a edição final. A publicação diz que o fluxo de trabalho preservou os personagens e localização. Veja o fluxo de trabalho da luta de espadas no X.

Uma demo de câmera de 3 de setembro também descreveu vincular um telefone à viewport do Blender para comandar movimento manual. Veja o fluxo de trabalho manual no X.

Essas publicações descrevem o que os fluxos de trabalho realizaram, mas não fornecem um registro completo de prompts, tentativas ou intervenções. Elas nos dão exemplos úteis para comparar, sem estabelecer quanto trabalho cada criador deve esperar.

A questão para o Flick é como tornar esse processo acessível a partir da imagem de referência que você já tem.

Parte do fluxo de trabalhoFluxos de trabalho referenciados GPT-6 / SeedanceFlick imagem para 3D
Ponto de partidaPlanejamento de cena ou briefing de história nos exemplos do museu e luta de espadasUma foto de referência
Cena e bloqueioEncenação baseada em viewport; pré-visualização no Blender no exemplo da luta de espadasUm cenário editável dentro do Flick
Direção de câmeraMovimento de câmera no Blender vinculado ao telefone no exemplo manualMovimentos em linguagem simples, movimentos conectados e trajetórias desenhadas
CoberturaConfigurações geradas no exemplo do museuGravação simultânea de várias câmeras
Passando para vídeoGeração com Seedance; uma edição final no exemplo da luta de espadasTomadas gravadas chegam no canvas do Flick para geração de vídeo

Já existem maneiras de simplificar uma transferência do Blender. O Dreamina, por exemplo, documenta um plugin Clay Renderer que combina renderização e upload de um clipe de referência. Veja o fluxo de trabalho do Dreamina.

A abordagem do Flick coloca criação de cena baseada em fotos, direção de planos e tomadas gravadas em um só lugar. Se você pensa em enquadramento e bloqueio, essas são as decisões com as quais você pode começar.

Construído em torno da visão através da sua câmera

Um cenário útil precisa se manter coeso a partir do ângulo que você pretende filmar.

O Flick verifica sua reconstrução através da câmera que posicionou, usando a distância focal dessa câmera. Ele revisa a imagem resultante e pode fazer correções em até três passagens, parando antes quando uma passagem não produz alterações.

Essa verificação está ligada à sua composição. Uma forma faltando no fim de uma rua pode mudar o quadro inteiro, mesmo que a maioria dos prédios esteja presente.

O Flick também identifica o elemento que fecha a vista e o constrói primeiro. Pense em um templo no fim de uma viela: pequeno na fotografia, mas central para onde seu olhar viaja.

Esses detalhes tornam a referência útil como ponto de partida para um plano. Você pode então dirigir o que acontece dentro dele.

Seu próximo cenário começa com uma foto

Traga uma foto. Bloqueie a ação. Experimente o movimento de câmera. Grave a cobertura. Continue em vídeo com IA no seu canvas.

Estamos construindo isso para cineastas que querem passar mais tempo experimentando o plano que conseguem visualizar. Enquanto finalizamos, você pode explorar o Flick e organizar as referências para sua próxima cena.

O recurso de imagem para 3D do Flick será gratuito. Está chegando em breve. Atualmente é um protótipo funcional, sem data de lançamento anunciada. A oferta gratuita cobre imagem para 3D; a geração de vídeo com modelo é separada.

Perguntas Frequentes

A IA pode transformar uma foto em uma cena 3D?

Sim. O protótipo de imagem para 3D do Flick constrói um cenário de previz editável a partir de uma imagem, com objetos selecionáveis e uma câmera posicionada em torno da vista de referência.

Preciso conhecer Blender ou outro software 3D?

Não. O fluxo de trabalho que estamos construindo roda dentro do Flick. O agente constrói o cenário e responde a direção de planos em linguagem natural.

Posso mover a câmera e animar pessoas?

Sim. O protótipo suporta movimentos de câmera conectados, caminhos desenhados e animação de personagens. Você também pode gravar várias câmeras ao mesmo tempo para cobertura da mesma performance.

Como transformo a cena 3D em um vídeo de IA?

Grave uma tomada. Ela se torna um clipe no seu canvas do Flick, pronta para usar como entrada para geração de vídeo junto com suas outras referências e direção.

A cena 3D é fotorrealista?

É um set de previz cinza para planejar espaço, enquadramento e movimento. O tratamento visual final vem durante a etapa de vídeo de IA.

Que tipo de imagem posso usar para começar?

Uma foto de locação, um still de filme ou uma referência visual para sua cena. O fluxo de trabalho começa com uma imagem e constrói um set em torno dessa vista de referência.