GPT-6 Convirtió Fotos en Mundos 3D. Ahora Hagamos una Película

Yasushi Oh

Sep 2026

Los flujos de trabajo de GPT-6 y Seedance 2.5 que circulan en X ponen una idea cinematográfica familiar en un nuevo contexto: construye el espacio, bloquea la acción y luego genera la toma.

Para un cineasta, lo emocionante es el control. ¿Dónde empieza la cámara? ¿Cuándo cruza la habitación el personaje? ¿Qué revela el siguiente ángulo?

Estamos llevando ese tipo de dirección a Flick, empezando con una sola foto.

Coloca una imagen de referencia, obtén un set 3D editable y dile al agente cómo quieres filmarlo. Tus tomas se convierten en clips en tu lienzo, listos para la generación de video con IA.

Este es el flujo de trabajo que estamos construyendo, y cómo se compara con las demos de GPT-6 a Seedance.


Image

Convierte una foto en un set 3D

Empieza con una foto de scouting de locación, un fotograma de película o una referencia visual para la escena que tienes en mente.

Image

Flick construye un set 3D a partir de esa imagen. Los objetos tienen nombres, puedes seleccionarlos y las piezas relacionadas están agrupadas. Una cámara ya está posicionada para encuadrar la vista en tu referencia.

Image

Eso te da un punto de partida para dirigir. Puedes mirar la puerta, la distancia a través de la habitación o el espacio entre dos edificios y decidir qué necesita la toma.

El set es gris, con las formas principales y las relaciones espaciales dispuestas para previsualización. Estás trabajando la composición, el movimiento y la cobertura antes de comprometerte con el aspecto final.

Sin configuración de Blender. Sin construir la locación pieza por pieza antes de poder probar un movimiento de cámara.

Describe la toma. Deja que el agente la construya.

Imagina una fotografía callejera con una entrada al fondo. Quieres comenzar por encima de la calle, descender y moverte hacia la entrada.

Tu dirección puede ser así de simple:

Grúa hacia abajo en un travelling de acercamiento a la entrada.

El agente construye el movimiento de cámara en el set. Los movimientos se conectan: el travelling comienza donde termina el movimiento de grúa, así que puedes diseñar una toma con varios tiempos.

Puedes pedir una órbita, un dolly zoom, un paneo panorámico o una cámara fija. Sigue a un sujeto o dibuja un recorrido para que la cámara vuele a través de la escena.

La decisión creativa queda contigo. ¿El movimiento revela la entrada demasiado pronto? ¿Mantener el plano general haría que la aproximación se sienta más tensa? Tienes un set y una cámara con los que trabajar mientras respondes esas preguntas.

Coloca la acción donde la quieras

El movimiento de cámara es solo la mitad de la toma. Alguien necesita moverse a través de ella.

El prototipo de Flick incluye 47 animaciones de personajes. Dibuja un recorrido en el suelo y haz que un personaje camine, trote o corra a lo largo de él. Otros objetos también pueden ser animados: una puerta abriéndose, algo cayendo, una silla meciéndose.

Para la escena de la calle, podrías enviar un personaje hacia la entrada mientras la cámara se acerca. Ahora puedes ver cómo funcionan juntos la acción y el encuadre.

Esa es la parte útil del previz con IA: hacer visible tu puesta en escena mientras todavía es fácil de cambiar.

Filma la cobertura en conjunto

Coloca varias cámaras en el set y grábalas todas a la vez.

Un plano general establece la calle. Un ángulo lateral sigue la aproximación. Otra cámara observa la entrada. Una actuación te da cada ángulo como una toma.

Puedes comparar la cobertura alrededor de la misma acción y decidir qué vista cuenta mejor la historia. El momento en que el personaje llega a la entrada se convierte en algo que puedes examinar desde varias posiciones.

Lleva la previsualización directamente al video con IA

Cada toma grabada llega a tu lienzo de Flick como un clip, lista para alimentar los modelos de video que usas allí.

El flujo propuesto es simple:

Foto de referencia → set 3D editable → cámara y bloqueo → toma grabada → video con IA.

Tu previsualización lleva la puesta en escena y el movimiento de cámara al siguiente paso. Tus referencias visuales y dirección de video establecen el look que quieres crear.

Te quedas dentro de Flick mientras pasas de planificar la toma a generarla. No hay una exportación de escena separada que gestionar en el proceso.

Nuestra guía de filmmaking con Blender ya explica cómo una animación 3D básica puede guiar una toma de video con IA. Imagen a 3D trae la construcción de escenas y grabación de tomas a ese mismo espacio de trabajo.

Lo que los posts de GPT-6 a Seedance 2.5 realmente muestran

Los demos merecen reconocimiento. Ya demuestran flujos de trabajo que llegan al video, con control significativo sobre la escena antes de la generación.

El 3 de septiembre de 2026, Higgsfield describió una secuencia en un museo en la que GPT-6 Astra planeó la locación, el reparto y la lista de tomas. El bloqueo permaneció en el viewport, con Seedance 2.5 generando los setups. Ver el flujo de trabajo del museo en X.

El 5 de septiembre, Higgsfield publicó una cadena más completa: desarrollar una historia de pelea de espadas, hacer previsualización en Blender, generar tomas con Seedance 2.5 y ensamblar la edición final. El post dice que el flujo de trabajo preservó los personajes y la locación. Ver el flujo de trabajo de pelea de espadas en X.

Un demo de cámara del 3 de septiembre también describió vincular un teléfono al viewport de Blender para controlar el movimiento de cámara en mano. Ver el flujo de trabajo de cámara en mano en X.

Estos posts describen lo que los flujos de trabajo lograron, pero no proporcionan un registro completo de prompts, reintentos o intervenciones. Nos dan ejemplos útiles para comparar, sin establecer cuánto trabajo debe esperar cada creador.

La pregunta para Flick es cómo hacer ese proceso accesible desde la imagen de referencia que ya tienes.

Parte del flujo de trabajoFlujos de trabajo referenciados de GPT-6 / SeedanceImagen a 3D de Flick
Punto de partidaPlanificación de escena o un brief de historia en los ejemplos del museo y pelea de espadasUna foto de referencia
Escena y bloqueoPuesta en escena basada en viewport; previsualización en Blender en el ejemplo de pelea de espadasUn set editable dentro de Flick
Dirección de cámaraMovimiento de cámara en Blender vinculado al teléfono en el ejemplo de cámara en manoMovimientos en lenguaje simple, movimientos conectados y trayectorias dibujadas
CoberturaSetups generados en el ejemplo del museoGrabación simultánea desde varias cámaras
Pasando al videoGeneración con Seedance; una edición final en el ejemplo de pelea de espadasLas tomas grabadas llegan al lienzo de Flick para generación de video

Ya existen formas de simplificar la transferencia a Blender. Dreamina, por ejemplo, documenta un plugin Clay Renderer que combina renderizado y carga de un clip de referencia. Consulta el flujo de trabajo de Dreamina.

El enfoque de Flick reúne la creación de escenas basadas en fotos, la dirección de planos y las tomas grabadas en un solo lugar. Si piensas en encuadre y bloqueo, esas son las decisiones con las que puedes empezar.

Construido en torno a la vista a través de tu cámara

Un set útil necesita mantenerse cohesionado desde el ángulo que pretendes filmar.

Flick verifica su reconstrucción a través de la cámara que ha colocado, usando la distancia focal de esa cámara. Revisa la imagen resultante y puede hacer correcciones en hasta tres pasadas, deteniéndose antes cuando una pasada no produce cambios.

Esa verificación está vinculada a tu composición. Una forma faltante al final de una calle puede cambiar todo el encuadre, incluso si la mayoría de los edificios están presentes.

Flick también identifica el elemento que cierra la vista y lo construye primero. Piensa en un templo al final de un callejón: pequeño en la fotografía, pero central hacia donde viaja tu mirada.

Esos detalles hacen que la referencia sea útil como punto de partida para un plano. Luego puedes dirigir lo que sucede dentro de ella.

Tu próximo set comienza con una foto

Trae una foto. Bloquea la acción. Prueba el movimiento de cámara. Graba la cobertura. Continúa hacia video AI en tu lienzo.

Estamos construyendo esto para cineastas que quieren dedicar más tiempo a probar el plano que pueden imaginar. Mientras lo terminamos, puedes explorar Flick y organizar las referencias para tu próxima escena.

La función de imagen-a-3D de Flick será gratuita. Llegará pronto. Actualmente es un prototipo funcional, sin fecha de lanzamiento anunciada. La oferta gratuita cubre imagen a 3D; la generación con modelos de video es independiente.

Preguntas frecuentes

¿Puede la IA convertir una foto en una escena 3D?

Sí. El prototipo de imagen-a-3D de Flick construye un set de previz editable a partir de una imagen, con objetos seleccionables y una cámara posicionada alrededor de la vista de referencia.

¿Necesito conocer Blender u otro software 3D?

No. El flujo de trabajo que estamos construyendo funciona dentro de Flick. El agente construye el set y responde a direcciones de plano en lenguaje natural.

¿Puedo mover la cámara y animar personas?

Sí. El prototipo admite movimientos de cámara conectados, trayectorias dibujadas y animación de personajes. También puedes grabar varias cámaras a la vez para cobertura de la misma actuación.

¿Cómo convierto la escena 3D en un video con IA?

Graba una toma. Se convierte en un clip en tu lienzo de Flick, listo para usar como entrada para la generación de video junto con tus otras referencias e indicaciones.

¿La escena 3D es fotorrealista?

Es un set de previsualización gris para planificar el espacio, encuadre y movimiento. El tratamiento visual final llega durante la etapa de video con IA.

¿Con qué tipo de imagen puedo empezar?

Una foto de búsqueda de locaciones, un fotograma de película o una referencia visual para tu escena. El flujo de trabajo comienza con una imagen y construye un set alrededor de esa vista de referencia.