
GPT-6 将照片转化为 3D 世界。现在让我们来制作影片
Sep 2026
在 X 上流传的 GPT-6 和 Seedance 2.5 工作流程将一个熟悉的电影制作理念放到了新的环境中:搭建空间、安排动作,然后生成镜头。
对于电影制作者来说,令人兴奋的部分在于掌控力。镜头从哪里开始?角色何时穿过房间?下一个角度会揭示什么?
我们正在将这种导演控制引入 Flick,从一张照片开始。
放入一张参考图像,获得一个可编辑的 3D 场景,然后告诉智能体你想如何拍摄。你的镜头将变成画布上的片段,随时可用于 AI 影片生成。
这是我们正在构建的工作流程,以及它与 GPT-6 到 Seedance 演示的对比。

将照片转换为 3D 场景
从场景勘景照片、影片静帧或你心中场景的视觉参考开始。

Flick 从该图像构建一个 3D 场景。物体都有名称,你可以选中它们,相关的部分会组合在一起。一台摄像机已经定位好,用来框定你参考图中的视角。

这为你提供了开始导演的起点。你可以查看门道、房间的距离,或两栋建筑之间的空间,并决定镜头需要什么。
场景是灰色的,主要形状和空间关系已布局好用于预览。你可以在确定最终外观之前,先安排构图、运动和覆盖范围。
无需 Blender 设置。无需在测试镜头运动之前逐块搭建场景。
描述镜头,让智能体来构建。
想象一张街道照片,远处有一扇门。你想从街道上方开始,下降,然后向入口移动。
你的指令可以很简单:
摇臂下降,然后推轨进入门口。
智能体会在场景中构建摄影机运动。运动会连接起来:推轨从摇臂运动结束的地方开始,因此你可以设计一个包含多个节拍的镜头。
你可以要求环绕、推轨变焦、横摇扫视或固定机位。跟随一个对象,或者为摄影机绘制一条穿过场景的路径。
创意决策权始终在你手中。这个运动是否过早地展示了门口?保持广角镜头是否会让接近过程感觉更紧张?你拥有一个场景和一台摄影机来解答这些问题。
将动作放在你想要的位置
摄影机运动只是镜头的一半。还需要有人在其中移动。
Flick 的原型包含 47 个角色动画。在地面上绘制一条路径,让角色沿着它行走、慢跑或奔跑。其他物体也可以制作动画:门的开启、物体的坠落、椅子的摇动。
对于街道场景,你可以让一个角色朝入口走去,同时摄影机向前推进。现在你可以看到动作和构图如何协同工作。
这就是 AI 预览的实用之处:让你的场面调度在仍然易于修改时可视化。
一起拍摄全部景别
在场景中放置多台摄影机,同时记录所有画面。
广角镜头确立街道环境。侧面角度跟随接近过程。另一台摄影机注视着门口。一次表演为你提供每个角度的拍摄素材。
你可以围绕同一动作比较各个景别,决定哪个视角最能讲述故事。角色到达入口的那一刻成为你可以从多个位置审视的内容。
将预演直接导入 AI 视频
每一次录制的镜头都会作为片段落在您的 Flick 画布上,随时可以输入到您在那里使用的视频模型中。
建议的工作流程很简单:
参考照片 → 可编辑的 3D 场景 → 摄影机和调度 → 录制镜头 → AI 视频。
您的预演将场景调度和摄影机运动带入下一步。您的视觉参考和视频指导确立了您想要创建的效果。
当您从规划镜头转向生成镜头时,始终留在 Flick 内。沿途无需管理单独的场景导出。
我们的 Blender 影片制作指南已经解释了粗略的 3D 动画如何引导 AI 视频镜头。图像转 3D 将场景构建和镜头录制带入同一个工作区。
GPT-6 到 Seedance 2.5 的帖子实际展示了什么
这些演示值得称赞。它们已经展示了能够生成视频的工作流程,并在生成之前对场景进行了有意义的控制。
2026 年 9 月 3 日,Higgsfield 描述了一个博物馆序列,其中 GPT-6 Astra 规划了位置、演员和镜头列表。调度保留在视口中,由 Seedance 2.5 生成设置。在 X 上查看博物馆工作流程。
9 月 5 日,Higgsfield 发布了一个更完整的链条:开发一个剑战故事,制作 Blender 预演,使用 Seedance 2.5 生成镜头,并组装最终剪辑。帖子称该工作流程保留了角色和位置。在 X 上查看剑战工作流程。
9 月 3 日的摄影机演示还描述了将手机连接到 Blender 的视口以驱动手持运动。在 X 上查看手持工作流程。
这些帖子描述了工作流程所完成的内容,但没有提供提示词、重试或干预的完整记录。它们为我们提供了可供比较的有用示例,但并未确定每位创作者应该期待多少工作量。
对 Flick 来说,问题在于如何从您已有的参考图像出发,让这个过程变得易于使用。
| 工作流程部分 | 参考的 GPT-6 / Seedance 工作流程 | Flick 图像转 3D |
|---|---|---|
| 起点 | 博物馆和剑战示例中的场景规划或故事简介 | 一张参考照片 |
| 场景和调度 | 基于视口的场景调度;剑战示例中的 Blender 预演 | Flick 内的可编辑场景 |
| 摄影机指导 | 手持示例中与手机连接的 Blender 摄影机运动 | 自然语言运动、连接运动和绘制路径 |
| 覆盖 | 博物馆示例中生成的设置 | 从多个摄影机同时录制 |
| 转向视频 | Seedance 生成;剑战示例中的最终剪辑 | 录制的镜头到达 Flick 画布用于视频生成 |
已经有一些方法可以简化 Blender 的交接流程。例如,Dreamina 记录了一个 Clay Renderer 插件,它结合了渲染和上传参考片段的功能。查看 Dreamina 的工作流程。
Flick 的方法将基于照片的场景创建、镜头指导和录制镜次集中在一个地方。如果你习惯从构图和调度的角度思考,这些正是你可以开始着手的决策。
围绕摄影机视角构建
一个实用的场景需要从你打算拍摄的角度保持整体性。
Flick 通过它放置的摄影机检查重建效果,使用该摄影机的焦距。它会审查生成的图像,并可以在最多三次迭代中进行修正,当某次迭代没有产生变化时会提前停止。
这种检查与你的构图紧密相关。街道尽头缺失的一个形状可能会改变整个画面,即使大部分建筑都存在。
Flick 还会识别封闭视野的特征物并优先构建它。想象一下巷子尽头的寺庙:在照片中很小,但却是视线的中心。
这些细节使参考图像成为镜头的有用起点。然后你可以指导其中发生的内容。
你的下一个场景从一张照片开始
带来一张照片。调度动作。尝试摄影机运动。录制覆盖镜头。在画布上继续进行 AI 视频创作。
我们为希望花更多时间尝试他们能想象的镜头的影视创作者打造这个工具。在我们完善它的同时,你可以探索 Flick 并为下一个场景整理参考素材。
Flick 的图像转 3D 功能将免费提供。即将推出。目前它是一个可运行的原型,尚未公布发布日期。免费提供涵盖图像转 3D;视频模型生成是单独的功能。
常见问题
AI 能将照片转换为 3D 场景吗?
可以。Flick 的图像转 3D 原型可以从一张图像构建可编辑的预览场景,包含可选择的物体和围绕参考视图放置的摄影机。
我需要了解 Blender 或其他 3D 软件吗?
不需要。我们正在构建的工作流程在 Flick 内部运行。智能体会构建场景并响应自然语言的镜头指导。
我可以移动摄影机并让人物动起来吗?
可以。原型支持连贯的摄影机运动、绘制路径和角色动画。你还可以同时录制多个摄影机,以获得同一表演的覆盖镜头。
如何将 3D 场景转换为 AI 影片?
录制一个镜头。它会成为 Flick 画布上的一个片段,可以与其他参考和指示一起用作影片生成的输入。
3D 场景是照片级真实的吗?
它是一个用于规划空间、取景和运动的灰色预览场景。最终的视觉处理在 AI 影片阶段完成。
我可以从什么类型的图片开始?
可以是场地勘景照片、电影剧照或场景的视觉参考。工作流程从一张图片开始,围绕该参考视图构建场景。