我如何用 AI 制作写实维京影片(完整工作流程)

· Flick 内部影片制作人 · LinkedIn

Aug 2026

AI 短片《尤利西斯》中的低角度电影级肖像:以石碑和蓝天为背景的饱经风霜的北欧男子
AI 短片《尤利西斯》中的低角度电影级肖像:以石碑和蓝天为背景的饱经风霜的北欧男子

我用 AI 完全制作了一部名为 Ulysses 的照片级写实维京短片。没有摄影机、没有剧组、没有演员、没有布景。只用了四百多个镜头,大约八天时间搭建完成,看起来就像真实拍摄的素材。这是完整的工作流程,从头到尾,完全按照在画布上实际操作的方式呈现。如果你想的话,可以先在 Flick TV 上观看完成的影片;下面的所有内容都是关于它是如何制作出来的。

这是一部关于两个看似普通的游戏 NPC 在空旷的等候空间中等待的短片,我们逐渐意识到他们可能比控制他们的玩家更有生命力。我们不再将 NPC 视为不活跃的背景代码,而是想象他们即使在不被看见时也继续存在,承载着自己的意识、不确定性和存在感。故事始于一场荒诞的等待游戏,但慢慢演变成对可见性、表演以及拥有内在生命意味着什么的反思。

1. 先有故事,再有镜头

Ulysses 是一个维京时代的故事:一个蜂蜜酒馆老板、一个年轻守卫、一个身着盔甲的战士和一条龙。在生成任何内容之前,我将它分解成镜头,就像你为任何影片制作故事板一样。每个镜头都有一个粗略的计划,包括谁在其中、摄像机位置以及发生了什么。

制作你自己的 AI 影片

从一张图片开始,逐镜头构建完整影片。

2. 将角色设定为参考表

这是最重要的一步。对于每个角色,我生成了一个清晰的三视图参考表,包括正面、侧面和四分之三视角,背景为纯灰色,就像选角照片一样。

灰色背景上穿着羊毛束腰外衣的蓄须北欧男子的三视图全身参考表
灰色背景上穿着羊毛束腰外衣的蓄须北欧男子的三视图全身参考表

这个参考表成为角色的"演员"。该角色的每个后续镜头都基于它构建,因此面部不会发生漂移。我的主角参考表在 79 个不同的镜头中被重复用作基础。服装和盔甲也采用同样的处理方式:我手工绘制盔甲草图,然后将草图转换为完整的照片级写实全方位展示。

身穿盔甲、头戴角盔、手持斧头的维京战士三视图参考表
身穿盔甲、头戴角盔、手持斧头的维京战士三视图参考表

3. 手绘每个镜头的草图

这是最让人惊讶的步骤。在生成画面之前,我会粗略绘制构图草图,只是一些形状:角色站在哪里、地平线在哪里、摄像机看向哪里。在这部影片中,我为数百个镜头都做了这个工作。

草图将场景调度和摄像机合二为一。它快速、可抛弃,并且为模型提供了准确的遵循指引,而不是仅凭文字猜测构图。

4. 将草图转换为照片级写实画面

然后我在 Nano Banana 中结合了三样东西:构图草图、角色的参考表和简短的指令,并要求生成照片级写实的实拍画面。提示词禁止模型偏离:

Use the provided sketch as the only composition reference, use the provided guard
reference as the guard character reference. Convert the scene into a photorealistic
live-action cinematic image. Composition 100% exactly matches the provided sketch.
Camera position 100% unchanged.

粗略的草图加上锁定的角色,最终输出的镜头看起来就像拍摄的一样。

参考表中的同一位北欧人,在白色沙滩上沿着蓝色墙壁奔跑,呈现为完成的电影级画面
参考表中的同一位北欧人,在白色沙滩上沿着蓝色墙壁奔跑,呈现为完成的电影级画面

5. 通过编辑优化,而非重新生成

这部影片中几乎没有任何内容来自空白文本提示词。在我的图像生成中,371 次是对现有画面的编辑,只有 21 次是文本生成图像。当画面稍有偏差时,比如下巴过重、阴影奇怪或细节错误,我会编辑该画面而不是从头开始。一致性来自于在锁定的基础上进行编辑,而非完美的措辞。

6. 制作动画,让角色开口说话

静态画面锁定后,我使用 Kling 将选定的画面制作成视频动画。有些镜头是简单的运动;其他镜头是对话,角色直接对着镜头说话。这些提示词对表演有具体要求:

Handheld camera, extreme close-up of his face. His eyes stay locked on the camera,
no drift. He says, "Still, here." Then a brief pause, still staring, with visible
strain, as if forcing the words out.

静态画面保持了身份特征;视频则加入了呼吸和声音。

7. 一切发生的画布

以上每个步骤都在同一个工作区中完成。这是实际项目的缩小视图:左侧是草图行,向右侧的照片级真实行输入,底部是角色表,中间是迭代阶梯。424 张图像和 38 个视频镜头,全部可追溯到其参考。

Flick 中完整的 Ulysses 项目画布缩小视图:左侧为手绘构图草图,连接到右侧的照片级写实帧,底部为角色参考表
Flick 中完整的 Ulysses 项目画布缩小视图:左侧为手绘构图草图,连接到右侧的照片级写实帧,底部为角色参考表

放大任何位置,你都会看到相同的模式重复:一个构图,多个镜次,一个最终保留。这就是两位主角在迭代过程中的样子,穿锁子甲的守卫和穿束腰外衣的守护者,每个镜次中都是相同的面孔,因为每个镜次都指向相同的参考表。

Ulysses 画布的特写视图,显示两位主角的重复镜次,一位身着盔甲的守卫和一位穿羊毛束腰外衣的男子,站在白色沙滩上
Ulysses 画布的特写视图,显示两位主角的重复镜次,一位身着盔甲的守卫和一位穿羊毛束腰外衣的男子,站在白色沙滩上

8. 背后的数据

为了了解规模,以下是完成项目所包含的内容:

来自 Ulysses 画布数值
生成的图像 / 失败次数424 / 20
参考图像链接653(占所有连接的 92%)
图像编辑 vs 文本生成图像371 vs 21(95% 为图像到图像)
单个参考表重复使用79 个镜头
制作时间约 8 天,一人完成

9. 开始之前我想告诉你的

  • 首先制作参考表。这是整个流程的核心。没有参考表的角色会失去一致性。
  • 绘制镜头草图。一幅构图正确的粗糙草图胜过一段华丽的文字描述。
  • 编辑,而非重新生成。锁定基础图像,尽可能少做改动。
  • 预期会有失败。有 20 个镜头完全失败,还有更多需要修复。这很正常;整个流程能够消化这些问题。

制作你自己的作品

从一张图像开始,逐镜构建影片。最重要的步骤是参考表,我们的AI 角色一致性指南正是对此的深入探讨。

常见问题

制作这样一部 AI 影片需要多长时间?

Ulysses 在大约 8 天内运行了 432 个生成任务,一个人,没有团队。大部分时间用于在镜次之间做选择,而不是等待渲染。

这部影片实际使用了哪些 AI 模型?

静态图像和编辑使用 Nano Banana(392 次图像生成中有 371 次是对现有帧的编辑),动态使用 Kling:最终画布包含 37 个 Kling 视频镜头,包括口语对白镜次。

角色如何在 400 个镜头中保持一致?

参考表,连接到所有内容:项目包含 653 个参考图像连线,占所有连线的 92%,仅主角的参考表就用于 79 个镜头。没有镜头是仅从文字生成的。

角色真的能说话吗?

是的。对白镜头从锁定的静态图像开始制作动画,使用指定台词、停顿和眼神的表演提示词。静态图像保持身份;视频处理添加呼吸和声音。