
我如何用 AI 制作写实维京影片(完整工作流程)
Aug 2026

我用 AI 完全制作了一部名为 Ulysses 的照片级写实维京短片。没有摄影机、没有剧组、没有演员、没有布景。只用了四百多个镜头,大约八天时间搭建完成,看起来就像真实拍摄的素材。这是完整的工作流程,从头到尾,完全按照在画布上实际操作的方式呈现。如果你想的话,可以先在 Flick TV 上观看完成的影片;下面的所有内容都是关于它是如何制作出来的。
这是一部关于两个看似普通的游戏 NPC 在空旷的等候空间中等待的短片,我们逐渐意识到他们可能比控制他们的玩家更有生命力。我们不再将 NPC 视为不活跃的背景代码,而是想象他们即使在不被看见时也继续存在,承载着自己的意识、不确定性和存在感。故事始于一场荒诞的等待游戏,但慢慢演变成对可见性、表演以及拥有内在生命意味着什么的反思。
1. 先有故事,再有镜头
Ulysses 是一个维京时代的故事:一个蜂蜜酒馆老板、一个年轻守卫、一个身着盔甲的战士和一条龙。在生成任何内容之前,我将它分解成镜头,就像你为任何影片制作故事板一样。每个镜头都有一个粗略的计划,包括谁在其中、摄像机位置以及发生了什么。
制作你自己的 AI 影片
从一张图片开始,逐镜头构建完整影片。
2. 将角色设定为参考表
这是最重要的一步。对于每个角色,我生成了一个清晰的三视图参考表,包括正面、侧面和四分之三视角,背景为纯灰色,就像选角照片一样。

这个参考表成为角色的"演员"。该角色的每个后续镜头都基于它构建,因此面部不会发生漂移。我的主角参考表在 79 个不同的镜头中被重复用作基础。服装和盔甲也采用同样的处理方式:我手工绘制盔甲草图,然后将草图转换为完整的照片级写实全方位展示。

3. 手绘每个镜头的草图
这是最让人惊讶的步骤。在生成画面之前,我会粗略绘制构图草图,只是一些形状:角色站在哪里、地平线在哪里、摄像机看向哪里。在这部影片中,我为数百个镜头都做了这个工作。
草图将场景调度和摄像机合二为一。它快速、可抛弃,并且为模型提供了准确的遵循指引,而不是仅凭文字猜测构图。
4. 将草图转换为照片级写实画面
然后我在 Nano Banana 中结合了三样东西:构图草图、角色的参考表和简短的指令,并要求生成照片级写实的实拍画面。提示词禁止模型偏离:
Use the provided sketch as the only composition reference, use the provided guard
reference as the guard character reference. Convert the scene into a photorealistic
live-action cinematic image. Composition 100% exactly matches the provided sketch.
Camera position 100% unchanged.
粗略的草图加上锁定的角色,最终输出的镜头看起来就像拍摄的一样。

5. 通过编辑优化,而非重新生成
这部影片中几乎没有任何内容来自空白文本提示词。在我的图像生成中,371 次是对现有画面的编辑,只有 21 次是文本生成图像。当画面稍有偏差时,比如下巴过重、阴影奇怪或细节错误,我会编辑该画面而不是从头开始。一致性来自于在锁定的基础上进行编辑,而非完美的措辞。
6. 制作动画,让角色开口说话
静态画面锁定后,我使用 Kling 将选定的画面制作成视频动画。有些镜头是简单的运动;其他镜头是对话,角色直接对着镜头说话。这些提示词对表演有具体要求:
Handheld camera, extreme close-up of his face. His eyes stay locked on the camera,
no drift. He says, "Still, here." Then a brief pause, still staring, with visible
strain, as if forcing the words out.
静态画面保持了身份特征;视频则加入了呼吸和声音。
7. 一切发生的画布
以上每个步骤都在同一个工作区中完成。这是实际项目的缩小视图:左侧是草图行,向右侧的照片级真实行输入,底部是角色表,中间是迭代阶梯。424 张图像和 38 个视频镜头,全部可追溯到其参考。

放大任何位置,你都会看到相同的模式重复:一个构图,多个镜次,一个最终保留。这就是两位主角在迭代过程中的样子,穿锁子甲的守卫和穿束腰外衣的守护者,每个镜次中都是相同的面孔,因为每个镜次都指向相同的参考表。

8. 背后的数据
为了了解规模,以下是完成项目所包含的内容:
| 来自 Ulysses 画布 | 数值 |
|---|---|
| 生成的图像 / 失败次数 | 424 / 20 |
| 参考图像链接 | 653(占所有连接的 92%) |
| 图像编辑 vs 文本生成图像 | 371 vs 21(95% 为图像到图像) |
| 单个参考表重复使用 | 79 个镜头 |
| 制作时间 | 约 8 天,一人完成 |
9. 开始之前我想告诉你的
- 首先制作参考表。这是整个流程的核心。没有参考表的角色会失去一致性。
- 绘制镜头草图。一幅构图正确的粗糙草图胜过一段华丽的文字描述。
- 编辑,而非重新生成。锁定基础图像,尽可能少做改动。
- 预期会有失败。有 20 个镜头完全失败,还有更多需要修复。这很正常;整个流程能够消化这些问题。
制作你自己的作品
从一张图像开始,逐镜构建影片。最重要的步骤是参考表,我们的AI 角色一致性指南正是对此的深入探讨。
常见问题
制作这样一部 AI 影片需要多长时间?
Ulysses 在大约 8 天内运行了 432 个生成任务,一个人,没有团队。大部分时间用于在镜次之间做选择,而不是等待渲染。
这部影片实际使用了哪些 AI 模型?
静态图像和编辑使用 Nano Banana(392 次图像生成中有 371 次是对现有帧的编辑),动态使用 Kling:最终画布包含 37 个 Kling 视频镜头,包括口语对白镜次。
角色如何在 400 个镜头中保持一致?
参考表,连接到所有内容:项目包含 653 个参考图像连线,占所有连线的 92%,仅主角的参考表就用于 79 个镜头。没有镜头是仅从文字生成的。
角色真的能说话吗?
是的。对白镜头从锁定的静态图像开始制作动画,使用指定台词、停顿和眼神的表演提示词。静态图像保持身份;视频处理添加呼吸和声音。