在三个镜头中保持角色一致性
角色应该在角度、光照和动作变化中保持可识别性。仅有一张令人信服的图像是不够的。
为一个角色创建远景、中景和特写镜头。决定要保留什么,然后学会识别和纠正不必要的变化。
从可识别的身份开始
选择几个对角色重要的可见特征:独特的发型、面部轮廓、特定的外套或可识别的配饰。
编写简短的身份描述。将其与镜头描述分开,这样你可以改变构图而不会意外改写人物。
在本练习中,使用原创虚构角色。以下是一个可供测试的初始描述:
一位成年旅行者,留着深色短鲍勃发型,穿着芥末黄色雨衣,背着一个棕色小挎包。
雨衣和挎包可以帮助观众在远景镜头中识别这位旅行者。在特写镜头中,面部和头发承担了更多的识别工作。仅靠重复的服装无法建立面部的一致性。

选择有用的参考
使用能够清晰看到你想要保留的特征的图像。重阴影、遮挡物或非常小的面部会增加判断身份的难度。
在 Flick 中,使用所选模型支持的参考工作流。不同模型的参考类型和行为有所不同,因此在生成之前请查阅相关产品指南。

具体步骤请参阅角色参考。
保持身份,追踪变化
一致性允许有意的变化:雨衣被淋湿、角色变老或物体移动。检查每个变化是否服务于故事,还是生成错误。
在添加更多镜头之前,制作一个简短的参考清单:
| 元素 | 必须保持可识别 | 本场景中的变化 | 有用的参考 |
|---|---|---|---|
| 旅行者 | 面部、深色短发、芥末黄色雨衣 | 表情和观看角度 | 清晰的面部和相关的较宽视角 |
| 雨伞 | 红色伞布、弯曲手柄、整体形状 | 位于长椅旁边或上面 | 故事所需的每个位置中的物体 |
| 挎包 | 棕色、背带和尺寸 | 旅行者转身时的悬挂方式 | 背带易于识别的视角 |
仅使用本场景所需的参考。你不必在开始之前构建每一个可能的姿势或服装。
在Seasons的驻留访谈中,创作者描述了准备同一角色不同年龄的形象以及反复出现的家居物品。这个经验是定义有意的变化,而不是将角色冻结在某个年龄或保持每个表面一尘不染。
为重要细节提供专门的参考
为重要细节提供专门的特写参考,例如手表、眼部细节或某件设备。在角色参考中查看支持的输入。
Mila & Sasa的创作者描述了准备手部、故事中重要的手表、设备和表情,然后在迭代过程中修正比例和位置。仅有令人信服的面部无法回答这些其他连续性问题。
清晰展示道具的各个状态。在 Xenogenesis 采访中,创作者描述了工具包内的扫描仪、空工具包以及取出的扫描仪。某些生成结果复制了扫描仪。清晰的参考有助于解释这些关系,但结果仍需检查。
规划三个不同视角
| 镜头 | 变化的内容 | 观众仍应识别的内容 |
|---|---|---|
| 远景 | 角色在车站内显得很小 | 外套、发型轮廓、包 |
| 中景 | 上半身和面部变得更清晰 | 面部、头发、服装、配饰 |
| 特写 | 注意力转移到表情 | 面部结构、头发、显著细节 |
保持身份描述稳定,并为每个视角编写单独的镜头描述。例如:
- 远景:旅行者雨后站在车站站台下。空旷的站台占据了画面的大部分。
- 中景:旅行者低头看向长椅旁的雨伞。
- 特写:旅行者停顿,表情若有所思,柔和的日光洒在脸上。
这些描述表达了一种意图。将生成的图像视为需要评估的候选项,而非保证匹配的结果。
同一影片中裁缝的三个视角,全部在 Flick 中根据上述表格生成:



动画制作前先进行对比
将三张图像并排放置。依次查看面部、头发、服装和配饰。
问问自己,陌生人是否能在不阅读提示词的情况下识别出同一个人。寻找悄然改变的细节,例如外套的长度或包的形状。
光线和姿势可以自然变化。判断某个差异是符合场景,还是会让这个人看起来像是另一个人。
每次改进一个问题
如果面部发生变化,请首先检查参考图像是否清晰显示面部,以及是否使用了预期的参考模式。如果服装发生变化,请检查是否存在矛盾的服装描述。如果整体外观发生变化,请检查每个镜头使用的模型和风格选择。
更改一个主要输入并再次比较。记录模型、设置、提示词、参考图像和尝试次数。一次成功的结果并不能保证该设置始终有效。
一旦静态图像呈现出一致的角色,也要测试视频片段。动态可能会引入在起始帧中看不到的新变化。
你的实践
将旅行者从车站移动到安静的咖啡馆。保留身份描述和预期的角色特征。先更改环境,然后在更改光照或服装之前评估结果。
目标是识别连续性问题并指定一个要测试的调整。
可选的下一步:更改一个预期状态,例如将雨伞移到长椅上,同时保留其可识别的形状。将结果与状态检查清单进行比较。解释哪些差异是有意为之,哪些仍需改进。如果反复尝试没有帮助,请使用在不丢失场景的情况下修复镜头来选择另一种方法。
检查你的序列
- 你能在每个镜头中识别出同一个人吗?
- 服装和配饰的变化是有意为之的吗?
- 光照和姿势是否符合场景?
- 这些镜头是否在保留身份的同时提供了不同的信息?
将其应用到用三个镜头讲述一个小故事中。