如何在 2026 年打造一致性 AI 角色:完整指南

Jack McCain

Jun 2026

图像到图像的角色一致性是指在新场景、新角度下生成同一角色的新图像,同时保留其精确的视觉身份。你无需每次都用文字重新描述角色,只需给模型一张参考图像,它就能在每个镜头中匹配面部、发型和服装。

如果你曾经创建过一个角色,却眼看着它在不同场景、镜头角度和细节的新镜头中逐渐"跑偏",那么你已经体验过角色漂移。这是AI 影视制作中最普遍的挑战之一。本指南将精确解释角色漂移发生的原因,以及可用来解决它的确切方法,帮助你在 Flick、Midjourney、Veo 3、Sora 和 ComfyUI 中保持角色一致性。

2026 年如何创建一致的 AI 角色一览

对于想快速了解概况的人来说,这里是简短答案

用 AI 创建一致角色最可靠的方法,是先在单张参考图像中锁定角色的身份,然后在每个新镜头中重复使用该参考图像。这种方法比从头重新提示更一致、更精确、更可靠,这也是为什么它已成为 2026 年的默认工作流程。

在 Flick 中,这就是Character Reference工具,只需三个步骤:

  1. 生成或上传一张角色图像——干净、光线充足、正面朝向的肖像效果最佳
  2. 选择该图像,然后点击 Character Reference
  3. 自由地为你的新场景撰写提示词("走在夜晚霓虹闪烁的市场中,电影感"),你的参考图像会让角色保持稳定。

对几乎所有创作者来说,这都是杠杆效应最强的技巧,因为它不需要训练、不需要代码、不需要 GPU——只需一张好的参考图像。观看我们的教程:Nano Banana Pro 角色一致性教程

立即开始,打造你的角色。

角色漂移为何会发生

要解决角色漂移问题,首先要理解它产生的原因。当你生成一张图像时,模型会从随机噪点开始,在你的提示词引导下逐步去除噪点,直到呈现出一张清晰的图像。这个过程被称为扩散。

当你在提示词中描述一个角色时,实际上并没有指向某个具体的人物。“一位三十多岁留胡须的男性”这样的描述可以匹配模型在训练中见过的数百万张图像。你的提示词落在所有这些可能性构成的空间中的某一处。输出结果是从整个图像空间中抽取的一个泛化结果——是众多符合你描述的不同面孔的平均值。

因此,即使你反复使用完全相同的提示词描述同一个角色,模型每次都会从一片新的随机噪点开始,最终落在该空间中略有不同的位置上。这导致即便提示词保持不变,输出结果每次也会略有差异。而对提示词的细微改动——比如新增角度、新角色或不同背景——会加剧这种效应。一次又一次的拍摄叠加起来,最终你最初设定的角色会逐渐漂移成另一个人。

这正是 Flick 的 Character Reference 功能所要解决的问题。Character Reference 工具不再将角色存储在提示词中,而是将你的主角保存为一张参考图像。这样一来,无论你如何调整场景的其他部分,每一次新的生成都能还原出你最初设定的角色。

你所定义的角色代表着模型在训练中接触过的众多图像的一个泛化版本。每一次图像生成都是全新的一次生成,都从随机噪点开始。模型逐步去除这些噪点(扩散),直到呈现出与你描述的提示词相匹配的图像。你所定义的角色代表着模型在训练中接触过的众多图像的一个泛化版本。每一次生成都从随机噪点出发,在这个范围内产生略有不同的面孔。因此,经过多次生成后,尤其是当你在提示词中添加更多内容时,你最初设定的角色形象会逐渐漂移成完全不同的样子。

用 Flick 打造一致的角色形象

Image

The Herder,仅以单一角色参考锁定。观看完整影片

首先,创建一个角色 —— The Herder:不是英雄,也不是巫师——只是一名工匠,他的手艺在奏效的那一刻便悄然隐身。他是来自“近代欧洲”(大约 1800 年代到 20 世纪初)的一名手艺人。为了让他从正面到背面(乃至每个镜头之间)都保持一致,可以使用 Flick 的 Character Reference 工具。

从单张参考图开始。基于这张初始图像,绘制多张转身参考图——正面/侧面/背面——涵盖不同状态:戴帽子、不戴帽子、撑伞、双手空着、湿外套、装备变化等。

Image
Image

然后使用 Flick 的 Character Reference 工具将这些转身参考图组合起来,让角色的正面/侧面/背面轮廓在各个镜头之间保持稳定。

5 种 AI 角色一致性方法对比

并没有一种绝对“正确”的工具或模型,但针对你的技能水平和所需的控制程度,总有一种最合适的方法。以下总结了 5 种最佳图生图角色一致性方法,以及它们各自最适合哪类用户:

方法工作原理最适合投入程度一致性
Character Reference(图生图)上传一张参考图片,模型会在新场景中匹配该形象几乎适用于所有人——获得一致角色的最快途径
角色 / 转身图(turnaround sheet)生成正面、侧面、背面和四分之三视角图,用作多角度参考为图像视频工具提供足够的角度和动作上下文低至中
提示词在多次生成中重复使用同一 seed 和完全一致的角色描述快速生成单一形象的变体
LoRA 训练用 15–50 张角色图片训练一个小型自定义模型数百个镜头且几乎零漂移非常高
换脸(最终清理)自由生成,然后将角色的脸替换到每一帧中事后修复漂移问题高(仅限脸部)

如何在各大主流工具中保持角色一致性

精确保留的细腻面部细节,出自《Honey, I'm Home》。观看完整影片。了解幕后工作流程。
精确保留的细腻面部细节,出自《Honey, I'm Home》。观看完整影片。了解幕后工作流程

Midjourney 通过 Omni Reference 来处理一致性(即 —oref 参数,配合 omni-weight —ow 来控制对参考图的贴合程度)。使用适中的权重以保持平衡(默认值为 100),当你需要调整角色某些方面时可适当降低权重。它能生成极其精美的效果,拥有令人惊艳的风格,但可能会柔化雀斑或纹身等精细细节。

Google 的 Veo 3(以及 Veo 3.1)通过其“Ingredients to Video”参考系统来保持角色一致性。向其输入参考图片以锁定角色身份,并确保在每个提示词中使用完全相同的角色描述。Veo 还能原生生成同步音频和唇形同步,让你的角色开口说话。

Sora 围绕录制的参考片段(最初称为“Cameos”,后来改称“Characters”)构建角色一致性,从而在多次生成中创建可复用的形象,并配有原生音频。OpenAI 已于 2026 年停用 Sora,但你可以使用 OpenAI 的图生图模型 GPT Image 2,在 Flick 中生成带有你的角色的场景。

如果追求绝对的掌控力,ComfyUI 可以让你将 PuLIDInstantIDIP-Adaptor 等工具与自定义训练的角色 LoRA 结合使用,再加上姿态控制和面部细化节点。这是最具挑战性也最技术化的路线,但如果你追求零漂移的无限本地生成,这将是理想之选。

端到端工作流:从角色设计到最终成片

要超越静态图像、将角色真正融入你的完整影片,以下是 2026 年最优秀的创作者们所采用的工作流程:

  1. 设计你的主角。 生成一张你满意的强有力肖像。
  2. 构建参考图集。创建一个转身图(正面、侧面、背面、四分之三侧面)。创建不同服装、道具和表情的参考图。
  3. 在 Flick 中设置 Character Reference,并生成场景中的每一个镜头,在每条提示词中着重定义角色所处的场景与动作。
  4. 从静帧生成动画。 将每张定稿图像输入图生视频模型,生成角色的动态场景。
  5. 剪辑与调色。在视频编辑器中拼接你的场景,制作出最终成片。

实用法则:先在静态图像中锁定角色身份,然后再进行动画化。

如何在 Flick 中实现更精准的角色一致性

Image

我们的内部影视制作团队花费了无数时间,试验了各种变通方法,力求在 Flick 中实现 img2img 角色一致性的最佳效果。在此过程中,我们发现了一些进阶技巧,能帮助你生成更精准的镜头,同时保持角色的一致性。

强大的角色一致性工作流中,最关键的环节之一就是提示词撰写。我们提供了一份完整的提示词清单,供你在 img2img 角色一致性场景中使用。下面,我将分享一些可用于不同工作流的最佳角色一致性提示词。

对于第一种方法,让我们从单张角色参考图开始,将其转化为一张转身图,具体如下:

Image
Image

从这一步开始,我们的目标是生成角色的第一个镜头。在这个案例中,我们来创建一个角色乘坐豪华马车、望向窗外北欧雪原的镜头。

这里的技巧在于:与其一次性生成图像和角色(精准度较低),不如先生成一张轻量的模板草图,将角色描述嵌入到文字提示中。这里要注意不要加入太多细节,因为这只是为最终画面提供一个简单的构图示意图。我们可以用以下提示词来生成这张图像:

创建一幅轻淡、粗略的铅笔轮廓草图。目标是一幅粗略的示意图,不要过多细节。场景设定在一辆豪华马车内部。马车内部整体非常昏暗,只有微弱的环境光。唯一清晰的光源来自窗外。马车的窗户是完全敞开的窗洞,没有玻璃。厚重的窗帘环绕着窗户。马车内部包含雕花木质装饰结构和一个带软垫的座椅靠背。窗台上覆着一层薄雪,少量雪花轻轻飘入马车内。窗外是一片北欧雪原。室外弥漫着浓密的晨雾。白色雾气非常浓厚,只能隐约看到被雪覆盖的开阔平原、低矮的雪山丘陵,以及极远处的山脉轮廓。角色是一位二十出头的年轻欧洲女性。她的脸型略窄,呈柔和的椭圆形,额头光滑,颧骨分明,下颌线条清晰,下巴微微收拢。她的眉毛颜色深、轮廓清晰,形状大多平直。她的眼睛是狭长的杏眼,上眼睑轮廓分明,目光坚定直视。虹膜和瞳孔呈明亮的琥珀金色,眼睛带有真实的湿润反光。她的鼻梁挺直纤细,鼻尖小巧精致。她的嘴唇轮廓清晰,上唇相对较薄,下唇略丰满。她的表情平静而严肃。她的皮肤苍白,略带冷色调,保留着淡淡的雀斑、真实的肌肤质感、可见的毛孔、轻微的眼下细节、细微的不对称、真实的嘴唇质感,以及自然的皮肤细微变化。她将下巴搁在手上,静静沉思,凝望着一望无际的北欧雪原空旷景象。

使用 GPT Image 2 生成,以下是我们的结果:

Image

由于我们对这张草图感到满意,接下来可以继续生成最终镜头。我们可以使用像 Nano Banana Pro 这样的图像模型来生成最终画面,传入角色参考图像和构图草图,让模型准确理解我们想要的角色构图效果。

我们的提示词首先指示模型将所提供的草图作为构图参考,让角色与我们的参考图像 100% 精准匹配,并将草图转化为一张实景摄影照片。完整提示词如下:

使用提供的草图作为唯一的构图参考。使用提供的侧脸参考作为唯一的面部和发型参考。使用提供的全身参考作为唯一的服装参考。

创作一张塞拉娜(Serana)的真人特写照片。角色动作、整体构图和马车内部结构100%完全匹配提供的草图。角色身份、侧脸轮廓、面部特征、肤色、琥珀金色眼睛和发型100%匹配提供的侧脸参考。服装设计、色彩和整体角色造型100%匹配提供的全身参考。

将图像转化为真人实拍照片。场景设定在一辆豪华马车内部。马车内部整体非常暗淡,只有微弱的环境光。唯一清晰的光源来自窗外。马车车窗是完全敞开的窗口,没有玻璃。厚重的窗帘围绕着窗户。马车内部包括雕刻的木质装饰结构和带垫的座椅靠背。窗台上覆有一层薄雪,还有少量雪花轻轻飘入马车内。

窗外是一片北欧雪原。外部弥漫着浓厚的晨雾。白色雾气非常浓密,只能看到隐约的雪覆盖开阔平原、低矮雪丘和极远处的山脉轮廓。少量柔和的晨光穿过雾气,落在塞拉娜的脸部和发梢边缘。明亮区域带有柔和的光晕效果,尤其是在窗外雾气高光处、窗光沿线以及她脸上的晨光处。

焦点集中在塞拉娜的脸部。她的眼睛、睫毛、皮肤纹理和面部轮廓是画面中最清晰的部分,但仍带有轻微的真实相机自然柔化和些微对焦不完美,而非完全精准锐利。外部景色极度失焦,只呈现为非常柔和的模糊层次。马车内部其余部分同样柔和失焦,但保持基本结构可辨识。

保留真实的皮肤纹理、可见毛孔、细微雀斑、真实的发丝质感、真实的织物质感、真实的木质纹理、细微的胶片颗粒感、轻微的传感器噪点、轻微的镜头柔化、极细微的色差,以及自然不完美的真实相机呈现效果。

使用Nano Banana Pro生成,以下是我们的结果:

Image
Image

在生成最终画面之前先从构图草图开始,只需要多生成一张图片,但它能让你对最终镜头的构图拥有更出色的创作把控力。接着,将构图草图和角色图像作为参考进行第二次生成,就能让最终镜头完美遵循我们想要的构图,同时完美保持角色一致性。

从角色静态图到视频

角色被稳固地融入全新场景,出自《Forever Yours》。观看完整影片。了解幕后工作流程。
角色被稳固地融入全新场景,出自《Forever Yours》。观看完整影片。了解幕后工作流程

到目前为止,本指南已经为你提供了创作出角色一致性极高、精准无比的镜头静态图所需的理解。下一步是用这些镜头生成视频,同时避免角色漂移。这是AI影视创作中一项独特的挑战,因为你的角色不仅需要在单张图像生成中保持一致,还要在生成视频的逐帧之间保持一致。此外,每一个新镜头都是角色发生漂移的机会。我们的制片人发现,从图像转向视频时,以下几个方面最常出现问题:

  • 逐帧漂移。尤其是在你为角色制作新姿势动画时,角色漂移就会出现。举例来说,当角色的头部转离摄像机再转回来时,角色的脸部可能会在镜头中途发生变形。
  • 侧面和背面视角。大多数参考系统都是基于正面人脸训练的。当你的角色转向四分之三侧面或完全侧面时,这种参考可能会失效。这就是为什么使用展示角色多个角度(正面、侧面、背面、四分之三侧面)的转身参考图至关重要。
  • 输出与道具漂移。图生视频模型在生成视频的过程中往往最专注于保持角色的脸部一致。因此,服装和配饰在生成过程中获得的关注较少。这就是为什么在参考静帧中锁定服装造型、并在提供给图生视频模型的提示词中加以强调至关重要。
  • 时长限制与镜头衔接。大多数图生视频模型将单个片段的时长限制在5-15秒。这意味着要生成更长的镜头,需要先生成一个片段,再用 Flick 的“提取帧”工具提取其最后一帧,然后将该帧作为下一个片段的起始帧。每次衔接进入新的图生视频生成,都是角色再次发生漂移的机会。

视频生成中你会真正用到的参考模式

  • 参考生成视频 —— 通过 Flick 与 Kling Omni Reference 和 Seedance Reference to Video 等强大模型的顶尖集成,提供一张或多张角色图像。
  • 首帧/尾帧 —— 在图生视频生成中提供第一帧(以及可选的最后一帧)。结合我们上文介绍的构图草图方法,使用精确渲染出你角色和期望构图的首帧与尾帧,能获得最佳效果。
  • 角色 LoRA —— 为了在整部影片中最大限度地减少漂移,可以使用大量(50张以上)角色参考图训练一个 LoRA。我们发现像 Wan 2.2 这样的模型最适合此方法。在生成时应用这个 LoRA,可以在保持角色一致性的同时产出出色的视频效果。

具备角色一致性的 Flick 视频工作流

这正是围绕 Flick 原生 Character Reference 功能构建的角色参考工作流发挥价值的地方。因为你已经在一张镜头静帧中锁定了角色形象,并制作了转身参考图,所以你为视频模型提供的正是关于最终生成结果中角色外观的最佳参考信息。以下是我们内部电影制作团队发现的两种最佳方法:

使用 Omni Reference 实现角色一致性

动态中保持一致的主角形象,出自《Echoes of the Sun》。观看完整影片。了解幕后工作流程。
动态中保持一致的主角形象,出自《Echoes of the Sun》。观看完整影片。了解幕后工作流程

使用这种方法时,你需要先从一张展现所需场景设定的图像入手。举例来说,我们来生成一个雪山环境,采用我们期望的清爽蓝色调,并指定构图、配色方案,以及能实现更高精度的摄像机角度。以下是我们使用的提示词:

广袤雪覆高山山坡的电影级广角摄影,画面中一片平滑洁净的雪坡呈对角线贯穿全幅,大面积留白,未经踏足的粉雪,雪面上细腻的风蚀纹理,远处岩石山脊从冰川中显现,极简主义的风景构图,柔和的冬日阳光,淡蓝色的氛围调色,寒冷的山间空气,宁静的荒野,画面中无人物、无树木、无建筑。

取景于高山观景点,强调尺度感与空旷感。雪与阴影塑造出干净的几何形状,柔和的色调过渡,冰封地形向画面之外无尽延展。

超写实摄影,中长焦压缩效果,国家地理探险摄影风格,高动态范围,雪面纹理细节清晰,若隐若现的大气薄雾,自然光线,高品质户外电影摄影,冰岛冰川美学,斯堪的纳维亚极简主义,令人屏息的孤寂与静谧感。

构图:强烈的对角引导线,非对称取景,画面80%由雪与天空色调构成,极致留白,极简艺术风格风景摄影。

色彩基调:冰蓝色、冰川白、柔灰岩石色、低饱和冬日色调。

相机:Sony A1,135mm镜头,f/8光圈,ISO 100,偏振镜,电影级调色。

使用 Nano Banana Pro 生成,这是我们的结果:

Image
Image

接下来,我们可以使用 Flick 的旗舰级 Omni Reference 模型之一,将我们的角色动画化并融入场景中。Kling 和 Seedance 都能提供出色的效果以及精准的角色控制。要使用 Omni Reference,我们可以将鼠标悬停在生成的场景图片上,选择视频,然后选择 Seedance 2.0。

Image

使用 Seedance 2.0 实现角色一致性

角色在整场戏中保持一致,出自《WITCH》。观看完整影片。了解幕后工作流程。
角色在整场戏中保持一致,出自《WITCH》。观看完整影片。了解幕后工作流程

接下来,我们可以提供场景图片和角色参考图片作为输入。由于我们计划让角色以全身姿态在场景中行走,因此最好提供角色的全身参考图片。要添加对白,我们可以选择附加音频作为参考,并指示模型让角色说出该对白。

在这个示例中,让我们生成一段角色在场景中行走并说出台词“啊!在这里呼吸真是太舒服了。”的视频。我们还可以指定手持摄影机风格,以获得我们想要的精确视频效果。

Flick 先进的提及系统让你可以在提示词中引用特定的输入内容,从而精确指导模型在最终生成中如何使用每一项输入。例如,我们可以告诉模型将第一张图片用作起始帧,然后使用三张角色参考图来塑造角色的外观。我们指定角色的动作,再让模型使角色说出附带的对白。以下是我们的最终提示词:

以 @Image1 作为起始帧。参考 @Image2 、@Image3 和 @Image4 中 Serana 的外观。手持镜头风格,Serana 从画面左下角走入镜头,边走边伸展身体,并说出 @Audio1 。
Image
Image

这条提示词简短而简单——这正是重点所在。我们希望模型依赖的大部分信息都来自我们的参考图像。我们可以借助 Seedance 2.0 的能力与 Flick 的提及系统来精确指定具体方式,从而生成精准的最终视频,同时完美保持角色一致性。以下是我们的最终成果:

同一角色,全新镜头:Seedance 2.0 配合锁定参考。

使用 Kling O3 Pro Omni Reference 实现角色一致性

来自我们博客的文章《In the AI Era, Story Is Everything》,由联合创始人 Zoey Zhang 撰写。阅读完整博客。
来自我们博客的文章《In the AI Era, Story Is Everything》,由联合创始人 Zoey Zhang 撰写。阅读完整博客

使用 Kling O3 Pro 实现角色一致性视频,与使用 Seedance 2.0 时的许多步骤相同。首先准备一张场景图片和你的角色参考图片。接下来,我们可以将鼠标悬停在场景参考图片上,进入 Omni Reference。Flick 的提及系统同样适用于 Kling Omni Reference,让你最多可以提供 12 张图片参考,供模型在最终生成时使用。

要在 Kling O3 Pro Omni Reference 中结合角色参考使用,请选择模型选择器并传入你想要的起始帧。在这个示例中,我们将使用场景参考图片作为起始帧。接着,你可以使用 Flick 的提及系统创建一个 Element。Element 让你可以在一次提及中存储多张参考图片。将场景图片设为起始帧后,我们可以创建一个 Element 来代表我们的角色。默认情况下,这个 element 会被命名为“Element1”。我们可以将三张全身角色参考图片附加到这一个 element 上,并在提示词中引用它。

在提示词中,我们指示模型参考“Element1”中角色的外貌,并指定手持相机的拍摄风格。我们定义了她的动作——她“张开双臂走进画面,仿佛在感受风”,最后告诉模型不要生成背景音乐。以下是我们最终的提示词:

从 @Element1 参考 Serana 的外貌。手持相机风格。Serana 张开双臂走进画面,仿佛在感受风。没有背景音乐。

同样地,我们可以让提示词保持简洁,因为我们提供给模型的大部分信息都来自起始帧(代表镜头的场景)和 Element(通过我们提供的三张参考图片代表角色)。在输入场景图片作为起始帧、定义 Element1 代表角色,并写好提示词后,我们就可以开始生成了:

Image
Image
Image

这是生成结果。它精准保持了角色一致性,完全按照起始帧中指定的场景生成,并精确遵循了手持相机风格的指令:

Kling O3 Pro Omni Reference 稳定保持了角色、场景和手持运镜风格。

在 Flick 中以更高精度实现角色一致性视频:换脸方法

对于这种方法,我们的内部制片人建议分两次生成视频,而不是将场景、角色设计和提示词一次性放入单个生成中。

在我们生成的第一个视频中,我们不包含任何角色参考。相反,我们提供一张我们希望镜头发生所在的场景图片,然后用提示词详细描述我们想看到的动作。生成这个视频后,我们使用 Flick 的提取帧工具提取最后一帧。我们将这张图片传入 Nano Banana Pro,并以角色参考图片为参考重新生成它。这样就得到了一张包含我们精确角色的最终帧。

在我们生成的第二个视频中,我们将新生成的、带有角色的结束帧和最初生成的视频一起传入 Kling O3。这样就生成了一个最终视频,精确复现了最初的生成视频,但角色变成了我们指定的角色。第一次生成让我们能够精确控制场景以及其中发生的动作,而第二次生成让我们能够替换进我们的角色,从而保持角色一致性。

具体操作方法如下:

对于这种方法,我们从一张单一的角色参考图片开始,将其转换为一张转身参考图(turnaround sheet),并排展示角色的三个全身视角。以下是我们使用的提示词:

使用提供的图片作为精确的角色参考。为同一位中国古代男性角色制作一张手工定格动画木偶风格的角色设计转面图,带有细腻的黏土质感与戏服玩偶质感。并排展示三个全身视图:正面视图、纯侧面视图和四分之三侧面视图。完全保留参考图中的服装设计,包括高高的黑色帽子、浅灰色外袍、白色内袍、袍子的长度、袖子形状、领口结构、腰带、悬挂饰物、黑色靴子、长柄兵器以及圆柱形容器。保持服装轮廓、层次、比例、剪裁、配饰位置以及整体服装结构不变。不要重新设计或简化服装。唯一的转变是视觉媒介:手工制作的木偶角色、定格动画影片美学、略带纹理的布料、略经雕琢的面部、细腻的类黏土表面处理、手工制作的服装细节、逼真的微缩戏服构造、影棚级转面展示。中性纯色背景、柔和均匀的光线、全身可见、干净的排版、高辨识度的服装设计图、精良的制作角色设定图、中国民间奇幻定格动画美学,细节丰富但克制,光泽度低,数字感弱,触感质朴的手工质感。

结果如下:

Image

我们还会为场景生成一张所需环境的图像。这可以通过两种方式实现。首先,我们可以在 Nano Banana Pro 或 GPT Image 2 等文生图模型中输入一段清晰明确的提示词,生成我们想要的场景示意图。

为了获得更高的精确度,我们可以采用第二种方法。与其用文生图模型生成,不如在 Microsoft Paint 之类的工具中手绘出我们想要的场景分镜。然后,我们可以让 Nano Banana Pro 在最终生成时参考我们的草图。以本例为例,我们来画一个冰封湖面上的雪地码头,前景中飘着一面褪色的红旗。这是我们的草图:

Image

接下来,我们可以将草图连同一段描述性提示词一起传给 Nano Banana Pro,详细说明我们想要的真实细节,并以草图作为参考。以下是我们的提示词:

将这张手绘分镜草图作为严格的布局与构图参考。100% 保留当前的构图、镜头角度、取景、主体位置以及大形设计。中国民间定格动画木偶微缩布景,一根光秃秃的湖边树枝斜插在雪地中,上面系着一块褪色的暗红色布条,其后是一个覆雪的小木质码头,右侧岸边点缀着被雪压弯的成簇冬季芦苇与香蒲,触感真实的手工积雪、手工搭建的码头、自然的树枝纹理、带有细微编织感的布料、冷调蓝灰色冬季配色、哑光手工质感的成品效果,诗意而克制的氛围。湖面呈现为影棚微缩冰面,柔和不透明的蓝灰色冰层,带有细微的石膏状凹凸不平质感,哑光树脂般的质地,浅浅的霜层,若隐若现的乳白色斑块,细腻的冰纹肌理,柔和的手工表面变化,反光极少。

结果如下:

Image

与依赖在提示词中描述角色的文生视频不同,Flick 提供了一种更好的方法。使用你生成的分镜静帧图——每一张都具有你想要的精确构图与角色设计——作为图生视频模型的参考图。这样可以锚定第一帧,并让模型在后续画面中保持角色的一致性。

接下来,我们可以用 Kling O3 Pro 或其他图生视频模型生成第一段视频。我们可以将场景图作为起始帧传入,并指定角色的动作。由于此处我们没有提供角色图像作为参考,角色描述可以保持简短。在本例中,我只需要求一个“定格动画木偶渔夫”。我们指定他的动作:走过雪地、上到码头,并在码头尽头停下。我们定义想要的角色动作,并引导模型让降雪变得越来越大,风雪飘散整个画面。以下是我们的最终提示词:

一个身穿蓑衣、头戴斗笠的定格动画木偶渔夫走过雪地登上码头,因寒冷而微微弓着身子,一只手扶稳身体,另一只手将外衣裹紧。手工微缩摄像机缓缓向前推进,并略微向上仰起。降雪变得越来越猛烈,最终形成一场浓密的冬季暴风雪,雪花在画面中飘舞,逐渐遮蔽了冰封的湖面。最后,渔夫走到码头尽头,停下脚步,面朝冰面静立片刻。

以我们的场景图作为参考,生成了精准而优美的结果:

这就是换脸方法优势的用武之地。当我们对第一个视频生成结果感到满意后,可以使用 Flick 的抽帧工具提取该视频的最后一帧。借助我们之前生成的角色多视图设定图,我们可以将两张图片一起传入 Nano Banana Pro,并指示模型将最后一帧中的角色替换为我们的角色参考,同时保持初始生成结果的光线、构图、镜头角度和场景设置不变。以下是我们的提示词:

以雪地码头场景作为主要构图参考,并使用提供的定格动画木偶角色设定图作为角色参考。将站在码头尽头的渔夫替换为这个确切的角色。匹配角色设定图中的背影轮廓、帽子形状、长袍长度、浅灰色外袍、白色内袍、黑色靴子、腰带、悬挂的配饰、长杆状物件、圆柱形容器以及整体身体比例。让角色保持背对镜头,站在码头远端,与当前图片相同的背对姿态。保留现有的镜头角度、构图、码头、冰封的湖面、前景中挂着褪色红布的树枝、积雪覆盖的湖岸,以及被雪压弯的芦苇。保持中国民间定格动画木偶的微缩风格、手工材质、有质感的积雪、哑光冰面、微妙的木偶比例,以及安静的冬日氛围。新角色应自然融入同一个微缩场景中,保持相同的比例、相同的背对姿势逻辑,以及相同的克制电影氛围。

结合我们的两个输入——多视图设定图和提取的最后一帧,我们使用 Nano Banana Pro 生成新的最后一帧:

Image

Image

这是我们的结果:

Image

这个方法之所以如此强大,是因为我们可以精确掌控场景构图的呈现方式。与其在一次生成中同时指示模型使用场景图片、角色参考和提示词来生成最终视频,我们将其拆分为两个步骤。第一步,我们先创建场景,暂时不太关注角色本身。然后,我们使用所需的角色生成新的最后一帧,再进行第二步来生成最终视频。

以我们之前创建的场景图片作为起始帧,以包含角色参考的全新精修尾帧作为结束帧,我们生成最终输出结果。除了嵌入在尾帧中的角色参考外,我们还使用提示词来提醒模型我们角色的描述、他的动作、场景设置,以及我们期望的镜头运动和背景音效。以下是我们的提示词:

一位中国定格动画木偶风格的士大夫,头戴高高的黑帽,浅灰色外袍罩在白色内袍之上,脚穿黑靴,腰间挂着箭袋和横刀,迈着克制而沉稳的步伐缓缓踏雪走上码头。手工制作的微缩摄影机缓慢向前推进,并略微向上倾斜。轻雪在画面中飘散。冰封的湖面依旧安静如常。最后,这位士大夫走到码头尽头,停下脚步,静静地面向冰面伫立。氛围非常安静,只有雪地和木板上传来的轻柔脚步声。

这是我们的最终结果:

换脸方法的结果:与场景镜头完全一致的构图,替换为锁定的角色。

这种方法更为进阶,能够在保持角色形象绝对一致的同时,对场景构图实现极其精确的控制。虽然它需要你使用 Kling 或其他模型运行两次独立的视频生成,成本更高,但它能帮你省下积分,避免因单次生成不精确、结果不满意而造成的浪费。

常见问题

哪个 AI 工具最适合保持角色一致性?

没有所谓的单一最佳工具——只有最佳方法。对大多数人来说,像 Flick 这样的 img2img 角色参考工作流是无需任何训练、最快速可靠地保持角色一致性的方式。而对于近乎零漂移的大批量生产,在 ComfyUI 中自定义训练的 LoRA 才是黄金标准。

img2img 角色一致性是什么意思?

图生图(img2img)角色一致性是指为你的主角生成新的图片——处于新的场景中、增添新的细节、采用全新的角度——同时保持你所定义角色的确切视觉身份不变。

如何在 Flick 中实现角色一致性?

你只需提供角色的参考图像。借助 Character Reference 工具,AI 会生成保留主角视觉身份的新图像。你不必再用文字描述角色,然后寄望模型两次都能生成相同的结果,而是直接把参考图交给它,告诉它:“就是这个角色,现在放到新场景里。”

如何在 Midjourney 中制作一致的角色?

使用 Omni Reference(--oref)配合你角色的参考图像,并调整 omni-weight(--ow),让模型在保持身份一致的同时,依然遵循你的场景提示词。

在 AI 视频中可以保持角色一致吗?

可以。先在一张静态图像中锁定角色,然后用视频工具的参考功能来为该图像制作动画——例如 Veo 3 的 "Ingredients"、Runway 的 References,或 Kling 的 "Elements"。从一张已锁定的静态图出发制作动画,效果远比文字生成视频更一致。

要获得一致的角色,需要训练模型吗?

不需要。训练 LoRA 能带来最紧密的锁定效果,但对大多数项目来说,配合 Character Reference 功能的一张优质参考图像就足够了。只有当你要生成数百个镜头、手动修复漂移成本过高时,才需要训练模型。

为什么我的 AI 角色一直在变化?

因为每次生成都是从零开始的,不会记住上一次的结果,微小的差异不断累积就会形成漂移。解决办法是给模型一个固定的参考对象去匹配,而不是每次都用文字重新描述角色。

如何在 Flick 中开始使用?

观看我们的教程:Flick 101:新手入门。 创建你的第一个项目,完成入门引导,开启你的 AI 影视创作之旅!



探索相关教程:

https://flick.art/docs/visual-styles

https://flick.art/docs/voice-consistency

了解更多关于 The Herder 的内容:

https://flick.art/blog/behind-the-herder

为什么打造出色的角色如此重要:

https://flick.art/blog/in-the-ai-era-story-is-everything