
QUOTE
角色资产锁住“是谁”,位置关系图锁住“在哪里”。
做 AI 视频时,我遇到过一种很隐蔽的穿帮。
单看每一帧,人物没有变,服装没有变,场景也都挺漂亮。可一剪到一起,问题就来了:上一镜还在人物左边的飞机模型墙,下一镜跑到了右边;圆形舷窗忽远忽近;人物明明在对话,正反打之后却像各自站进了不同的房间。
问题不一定出在人物一致性,而是我们只告诉了模型“画面里有什么”,却没有告诉它“这些东西彼此在哪里”。
这次我用自己制作的一组素材,演示一个很实用的方法:先建立人物和场景资产,再做一张位置关系图,用它锚定人物与人物、人物与场景之间的空间关系,最后才拆成具体镜头。

位置关系母图:女飞行员固定在左侧并朝右看,老人固定在右侧并朝左看
本文人物、场景、关系图与视频案例均为作者自制。
本文看点
01
锁定人物与空场景
02
关系母图固定空间
03
拆出全景与正反打
01
PROBLEM
为什么角色没变,空间还是会穿帮?
人物参考图通常只能回答一个问题:这个人是谁。
它能帮助模型稳定发型、五官、服装和体态,却不会自动记住女飞行员应该站在飞机模型墙前,老人应该坐在长桌右侧,也不会主动维护两人的视线方向和拍摄轴线。
我后来把这类穿帮拆成三层关系:
人物与人物
谁在左,谁在右,彼此距离多远,视线朝向哪里。
人物与场景
每个人靠近哪个地标,处于前景、中景还是后景。
场景与场景
舷窗、楼梯、长桌和陈设之间的相对位置是否稳定。
背景一致性并不是让每个镜头复制同一张背景,而是让不同景别都遵守同一组空间关系。
02
ASSETS
先锁什么,才能让模型知道这个房间没变?
我的第一步不是写分镜提示词,而是把人物和空场景分开制作。
人物资产要尽量包含正面、四分之三侧面和背面。它们不是为了展示好看,而是为了让人物在转身、过肩和反打时仍然保留同一套脸型、发型与服装结构。

人物资产:女飞行员的正面、四分之三侧面和背面

人物资产:老人角色的正面、四分之三侧面和背面
场景资产则尽量先做成一个没有人物的完整空镜。把未来会反复出现的地标交代清楚,比堆满装饰细节更重要。
在这个案例里,我选择了四个固定地标:左侧的飞机模型墙、中央的圆形舷窗、右侧的螺旋楼梯,以及横向贯穿画面的工作长桌。后续镜头不管远近,都要能从这些地标中找到空间依据。

空场景资产:飞机模型墙、圆形舷窗、螺旋楼梯与长桌构成稳定地标
人物资产锁身份,空场景资产锁环境。但两者仍然是分开的,模型还不知道人物进入这个房间后应该站在哪里。
到这里,人物和房间之间仍然没有坐标。
03
SPATIAL MAP
位置关系图到底要锁住哪些东西?
我把两个人物放回空场景,做了一张双人关系母图。也就是文章开头看到的那张画面。
这张图不是某个镜头的最终成片,而是后续所有镜头共同遵守的空间依据。它至少锁住五件事:
• 女飞行员在画面左侧,靠近飞机模型墙,站立,视线朝右。
• 老人在画面右侧,靠近工作长桌,坐着,视线朝左。
• 圆形舷窗位于两人之间的后方,承担冷色月光来源。
• 猫在前景左侧,收音机和灯具留在桌面右侧。
• 两人之间形成一条对话轴线,后续机位始终留在轴线同一侧。
「位置关系图不是最终成片,它是全片的空间宪法。」
关系图不用做得像最终画面,但一定要明确。人物左右位置、视线方向和固定地标必须一眼就能看懂。如果关系母图本身含糊,后续生成再精细,也只是在放大歧义。
04
PROMPT
怎么把一张关系图翻译成提示词?
把多张参考图交给生成工具时,不要只说“参考这些图片”。每张图承担的职责必须写清楚,尤其要把位置关系图放在空间控制的最高优先级。
我在这个案例里使用的提示词逻辑,可以抽象成下面这份模板:
以 @位置关系图 作为双人位置与构图参考:
A 位于画面左侧的 [场景地标] 前,
B 位于画面右侧的 [场景地标] 旁。
两人保持参考图中的站位与轴线关系:
A 看向画面右侧,B 看向画面左侧,全片不越轴。
场景环境与陈设参考 @场景资产;
A 的外观、发型和服装参考 @人物资产A;
B 的外观、发型和服装参考 @人物资产B。
切换景别时,只改变机位距离、焦点和景深,
不改变人物左右关系、视线方向与关键背景地标。
避免:交换人物左右位置、改变视线方向、
移动舷窗、飞机模型墙和长桌,新增主要道具,跨越轴线。

提示词截图:位置关系图负责构图和轴线,场景图负责环境,两张人物图分别负责角色外观
这段提示词里有一个很容易被忽略的顺序:
先声明位置关系图负责构图和轴线,再声明场景图负责环境,最后说明人物图只负责外观。这样能减少模型把某张人物参考图误当成构图参考,或者为了还原脸部而擅自改变人物站位。
“不越轴”也不能只写成一个术语。最好把它翻译成可见动作:女飞行员始终看向画面右侧,老人始终看向画面左侧。模型对具体画面关系的理解,通常比对抽象摄影术语更稳定。
05
SHOT DESIGN
三个镜头为什么没有跳轴?
关系母图确定以后,我才从它拆出三个镜头。拆镜头时只改变景别和焦点,不重新发明空间。
全景先交代空间
第一个镜头保留两个人物和主要地标。女飞行员仍在左侧,老人仍在右侧,圆形舷窗位于中央后方,长桌连接两人。

镜头一:全景先向观众交代人物站位、桌面方向和背景地标
老人过肩,前景仍然有方向
第二个镜头从女飞行员一侧拍老人。女飞行员的肩部留在左下前景,老人位于画面右侧,继续朝左看。即使背景被景深虚化,观众仍能知道摄影机站在空间的哪一边。

镜头二:女飞行员肩部位于左侧前景,老人位于右侧并朝左看
反打女飞行员,左右关系不交换
第三个镜头反打女飞行员。老人的肩部出现在右下前景,女飞行员仍位于画面左侧并朝右看。前景肩部、面部位置和视线方向共同维持了轴线。

镜头三:老人肩部位于右侧前景,女飞行员位于左侧并朝右看
这三个镜头看起来变化很大,但真正变化的只有景别、焦点和表演重点。人物左右关系、视线、长桌方向和背景地标都没有被重写,所以剪在一起仍然属于同一个空间。
把三个镜头接起来,15 秒成片里的空间关系可以从下面这组连续画面直接看出来。
视频|15 秒完整成片:女飞行员始终位于画面左侧,老人始终位于画面右侧,三次景别切换均未越轴
06
PITFALLS
哪些写法最容易让空间再次失控?
第一种,只上传人物参考图,不提供完整场景。模型可能记得脸和衣服,却会在每个镜头里重新布置房间。
第二种,每个镜头从头描述一次场景。提示词看似详细,但不同段落里的用词稍有变化,模型就可能把它们理解成三个不同空间。
第三种,只写“A 在左,B 在右”,却不绑定背景地标。人物可能没有换位,但墙面、门窗和桌子仍然会漂移。
第四种,为了追求某个单镜头更好看,临时交换左右站位。单帧或许更漂亮,剪辑时却会让两个人突然改变面对方向。
所以我更愿意把提示词写成一套“不变量”:哪些可以变,哪些绝对不能动。机位距离、景别、焦点、动作可以变化;人物身份、左右关系、视线、轴线和关键地标必须保持。
07
CHECKLIST
生成前,最后检查哪五件事?
在正式生成多镜头视频前,我会快速检查下面五项:
• 能不能用一句话说清楚每个人物在谁的左边或右边。
• 每个人物是否绑定了一个不会移动的场景地标。
• 正反打中的视线方向是否互相对应。
• 过肩镜头的前景肩部是否出现在正确一侧。
• 不同景别中是否至少保留一个可识别的共同背景地标。
如果这五件事还需要靠猜,说明位置关系图还不够明确,先别急着生成。
「角色资产锁住身份,场景资产锁住环境,位置关系图锁住叙事空间。」
AI 影像的一致性,并不是让模型记住画面里的所有细节,而是先告诉它哪些关系不能动。关系一旦稳定,镜头才有自由变化的空间。
你做 AI 短片时,最常遇到的是人物穿帮、道具穿帮、背景穿帮,还是轴线穿帮?

往期推荐
夜雨聆风