乐于分享
好东西不私藏

AI 视频背景总穿帮?先做一张位置关系图

AI 视频背景总穿帮?先做一张位置关系图

QUOTE

角色资产锁住“是谁”,位置关系图锁住“在哪里”

做 AI 视频时,我遇到过一种很隐蔽的穿帮。

单看每一帧,人物没有变,服装没有变,场景也都挺漂亮。可一剪到一起,问题就来了:上一镜还在人物左边的飞机模型墙,下一镜跑到了右边;圆形舷窗忽远忽近;人物明明在对话,正反打之后却像各自站进了不同的房间。

问题不一定出在人物一致性,而是我们只告诉了模型“画面里有什么”,却没有告诉它“这些东西彼此在哪里”

这次我用自己制作的一组素材,演示一个很实用的方法:先建立人物和场景资产,再做一张位置关系图,用它锚定人物与人物人物与场景之间的空间关系,最后才拆成具体镜头。

位置关系母图:女飞行员固定在左侧并朝右看,老人固定在右侧并朝左看

本文人物、场景、关系图与视频案例均为作者自制。

本文看点

01

锁定人物与空场景

02

关系母图固定空间

03

拆出全景与正反打

01

PROBLEM

为什么角色没变,空间还是会穿帮?

人物参考图通常只能回答一个问题:这个人是谁。

它能帮助模型稳定发型、五官、服装和体态,却不会自动记住女飞行员应该站在飞机模型墙前,老人应该坐在长桌右侧,也不会主动维护两人的视线方向和拍摄轴线。

我后来把这类穿帮拆成三层关系:

人物与人物

谁在左,谁在右,彼此距离多远,视线朝向哪里。

人物与场景

每个人靠近哪个地标,处于前景、中景还是后景。

场景与场景

舷窗、楼梯、长桌和陈设之间的相对位置是否稳定。

背景一致性并不是让每个镜头复制同一张背景,而是让不同景别都遵守同一组空间关系

02

ASSETS

先锁什么,才能让模型知道这个房间没变?

我的第一步不是写分镜提示词,而是把人物和空场景分开制作

人物资产要尽量包含正面、四分之三侧面和背面。它们不是为了展示好看,而是为了让人物在转身、过肩和反打时仍然保留同一套脸型、发型与服装结构。

人物资产:女飞行员的正面、四分之三侧面和背面

人物资产:老人角色的正面、四分之三侧面和背面

场景资产则尽量先做成一个没有人物的完整空镜。把未来会反复出现的地标交代清楚,比堆满装饰细节更重要。

在这个案例里,我选择了四个固定地标:左侧的飞机模型墙、中央的圆形舷窗、右侧的螺旋楼梯,以及横向贯穿画面的工作长桌。后续镜头不管远近,都要能从这些地标中找到空间依据。

空场景资产:飞机模型墙、圆形舷窗、螺旋楼梯与长桌构成稳定地标

人物资产锁身份,空场景资产锁环境。但两者仍然是分开的,模型还不知道人物进入这个房间后应该站在哪里。

到这里,人物和房间之间仍然没有坐标

03

SPATIAL MAP

位置关系图到底要锁住哪些东西?

我把两个人物放回空场景,做了一张双人关系母图。也就是文章开头看到的那张画面。

这张图不是某个镜头的最终成片,而是后续所有镜头共同遵守的空间依据。它至少锁住五件事:

• 女飞行员在画面左侧,靠近飞机模型墙,站立,视线朝右。

• 老人在画面右侧,靠近工作长桌,坐着,视线朝左。

• 圆形舷窗位于两人之间的后方,承担冷色月光来源。

• 猫在前景左侧,收音机和灯具留在桌面右侧。

• 两人之间形成一条对话轴线,后续机位始终留在轴线同一侧。

位置关系图不是最终成片,它是全片的空间宪法

关系图不用做得像最终画面,但一定要明确。人物左右位置视线方向和固定地标必须一眼就能看懂。如果关系母图本身含糊,后续生成再精细,也只是在放大歧义。

04

PROMPT

怎么把一张关系图翻译成提示词?

把多张参考图交给生成工具时,不要只说“参考这些图片”。每张图承担的职责必须写清楚,尤其要把位置关系图放在空间控制的最高优先级。

我在这个案例里使用的提示词逻辑,可以抽象成下面这份模板:

...TEXT

以 @位置关系图 作为双人位置与构图参考:

A 位于画面左侧的 [场景地标] 前,

B 位于画面右侧的 [场景地标] 旁。

两人保持参考图中的站位与轴线关系:

A 看向画面右侧,B 看向画面左侧,全片不越轴。

场景环境与陈设参考 @场景资产;

A 的外观、发型和服装参考 @人物资产A;

B 的外观、发型和服装参考 @人物资产B。

切换景别时,只改变机位距离、焦点和景深,

不改变人物左右关系、视线方向与关键背景地标。

避免:交换人物左右位置、改变视线方向、

移动舷窗、飞机模型墙和长桌,新增主要道具,跨越轴线。

提示词截图:位置关系图负责构图和轴线,场景图负责环境,两张人物图分别负责角色外观

这段提示词里有一个很容易被忽略的顺序:

先声明位置关系图负责构图和轴线,再声明场景图负责环境,最后说明人物图只负责外观。这样能减少模型把某张人物参考图误当成构图参考,或者为了还原脸部而擅自改变人物站位。

“不越轴”也不能只写成一个术语。最好把它翻译成可见动作:女飞行员始终看向画面右侧,老人始终看向画面左侧。模型对具体画面关系的理解,通常比对抽象摄影术语更稳定。

05

SHOT DESIGN

三个镜头为什么没有跳轴?

关系母图确定以后,我才从它拆出三个镜头。拆镜头时只改变景别和焦点,不重新发明空间。

全景先交代空间

第一个镜头保留两个人物和主要地标。女飞行员仍在左侧,老人仍在右侧,圆形舷窗位于中央后方,长桌连接两人。

镜头一:全景先向观众交代人物站位、桌面方向和背景地标

老人过肩,前景仍然有方向

第二个镜头从女飞行员一侧拍老人。女飞行员的肩部留在左下前景,老人位于画面右侧,继续朝左看。即使背景被景深虚化,观众仍能知道摄影机站在空间的哪一边。

镜头二:女飞行员肩部位于左侧前景,老人位于右侧并朝左看

反打女飞行员,左右关系不交换

第三个镜头反打女飞行员。老人的肩部出现在右下前景,女飞行员仍位于画面左侧并朝右看。前景肩部、面部位置和视线方向共同维持了轴线。

镜头三:老人肩部位于右侧前景,女飞行员位于左侧并朝右看

这三个镜头看起来变化很大,但真正变化的只有景别、焦点和表演重点。人物左右关系、视线、长桌方向和背景地标都没有被重写,所以剪在一起仍然属于同一个空间

把三个镜头接起来,15 秒成片里的空间关系可以从下面这组连续画面直接看出来。

已关注
关注
重播 分享

视频|15 秒完整成片:女飞行员始终位于画面左侧,老人始终位于画面右侧,三次景别切换均未越轴

06

PITFALLS

哪些写法最容易让空间再次失控?

第一种,只上传人物参考图不提供完整场景。模型可能记得脸和衣服,却会在每个镜头里重新布置房间。

第二种,每个镜头从头描述一次场景。提示词看似详细,但不同段落里的用词稍有变化,模型就可能把它们理解成三个不同空间。

第三种,只写“A 在左,B 在右”,却不绑定背景地标。人物可能没有换位,但墙面、门窗和桌子仍然会漂移。

第四种,为了追求某个单镜头更好看,临时交换左右站位。单帧或许更漂亮,剪辑时却会让两个人突然改变面对方向。

所以我更愿意把提示词写成一套“不变量”:哪些可以变,哪些绝对不能动。机位距离、景别、焦点、动作可以变化;人物身份、左右关系、视线、轴线和关键地标必须保持

07

CHECKLIST

生成前,最后检查哪五件事?

在正式生成多镜头视频前,我会快速检查下面五项:

• 能不能用一句话说清楚每个人物在谁的左边或右边。

• 每个人物是否绑定了一个不会移动的场景地标。

• 正反打中的视线方向是否互相对应。

• 过肩镜头的前景肩部是否出现在正确一侧。

• 不同景别中是否至少保留一个可识别的共同背景地标。

如果这五件事还需要靠猜,说明位置关系图还不够明确,先别急着生成。

角色资产锁住身份,场景资产锁住环境,位置关系图锁住叙事空间

AI 影像的一致性,并不是让模型记住画面里的所有细节,而是先告诉它哪些关系不能动。关系一旦稳定,镜头才有自由变化的空间。

你做 AI 短片时,最常遇到的是人物穿帮、道具穿帮、背景穿帮,还是轴线穿帮?

END

往期推荐

来吧,用AI制作电影配乐

50个AIGC影像奖项入口表,截至20260727

不会画画,也能控制 AIGC 分镜

老生常弹:Midjourny的进阶用法

AIGC视频黑科技——深度图与深度视频

GPT出图全是噪点?两个思路解决

群像 AI 视频为什么总糊脸?

只输入焦段就能精准控制AI画面景别?这行不通!!

AIGC短片,投奖全攻略

手把手教你用Midjourny尝试更多影像风格

学会为你AI视频的首帧图添加“动势”

一张AI图改到第6轮,为什么越来越不像它?

AI画面控不住,有了它能解决一部分问题