乐于分享
好东西不私藏

搞定AI视频人物幻觉

搞定AI视频人物幻觉

## 一、问题:AI视频里的「人物幻觉」到底是什么?

用AI视频工具(Seedance 2.0 / Sora / Runway等)做有多个人物的视频时,最常见、最头疼的问题是:
**人物数量不对**——明明写了「一家五口」,渲染出来画面里有7个人。
**人物重复/克隆**——双胞胎本来是两个不同的人,AI直接把其中一个渲染了两次。
我在做原创IP动画《超能制造局》时,S2首集(EP13)反复出现这两个问题,迭代了5轮才彻底解决。以下是我们总结出的一套「防人物幻觉硬锁体系」。
---

## 二、根因:为什么AI会「幻觉」出额外人物?

在深入解决方案之前,先理解AI为什么会犯错:

### 原因1:集体名词触发幻觉

Prompt里写「4个孩子惊喜地出现」——AI看到「4个孩子」这个集体概念,自由发挥,可能渲染出5个或3个,甚至多出几个路人。

### 原因2:外形相似的角色被「合并」

双胞胎(我家IP里的老三LaoSan和老四LaoSi)外形相似,AI在动作复杂时偷懒,直接把一个角色渲染两次,凑成「双胞胎」。

### 原因3:人数约束写在Prompt尾部,权重不够

如果你把「只有3个人」写在Prompt最后,AI优先处理前面的叙事描述,人数约束被忽略。

### 原因4:风格漂移导致角色「分裂」

如果没有跨镜风格硬锁,AI可能把同一个角色渲染成两个不同样子,看起来像两个人。
---

## 三、解决方案:五重硬锁体系

核心思路是:**把人数约束提到最高优先级,用多种手段重复锁定**。
---

### 硬锁1:PEOPLE COUNT HARD LOCK(人数硬锁放在Prompt第一行)

**错误写法**(人数约束在中间或尾部):
```
爸爸和四个孩子开心地笑。画面里只有5个人。
```
**正确写法**(人数硬锁放在Prompt最顶部,用醒目符号标注):
```
🚨🚨🚨 EXACTLY 5 PEOPLE ONLY: (1) Dad (2) LaoDa (3) LaoEr (4) LaoSan (5) LaoSi.
NO OTHER PEOPLE. NO EXTRA FIGURES.
(然后是正常Prompt内容...)
```
**关键细节**:
- 用 emoji 🚨 或 ⛔ 视觉上突出人数约束
- 逐一点名每一个人,不要写「爸爸和4个孩子」
- 明确写 `NO OTHER PEOPLE` / `NO EXTRA FIGURES`
---

### 硬锁2:禁用集体名词,逐一点名

**错误写法**:
```
四娃看到鱼获,高兴得跳起来。
```
**正确写法**:
```
THEN explicitly render ONLY these 5 people:
(1) Dad center, (2) LaoDa left, (3) LaoEr right, (4) LaoSan left-front, (5) LaoSi right-front.
**DO NOT use "4 kids" as collective noun — render NAMED individuals only.**
```
**关键细节**:
- 把「4个孩子」拆成「老大大/老二/老三/老四」逐一列出
- 在Prompt里明确写:`NO "X kids" as collective — render NAMED individuals only`
---

### 硬锁3:位置锚定(多人场景必写每个角色的位置)

当画面里有3个以上人物时,**必须**明确每个人的位置,否则AI会自由摆放,导致人数错误。
```
**POSITION: Dad center-front, LaoDa left-front, LaoEr right-front,
LaoSan left-back, LaoSi right-back. EXACTLY 5 people total.**
```
位置锚定的额外好处:AI渲染时人物的相对位置固定,不会出现「两个人叠在一起看起来像一个人」的问题。
---

### 硬锁4:双胞胎/相似角色的防克隆负号

对于外形相似的角色(双胞胎、穿同款衣服的角色),需要在角色描述结尾加**视觉负号**:
```
LaoSan (item 4): Red buffalo plaid jacket, missing front teeth, NO MOLE.
THIS IS THE ONLY LAOSAN — DO NOT CLONE THIS CHARACTER.
LaoSi (item 5): Dark blue buffalo plaid jacket, mole under RIGHT EYE, white bandage on RIGHT WRIST.
THIS IS THE ONLY LAOSI — IF YOU SEE 2 BOYS IN PLAID, THEY MUST BE DIFFERENT.
```
对于已经出现过克隆问题的角色,可以加更激进的视觉负号:
```
LAOER WEARS MEDIUM COOL-GREY CARDIGAN — THERE IS ONLY ONE LAOER IN THIS FRAME.
IF YOU SEE 2 GIRLS IN GREY CARDIGAN, ONE IS WRONG, REMOVE IT.
```
---

### 硬锁5:STYLE HARD LOCK(跨镜风格一致,防止角色「分裂」)

如果同一个角色在不同Shot里被渲染成不同样子,观感上就像「多出了一个人」。解决方法是在每个Shot的Prompt里加入**跨镜风格硬锁**:
```
🔒🔒🔒 STYLE HARD LOCK v3.0 (CONSTITUTIONAL · CROSS-SHOT CONSISTENCY MANDATE):
⛔ THIS IS A STYLIZED 3D CARTOON ANIMATION (NOT photorealistic, NOT live-action).
⛔ CROSS-SHOT CONSISTENCY: This shot MUST look as if rendered by THE SAME STUDIO,
THE SAME ART DIRECTOR, THE SAME RENDERING ENGINE as every other shot.
⛔ REFERENCE LOOK (NEVER substitute another style):
Primary: Pixar "The Incredibles" (warm saturated palette)
Character: Pixar "Inside Out 2" (cartoon-proportioned, large eyes, chunky hair)
```
---

## 四、实战案例:EP13《爸爸的空军日》的5轮迭代记录

### 第一轮:直接写Prompt,渲染结果——画面里多出了2个路人

**问题**:Prompt里写了「爸爸打电话叫四娃来」,没加人数硬锁。
**修复**:在Prompt顶部加入 `🚨🚨🚨 EXACTLY 5 PEOPLE ONLY` 硬锁。
---

### 第二轮:人数对了,但老三和老四「合体」了——只出现了一个男孩

**问题**:AI把老三和老四渲染成了同一个男孩(双胞胎克隆问题)。
**修复**:
1. 在PEOPLE COUNT里加 `NO CLONING. NO DUPLICATE CHARACTERS.`
2. 在老三/老四的角色描述里加区分锚(老三无痣 / 老四右眼下有痣+右手腕绷带)
---

### 第三轮:Shot 4里出现了两个「老二」

**问题**:Prompt里用了「4个孩子围绕爸爸」,AI自由发挥,把老二(穿灰色开衫)渲染了两次。
**修复**:
1. 把所有「4 kids」改成逐一点名(LaoDa / LaoEr / LaoSan / LaoSi)
2. 在LaoEr的描述结尾加视觉负号:`IF YOU SEE 2 GIRLS IN GREY CARDIGAN, ONE IS WRONG`
---

### 第四轮:Mom「穿越」到了不该出现的Shot里

**问题**:某Shot的Prompt里没写「Mom不在」,AI自作主张加了个成年女性。
**修复**:在每个Shot的「不在场否定」栏里明确写 `NO Mom · NO 额外人物 · NO 第6个人`
---

### 第五轮(最终版):所有问题解决,渲染100%正确

经过以上四轮迭代,最终版的EP13 Prompt文件里,每个Shot都有:
1. ✅ PEOPLE COUNT HARD LOCK(人数硬锁在第一行)
2. ✅ 逐一点名(禁用集体名词)
3. ✅ 位置锚定(多人场景标注每个人位置)
4. ✅ 不在场否定(明确写哪些角色不出现)
5. ✅ STYLE HARD LOCK(跨镜风格一致)
---

## 五、总结:防人物幻觉检查清单

下次用AI视频工具生成多人场景时,对着这个清单过一遍:
- [ ] 人数硬锁(EXACTLY N PEOPLE)是否放在Prompt**第一行**?
- [ ] 是否用了**逐一点名**,而非「3个孩子」这类集体名词?
- [ ] 多人场景是否标注了**每个角色的位置**?
- [ ] 外形相似的角色是否加了**防克隆负号**?
- [ ] 不该出场的角色是否明确写了**「NO XXX」**?
- [ ] 是否加了**跨镜风格硬锁**,防止角色外观「分裂」?
---

## 六、延伸思考:为什么AI视频工具普遍有这个问题?

人物幻觉的本质是:**当前AI视频模型的空间推理能力还不够强**。
大模型(LLM)擅长处理和生成文本,但在「精确空间计数」和「严格遵循人数约束」方面,能力远不如人类。这就像让一个擅长写小说的人去画工程图纸——不是他不够聪明,而是任务不匹配。
解决思路只有一个:**用Prompt工程手段,把模糊的约束变成硬性的、重复的多重锁定**。
更多精彩视频,敬请关注视频号:超能制造局