乐于分享
好东西不私藏

AI视频为什么容易翻车?不是提示词太短,是你没有导演系统(上)

AI视频为什么容易翻车?不是提示词太短,是你没有导演系统(上)
为什么你的 AI 视频画面很精美,但一动起来就像摆拍?
人物脸很漂亮,光影很电影,质感也不差。
但镜头一连起来,问题全出来了:
人物一会儿像本人,一会儿像表弟。
办公室门上一镜在左边,下一镜门跑到右边。
两个人对话,A 张嘴,B 也跟着抽风。
情绪戏更惨,角色哭得很努力,观众毫无感觉。
很多人第一反应是:提示词不够长。
于是继续加:
电影感、8K、大师级、情绪浓烈、真实自然、镜头推进、高级光影……
最后提示词写成裹脚布,视频还是像随机抽出来的。
问题不在词少。
问题在于:你想用一段提示词,干完整个导演组的活。
一:核心观点
不是把提示词写得更长,而是把 AI 视频拆成“资产、叙事、镜头、动作、修正”五层控制。
一句话:AI 视频不是生成出来的,是导演出来的。
二、误区拆解
误区一:以为提示词越长,视频越稳定
很多人以为:描述越细,AI 越听话。
真实问题是:
提示词太长以后,信息优先级会混乱。人物、场景、光影、动作、镜头、情绪全部挤在一起,AI 不知道先保谁。
结果就是:
人物变脸、动作丢失、镜头乱飘、风格跳变。
正确方向是:
不要堆词,要分工。
  • 人物用人物身份板控制;
  • 场景用场景资产图控制;
  • 镜头用故事板控制;
  • 风格用预想效果图控制;
  • 动作用时间段控制;
  • 后期用补拍和剪辑修正。
提示词只负责最后整合,不负责包治百病。
误区二:以为画面漂亮,视频就高级
很多人以为:只要画面足够电影感,短片就成立。
真实问题是:
电影感不是滤镜,不是大光圈,不是 8K。
电影感来自镜头背后的叙事逻辑。
结果就是:
画面像高级写真,但没有戏。
角色像模特站台,不像人在故事里。
正确方向是:
每个镜头先问一句:
这一镜,角色到底在完成什么行动?
不是“他很伤心”。
而是“他把辞退通知书折起来,放回桌面,抬头看向对方”。
行动比形容词重要。
误区三:以为情绪要写在脸上
很多人以为:想表达悲伤,就写哭。
想表达愤怒,就写 angry。
想表达紧张,就写 nervous。
真实问题是:
AI 很容易给你一张“情绪结果图”。
脸上挂泪,眼神空洞,没有情绪。
结果就是:
角色很努力,观众很冷静。
正确方向是:
不要让角色表演情绪,要让世界替他表达情绪。
悲伤可以是:
  • 空房间;
  • 冷蓝光;
  • 下雨窗户;
  • 桌上枯萎的花;
  • 背对镜头的人;
  • 没有收拾的第二套餐具。
情绪不是写出来的,是通过环境刻画的。
误区四:以为多角色可以一句话写完
很多人以为:“左边男人喝咖啡,右边女人跳舞,然后男人站起来鼓掌”这种句子很清楚。
真实问题是:
人类读得懂,AI 未必稳。
多个角色、多个动作、多个时间关系混在一起,AI 很容易抓错重点。
结果就是:
女人跳舞对了,男人一边端咖啡一边鼓掌。
或者男人动了,女人变成背景板。
再或者两个人互相污染,场面像模型喝多了。
正确方向是:
多角色必须拆成:
  • 空间区域;
  • 时间段;
  • 动作优先级。
不要写作文,要写调度表。
误区五:以为生成完视频就算结束
很多人以为:AI 视频就是提示词进去,成片出来。
真实问题是:这是幻想。
真正能用的 AI 视频,基本都要经历:
  • 首帧控制;
  • 尾帧控制;
  • 多次生成;
  • 局部编辑;
  • 补拍反应镜头;
  • 剪辑拼接;
  • 音效和口型修正。
结果就是:
没有后期意识的人,会一直抽卡。
有后期意识的人,会开始控片。
正确方向是:
把 AI 当摄影组,不要当许愿池。
三:具体方法
3.1:先建资产,再谈生成
一句话解释:先把人物、场景、道具、风格固定下来,再进入剧情和视频生成。
底层逻辑:AI 不是记忆型导演。你不提前给它明确资产,它每次都会重新脑补。
人物身份板解决“谁”?场景资产图解决“在哪”?道具资产图解决“拿什么”?
风格参考图解决“长什么样”?
反面案例
低级提示词:
一个唐僧站在现代会议室里,被如来通知裁员,电影感,真实,镜头推进。
这个提示词会出什么问题?
  • 唐僧造型每次变;
  • 如来像佛像、老板、和尚之间随机切;
  • 会议室布局乱;
  • 通知书可能消失;
  • 镜头推进但人物动作僵硬。
正确做法
先准备四张资产:
  • 唐僧人物身份板;
  • 如来 HR 人物身份板;
  • 灵山集团汇报厅场景图;
  • 优化通知书道具图。
实操步骤
  1. 生成人物三视图;
  2. 生成主场景固定图;
  3. 生成关键道具图;
  4. 写人物与场景约束;
  5. 再写剧情与分镜。
提示词模板
【人物资产】
请严格参考唐僧人物身份板:
32岁男性,光头,九个戒疤,金框圆眼镜,深灰僧式商务正装,手持《玄奘绩效改进通知书》,气质温和但被压抑。
请严格参考如来 HR 人物身份板:
中年男性,螺髻,长耳,土黄色暗纹僧袍款商务正装,佩戴工牌,站在左侧办公台后,表情职业化、冷静、带压迫感。
【场景资产】
地点为灵山集团汇报厅。
正前方巨大LED屏,左侧为HR办公台,右侧为空旷站立区。
请保持办公台、屏幕、人物左右位置、主光源方向不变。
不要新增桌子,不要改变空间布局,不要让人物随机换位置。
3.2:用“核心行动”替代情绪形容词
底层逻辑:AI 擅长生成可见动作,不擅长理解抽象心理。
情绪必须落到:
  • 手;
  • 眼神;
  • 呼吸;
  • 身体方向;
  • 物品互动;
  • 空间距离变化。
反面案例
唐僧非常震惊、伤心、愤怒,表情复杂,情绪崩溃,电影感特写。
这种写法的问题是:
  • 情绪词太虚;
  • 表情容易用力;
  • 动作缺失;
  • 画面像摆拍剧照。
正确做法
把情绪翻译成动作:
  • 震惊:手指停在纸边,迟迟没有翻页;
  • 愤怒:把通知书慢慢折好,按在桌面上;
  • 反击:抬头,向前半步,语速变慢;
  • 冷静:眼神稳定,不再解释。
提示词模板
【本镜核心行动】
唐僧没有哭,也没有大喊。
他先低头看着通知书,右手拇指压住纸张边缘,停顿两秒。
随后他把通知书慢慢折成两半,放回桌面。
最后抬头直视如来 HR,身体向前半步。
【情绪表达】
不直接表现“愤怒”。
通过手指用力、呼吸变慢、眼神从错愕变为冷静来表现压抑后的反击。
3.3:用镜头语法控制观众心理
底层逻辑:观众和角色的距离,不只来自剧情,也来自镜头。
  • 远景:让人变小,适合孤独、宿命、无力;
  • 中景:保留动作和环境,适合叙事;
  • 近景:压缩注意力,适合对话和反应;
  • 特写:放大细节,适合情绪爆点;
  • 广角:强调空间压迫;
  • 长焦:强调隔离、窥视和压缩。
反面案例:
你想表达“被裁员的压迫感”,却写:
大远景,唐僧站在巨大的会议室里,表情愤怒,浅景深,长焦压缩,广角镜头,电影感。
这就很混乱。
大远景会削弱人物情绪。浅景深和大远景不适配。长焦压缩和广角透视又互相打架。
正确做法
压迫感可以这样拍:
  • 中近景;
  • 低机位或平视偏低;
  • 前景压住人物;
  • 背景屏幕巨大;
  • 冷色屏幕光切脸;
  • 镜头缓慢推进。
提示词模板:
【镜头语言】中近景,50mm标准镜头,平视略低机位。
前景左侧有虚化的HR办公桌边缘,形成压迫遮挡。
中景为唐僧站在屏幕右侧,手持通知书。
后景为巨大的LED屏幕,冷白光从屏幕方向照亮他半张脸。
镜头在5秒内缓慢推进,突出他从被动接受到冷静反击的变化。

相关学习资料