刷到别人用AI做的短片:人物稳定、运镜丝滑、光影像电影截帧。你打开同一个工具,把攒了半年的形容词全砸进去——"电影感、高级光影、真实质感、大师运镜"——结果生成出来:主角走到一半换了张脸,镜头晃得像地震现场,剧情和你想的完全不是一回事。
先说结论:问题九成不在模型,在你写提示词的方式。你把提示词当成了许愿池,而AI需要的,是一份导演的拍摄清单。这篇文章把这个认知差补上,看完你就知道那些能稳定出片的人,到底在写什么。
一、AI不缺想象力,缺的是你的"施工图"

很多人对提示词有个根本误解:以为写得越"高级",画面就越高级。于是提示词里塞满了情绪词——唯美、震撼、氛围感拉满、电影级质感。
问题是,这些词在AI眼里约等于没说。
"电影感"是什么?是《布达佩斯大饭店》的对称构图,还是《谍影重重》的手持晃动?这两种"电影感"背道而驰,你不说清楚,AI只能掷骰子。它掷出来的结果,就是你看到的那些混乱画面。
换个角度想就通了:真实片场里,导演从来不会对摄影师喊"给我拍出电影感"。他会说:"低角度,缓慢推轨,逆光,浅景深。"每个词都对应一个可执行的动作。
AI视频模型是用真实影像数据训练出来的,它认识的是摄影行业的"行话",不是你朋友圈的形容词。你写"缓慢推轨入镜",它在训练数据里见过上万个推轨镜头,稳稳给你还原;你写"运镜牛一点",它只能靠猜。
所以,写提示词的第一步不是打开词库,而是切换身份——别当许愿的甲方,去当发号施令的导演。
二、黄金公式:六个要素,缺一个就翻车

行业里跑通率最高的提示词结构,其实各家官方文档说法惊人一致,拼起来就是六件事:
主体 + 动作 + 场景 + 镜头语言 + 光影氛围 + 约束条件
一个个说:
1. 主体: 画面里是谁?别只写"一个女人",要写"穿黄色雨衣、饱经风霜的中年渔妇"。特征越具体,人物越不容易崩。
2. 动作: 她在干什么?用有物理感的动词。不要"走路",要"顶着风缓慢前行,雨衣下摆被吹得贴在腿上"。AI对物理细节的响应,远好于抽象描述。
3. 场景: 在哪、什么时间。"黎明时分,风暴刚过的码头",一句话把时空钉死。
4. 镜头语言: 镜头怎么动。这是普通玩家和高手拉开差距的地方,下一节专门讲。
5. 光影氛围: 光从哪来、什么色调。"冷色调背光,雨雾里透出暖黄灯光"——注意,是描述光的来源和方向,不是喊"光影大气"。
6. 约束条件: 明确说"不要什么"。负面提示词写上"崩脸、多余手指、画面闪烁、突然跳切",能帮你挡掉一大半废片。
有人会问:写这么细,得写多长?其实60~100个词的精准提示词,效果远好于两千字的形容词轰炸。字数不值钱,信息密度才值钱。每一句话都该回答一个具体问题,回答不了的,删掉。
三、镜头语言速查:把"人话"翻译成"行话"

这一节建议直接收藏。左边是你嘴边的模糊需求,右边是AI能执行的精确指令:
"拍得有电影感" → 缓慢推轨入镜(slow dolly-in)+ 浅景深 "动感一点" → 快速横摇跟拍(whip pan tracking) "角度帅一点" → 低角度仰拍 + 35mm镜头 "绕着主角转" → 向左环绕运镜,平滑180度弧线 "有点呼吸感" → 手持轻微晃动 + 缓慢推近 "大场面开场" → 广角建立镜头 + 无人机缓慢前推
为什么这套翻译这么灵?因为右边每一个术语,都对应真实片场里一种标准操作,模型的训练数据里全是这些镜头的真实样片。你用行话,等于直接调取它的肌肉记忆。
再进一步,镜头语言还要和景别配合:特写镜头就多写微表情——"眼眶泛红,睫毛轻颤";全景镜头就多写环境氛围——"暮色下的长街,灯笼次第亮起";动作镜头就补运动轨迹——"从屋脊跃下,斗篷展开划出弧线"。不同景别喂不同的细节,画面才不会顾此失彼。
四、图生视频最容易犯的错:重复描述画面
现在多数人做片子的主流路线是"先生图、再图生视频",人物一致性好控制。但这里藏着一个高频错误:
上传了一张"红裙女子站在窗前"的图,提示词又写一遍"一位穿红裙的美丽女子站在窗前"——纯属浪费字数。模型已经看见这张图了,你再描述一遍画面,等于给导演念剧照说明。
图生视频的正确写法只有一条规则:只写变化,不写现状。也就是动作和镜头:
"她缓缓转向窗外,发丝被微风掀起,镜头缓慢推近到侧脸特写。"
主体、服装、场景一个字不用提,把字数全部花在"接下来发生什么"上。
同理,如果你在用支持多参考素材的模型(比如给它一张人物图+一段运镜参考视频),指令要写清楚"参考什么":"以图1中黑衣女子为固定主角,严格保留五官和服装;模仿视频2的运镜节奏。"不指明参考维度,AI就不知道你要它抄脸、抄动作还是抄镜头,结果大概率全部抄歪。
还有个冷知识:想让AI在原视频上做修改(换装、删路人、改天气),指令里要强调"哪些保持不变"——"人物五官、动作、镜头全部保持原样,仅将黑色劲装替换为红色长裙"。不锁定不变项,AI会顺手把整个画面重做一遍。
五、实战:一条10秒短片的提示词全流程

最后拿一个具体案例串一遍。目标:10秒古风短镜头,雨夜宫门前,女侠拔剑对峙。
第一步,按六要素写主干:
黑金劲装、低束马尾、眉带旧疤的女子(主体),立于雨夜宫门前,缓缓握住剑柄拔剑出鞘(动作),青石广场积水倒映宫灯(场景),镜头从背后缓慢环绕至正面,停在中景(镜头),冷蓝月光为主光、宫灯暖光勾边(光影),人物五官全程一致,无崩脸无多余手指(约束)。
第二步,超过6秒的片段,拆时间线节拍。别指望一句话管10秒,直接标时间段:
0-3秒:全景,雨幕中女子静立,只有雨声; 3-7秒:环绕运镜至侧面,她低头握剑,特写手部青筋; 7-10秒:拔剑出鞘,剑光划亮雨丝,镜头急推至眼部特写。
给了节拍表,模型会自动规划成多镜头序列,叙事感立刻出来。
第三步,也是多数人从来不做的一步:迭代时一次只改一个变量。这一版脸崩了,就只调人物描述和负面词,别的不动;下一版运镜不顺,就只换镜头术语。一次改十个地方,你永远不知道是哪个改动起了作用——这跟做实验是一个道理。
跑顺这套流程之后,把你验证有效的提示词存成模板:人物设定单独存一份,以后所有镜头直接调用,跨片段换脸的老毛病也就根治了。
说到底,AI视频的门槛从来不是工具,是镜头思维。工具每三个月换一代,但"主体、动作、场景、镜头、光影、约束"这六件事,一百年前的片场就在用,一百年后也不会变。
下次生成翻车,别急着骂模型——先回头看看你的提示词,到底是一份拍摄清单,还是一张许愿纸条。
夜雨聆风