SV-002
最近,我做了七段藏式题材的 AI 视频:湖边的僧人、雪地里的背影、草原上的骑手、火堆旁的人群、经幡下的人物……
它们都从一张静态图开始。我把原图、人物参考和口语化的创作要求交给 Gemini Flash,再通过一次次观看与重试,把它们变成十秒左右的镜头。
一开始我以为,只要把提示词写得足够完整——人物怎么走、衣服怎么动、风从哪里吹、摄影机怎样晃,甚至每一秒发生什么——AI 就会更接近我脑海里的画面。
结果恰恰相反。
有些提示词越写越长,人物动作反而出现停顿、滑行和不自然的节奏;有些要求写得很少,AI 却自己补出了更连贯的风、布料和身体惯性。
这组实验让我重新理解了一件事:“提示词不是越全面越好。真正重要的是,哪些必须由我决定,哪些应该留给模型。”
01|先决定它像什么,再决定它发生什么
我想要的并不是“西藏旅游宣传片”,也不是把雪山、经幡和藏袍堆在一起的视觉奇观。
我更在意一种观察式纪录片的感觉:自然光、低饱和、真实的皮肤和织物,人物不必站在画面中央,摄影机像是偶然遇见了这个人,只安静地记录几秒。
所以即使我使用的是非常口语化的指令,也会先反复强调同一件事:
> 像摄影师扛着摄影机拍摄,机位不要改变,不要切镜头;画面可以有轻微的手持晃动,人物只做日常、像被无意捕捉到的动作,所有运动都要符合物理规律。
这不是一句装饰性的“风格词”,而是在规定整段视频的观看方式:摄影机为什么在这里,人物是否意识到镜头,以及画面应该克制到什么程度。
在火堆女性的镜头里,我要求焦点始终留在画面左侧的女性身上。她不需要跟着人群跳舞,只要坐在那里,看向火堆,偶尔眨眼或轻微说话。背景人群、火焰和光影已经足以让画面活起来。


第一版里,我试图同时锁定机位、焦点、人物动作与背景人群。
真正让画面摆脱 AI 油腻感的,往往不是“更电影化”,而是具体又不完美的细节:衣服有重量,风不是匀速的,人物没有标准化表演,构图甚至可以稍微偏一点。
“真实感并不来自画面有多漂亮,而来自画面是否允许偶然发生。”
02|提示词给边界,修改时一次只解决一个问题
我最初常把指令写得很满:锁定机位、色调和构图,规定人物怎么眨眼、周围的人怎么移动,甚至要求每一处都符合物理规律。
这些要求单独看都合理,叠在一起却可能互相争夺控制权:模型既要守住人物,又要完成动作、维持背景、模拟环境,还要兼顾镜头晃动与连贯。最终每一项都“做了一点”,整体却未必自然。
反而在夜间火堆的实验里,我只写了一个很短的要求:
> 保持手持摄影的轻微晃动,不要运镜;让图片中的火自然燃烧。

*当火焰成为唯一主运动,简短要求反而给了模型更完整的发挥空间。*
这个镜头没有复杂人物动作,火焰是唯一的主运动,模型反而有更多空间去处理火苗、火星和明暗变化。
我后来意识到,提示词真正需要说清楚的只有四类信息:
- 什么不能变:人物身份、原始构图、机位与色调;
- 什么必须动:这一镜头最重要的动作;
- 什么可以轻微动:风、衣摆、树叶、呼吸或手持感;
- 什么绝对不要发生:切镜、夸张表演、无理由变形。
至于每一只脚怎样落下、每一片衣角如何摆动,并不一定都要由我预先写完。
*复杂提示词适合帮我想清楚,简洁提示词更适合真正生成。*
这组视频并不是靠一条完美提示词一次生成的。我的真实过程更像剪辑:先做一版,完整看完,再寻找最影响观看的那个断点。
湖边僧人的一版视频,十秒中间出现了不流畅的衔接:画面短暂停顿,紧接着人物或环境状态发生变化。于是我没有把所有要求重新写一遍,只追问一个问题:“让这十秒从头到尾连贯起来。”

*第一次生成在中段出现停顿;第二轮我只修正“十秒连续流畅”这一件事。*
这也让我意识到,修改提示词时最容易犯的错,是一次修五个问题。面部、动作、机位、光线和背景同时重写,等于让模型重新理解整条视频;即使问题被修好,也很难知道是哪一句起了作用。
我现在更愿意把每轮生成当成一次小实验:
> 第一版看整体方向;第二版只修最明显的问题。
例如,草原骑手需要处理人和马的大幅位移,本身就比静态肖像更难。生成失败时,最重要的不是继续增加形容词,而是重新确认主运动是什么,其他要求能否删减。
03|一个镜头,需要“动作预算”
图生视频里,十秒钟能稳定承载的动作其实很有限。我会把运动分成三层:人物运动、环境运动和摄影机运动。
三层如果同时很强,画面很容易失控。更稳妥的办法,是每个镜头只选一个主运动。
湖边僧人的主运动是环境:人物保持背影和位置,风吹动树叶、衣服和经幡,湖面出现细微变化,摄影机只留下站在原地的轻微手持感。
草原骑手的主运动是人物位移,摄影机和背景就应该更克制;夜间火堆的主运动是火焰,坐在后方的人只需要自然存在;藏族女性肖像里,人物的呼吸、眨眼与经幡的风动已经足够,不需要额外设计剧情。
我把它总结成一句很实用的话:
> *人物在动,镜头就少动;环境已经很丰富,人物就少表演。*
这不是为了让视频变得保守,而是把有限的生成能力放在最值得被看见的地方。
04|有终点的动作,需要更强的控制
并非所有镜头都适合只写“自然地动起来”。玛尼堆的镜头有一个明确的动作结果:男人拿起一块石头,放到玛尼堆上,再自然垂下手臂。

“拿起—放下—垂手”有明确终点,因此需要比风吹、呼吸更强的动作约束。
这种动作同时涉及手、石头、身体重心和物体接触,难度远高于呼吸或风吹。我在提示词中必须明确保留原图信息、固定机位、不切镜,并把“石头最后放在哪里”说清楚。
如果使用的平台支持首尾帧,这类有明确落点的动作也更适合设置尾帧,帮助模型理解它最终要到达的状态。
但如果镜头只是凝视、呼吸、风吹、火焰或湖面涟漪,它本来就没有一个必须抵达的结尾。强行设定尾帧,模型反而可能为了“赶到终点”而加速、停顿或改变姿态。
所以我的判断标准是:
> 有明确动作结果,才考虑尾帧;开放式的观察镜头,让它自然结束。
05|先建立人物,再让人物进入镜头
另一项明显影响稳定性的,是人物一致性。
“人物资产”这个说法可以成立;更准确地说,它是一套**角色设定或人物 Bible**。它不只是三视图,而是让模型持续认出“这是同一个人”的身份锚点。
在转经筒女性的实验里,我不只提供一张首帧,还加入了人物近景、正侧背参考、头部角度、转经筒结构以及不同场景中的人物状态。这些参考共同回答:她是谁,她穿什么,她手里的道具是什么,以及镜头换角度以后仍然应该如何保持一致。

在“失败版本”中,镜头就出现了多次偏差与切换,因为我所给出的提示词过于冗长复杂导致理解上出现了偏差。
*参考资料的目的不是让画面更复杂,而是让换角度后的她仍然是同一个人。*


但参考图也不是越多越好。前提是它们彼此一致、各自承担明确功能。相互矛盾的脸型、服装或光线,只会给模型更多错误答案。
我现在会优先准备:正面、侧面、背面、头部近景、完整服装、首饰与常用道具。若同一人物要出现在多个镜头里,还会固定年龄、体型、发型、服装层次和色彩。
场景也是一样。对于连续镜头,比传统“场景三视图”更有用的是一套环境锚点:全景建立镜头、主机位纯环境、反打方向,以及关键建筑和道具的位置关系。
人物回答“她是谁”,场景回答“她在哪里”,摄影规则回答“是谁在看她”。三者稳定以后,连续镜头才不会像每次都重新抽取一个世界。
纪实感,不等于纪实证据
这些画面借用了纪录片的视觉语言,但它们不是发生在现实中的纪录片素材。发布它们时,我会明确标注 AI 生成。
我所感受到的“自由”和“信仰感”,也不应该靠把一种文化简化成遥远、神秘或原始的符号来制造。我觉得它打动人的,是人在风雪、劳作、自然与信仰之间呈现出的尺度关系。
AI 让画面越来越接近真实,也让我们更有必要追问:真实只是表面的像真,还是一种诚实的观看?当任何地点、人物和光线都可以被合成,创作者的价值也许不再只是“做出一张图”,而是决定如何观看、为什么选择,以及主动舍弃什么。
这也是 Synthetic Vision 想继续记录的内容:不只展示完成的画面,也保留失败、重试、犹豫和判断发生的过程。
如果你也在做图生视频,不妨在下一次输入提示词前先问自己一句:
“这个镜头真正需要动的,到底是什么?”
—
Synthetic Vision|合成视觉档案
探索 AI 时代新的观看方式。
*本文画面均为 AI 生成影像实验,不代表真实人物或真实事件的纪录。*
夜雨聆风