乐于分享
好东西不私藏

AI 视频,不是写得越细越好 :一组藏式影像实验里的 5 个发现

AI 视频,不是写得越细越好 :一组藏式影像实验里的 5 个发现

SV-002

最近,我做了七段藏式题材的 AI 视频:湖边的僧人、雪地里的背影、草原上的骑手、火堆旁的人群、经幡下的人物……

它们都从一张静态图开始。我把原图、人物参考和口语化的创作要求交给 Gemini Flash,再通过一次次观看与重试,把它们变成十秒左右的镜头。

一开始我以为,只要把提示词写得足够完整——人物怎么走、衣服怎么动、风从哪里吹、摄影机怎样晃,甚至每一秒发生什么——AI 就会更接近我脑海里的画面。

结果恰恰相反。

有些提示词越写越长,人物动作反而出现停顿、滑行和不自然的节奏;有些要求写得很少,AI 却自己补出了更连贯的风、布料和身体惯性。

这组实验让我重新理解了一件事:“提示词不是越全面越好。真正重要的是,哪些必须由我决定,哪些应该留给模型。”

已关注
关注
重播 分享
(夜晚的火堆旁)
已关注
关注
重播 分享
(一位中年藏族妇女的形象)
已关注
关注
重播 分享
(篝火聚会群像)
已关注
关注
重播 分享
(草原上的骑手)
已关注
关注
重播 分享
(青年妇女手持法器)
已关注
关注
重播 分享
(玛尼堆旁)
已关注
关注
重播 分享
(女子的眺望)
已关注
关注
重播 分享
(湖边的僧人)
已关注
关注
重播 分享
(走向雪山远处的僧人)

01|先决定它像什么,再决定它发生什么

我想要的并不是“西藏旅游宣传片”,也不是把雪山、经幡和藏袍堆在一起的视觉奇观。

我更在意一种观察式纪录片的感觉:自然光、低饱和、真实的皮肤和织物,人物不必站在画面中央,摄影机像是偶然遇见了这个人,只安静地记录几秒。

所以即使我使用的是非常口语化的指令,也会先反复强调同一件事:

> 像摄影师扛着摄影机拍摄,机位不要改变,不要切镜头;画面可以有轻微的手持晃动,人物只做日常、像被无意捕捉到的动作,所有运动都要符合物理规律。

这不是一句装饰性的“风格词”,而是在规定整段视频的观看方式:摄影机为什么在这里,人物是否意识到镜头,以及画面应该克制到什么程度。

在火堆女性的镜头里,我要求焦点始终留在画面左侧的女性身上。她不需要跟着人群跳舞,只要坐在那里,看向火堆,偶尔眨眼或轻微说话。背景人群、火焰和光影已经足以让画面活起来。

(原图画面参考图)
(制作花絮)

第一版里,我试图同时锁定机位、焦点、人物动作与背景人群。

真正让画面摆脱 AI 油腻感的,往往不是“更电影化”,而是具体又不完美的细节:衣服有重量,风不是匀速的,人物没有标准化表演,构图甚至可以稍微偏一点。

“真实感并不来自画面有多漂亮,而来自画面是否允许偶然发生。”

02|提示词给边界,修改时一次只解决一个问题

我最初常把指令写得很满:锁定机位、色调和构图,规定人物怎么眨眼、周围的人怎么移动,甚至要求每一处都符合物理规律。

这些要求单独看都合理,叠在一起却可能互相争夺控制权:模型既要守住人物,又要完成动作、维持背景、模拟环境,还要兼顾镜头晃动与连贯。最终每一项都“做了一点”,整体却未必自然。

反而在夜间火堆的实验里,我只写了一个很短的要求:

> 保持手持摄影的轻微晃动,不要运镜;让图片中的火自然燃烧。

(制作花絮)

*当火焰成为唯一主运动,简短要求反而给了模型更完整的发挥空间。*

这个镜头没有复杂人物动作,火焰是唯一的主运动,模型反而有更多空间去处理火苗、火星和明暗变化。

我后来意识到,提示词真正需要说清楚的只有四类信息:

- 什么不能变:人物身份、原始构图、机位与色调;

- 什么必须动:这一镜头最重要的动作;

- 什么可以轻微动:风、衣摆、树叶、呼吸或手持感;

- 什么绝对不要发生:切镜、夸张表演、无理由变形。

至于每一只脚怎样落下、每一片衣角如何摆动,并不一定都要由我预先写完。

*复杂提示词适合帮我想清楚,简洁提示词更适合真正生成。*

这组视频并不是靠一条完美提示词一次生成的。我的真实过程更像剪辑:先做一版,完整看完,再寻找最影响观看的那个断点。

湖边僧人的一版视频,十秒中间出现了不流畅的衔接:画面短暂停顿,紧接着人物或环境状态发生变化。于是我没有把所有要求重新写一遍,只追问一个问题:“让这十秒从头到尾连贯起来。”

(制作花絮)

*第一次生成在中段出现停顿;第二轮我只修正“十秒连续流畅”这一件事。*

这也让我意识到,修改提示词时最容易犯的错,是一次修五个问题。面部、动作、机位、光线和背景同时重写,等于让模型重新理解整条视频;即使问题被修好,也很难知道是哪一句起了作用。

我现在更愿意把每轮生成当成一次小实验:

> 第一版看整体方向;第二版只修最明显的问题。

例如,草原骑手需要处理人和马的大幅位移,本身就比静态肖像更难。生成失败时,最重要的不是继续增加形容词,而是重新确认主运动是什么,其他要求能否删减。

03|一个镜头,需要“动作预算”

图生视频里,十秒钟能稳定承载的动作其实很有限。我会把运动分成三层:人物运动、环境运动和摄影机运动。

三层如果同时很强,画面很容易失控。更稳妥的办法,是每个镜头只选一个主运动。

湖边僧人的主运动是环境:人物保持背影和位置,风吹动树叶、衣服和经幡,湖面出现细微变化,摄影机只留下站在原地的轻微手持感。

草原骑手的主运动是人物位移,摄影机和背景就应该更克制;夜间火堆的主运动是火焰,坐在后方的人只需要自然存在;藏族女性肖像里,人物的呼吸、眨眼与经幡的风动已经足够,不需要额外设计剧情。

我把它总结成一句很实用的话:

> *人物在动,镜头就少动;环境已经很丰富,人物就少表演。*

这不是为了让视频变得保守,而是把有限的生成能力放在最值得被看见的地方。

 04|有终点的动作,需要更强的控制

并非所有镜头都适合只写“自然地动起来”。玛尼堆的镜头有一个明确的动作结果:男人拿起一块石头,放到玛尼堆上,再自然垂下手臂。

(制作花絮)

“拿起—放下—垂手”有明确终点,因此需要比风吹、呼吸更强的动作约束。

这种动作同时涉及手、石头、身体重心和物体接触,难度远高于呼吸或风吹。我在提示词中必须明确保留原图信息、固定机位、不切镜,并把“石头最后放在哪里”说清楚。

如果使用的平台支持首尾帧,这类有明确落点的动作也更适合设置尾帧,帮助模型理解它最终要到达的状态。

但如果镜头只是凝视、呼吸、风吹、火焰或湖面涟漪,它本来就没有一个必须抵达的结尾。强行设定尾帧,模型反而可能为了“赶到终点”而加速、停顿或改变姿态。

所以我的判断标准是:

> 有明确动作结果,才考虑尾帧;开放式的观察镜头,让它自然结束。

 05|先建立人物,再让人物进入镜头

另一项明显影响稳定性的,是人物一致性。

“人物资产”这个说法可以成立;更准确地说,它是一套**角色设定或人物 Bible**。它不只是三视图,而是让模型持续认出“这是同一个人”的身份锚点。

在转经筒女性的实验里,我不只提供一张首帧,还加入了人物近景、正侧背参考、头部角度、转经筒结构以及不同场景中的人物状态。这些参考共同回答:她是谁,她穿什么,她手里的道具是什么,以及镜头换角度以后仍然应该如何保持一致。

(制作花絮)
已关注
关注
重播 分享
(青年妇女手持转经筒的“失败版本”)

“失败版本”中,镜头就出现了多次偏差与切换,因为我所给出的提示词过于冗长复杂导致理解上出现了偏差。

*参考资料的目的不是让画面更复杂,而是让换角度后的她仍然是同一个人。*

(人物三视图、法器三视图、环境视图)
(人物八视图)

但参考图也不是越多越好。前提是它们彼此一致、各自承担明确功能。相互矛盾的脸型、服装或光线,只会给模型更多错误答案。

我现在会优先准备:正面、侧面、背面、头部近景、完整服装、首饰与常用道具。若同一人物要出现在多个镜头里,还会固定年龄、体型、发型、服装层次和色彩。

场景也是一样。对于连续镜头,比传统“场景三视图”更有用的是一套环境锚点:全景建立镜头、主机位纯环境、反打方向,以及关键建筑和道具的位置关系。

人物回答“她是谁”,场景回答“她在哪里”,摄影规则回答“是谁在看她”。三者稳定以后,连续镜头才不会像每次都重新抽取一个世界。

 纪实感,不等于纪实证据

这些画面借用了纪录片的视觉语言,但它们不是发生在现实中的纪录片素材。发布它们时,我会明确标注 AI 生成。

我所感受到的“自由”和“信仰感”,也不应该靠把一种文化简化成遥远、神秘或原始的符号来制造。我觉得它打动人的,是人在风雪、劳作、自然与信仰之间呈现出的尺度关系。

AI 让画面越来越接近真实,也让我们更有必要追问:真实只是表面的像真,还是一种诚实的观看?当任何地点、人物和光线都可以被合成,创作者的价值也许不再只是“做出一张图”,而是决定如何观看、为什么选择,以及主动舍弃什么。

这也是 Synthetic Vision 想继续记录的内容:不只展示完成的画面,也保留失败、重试、犹豫和判断发生的过程。

如果你也在做图生视频,不妨在下一次输入提示词前先问自己一句:

“这个镜头真正需要动的,到底是什么?”

Synthetic Vision|合成视觉档案  

探索 AI 时代新的观看方式。

*本文画面均为 AI 生成影像实验,不代表真实人物或真实事件的纪录。*