ARTICLE · 1088938
AI 视频工具能把长片连起来了,最难的到底是哪一环?
单段生成的门槛早就过去了,卡点在跨镜头一致性
我盯这个方向有一段时间了。工具的比稿重点明显变了,前两年大家比的是单张画面漂不漂亮,现在比的是几个镜头能不能接成一条。我关心这件事的理由很直接,单段生成在演示里早就过关了,随手写一句话都能出来几秒钟的好画面;可我需要交出去的是一条几分钟的片子,几十个镜头连着放,麻烦就从画面里面跑到了画面之间。
差在哪儿,我拿自己那条片子对照过。人物的脸、当时的光线、所处的场景,只要跨过镜头就得重新对一次。同一张脸在第一段里是圆下巴,到第四段成了尖下巴,单看每一段都挑不出毛病,连起来看就像换了个人。所以在我这儿,这种长片先是个可控性的问题,画质反倒排在后面。
角色表这一步,是在给模型补记忆
这类流程里基本都带一个角色表环节。做法是把每个角色的五官特征、发型、衣服颜色和款式写成一段固定文字,之后每生成一个镜头,就把这段文字原样带进去。想让模型自己回忆上一段里那个人长什么样,基本靠不住。这一步看着像创作准备,其实是补丁:单次生成里没有跨镜头的记忆,角色表就是把这份记忆搬到外面,用一张清单替它记住。
角色表还能先批量生成,再把每个角色的名字固定下来,后面每一步都对着名字调用。一致性指望不上模型的记性,靠的是一份放在外面、每次都要带上的清单。我在这类流程里最费神的地方是核对,每生成一张都得回头确认清单有没有带全,想画面反倒是轻松的。这一步省不得,省一次就要重做一段。
首尾帧接龙,补的是镜头之间的连续性
另一个补丁是首尾帧接龙。把上一段画面的尾帧留下来,当作下一段的首帧送进去,两段之间的色调、构图、人物朝向就顺着走,动起来才像同一个镜头在继续。这一步跳过去会怎样,我试过:画面会出现一种说不清的漂移,前一段人从左边走到右边,后一段又走回左边来。
看得多了我有个体会,一个镜头假不假,观众很少盯着单帧的精细度看,他们看的是相邻两帧有没有连续的变化。这套做法说白了就是拿上一段的结果去约束下一段的起点,把创作的自由度按段锁住。锁得越紧,参数上未必好看,能用的片段反而越多。
分段生成背后是额度与算力的硬边界
长片必须拆着做,我看到两个原因。一头在工具那边:这类流程一次只给十条画面提示词,想要更多就得再催一轮,接着要下一批十条。我试过让它一口气把整条片子的提示词全吐出来,结果是提示词之间开始串味,同一个动作在好几张里反复出现,节奏也散。分成几批要,前后反而顺,这个取舍谈不上漂亮,但它管用。
另一头是额度。图片那类生成量大,单张成本低;视频那类每天有固定上限,用完了只能等第二天。所以常见的做法是整条片子以静帧为主,只在开头拿一小段真会动的画面把人拉住,比如前面四五张图转成视频,每条十秒上下,凑出接近一分钟的活动画面。每天具体的额度数字我见过好几种说法,我没找到确切说法,只能按当天看到的来安排先做哪几张。
废片率决定这条链上的真实成本
我以前算成本,只算单条生成要占掉多少额度,做完一条长片才知道这么算不对。真正决定成本的是废片率,也就是十条里能用几条。一致性出问题的、光线不对的、旁白和画面对不上的,全都要重做,重做又要重新占额度。
所以额度消耗和成片时长不是一条直线。片子越长,要拼的镜头越多,对齐的活越重,废掉的也越多。我那条五分钟的片子一共十八张图,里面只有两个角色,已经算省事的了;角色再多一点,手工核对就跟不上。我后来养成的习惯是动手之前先把返工的时间留出来,不留就等于把风险攒到交片那天。
能连起来比单帧好看更值钱
我现在的挑图标准跟刚上手的时候正好相反。那会儿我先看画面好不好看,现在我先看它接不接得上前面那张。有一张单看很漂亮,就是光线跟前一段差了一档,我犹豫了半天还是换掉了。流程里还有个固定设定,每张图在成片里停留多久是写进提示词的,比如十五秒一张,十八张正好拼够五分钟。这个设定一摆出来,单张画面能分到的注意力就被时间摊薄了。
观看这件事本来就是连续的。观众不会为一帧停下来,却会因为一处跳跃出戏。旁白说到哪件事,画面里就得让人看见哪件事,有一回我念到下雨,画面里却是大晴天,自己回放的时候都停了一下。画面撑不满的时候,常见的处理是把那张图在时间线上拉长,让它慢慢放大一直顶到旁白念完,听上去像凑时间,观感反而比频繁切图顺。这几件事凑在一起,我的顺序就定死了:先管连得上,再管好不好看。
这套流程在重分拍摄与剪辑的活
从分工上看,这条链先吃掉的是那些必须拍到、又拍不出花的镜头:过场、空镜、氛围画面、讲述里的配图。这类活以前要出外景、约人、等天气,现在坐下来就能生成,对预算有限的人来说,这是实打实省下的一块前期。
但它吃不掉另一块。真实人物的表情、手部动作、复杂运动,还有精确到某一秒的现场感,这些还是拍摄的强项;生成出来的画面更像够用的讲述配图,分量有限。剪辑那边也在变,以前最难的是从一堆拍好的镜头里挑出能连上的,现在最难的是把生成的碎片排成不跳的顺序,还要保证旁白每一句都有画面接着。工序没少,只是从找画面变成了保住连续。所以两种说法我都认:说生成式会吃掉一部分前期拍摄,站得住;说专业拍摄替代不了,也站得住,被顶掉的主要是覆盖率,精度那一层还动不了。



我不打算把这件事说成以后不用拍片子了。照我说,这条链眼下解决的是可控性,创作力那部分还轮不到它。单段生成早就不难,难的是几十个镜头连起来还认得出是同一个人、同一处光、同一个场景,眼下的答法是拿一整套外部流程,去补模型缺的那一环。它替代的是一部分必须拍到的工作,替代不了决定要说什么的工作。谁在这条链上更划得来,取决于谁更会给约束:约束写得越死,废片率越低,成本才真的降下来。
画面归模型生成,能不能站得住归流程。一段好看算本事,一段接一段都不跳,才是能交出去的东西。
如果你也在琢磨这类长片,先别急着羡慕别人做得顺,先问问自己能不能给每个角色写出一份不动的清单。你在这条链上最头疼的是哪一环,是角色中途变脸,还是画面接不上,评论区一起聊聊。
这条链我还会继续拆下去:角色表怎么定得住、废片率怎么压下去,后面一篇篇写清楚。想跟着一起琢磨的,点个关注,公众号:Sider,这类机制拆解我接着写。
|来源:互联网|编辑排版:小四|说明:本文由Sider整理创作,转载请注明来源
免责声明:本文仅供学习交流参考,不构成医疗、投资、法律等专业建议,亦不代表本公众号立场。部分文字、图片、音视频来源于网络,版权归原作者所有,如涉侵权请及时联系,我们将第一时间删除。读者据此操作风险自担,本公众号不承担相关责任;留言评论仅代表发布者个人观点。特此声明。