乐于分享
好东西不私藏

第一次AI短视频实践,明白关键工作都在“生成”之前

第一次AI短视频实践,明白关键工作都在“生成”之前

本文1653字,阅读时间约4.5分钟

前两天,我第一次完整实践了一遍AI短视频。

没有想做精品,也没有指望它获得多少播放量。我的目标很简单:先做出一条哪怕破破烂烂、但可以正式发布的作品。因为只有真的做出一个东西,我才会被迫经历完整流程,碰到真实问题,而不是一直站在外面看教程。

最后,我用一段和媳妇做红烧肉的生活记录,做成了一条大约20秒的猫咪剧情短视频,并发布到了视频号和抖音。

已关注
关注
重播 分享

做之前,我以为AI短视频大概是这样的:把文案交给模型,它理解故事以后,自动补充人物、场景和动作,很快就能生成一条相对完整的视频。

真正做完以后,我才发现:视频根本不是在点击“生成视频”的时候才开始产生的。

20秒视频前面,藏着一条生产链

我的实际流程大概是:

项目设定 → 可拍剧本 → 分镜清单 → 人物与场景设定 → 资产图 → 静态分镜 → Seedance 2.0提示词 → 生成视频 → 剪辑发布。

原始素材只是一段生活记录。ChatGPT先把它整理成旁白脚本,我觉得旁白太完整,反而没有我喜欢的感觉,于是又改成两只猫只发出简单语气声,正式对白通过字幕表达。

接下来还要确定两只猫的形象、身材比例和表演特点,生成厨房场景、空间布局和关键道具,再为每个镜头制作静态分镜。

角色比例图、场景图、空间布局图和道具资产图

这些图不是为了好看,而是让模型知道:两只猫分别长什么样,谁高谁矮,厨房是什么结构,角色站在哪里,手里拿的东西究竟是什么。

静态分镜完成以后,我才把需要的角色、场景和镜头放进即梦画布,分成原始参考区、正式角色区、场景区、静态分镜区和当前任务包,再交给Seedance 2.0生成动态视频。

静态分镜图

即梦上的画布工作区

过去作为观众,我只会判断一条视频好不好看。开始生产以后,才会注意角色比例会不会变化、衣服是否连续、人物站位是否奇怪、空间关系能不能接上,以及一个镜头到底承担什么任务。

这就是实践带来的认知颗粒度。

一个“衣架”引发的返工

这次最具体的返工,来自一个很小的词。

故事里需要的是普通的黑色三角衣架,但我最开始写成了“晾衣杆”。模型非常诚实地生成了一根长杆。

问题是,在资产图生成以后,我没有认真检查;静态分镜完成以后,我还是没有认真检查。直到动态视频生成出来,我才发现这根杆子完全不对。

于是我只能回到前面的步骤,重新制作道具图,修改相关的三张分镜,再补拍对应的5—6秒镜头。

左侧是修改前,右侧是修改后

这件事让我意识到,AI当然可以不断提出方案、批量生图和继续执行,但它不知道我脑子里的“常识”是什么。我说晾衣杆,它就按照晾衣杆理解;我没有发现错误,它也不会主动停下来问我。

如果资产阶段的错误没有被拦住,它就会进入分镜;分镜没有被拦住,它又会进入视频。到最后,AI只是让错误动了起来。

所以合理的流程不应该是:

AI提案 → AI执行 → AI继续执行 → 最后人看结果。

而应该是:

AI提案 → 人判断 → AI执行 → 人验收。

剧本、资产、分镜和生成任务包,都应该有明确的人工检查点。

好视频不是在生成视频时才产生的

这条视频最终在Seedance 2.0里生成了4次:15秒主片生成两次,补拍镜头一次,结尾一次,共消耗574积分。

积分不是这次实践最重要的成本,但它让我明显感觉到:图片阶段的返工相对便宜,进入视频阶段以后,每一次错误都会变得更贵。

真正稳妥的方法,不是不断抽卡,希望模型偶然生成一条完美视频,而是在生成之前,尽量用成本更低的图片把人物、场景、道具和分镜确认清楚。

如果一组静态画面已经能够讲清楚故事,视频模型只需要让它动起来;如果静态分镜本身都不成立,模型能力再强,也只是把模糊放大。

所以我现在认为,一条好的AI视频,在点击“生成”之前,可能已经完成了一大半。

第一次实践留下的,不只是一条视频

从周五晚上开始,到周六傍晚发布,我是想到就做一会儿,中间也在处理其他事情。真正由我操作、判断和调整的时间,大约两个小时,更多时间是Codex批量生成人物、道具和分镜图,以及等待视频结果。

但这次实践留下的东西很多。

我已经知道一条剧情短视频需要经过哪些环节,知道怎样管理参考图和资产,第一次使用了即梦画布,也知道了字幕、对白和背景音乐不一定要交给视频模型,可以留到剪映中处理。

更重要的是,我从一个观看AI视频的人,变成了一个开始知道“它为什么是这样”的生产者。

我认为未来个体创作者,不能想着和别人拼团队、预算和生成次数。大家都做同样的题材和画风,最后很容易变成谁的积分更多,谁就能多抽几次。

个人真正能形成差异的,可能还是自己的生活、感受和表达。对我来说,或许是日常生活的小事,是普通人的一些安静时刻,是一段音乐、几幅画面,再加上一句自己真正想说的话。

第一次实践的意义,不是证明自己已经会了。

而是让一个原来模糊的世界,开始出现颗粒。

(全文完)