ARTICLE · 1058520
驯服 AI 视频的第一步,先在 3D 片场走一遍

有人企图驯服 AI 做视频,最后又破防了
以上视频来自 @刘幸运 老师,用幽默的方式,非常精准地说出了 AI 视频人的心里话。
视频里吐槽了 AI 做视频的很多痛点,比如多角色时身份容易串,多镜头时角色一致性难保持。特别是男二一出场,位置和动作全乱了。这一下戳中的,其实是 AI 视频最难搞的一件事,空间关系。谁站在哪、镜头从哪拍、人物怎么走。
prompt 写得再细,模型给你的结果总是差那么点意思。走位和调度这种东西,本来就不是靠文字能讲清楚的。
而真人拍片怎么解决这个问题?先搭片场,再定机位,然后排走位,演员们先简单过一遍,导演看了预演没问题,节奏对了才开机。
AI 视频一直缺的就是这一步。没有片场,没有预演,脑子里的镜头只能翻译成文字,再赌模型猜不猜得中。
直到我体验了 TapNow 支持预演的 3D 片场功能,这个问题终于有解了。
先看下我用 3D 片场最后跑出来的效果视频《交接》。
下面是 3D 片场导出来的镜头预演,一共四个摄像机,预演了四个镜头,基本把整个故事的镜头讲清楚了。蓝色人偶是父亲,粉红人偶是作为新娘的女儿,黄色人偶是新郎。
第一个摄像机放在新娘背后,拍新娘的背影走向新郎;第二个摄像机放在新郎背后,拍新娘正面走向新郎;第三个摄像机是新娘视角,拍新郎单膝下跪,拿出戒指;第四个摄像机是新郎视角,拍新娘喜极而泣。
接下来我会把完整的创作过程分享出来。
TapNow 3D 片场是什么
3D 片场是 CreativeOS 里的一个虚拟片场。

可以生成资产、搭建场景,还可以摆放角色、设定多机位,最终通过时间轴把走位整个预演一遍,再拿预演结果作为参考,用 SD 去生成视频,AI 视频的可控性直线拔高。
不需要掌握 Blender 这种专业 3D 软件,小白也能玩。

等于把真人拍片那套先排后拍的流程,搬进了 AI 视频创作里。
我拿它做了一场婚礼的戏。故事梗概大概是这样的。
父亲牵着女儿走红毯,走到中段停下,把女儿的手交到新郎手里,然后退后一步。新郎当着他的面单膝下跪,给新娘戴上戒指,新娘低头看着戒指,掉了眼泪。

整场戏没有一句台词,但这些演员的走位、动作、情绪已经传达得非常到位。这本身,胜过任何台词。
完整流程
前面提到《交接》的故事梗概,要完成整条视频,大概的节奏是这样的。

首先用下面的提示词生成人物、场景和道具。
场景提示词:一个室内婚礼仪式场地,纵向纵深构图。画面中央是一条长长的红色地毯,从画面前景一直延伸到远端。红毯两侧整齐摆放着简约的白色座椅,座椅之间留出宽敞通道。红毯远端是一个半圆形白色花艺拱门,花门上点缀白色玫瑰和绿色叶材,拱门后方是柔和的暖光背景。场地整体为暖色调,顶部柔和光线洒下,地面有轻微反光,空气中有淡淡的光晕。空间开阔庄重,仪式感强,没有人物。广角横构图,写实摄影风格,高清细节,电影质感,暖色调。生成四宫格图新郎提示词:一位28岁左右的亚洲年轻男性,新郎形象。短发干净利落,面容清爽端正,亚洲人脸型,神情温和带一点紧张期待。身材挺拔匀称。身穿深灰色合身西装,白色衬衫,深色领带,胸前别一朵白色胸花。全身像,自然站立,双手自然垂在身侧,目光看向前方,表情认真。纯色浅灰背景,柔和均匀布光,写实摄影风格,高清细节,电影质感。生成四宫格图新娘提示词:一位26岁左右的亚洲年轻女性,新娘形象。长发盘成低发髻,几缕碎发自然垂在脸侧,面容清秀温柔,亚洲人脸型,淡妆。身穿白色保守款婚纱,高领或小圆领设计,长袖或七分袖,裙摆简约垂坠不蓬夸张,面料有细腻质感,整体端庄不暴露。手捧一束白色和浅绿色小花束。全身像,自然站立,微微低头,表情平静中带一点羞涩和感动。纯色浅灰背景,柔和均匀布光,写实摄影风格,高清细节,电影质感。生成四宫格图父亲提示词:一位50岁左右的亚洲中年男性,父亲形象。短发,两鬓微微泛白,面容沉稳温和,眼角有细纹,眼神内敛克制。身材中等偏瘦,站姿挺拔但带一点这个年纪的迟重感。身穿深藏青色合身西装,白色衬衫,深色领带,西装剪裁传统正式。全身像,自然站立,双手自然垂在身侧,面部表情平静,嘴角没有明显笑意,眼神里有不舍但克制。纯色浅灰背景,柔和均匀布光,写实摄影风格,高清细节,电影质感。生成四宫格图钻戒提示词:一枚求婚钻戒,经典六爪镶嵌单钻款式,圆形明亮式切割主钻,钻石火彩闪耀,戒托为银白色铂金材质,戒臂纤细简约。戒指单独展示,约45度斜侧角度立在纯色浅背景上,柔和布光突出钻石通透感和金属光泽,微距特写,写实摄影风格,高清细节。手捧花提示词:一束新娘手捧花,圆形紧凑造型,以白色玫瑰、白色洋牡丹为主,搭配浅绿色桉树叶和少量满天星,花茎用白色缎带缠绕。花束单独展示,纯色浅背景,柔和布光,写实摄影风格,高清细节。

留心的小伙伴会发现,人物提示词结尾我都加了「四宫格」这几个字。这样一张图里就能直接生成四个效果,哪个好就截取哪一个。比如新娘的效果。

然后用 TapNow 的图片节点工具快速切分,把图片切成四张。

然后选最满意的一张,生成三视图。

用同样的方法处理场景和其他人物就可以。
然后从画布右侧的节点栏里,拖出一个 3D 节点。

生成 3D 场景图。

然后点击「预览」,进入 3D 场景看效果。

在 3D 场景里,可以用 WASD 控制前后左右移动,鼠标左键控制视角,QE 控制上下。确认没问题后,点击下方的「在 3D 片场中使用」。

就会自动生成一个 3D 片场节点。

进入片场之后,移动方法还是一样。来到红毯中间,点击鼠标右键,新建角色人偶。

人偶可以改变颜色、调整身高,还可以控制行走、调整姿势。
然后就是添加摄像机,摄像机决定你拍摄的角度。这里有个比较方便的办法,先把视角移动到合适位置,再点「当前视角添加」,省掉手动调整的麻烦。

摄像机放好之后,还能手动调整,也支持焦段控制,远景、中景、近景随意切换。
前文提过,我总共布置了四台摄像机,分别拍摄新娘的背后、正前和双侧视角。

摄像机架好以后,就可以排练演员走位了。这也是本文的重点,用时间轴功能预演人物走位。核心就是在时间线上添加关键帧,关键帧可以作用在人偶身上,也可以作用在道具上。
这里我以新娘的动态走位时间轴处理为例,先看下新娘的剧本

打开时间轴,先在初始位置打上一个关键帧,作为起点

然后在走到新郎面前时,再打上一个关键帧

接下来是跟新郎面对面

最终新郎单膝下跪时,新娘始终保持当前位置,也打上一个关键帧

最终新娘的时间轴动态走位效果预览如下
同样的操作分别是新娘父亲、还有新郎都在时间轴上排好走位即可。
然后就可以切到各个摄像机视角看动态走位预演效果了,比如这是摄像机 1 的动态走位预演
这是摄像机2的动态走位预演
等到预演没啥问题,就可以直接导出到画布。操作入口在「镜头管理」里的「导出到画布」。

导出后,每个镜头预演都是长镜头,需要裁剪,比如第一个摄像机的背影视角只需要 2 秒,正面镜头需要 2 秒,单膝下跪需要 3 秒。TapNow贴心的内置了时间线功能,可以直接进行剪辑。 要注意,最短不能低于 1.8 秒,否则不能作为 SD 的参考视频。

接下来交给 TapNow CreativeOS 的 Agent 接手后面的活儿。点击屏幕右下角的 Agent 按钮。

然后选择最新的 6 Astra 作为智能大脑,同时选择头脑风暴模式,帮我们完善分镜。

详细说明故事梗概、镜头预演和角色道具,并指定 SD 2.5 作为最后的视频生成工具。

Agent 在头脑风暴模式下,会补全我没考虑到的细节,并让我确认。

然后规划分镜。

接下来有个比较有意思的点,Agent 会主动降低分辨率生成样片,帮我省积分。

视频提示词也可以二次调整。

最终令我震撼的事情发生了,样片一次通过。继续让 Agent 生成其他视频,也是一次通过。

由于视频本身是 480p,画质太低,我又用视频工具做了画质增强,把画质提到了 2K。

视频有了,但背景音乐还没找到合适的。于是我继续让 TapNow Agent 帮我生成音频。

生成效果也非常不错。最后把三个视频和背景音乐简单剪辑一下,整支短片就做好了。再回顾一下这条短片。
写在最后
做完这支片子,我一个很深的感受是,以前我老想着驯服 AI。prompt 写得越来越长,抽卡抽得越来越狠,好像只要我足够虔诚,模型总能被我感动。
现在想想,方向就错了。你不需要驯服它,你需要的是先自己想清楚。想清楚谁站在哪,镜头从哪拍,人往哪走,在片场里先走一遍,走对了,再让它照着演。
它补上的,就是从想到画之间,一直缺的那层排练。
以后模型还会越来越强,我反而没那么焦虑了。导演脑子里的那部分,工具替你想不了,也抢不走。
片场和预演我传到 TapTV 了,里面还有更多大神无私分享的画布,全部都可以一键拆解创作思路。想拆、想复刻的,评论区有入口,自己去走一遍。
