夜雨聆风学习资料网

ARTICLE · 1077090

AI Skill 实战:不出镜、不剪辑,我用一张照片做出了一条口播讲解视频

AI Skill 实战:不出镜、不剪辑,我用一张照片做出了一条口播讲解视频

想分享自己的经验,却一直没开始拍视频。

要找时间录,要担心说错,还得剪掉停顿、配画面、加字幕。光想一遍,就觉得这件事很麻烦。

这次,我用自己的一段录音、一张照片,和 Codex 一起做出了讲解视频样片:有我的声音,有数字人讲解,也有跟着内容出现的动画和字幕。

我负责看效果、提修改,AI负责生成素材和写动画代码。

实际样片截图:数字人、内容画面与字幕组合展示。

但第一次做,确实来回改了很多次。声音有时不像我,人物没有在该出现的地方出现,画面也曾经只剩下几张单调的文字卡片。

今天把这个过程拆开讲。如果你也想做知识分享、经验讲解,可以看看我们是怎么一步步把它接起来的。

先准备三样东西:要讲的文案、自己的录音,以及一张清晰的人物照片。

文案怎么写,我们另开一篇。这篇先讲:有了文案,怎样把它做成视频。

先做声音,满意了再往下走

我用到的是 VoxCPM,你可以把它理解成一个能参考你的录音、生成配音的工具。

上传自己的录音,输入要讲的话,再听生成结果。实际试下来,这次声音克隆竟然没花钱。 可以先做十秒试听,确认方向合适,再继续做长稿。

当时使用的 VoxCPM 页面截图:左侧是参考音频,右侧是生成结果。

这里有个细节:声音听起来像自己,和说话的感觉像自己,是两回事。

有些段落声音还可以,但节奏偏慢;“第一步、第二步、第三步”这些地方,听起来又不太像我。后面还出现过读音不顺、英文词不适合直接念出来的问题。

所以,我们先把适合阅读的稿子,调整成适合朗读的稿子,再反复试听,最后确认了分成三段的配音,并稍微加快速度。

声音确认后,就把这一版固定下来。 后面做字幕、数字人和动画,都用它。否则配音一换,口型和画面节奏又得跟着改。

声音制作顺序示意:先试听,确认后固定主音轨。

人物出现多久,先看视频需要什么

数字人这一步,我也比较了不同方案。有的要考虑付费预算,有的需要更高的电脑配置。

我当时主要看三件事:花多少钱、效果合不合适、做起来省不省事。 几个方案各有优劣,简单放在一起看:

方案
优点
要考虑的地方
HeyGen
网页上就能做,省去本地安装
持续做视频,要考虑付费预算
LongCat
开源,可自己部署和调整
安装较折腾,还要考虑显卡成本
阿里云 EMO
这次口型效果满意,适合小头像、对画面尺寸要求不高的场景
如果人物要放大展示,需再检查清晰度和细节
通义万相(WAN)
除了说话,还能用提示词描述动作
这次生成的样片有脸部漂移,看起来不够稳定

后来我想清楚了一件事:我的视频主要是讲内容,观众需要看清楚步骤和演示。人物可以在开头展示效果,在一些段落缩成小头像,把大部分画面留给内容。

这也意味着,我不需要一个全程放大、连面部细节都特别清晰的数字人。小头像看着自然、口型跟得上,就能满足这条视频的需要。按这个需求来选,EMO 对我来说更有性价比。

所以,我用阿里云 EMO,把照片和对应的配音组合起来生成数字人。先做短样片,确认口型效果,再补需要的段落。

人物出场也要提前安排。比如口播说“先看几秒”,后面就应该真的展示一段数字人与动画配合的样片,让观众看到我们做出的效果。

动画不好看,要把要求说具体

画面和动画用的是 Remotion。简单说,它能把代码做成视频;写代码的工作交给 Codex,我提出画面要求,再看生成结果。

一开始,我说得最多的是“好看一点”“动效再明显一点”。改过几次,还是觉得单调。

后来,我把喜欢的参考视频和截图给它看,逐段拆:人物放在哪里,内容怎样出现,重点怎样被看见,再换成自己喜欢的雾紫配色。

最有效的反馈,是把一句话对应的画面说清楚。

同句示意对照①:只摆放文字。此图为专门制作的对照示意。

讲“一张照片、一段配音”,就让照片先出现,再让声音波形进来,最后展示生成的讲解视频。元素一个个出现,观众才看得清它们之间的关系。

同句示意对照②:加入照片、声音波形和连接关系。静态图展示布局,动画节奏需看视频。

讲“关键词放大”,那个词就要真的明显变大,留出能读清的时间。

讲“声音和人物保留,只改动画”,画面上就让声音和人物保持原位、出现确认标记,把变化集中到动画这一部分。

我后来反复核对的,就是:听到这一句时,画面有没有帮观众理解它?

先看短片,哪里不好就改哪里

只看截图,很容易觉得已经不错了。一播放,才发现字幕没有跟上、动画出现得太晚,或者人物挡住了文字。

所以,我们先看关键画面,再看带声音的短片,最后才渲染整条视频。

如果只是动画不满意,就保留已经确认的声音和人物,单独改画面。这样前面做好的部分不会跟着反复返工。

还有一个容易忽略的地方:中间插入一段演示,后面的字幕和人物出场都要跟着移动。我们把这些时间放进同一份剪辑表,让它们一起调整,减少到处手工改时间的麻烦。

生成完成之后,仍然要完整播放检查。字幕、口型、遮挡和声音,都需要实际看、实际听。

把做对的部分保存下来,下一条接着用

这次花时间的地方,除了生成视频,还有选工具、试听、看参考和改效果。

我把这些做法整理成了 Skill。你可以把它理解成写给 AI 的工作说明:拿到什么材料,先做什么,怎样判断做得好不好,哪些已经确认的东西要保留。

配音、人物、包装策划、动画制作和检查各有分工,封面也单独做成一个 Skill。

完整制作顺序:确认一部分,再进入下一步。

封面可以沿用同一套配色,但人物动作不用每次一样:指向标题、托住成果、展示电脑,或者向镜头伸手。根据这条视频要表达的内容,提供几种动作来对比。

下一条视频,就能从已确认的做法接着改。新文案更长,画面也要重新安排,不能把文字塞进原来的卡片、越缩越小。

第一次不用追求把整套流程都做完。你可以先选一小段自己熟悉的内容,生成一段配音,再配上一段简单演示。看完觉得“这确实是我想表达的”,再继续往下做。

我已经把视频生产的基础工作流开源了,里面有操作说明、时间轴工具和可运行的动画示例:

查看讲解视频工作流

它提供的是可以动手修改的起点。配音和数字人需要接入你选择的工具,生成效果也需要自己确认。

如果你也想试,可以留言“视频”,我把这套工作流 Skill 发送给你。也可以说说你最想用它讲什么内容。

相关学习资料