
目录
视频生成
视频生成工具介绍
视频生成模式
Seedance 2.0的全能参考模式使用技巧
分镜优化
分镜图的意义
出图改图工具推荐
分镜出图技巧实战
优化分镜与画面补救
声音设计
音乐
音效
配音(非必需)
由于工具众多,无法一一详细介绍。针对当下 AI 仿真人短剧,我们从综合生成效果以及使用门槛这两个维度出发,着重为大家介绍 Seedance 2.0 模型。
一)视频生成工具介绍
聚合平台 —— LibTV
双击画布,就能创建视频节点。在此处的模型选择栏中,大家可以看到众多视频模型。要是模型众多,让你感到眼花缭乱,那么重点关注Seedance系列(字节出品)和kling系列(快手旗下可灵出品)即可。
核心优势:除了可以使用满血版Seedance 2.0外,还能使用众多其他视频模型。对真人没有限制。


各视频模型平台官网
即梦 (Seedance 2.0):上限极高的“一键成片”神器
核心优势:Seedance 2.0 的官方使用平台。
局限与痛点:若不使用VIP模式,算力压力大,高峰期排队时间极其漫长,但VIP模式价格较贵。平台底层的安全协议对真人写实风格的影片制作限制极其严格,很容易触发肖像或动作审核拦截。
可灵:画质与稳定性并存的“六边形战士”
核心优势: 在生视频的综合效果方面非常扎实。在即梦推出 Seedance 2.0 之前,是闭源模型中的绝对首选。它拥有极其清晰、稳定的画质,支持原生4k分辨率视频。
局限与痛点: 对于难度极大的大动态动作或极限运镜,表现较为一般。它不像 Seedance 那么无脑听话,非常考验创作者自身的视听语言拆解能力和提示词精准度。人物台词的精准度时好时坏,10秒以上的长素材抽卡率较高。最新的视频 3.0 和 3.0 Omni 模型较为昂贵,试错成本较高。
二)视频生成模式
AI视频有三大使用模式,文生视频、图生视频及参考生视频(全能参考/图片参考)。

鉴于Seedance 2.0的全能参考模式在AI仿真人短剧创作中展现出强大效能,我们在此着重介绍该模式下制作AI仿真人短剧的使用方法。
三)Seedance 2.0的全能参考模式使用技巧
现在写提示词的方法非常多,没有所谓的标准提示词,如果要做完整剧情的短剧,推荐如下方式。
(推荐)复杂调度片段:资产+分镜提示词
如果你本身就是导演,或者具备一定的视听语言基础,对这十几秒片段内部的机位调度、景别切换有非常精细化的要求(比如:必须先给手指特写,然后切到面部近景,最后切到双人全景等),光靠喂剧本让 AI 自由发挥就不够了。
在当下快节奏的 AI 短剧工作流环境中,若要提升产能,不太可能全流程一个个先出图分镜图,再图生视频,而是要学会将剧本转化成能够指导模型更精准生成视频的分镜提示词,具体写几秒到几秒的内容。
提示词公式:
起手式(固定角色、场景、声音及负面提示词、空间位置关系描述)+ 分镜提示词
上传角色、场景、音频等文件,这里要是深入学习的话可以展开很多,篇幅原因暂时不展开了,大家可以关注我们文末微信小店的课程。
注:若事先准备好角色位置关系图,并提供给Seedance2.0作为参考,那么便无需再对空间关系进行描述。
针对每个角色的首场戏,我们无需上传音色作为参考。待AI生成视频后,再从中提取该角色的声音。如此一来,制作下一个视频时,就能够上传此音频加以使用了,后面会有详细演示。
分镜提示词:初版分镜提示词可借助下列的提示词模版来撰写。
注:生成的视频分镜提示词仅为初版,需要根据跑视频生成的效果进行人工手动修改。
获取声音资产
将生成的视频导入到剪映中,找到对应角色说话的区域,快捷键I为设置起始位置,O为设置终点位置。
将不同角色说话的片段选中,建议不超过5秒钟。
随后导出音频作为角色的音色资产。之后用seedance 2.0生成视频就可以反复调用对应角色的声音资产作为音频参考了。


素材衔接技巧
短剧是由多个片段拼成的,如果每次生成的素材光影、站位差异太大,后期就很难接上。
1) 抽帧接力
将上一个视频生成的最后一帧截图,作为下一个视频生成的首帧参考图上传。这样能最大程度保证两个镜头的机位、光线和人物姿态在剪辑时能够无缝衔接。
如果是在libtv里生成的视频素材,鼠标悬停在视频上,右下角有个相机图标,可以截取首帧或者尾帧。



提取A段素材的尾帧
也可以把视频素材下载下来,导入到剪映或其他任意剪辑软件中去提取:

再继续做下一段素材的提示词的时候,写上:@图片X作为首帧

A段素材的尾帧作为B段素材的首帧
2) 延长视频
还可以上传上一个片段,接着在提示词中要求模型延长视频。如此,模型便能直接参照上一段视频的尾帧,同时还能借鉴上一段视频所使用的声音,这样就不需要像前面那样事先提取声音作为音色参考了。
鉴于目前平台针对真实人脸的限制,这种方法在即梦或者其他平台已几乎无法继续使用。但在libtv中,依旧只需要按照上节课介绍的方法,将需要延长的视频素材,进行seedance 2.0合规校验,通过审查后即可完成后续的操作。


只需要在提示词开头写上:将@视频延长XX秒。
但实测下来,抽卡率有点高,效果没有提取上一段视频的尾帧那样稳,音色的还原也比较一般。

除上述两种方法外,各素材间的衔接还涉及镜头组接的几大基本原则。这些需要我们在实战中积累,进阶课会详细讲解这方面的内容。
即梦等平台真人审核限制
如果使用libtv的seedance 2.0模型创作的小伙伴,下面这部分内容可以不看了。
对于使用即梦等其他平台的seedance 2.0模型的小伙伴来说,在上传参考图时,目前即梦平台针对真人照片和面孔会设置限制,拦截极度写实的真人照片或明星面孔。如果你的剧本就是想用某个特定真人的长相特征,直接上传原图大概率会面临生成失败或违规提示。

但制作AI仿真人短剧又绝对绕不开真人写实风格的角色资产的。下面教大家几个提高成功率的方法。
a. 局部面部转绘 (脸部轮廓可能改变)
利用即梦/香蕉等图片模型,对图片的面部进行重绘。
提示词:仅将皮肤区域(面部)转绘为彩色素描效果,其他包括服装、发型颜色等一切不改变。

这样能在保留人物骨相和核心特征的同时,让脸部恰好低于系统对“绝对真实照片”的判定阈值。此方法成功率近乎百分之百,并且仅对脸部进行重绘,衣服细节仍能保持较高的还原度。不过,其不足之处在于,生成视频素材时,脸部相似度会稍有降低。
b. 平台站内洗图 (需要多次尝试)
这是一个非常实用且巧妙的过审技巧,核心逻辑是让平台信任自家产出的数据。
将你准备好的高写实人物三视图,先上传到即梦的图像生成模块中进行一次轻微的修改,或者直接通过提示词让即梦在图片的角落生成一行字:“此人物由AI生成”。
修改完成后,直接在即梦工作台里将这张图拖入视频生成模块中引用。这一步必须在即梦平台内部完成! 平台系统有概率会将其识别为自家 AI 生成的合法原生资产。千万不要耍小聪明在本地用 PS 加上这句话再上传,这种是无效的。

这种方法的优势在于,角色脸部能得到更好的还原,但仍存在生成失败的可能性。一次生成四张图后,依次将它们拖入下方的视频生成模块作为参考图,逐一尝试,通常会有一张可用。
比如前面图生视频的时候我们选取的那个男主和女主对坐的场景图作为案例,在右上角添加文字后,实测只有第三张图能绕过审查。

c. 脸部加网格 (脸部网格需要多次抽卡)
对于四视图的角色图(特写+三视),主要限制人脸的就是左边的特写,要么不出四视图,只出三视图,不要左边的特写了,基本都能成功,但这样生成的视频一旦切到人物的近景就容易变成即梦脸。
为了解决这个问题,只需要将左边的脸部特写处理一下,增加一个网格,这样既能保证基本的脸部轮廓,又能做一些遮挡处理,成功率百分之70左右。最好用Nano Banana 2来改图(使用方法见后一章),即梦改图脸会变,提示词如下:
香蕉多出几张图,多次尝试,有时候脸上的网格如果太稀疏了,容易失败。

d. 脸部特写遮挡 (效果不错)
基本,如果只有三视图(不包含脸部特写)是基本不会触发平台的人脸审核限制的。问题的关键就在四视图里的脸部特写。但如果不放脸部特写,只保留三视图,做视频的时候一旦切近景,很可能就会变成“即梦脸”。
于是我们可以在PS或者其他作图工具中,按照如下所示,画一个小方框遮住脸部的一侧区域,这样基本就能通过审核了。跑视频的时候,由于只遮住了一小半区域,AI是能通过另一半脸脑补出完整脸部长相的。

e. 多角色生成失败
对于多角色的视频素材,不要一上来就像下面这样把几个角色全部参考,然后去跑15秒的视频。

一定要一个角色一个角色地利用如上的两种方法去尝试,让角色分别去跑4秒钟的视频,要确保每个角色图都能通过审核之后,再去将多角色合到一起来生成长素材。
Seedance 2.0 原生字幕消除
使用Seedance 2.0制作竖屏短剧时,常常会不受控制地生成大量原生字幕。这些字幕往往带有诸多乱码,而且每段字幕的格式也不尽相同。此类字幕必须去除,因为甲方肯定不会接受,需将其去除后,在后期利用剪辑软件自行添加字幕。

1)剪映AI消除
推荐用剪映里的AI消除功能,选择智能选取,找到素材里字幕最长的那一帧,涂抹一下,会自动识别字幕,随后点消除即可。这种方式需要消耗剪映会员的积分,但是方便,可以直接在剪辑软件里操作,不用来回折腾,而且效果较好。


2)Libtv智能去字幕

可以选择智能擦除或者框选擦除两种模式。
智能擦除就是让AI自动识别字幕,并一键去除,速度较慢。

在框选擦除模式中,挑选字幕最长的那一行,手动框选字幕所在区域。随后,AI会对该区域进行整体擦除。这种方式速度相对较快。

一)分镜图的意义
在以前的“手搓流”时代,分镜图的意义大于一切,它的好坏直接决定了视频的整体节奏、画面审美和连贯性。分镜师需要精心规划景别、构图与拍摄角度,还得将连贯的复杂动作,细致拆解为一个个极为精细的画面。
但现在,随着 Seedance 2.0等原生视频大模型的横空出世,只要给足剧本提示词和资产,它们就能直出十多秒、包含多机位切换的完整素材。
但这也不意味着出图能力一点都不需要了。目前,分镜图的意义,已经从流水线铺路变成了精准的外科手术,主要用于解决以下三大痛点:
1.降低视频抽卡率: 对于极其复杂的极限镜头,先生成一张精准的静态分镜图,再去跑图生视频,能极大提高成功率。
2.残次镜头的兜底补救: 动辄十几秒的长素材局部崩坏(如最后几秒脸崩了),通过“抽帧 ➡️ 改图 ➡️ 重新图生视频”来优化。
3.空镜头与情绪定格: 解决视频大模型难以直出的绝美静物特写和情绪空镜头(如雨滴特写、信件特写、人物落泪定格)。
二)出图改图工具推荐
玩 AI 绘画的朋友都知道,前两年我们出图的主力是 Midjourney 和 Stable Diffusion。
Midjourney 审美虽好,但需要科学上网、付费门槛高、且对中文与中国东方元素的理解经常带有“刻板印象”;而 Stable Diffusion WebUI 以及 ComfyUI 工作流,尽管开源免费,对画面的控制力也较强,但对于新手而言,具有一定门槛,调试过程繁琐,在当下短剧快节奏的商业化生产流程中,容易拖慢进度。
在我们的短剧视觉生产流程里,出图平台众多。从模型自身特性考虑,我们推荐使用以下模型:
Nano Banana 系列(Nano Banana 2 和 Nano Banana pro)
GPT Image 2
Seedream系列(即梦/豆包图片模型)
🌟推荐使用平台:LibTV(无需魔法)
接入了大量的图片、视频模型工具。
其中的Lib Nano系列模型就相当于Nano Banana系列模型,Lib Image模型相当于GPT Image 2模型。

三)分镜出图技巧实战
标准出图提示词公式
在制作真人写实短剧时,AI文生图的基本提示词可参照下面这个公式:
【艺术风格/媒介】+【景别与视角】+【主体描述】+【环境场景】+【光影与色调】+【画质与质感修饰词】
当然,提示词的写法与格式绝非仅有这一种。在学习 AI 绘画的过程中,大家能探索出形形色色的提示词写法。但无论形式如何变化,本质始终如一。想生成契合自身需求的图片,关键在于抓住核心要点。坦率地讲,在提示词公式里,只有主体描述与环境场景最关键,其余要素都只是辅助模型更好遵循指令的锦上添花。
例如【完整提示词】:
王家卫电影质感,真人影视剧照。近景特写,45度侧拍。一名30岁的冷峻男子,面容硬朗,穿着黑色定制西装,微微低头,右手把玩着一枚银色打火机。背景是奢华的极简风总裁办公室,落地窗外有模糊的都市夜景。伦勃朗光,冷色调为主,打火机火苗提供暖色补光。真实的皮肤毛孔纹理,浅景深,胶片颗粒感。

多资产融合生图(参考图 + 提示词)
在确立了角色和场景资产后,需要利用 Nano Banana 2 ,通过“参考图+提示词”来实现特定画面的精准合成。这种方式也被称为“参考生图”。
参考生图的提示词,基本骨架和前面的文生图标准提示词公式是一样的。 可以灵活处理:
•简单写法: 可以只写一句话的主体描述,比如“把图1的男人放到图2的场景里抽烟”。但这种写法极其随机,景别、光影和构图完全凭 AI 的喜好盲猜。
•标准写法(推荐): 继续套用我们的黄金公式 (风格)+(景别)+(主体描述) + (环境) + (光影) + (质感)。只需要在“主体描述”和“环境场景”这两个环节,明确指出“谁(图X)在哪个场景(图Y)里,拿着什么东西(图Z)”即可。
1)实战案例一:角色与场景的融合

图1 男主角

图2 深夜跨海大桥
电影级大片截图,中景镜头(腰部以上构图),侧面拍摄,请将图1中的男主角无缝置入图2的深夜跨海大桥场景中,他正靠在桥边栏杆上抽烟,神情疲惫。霓虹冷色调,桥面的粉蓝色灯光自然映射在男主的侧脸和风衣上。
大家能看出不同模型效果的差别吗?

Nano Banana 2 出图效果

GPT Image 2 出图效果

Seedream 5.0 Lite出图效果
2)实战案例二:短剧封面的制作
GPT Image 2在制作封面方面极具优势。它拥有强大的文字渲染能力,仅需简单指令,无需复杂的提示词,就能生成设计感十足的文字,进而创作出非常出色的封面、海报、手册、说明等各类图片。GPT Image 2的表现堪称惊艳,着实可称作一大奇迹。
生成一张古装短剧的封面,剧名为“重生之这满门白眼狼我不养了”,图1的女主角要站在中心位置。一共只有四个人。


分镜头脚本提示词模板
如果希望能够按照传统的手搓分镜的手段来做片(将所有剧本拆解为一个个分镜,将每张分镜图提前生成,再图生视频),也可以借助下列的提示词模版来生成初版分镜。之后再进行人工优化。
注意:在提示词规则部分,需要手动调整为自己所要制作影片的风格以及出图比例。
四)优化分镜与画面补救
图片快速裂变
如果在同一张图上反复进行多次重绘,会产生严重的编解码磨损,导致底图的锐度下降,逐渐出现涂抹感或噪点。直白的说,就是图会越改越糊。
如果不让模型改图,而是让它们从现有的图片中提取特征,再据此进行二次参考生图,这样得到的图画质基本不会受损。通过这种方式,不仅能够规避画质受损的风险,还能通过一张高质量底图,瞬间裂变出无数张符合剧情要求的新分镜。
具体的玩法如下:
1)多视角转换
获得满意的单张人物图后,利用Nano Banana 2(Libtv里面叫做Lib Navo 2)模型, 并输入:“基于此图,生成XX视角/XX景别”
生成女人的脸部特写,动作、视线的方向保持不变。


如果切换的角度与原图差异过大,例如切换成女人看向窗外的镜头,那就要描述清楚窗外有什么了。
生成过肩镜头,前景的右边缘是女人的肩膀,前景模糊,聚焦在女人看向的窗外,窗外是公园。


当然,我们也可以用 Nano Banana 2/GPT Image 2 批量生成九宫格的不同角度的组图,然后再提取想要的图。
根据这张图,生成画面中女人的不同视角、景别的图,女人的姿势和动作要保持不变,3*3九宫格,16:9的出图比例,左上角要有清晰的数字序号标注。


提取第2张图,然后放大,左上角的数字水印去除。16:9的比例。


2)LibTV多角度
还可以通过LibTV、lovart、Tapnow中内置的角度调整节点来一键调整图片角度。
上传一张需要调整角度

选择多角度编辑器
包含鱼眼视角、倾斜视角、正面俯拍、正面仰拍、全景俯拍、背面视角等六种预设角度,当然还可以自定义调整角度。一张图只需要一积分,效果很不错。


3)精准控制的关键:角色站位图
对于相对复杂的室内场景,最好提前生成人物的位置关系图作为参考。
像下面这张全景图,空间关系一目了然,甚至都不需要上传其他的场景参考图了。

角色位置关系图
如何生精准生成类似如下角色的站位图呢?

这里展开会比较多内容,第五期实战营里面会具体讲解,另外可以参考我们这篇文章,结合LibTV里面的3D导演台:我用 LibTV 搭了个 3D 片场,完美解决 AI 视频多人构图与多视角问题!
4)视频抽帧修改🌟
当长视频素材出现局部变形时,可在剪辑软件中抽取崩坏前最后一帧完美的画面保存为图片。
将该图片利用GPT image 2/Nano Banana,结合提示词生成下一个连贯的动作画面。随后,以此图作为首帧参考,回到视频模型中重新生成后半段视频,最后在剪辑软件中进行拼接。
通过Nano Banana 2/ GPT Image 2,输入提示词:“将男人手握着的物件去掉,手指向前方,其余不变。”

提取有缺陷的图

优化后的图
对于这种很短的视频素材,动作和运镜也不复杂,可以不必使用Seedance 2.0模型,可以使用kling o3模型的首尾帧功能,同样支持声画同出,效果也完全够用。

即梦的Seedance 2.0模型最低生成时间是4秒,而Seedance 1.5 pro模型的最低生成时间为5秒。因为这个动作很简单,只是两个固定镜头的衔接,且台词极为简短,通常 2-3 秒就已足够。
可灵视频 3.0 Omni (kling o3) 模型最短能生成 3 秒的内容,Vidu Q3 更是最短可生成 1 秒,所以,从时间适配角度考虑,也可选用 Vidu 或者可灵。
即梦3.5pro
Vidu Q3
目前主流的AI视频模型,例如seedance 2.0、可灵3.0、Vidu 3.0、Wan 2.7、HappyHorse 1.0 等都支持音画同出功能,即我们可以通过提示词直出画面+音乐+音效+配音。
这种直出的效果肯定是非常适配的,混音技巧方面比大多数普通人做的专业,而配音这一块也配得情绪爆满、严丝合缝,省去我们后期对嘴型的过程,这对于AI仿真人短剧来说,大大降低了AI感。
但如果想要做一集完整的AI仿真人短剧/AI漫剧,光靠视频模型直出是不行的。许多时候我们还是需要借助传统的后期音乐、音效、配音手段来补足。
一)音乐
AI短剧中的音乐应用
短剧的特殊性: 传统真人电视剧一集40分钟,有完整的OST结构。而许多AI短剧通常是竖屏短视频逻辑,单集时长1-3分钟,节奏极快。因此他们的音乐通常具有以下特点:
•去OP/ED化: 短剧很少有长篇大论的片头片尾,通常直接进剧情。
•功能性BGM: 短剧音乐更强调“功能性”,即在短时间内迅速拉起观众情绪。
短剧受限于篇幅,通常省掉了传统片头片尾曲,只保留这些功能性的bgm,主要用来渲染情绪。
我们要去哪里获得这些音乐文件?
获取 BGM 主要有两条路子:一是用 AI 生成,二是去素材库里找现成的。这两种方法各有优缺点。
1)使用 AI 工具生成原创短剧 BGM
这种方法现在是主流,特别适合那些对版权查得严的平台(比如油管),或者当你脑子里有很具体的画面,但在网上死活搜不到对应音乐的时候。
它的优点很明显:生成的音乐能保证是独一无二的,几乎不用担心发出去因为版权被消音,随着AI音乐模型的日益强大,我们几乎可以生成你能想到的各种曲风的音乐。
当然缺点也有,它有点像“抽盲盒”,对于某些风格,例如古风,不是那么擅长,抽卡率也会有点高。
我们列举了一些常见的AI音乐工具汇总如下:
国内外主流AI音乐工具一览表
我们主要为大家演示如何借助 Suno 生成适合音乐。之所以我们将 Suno 作为本次的核心演示工具,相比其他工具,Suno 在纯音乐的乐器编排、音质清晰度以及长段落生成的连贯性上,目前仍处于统治地位,非常适合生成具有电影质感的短剧配乐。
下面我们就进入suno的实操环节:
打开网站的主界面

点进来就可以看到,左边这一块是操作界面,右边是你之前生成的歌曲。

使用起来也非常方便。
它分为Simple(简单)模式和Advanced(高级)模式。
如果你只是想要一个简单的基调,Suno 的 Simple Mode 是最快的入口。
那对于短剧来说,我们多数情况下只需要生成渲染情绪的纯音乐BGM,具体用法也是差不多的,只需要打开 Instrumental(纯音乐)开关,然后在描述栏填入风格提示词即可。

下面是几种在短剧/漫剧中常见的几种情绪所对应的BGM的风格提示词,大家可以直接复制使用:

Simple模式固然方便,但这个模式无法控制节奏。 可能剧情刚开始只需铺垫,它上来就给你一个高潮重音。
如果想要精确控制,并且还想自定义歌词(如果有需要),则选择Advanced模式。
下面的两首渲染紧张氛围的音乐,第一首是用Simple模式生成的,第二首是用Advanced模式生成的。大家能听出区别吗?
Simple模式:
Advanced模式
我们可以明显地听出用Advanced模式生成的歌曲,具备很清晰的结构,呈现出一种起承转合的趋势。如果说这一集的剧集内容相对较长,且整集的主题都一致的时候,我们是需要音乐本身也具有一定情绪起伏的,不要一上来就是高潮。
这个时候我们就要需要针对音乐的不同段落提出具体的指令了,这个指令就叫做Metatags (元标签)。
元标签是被方括号 [] 包裹的指令。Suno模型会将方括号内的内容识别为“结构控制指令”而非“语音生成指令”,从而执行音乐指令而不进行演唱。
切换到Advanced模式,选择模型后,在Lyrics(歌词)栏中输入含有元标签的歌词/指令,下方的Styles栏中输入曲风提示词即可。具体操作如下:

通常完整的流行音乐歌曲具备下列的4-5个段落,而完整的短剧的BGM也同样有类似的结构。
我们可以轻易通过AI来生成符合这样需求的含有含有元标签的歌词。在课堂上,也会教大家如何通过一些简单的模板快速生成具备完整结构段落的、符合情绪需求的、适合短剧的纯音乐BGM。
2)剪映音乐素材库(注意版权)
除了使用AI音乐工具来生成AI音乐以外,我们也可以直接找到一些现成的音乐素材。
最常见的做法就是直接在剪映的音乐库里去搜索音乐了。
找到音乐库,下面已经给你做好了分类,也可以直接搜索,需要什么情绪的bgm就搜什么关键词,例如:紧张、危险、热血等。

⚠️注意:为避免版权问题,最好选用可商用的素材。

二)音效
音效不仅仅是声音的还原,更是节奏的调节器。
在制作中我们通常分为三层:环境音建立空间感,动作音增加真实感,以及特殊音效 强调视觉冲击。
如何获取音效
获取音效目前主要有两种途径:
第一种是利用 AI工具的音效生成功能。如今大模型已经可以实现音画同出,不用我们过多的后期拟音。
如果想要单独出音效也可以,现在众多AI视频工具都具有音效生成功能,例如可灵、即梦、拍我等。
使用方法都大同小异,拿可灵来举例:
进入界面后,切换到音效生成,这里可以选择文生音效和视频生音效。
选择文生音效,输入提示词,需要什么音效即可生成。

而视频生音效则是让你直接上传一段视频素材,它自动为你生成需要的音效,下方可以输入提示词来描述,也可以不输入。这种自动生成的,虽然精细度有限,但胜在方便。

此外,在剪映中也是可以生成AI音效的。
只需要对任意一段素材,点右键,选择智能生成AI音效就可以了。这种一键生成的效果肯定不如音效素材听起来更自然,毕竟素材一般都是录制好的。但AI生成的音效,对于一些简单的动作音效例如脚步声等,或是一些比较抽象的画面音效,还是够用的。

第二种是传统的素材叠加法,这也是专业度更高的方法。
最常用的就是直接在剪映的音效库中搜索对应的音效,几乎能满足你绝大多数常规视频的音效需求。

这里也推荐一些资源声音下载库: 爱给网(国内最大的免费库)

三)配音(非必需)
自Seedance 2.0等模型问世后,从理论上讲,只要事先收集好声音资产,所有台词配音便能与视频素材同步生成。这一内容在第三节课已有讲解,此处便不再详述。接下来所介绍的AI语音工具,当前并非必需,若感兴趣,可自行体验。
常用AI配音工具
针对不同的制作需求,下面为大家筛选了以下几款主力工具:
DubbingX: 语料丰富,多情绪控制很强,可以精确调整一句话是“愤怒”还是“阴阳怪气”,非常适合精细化制作。
MiniMax:它的核心优势是极致的拟真度。它生成的语音自带口癖、呼吸声和自然的停顿,听起来非常有人味,适合大段的自然对话。也特别适合英文的配音。海外版有声音克隆功能,非常好用。
即梦:即梦出了能出图/出视频外,也能配音,它的克隆声音功能在某些需要应急的场合同样好用。

ElevenLabs: 国际公认的标杆,适合多语言或海外题材。
IndexTTS2 / GPT-SoVITS/Qwen-TTS: 本地开源工具。适合有技术背景的同学,可以训练特定角色的声音模型。
好了,上述内容是我整体AI短剧入门干货的核心部分。
如果你想要进阶深入或者更加全面系统的学习,欢迎拍下面的微信小店商品,微信官方平台,更有保障。
夜雨聆风