乐于分享
好东西不私藏

声音设计 + 音色克隆:AI 音频工具正在变得越来越好玩

声音设计 + 音色克隆:AI 音频工具正在变得越来越好玩

AI

大家好,这里是机智波玩ai。

今天介绍如何去设计声音和克隆音色,这一步在视频创作中非常重要,能让生成的视频声音更可控,视频更有代入感。

01

项目总览

好的视频制作一定离不开音频的设计,
但很多朋友都是使用模型直接生成视频, 这样出来的人物音色类型不可控,情绪无法把握,也没办法直接调整。
已关注
关注
重播 分享
那我们可以试试提前准备好音频,给予剧中人物符合其特点的音色。另外还能复制这个声音,供后续的同角色使用。

02

声音设计

(完整工作流展示)
首先是声音设计的部分,我准备了两个工作流,大家可以配合使用。
第一个是Qwen 3 TTS模型,我们需要准备两部分内容:
一部分是人物的声音类型描述,我们可以拟定人物的年龄、说话音色、音调和听感等元素
例如:20-24岁清冷柔弱女声,音色温柔灵动。音量偏轻,情绪淡,易碎感。
还有就是人物说话的内容。这两块儿内容填好之后直接生成就ok了。
另一个OmniVoice有一点不同,它支持的声音类型描述要用标签化语言,不同标签之间用逗号给开。
不过它还支持多音字识别和方言设计,这里用“一行行,肯定行行行”这个多音字梗举例,我们可以用大写字母和数字表示音调

这人要是1HANG2XING2,那肯定是HANG2HANG2XING2,三百六十HANG2肯定都XING2

同时拟定为女青年说四川话,结果是这样的:
通过这两种方法我们就能提前设计好人物的音色,也为后续的音色克隆环节做好了准备。

03

音色克隆

音色克隆准备了四种不同的模型,但他们的使用方式都一样,只是效果稍有差异。有的音色还原好,有的语气还原好,还有的支持跨语种克隆。
仍然需要准备两部分内容:参考音频(需要克隆的音频)和说话的内容

04

什么是流行性感冒?

以上就是今天的分享了,音频设计是视频生成中尤为重要的一部分。提前设计好声音,后续再加以克隆复制音色使用,可以广泛应用于数字人口播、带货等场景中,也是极为方便、高效的。
同款工作流已准备好,赶紧来体验吧:
https://www.runninghub.cn/post/2059986652633849857/
?inviteCode=rh-v1222
AI来整活,我是机智波!持续为您分享最实用的AI教程...

创新AI玩法,赋能商业设计!
既然看到了这里,不妨随手点赞+收藏