夜雨聆风学习资料网

ARTICLE · 1095101

零基础学AI第35天:配音报价砍了七成,你还在一遍遍重录

零基础学AI第35天:配音报价砍了七成,你还在一遍遍重录

每天一个AI小知识 · 第35天

一条三分多钟的口播,光是开头那句"大家好",你就录了五遍。

头一遍气息不稳,第二遍窗外驶过车辆,第三遍直接卡壳。剩下两遍听不出差别,只想随便挑一条交差。进度条没走多少,1小时已经耗掉。

你肯定动过念头:干脆让AI帮我念旁白。可试听总觉得别扭,声音不是自己的味道。明明捷径摆在眼前,还是坐回话筒重录。

这两天AI语音的变化,就藏在这份纠结里。

AI语音早就不是新鲜事,新的突破是:它能直接造出你想要的音色,不用在预设音色库里勉强挑选。同样预算,从前只能生成一次旁白,现在可以试二十次。

AI语音的门槛,已经从"能不能发声",变成"想要什么样的声音"。

今日知识
这两天 AI 语音成本降价,而且它既能文字转语音,也能一句话直接生成全新虚拟人声。
虽然降低了试用门槛,但值得提前思考的核心问题:这个AI生成出来的声音,如何具有人感、最后到底归谁?

近日热点

① 谷歌DeepMind上了两款语音模型,声音能按描述现造。你用一句话描述要什么样的声音,它就照着造一个,还能拿30秒样本复刻一个人的音色,一句一句指定怎么念,安排两个人对谈,覆盖100多种语言。

② 通义千问发Qwen-Audio-3.1,五个模型一起降了价。听懂、说话、实时对话全升级,另外多了两个做音频创作和理解的模型。全线降价,语音合成降约七成,实时对话降约八成半,语音识别降幅到九成半。

③ 语音功能开始能调用工具了。OpenAI的语音能力升级,能在说话时调用邮箱、日历、Slack这些工具,语音也进了ChatGPT Work的网页端和手机端。

今天的小知识

今天把这四件事拆开说:声音怎么造出来的,为什么突然便宜,30秒够不够用,省钱的另一头在哪。

① 声音是怎么"造"出来的:以前你只能在现成的几十个音色里挑一个,挑不着就凑合。现在你说一句"三十来岁的女声,语速偏慢,带点鼻音",它就照这个描述现生成一个不存在的人。

根本的变化是:它不再从一批固定的声音里挑一个给你,你说什么,它就照着当场合成一段。但是,你说得含糊,它给你的就是一个谁都不像的平均声,听着总会觉得差了点什么。

② 为什么突然便宜这么多:语音这活儿,以前是顺手丢给大模型干,大模型什么都能干,代价是什么都贵。现在单独训一个只干语音的小模型,体积小、跑得快,成本就塌下来了;几家又同时抢这块,价就压得更狠。

三个数字摆着:七成、八成半、九成半。价钱跌成这样,能出声的人一多,被记住反倒更难了。报降价的是这几家自己,你手上正在用的那个工具换不换、什么时候换,是另一回事。

③ 30秒够不够,边界在哪:30秒能抓到一个人音色的轮廓,抓不到他那些情绪、停顿习惯和口头禅。以前想复刻得像,得录几十分钟的素材,现在半分钟起。

AI仿声辨真假是怎么分辨真假、怎么护住自己的声音;这次说的是:便宜到这个程度,你能拿来干什么。它抓的是音色的轮廓,一到长句子、情绪起伏大的地方,就会露出那种谁也不像的平。

④ 省钱的另一头在用量上:Fireworks出了个Ember-1,是在Kimi K3上面做的专用模型,少约四成token能达到差不多的质量。它凭什么能少说这么多:一个模型只干一件事,脑子里不用装着别的活,答题时绕的路就短。

同样的意思,说得长也说得短,省掉的那部分就是钱,所以省钱有两条路:单价降,用量也能降。需要注意是适用范围,一个专用模型对一个活儿,换个活儿它就不灵了,而且它现在挂着预览版的名头,不是正式版。

跟你有啥关系

自己录口播的:同一条稿子,今天念得顺,明天怎么念都平,状态不由你。

给片子配旁白的:你守着它一段一段出声,每回卡半分钟,一条片子得来回四趟。

想把内容发到外面去的:你得先找人翻译,再找人念,多次付费,出来的可能还不是一个声。费钱费事,还不像你。

顺手收藏

挑声音先别急着复刻,先用描述造一个:谷歌语音一句话定制全新音色,30秒音频复刻音色,但要注意他人声音授权。用描述造一个,造出来的声音没有"这是谁的嗓子"这层麻烦,拿它先试,省事。

看降价先看是单价还是总账:模型降价单价,但你要是量翻上去,账单不一定跟着少。

判断一段音频要不要真人补一句,听它的停顿和换气:长句子一口气念到底,听着就假。长句中间增加自然换气停顿,不要一口气读完;保留轻微的气息感,语速自然,不要匀速。

声音要不要本人点头:拿同事、朋友、家里人的嗓子去复刻,先问过本人,这层不商量。

四条过完,哪个声音能用、哪笔钱省得踏实,你自己能拍板。

小白能先做点啥

现在AI配音成本变低,你可以反复调试,但人声的情绪起伏,不会靠多生成几次自动变好。下面这四步,就是你手上那条视频里,声音这块要走完的路。

先把音色定下来。可以用一句描述造个全新音色,也可以克隆本人的音色:豆包App→我的→设置→声音→克隆我的声音。自然朗读,保留停顿、重音、语气,录20多秒。仅限个人非商用,需要实名,使用前勾选自用承诺。

做完你该看到的是:念出来听感自然,不是生硬念稿。

给稿件加朗读指令。把旁白按逗号、句号拆成一句一行,每行前面标注朗读指令,例:[慢一点] [压低音量] [停顿0.5秒]。支持这个格式的AI可以直接一次性生成;不支持就逐句生成后拼接。逐句拼接容易出现音色轻微漂移,优先选支持整段指令的工具。豆包网页版有免费额度,支持音频生成下载,单次有字数上限。

做完你该看到的是:每一句语速、轻重都按设定执行,不会全程平铺一个调子。

校验试听,不合格就重生成。固定一句测试句:今天好累啊。分别用疲惫、开心两种情绪生成,对比听感;换模型或调参数时,都用这句话测试。也可以拿你原来不满意的旁白,和AI配音对比,定位是断句问题还是情绪不足。

做完你该看到的是:同一句话的不同情绪你能明显分辨;配音到底差在哪,你能说得出来。

收尾两件事:导出字幕,核算开销。字幕:剪映电脑版,导入视频→文本→智能字幕→右键导出SRT/TXT,免费无水印。开销:同一份素材,不要同时做转写和配音,免得数据混乱;先用通用大模型跑一遍,记下消耗,再用专用音频模型(比如通义千问音频系列)跑同一份任务,记下费用,两组账单摆一起看差价。通义千问音频模型按需计费。

做完你该看到的是:一份带时间码的字幕;两组费用数据摆得清清楚楚,差多少一眼看到。

5个核心概念

① 声音设计(Voice Design):按你的一句描述,造出一个本来不存在的声音。原理是它学的不是某个人的嗓子,是描述和声音之间的对应关系。

大白话:像照着一段文字画像捏出一个人,这个人本来就没有。

② 实时语音(Realtime):边听边答,不等你把话说完。原理是把"听明白"和"想好怎么答"拆成两截同时跑,不用等你闭嘴再开工。

大白话:像跟人打电话,你话还没落,他那边已经接上了。

③ 逐行表演指导(Performance Direction):一句一句指定它怎么念。原理是给每行字单独标上情绪、快慢和停顿,不是整篇一个调子念到底。

大白话:像导演在剧本每一句旁边写批注,这句压低、那句快点。

④ 专用模型(Specialized Model):只干一类活的模型。原理是从大模型里把干这件事用得上的那部分单独拎出来练,所以又快又省。

大白话:像把什么都看的医生换成只看这一种病的专科医生,看这一样更快。

⑤ 多说话人(Multi-speaker):一段音频里安排几个不同的声音对谈。原理是同一个模型切换几套声音设定,不用真找几个人来录。

大白话:像一个人分饰两角,自己跟自己对台词。

收个尾

声音,正从稀罕变成管够。落到钱上就一句:声音在贬值。

贬值的只是单价,和音质好坏无关。供给一多,单份声音的成本自然变轻。

开头那笔账还记得吧,从前配一次旁白的预算,现在能试二十版。

这个数字意味着,你可以放开试,不用每次试音都掂量钱包。

但变便宜,不等于可以闭着眼用。说得清来路的那种声音,用起来没这层麻烦;照着真人音色复刻来的,边界很清晰:必须获得本人授权。

声音越来越像随手就能取的素材,好嗓子不再稀缺,省下来的那部分,得靠你说什么补上。

有一种想法挺常见:声音都这么便宜了,那就全交给它念。真全交出去你会发现,观众记住的还是那点人味儿。

这一轮省下来的,不在账单上,在你少录的那几遍里。

AI声音便宜了,但我的声音录进去之后去了哪、变成了谁在说话,这个问题,比省下的那点钱重要多了。

每天一个AI小知识,咱明天见。

#AI配音 #语音合成 #声音设计 #剪映 #每天一个AI小知识 #零基础学AI #新人小白 #AI小知识 #AI自习室手账 #自媒体提效

👉 关注「AI自习室手账」,每天一个AI小知识,零基础也能跟上AI。

相关学习资料