ARTICLE · 1095101
零基础学AI第35天:配音报价砍了七成,你还在一遍遍重录
每天一个AI小知识 · 第35天
一条三分多钟的口播,光是开头那句"大家好",你就录了五遍。
头一遍气息不稳,第二遍窗外驶过车辆,第三遍直接卡壳。剩下两遍听不出差别,只想随便挑一条交差。进度条没走多少,1小时已经耗掉。
你肯定动过念头:干脆让AI帮我念旁白。可试听总觉得别扭,声音不是自己的味道。明明捷径摆在眼前,还是坐回话筒重录。
这两天AI语音的变化,就藏在这份纠结里。
AI语音早就不是新鲜事,新的突破是:它能直接造出你想要的音色,不用在预设音色库里勉强挑选。同样预算,从前只能生成一次旁白,现在可以试二十次。
AI语音的门槛,已经从"能不能发声",变成"想要什么样的声音"。
近日热点
① 谷歌DeepMind上了两款语音模型,声音能按描述现造。你用一句话描述要什么样的声音,它就照着造一个,还能拿30秒样本复刻一个人的音色,一句一句指定怎么念,安排两个人对谈,覆盖100多种语言。
② 通义千问发Qwen-Audio-3.1,五个模型一起降了价。听懂、说话、实时对话全升级,另外多了两个做音频创作和理解的模型。全线降价,语音合成降约七成,实时对话降约八成半,语音识别降幅到九成半。
③ 语音功能开始能调用工具了。OpenAI的语音能力升级,能在说话时调用邮箱、日历、Slack这些工具,语音也进了ChatGPT Work的网页端和手机端。
今天的小知识
今天把这四件事拆开说:声音怎么造出来的,为什么突然便宜,30秒够不够用,省钱的另一头在哪。
① 声音是怎么"造"出来的:以前你只能在现成的几十个音色里挑一个,挑不着就凑合。现在你说一句"三十来岁的女声,语速偏慢,带点鼻音",它就照这个描述现生成一个不存在的人。
根本的变化是:它不再从一批固定的声音里挑一个给你,你说什么,它就照着当场合成一段。但是,你说得含糊,它给你的就是一个谁都不像的平均声,听着总会觉得差了点什么。
② 为什么突然便宜这么多:语音这活儿,以前是顺手丢给大模型干,大模型什么都能干,代价是什么都贵。现在单独训一个只干语音的小模型,体积小、跑得快,成本就塌下来了;几家又同时抢这块,价就压得更狠。
三个数字摆着:七成、八成半、九成半。价钱跌成这样,能出声的人一多,被记住反倒更难了。报降价的是这几家自己,你手上正在用的那个工具换不换、什么时候换,是另一回事。
③ 30秒够不够,边界在哪:30秒能抓到一个人音色的轮廓,抓不到他那些情绪、停顿习惯和口头禅。以前想复刻得像,得录几十分钟的素材,现在半分钟起。
AI仿声辨真假是怎么分辨真假、怎么护住自己的声音;这次说的是:便宜到这个程度,你能拿来干什么。它抓的是音色的轮廓,一到长句子、情绪起伏大的地方,就会露出那种谁也不像的平。
④ 省钱的另一头在用量上:Fireworks出了个Ember-1,是在Kimi K3上面做的专用模型,少约四成token能达到差不多的质量。它凭什么能少说这么多:一个模型只干一件事,脑子里不用装着别的活,答题时绕的路就短。
同样的意思,说得长也说得短,省掉的那部分就是钱,所以省钱有两条路:单价降,用量也能降。需要注意是适用范围,一个专用模型对一个活儿,换个活儿它就不灵了,而且它现在挂着预览版的名头,不是正式版。
跟你有啥关系
自己录口播的:同一条稿子,今天念得顺,明天怎么念都平,状态不由你。
给片子配旁白的:你守着它一段一段出声,每回卡半分钟,一条片子得来回四趟。
想把内容发到外面去的:你得先找人翻译,再找人念,多次付费,出来的可能还不是一个声。费钱费事,还不像你。
顺手收藏
挑声音先别急着复刻,先用描述造一个:谷歌语音一句话定制全新音色,30秒音频复刻音色,但要注意他人声音授权。用描述造一个,造出来的声音没有"这是谁的嗓子"这层麻烦,拿它先试,省事。
看降价先看是单价还是总账:模型降价单价,但你要是量翻上去,账单不一定跟着少。
判断一段音频要不要真人补一句,听它的停顿和换气:长句子一口气念到底,听着就假。长句中间增加自然换气停顿,不要一口气读完;保留轻微的气息感,语速自然,不要匀速。
声音要不要本人点头:拿同事、朋友、家里人的嗓子去复刻,先问过本人,这层不商量。
四条过完,哪个声音能用、哪笔钱省得踏实,你自己能拍板。
小白能先做点啥
现在AI配音成本变低,你可以反复调试,但人声的情绪起伏,不会靠多生成几次自动变好。下面这四步,就是你手上那条视频里,声音这块要走完的路。
先把音色定下来。可以用一句描述造个全新音色,也可以克隆本人的音色:豆包App→我的→设置→声音→克隆我的声音。自然朗读,保留停顿、重音、语气,录20多秒。仅限个人非商用,需要实名,使用前勾选自用承诺。
做完你该看到的是:念出来听感自然,不是生硬念稿。
给稿件加朗读指令。把旁白按逗号、句号拆成一句一行,每行前面标注朗读指令,例:[慢一点] [压低音量] [停顿0.5秒]。支持这个格式的AI可以直接一次性生成;不支持就逐句生成后拼接。逐句拼接容易出现音色轻微漂移,优先选支持整段指令的工具。豆包网页版有免费额度,支持音频生成下载,单次有字数上限。
做完你该看到的是:每一句语速、轻重都按设定执行,不会全程平铺一个调子。
校验试听,不合格就重生成。固定一句测试句:今天好累啊。分别用疲惫、开心两种情绪生成,对比听感;换模型或调参数时,都用这句话测试。也可以拿你原来不满意的旁白,和AI配音对比,定位是断句问题还是情绪不足。
做完你该看到的是:同一句话的不同情绪你能明显分辨;配音到底差在哪,你能说得出来。
收尾两件事:导出字幕,核算开销。字幕:剪映电脑版,导入视频→文本→智能字幕→右键导出SRT/TXT,免费无水印。开销:同一份素材,不要同时做转写和配音,免得数据混乱;先用通用大模型跑一遍,记下消耗,再用专用音频模型(比如通义千问音频系列)跑同一份任务,记下费用,两组账单摆一起看差价。通义千问音频模型按需计费。
做完你该看到的是:一份带时间码的字幕;两组费用数据摆得清清楚楚,差多少一眼看到。
5个核心概念
① 声音设计(Voice Design):按你的一句描述,造出一个本来不存在的声音。原理是它学的不是某个人的嗓子,是描述和声音之间的对应关系。
大白话:像照着一段文字画像捏出一个人,这个人本来就没有。
② 实时语音(Realtime):边听边答,不等你把话说完。原理是把"听明白"和"想好怎么答"拆成两截同时跑,不用等你闭嘴再开工。
大白话:像跟人打电话,你话还没落,他那边已经接上了。
③ 逐行表演指导(Performance Direction):一句一句指定它怎么念。原理是给每行字单独标上情绪、快慢和停顿,不是整篇一个调子念到底。
大白话:像导演在剧本每一句旁边写批注,这句压低、那句快点。
④ 专用模型(Specialized Model):只干一类活的模型。原理是从大模型里把干这件事用得上的那部分单独拎出来练,所以又快又省。
大白话:像把什么都看的医生换成只看这一种病的专科医生,看这一样更快。
⑤ 多说话人(Multi-speaker):一段音频里安排几个不同的声音对谈。原理是同一个模型切换几套声音设定,不用真找几个人来录。
大白话:像一个人分饰两角,自己跟自己对台词。
收个尾
声音,正从稀罕变成管够。落到钱上就一句:声音在贬值。
贬值的只是单价,和音质好坏无关。供给一多,单份声音的成本自然变轻。
开头那笔账还记得吧,从前配一次旁白的预算,现在能试二十版。
这个数字意味着,你可以放开试,不用每次试音都掂量钱包。
但变便宜,不等于可以闭着眼用。说得清来路的那种声音,用起来没这层麻烦;照着真人音色复刻来的,边界很清晰:必须获得本人授权。
声音越来越像随手就能取的素材,好嗓子不再稀缺,省下来的那部分,得靠你说什么补上。
有一种想法挺常见:声音都这么便宜了,那就全交给它念。真全交出去你会发现,观众记住的还是那点人味儿。
这一轮省下来的,不在账单上,在你少录的那几遍里。
AI声音便宜了,但我的声音录进去之后去了哪、变成了谁在说话,这个问题,比省下的那点钱重要多了。
每天一个AI小知识,咱明天见。
#AI配音 #语音合成 #声音设计 #剪映 #每天一个AI小知识 #零基础学AI #新人小白 #AI小知识 #AI自习室手账 #自媒体提效
👉 关注「AI自习室手账」,每天一个AI小知识,零基础也能跟上AI。