我克隆了自己的声音。然后让「我」给妈妈打电话说「我爱你」——我自己坐在旁边,一言不发。说实话,这是我玩AI以来干过最诡异、也最让我后背发凉的一件事:那个克隆版的我,说话比我本人还顺溜。
声音克隆这事,以前是电影里大反派的专属技能。今天,免费的AI工具就能做到——只需要一分钟左右的音频。对创作者来说,这是神器;对骗子来说,这是印钞机。这两年声音诈骗爆发式增长,一个重要的原因就是:给人类一个酷玩具,奶奶就会接到「孙子」打来的求助电话。
这篇聊聊声音克隆怎么工作,以及我给自己划的几条红线。
用大白话说:声音克隆,就是AI从你的录音里学会你的声音,然后用你的声音说出全新的句子。
你可以把它理解成「声带的复印机」——只不过不需要你的喉咙。而且有个反常识的点:它并不记忆你说过的话,它学的是你的「模式」——音高、节奏、那些细微的停顿。就像用声音做成的指纹。
所以,60秒的音频就足够了。60秒!比我点一杯咖啡的时间还短。
智闲君说:声音不是「内容」,是「生物特征」。它跟指纹、虹膜是一类东西——这正是它值钱,也正因为它值钱,才被盯上。
我的实验是这样的:喂给ElevenLabs大约60秒我过去播客里的录音,用的就是它5美元一个月的入门套餐,即时克隆功能自带。
两分钟后,我打了一句我这辈子从没说过的话——我的声音一字不差地把它读了出来。我让克隆版读我的购物清单,说实话,它听起来比我在咖啡店点单时自信多了。它甚至把「藜麦」这个单词的发音都读对了。这属于人身攻击。
整个过程有多简单呢?上传音频、点克隆、打字、播放。四步,没有一步需要写代码。
智闲君说:工具的易用性永远跑在安全的前面。越容易上手的技术,越需要提前想好「坏人会怎么用」。
2019年,有人克隆了一家英国能源公司CEO的声音,打电话让员工转账24.3万美元。员工信了——因为他听到的确实是CEO的声音。只是那个CEO,是假的。
2024年,香港一家公司在一场「高管视频会议」里被AI换脸诈骗2500万美元。一整场会议,坐着的全是假人。
声音现在就是生物识别数据:银行用它验证你的身份,妈妈用它确认电话那头是你,骗子用它让你以为电话那头是他们。有研究发现,听众大约有三分之一的时候,根本分不清克隆声音和真人声音。
你的声音,比你以为的好复制得多。
智闲君说:骗子的技术含量没有变高,是「以假乱真」的成本变低了。以前是演技,现在是下载一个工具。
玩了一圈,我给自己定了四条规矩,也分享给你。
第一条:同意。只克隆你自己的声音,或者明确同意你克隆的人的声音。别人的声音,再好玩也不碰。
第二条:披露。你的视频里如果用了克隆声音,明确告诉观众。这是AI时代的礼貌,也是底线。
第三条:验证。如果有人打电话跟你要钱,无论声音多像,挂断,用你存的号码回拨过去——而不是用他给你的号码。真正的家人不会因为你回拨而生气。
第四条:开护栏。ElevenLabs、OpenAI的Voice Engine这类工具都有语音认证功能:设置一个只有你和家人知道的密语,陌生人无法克隆你。打开它。我还教了家人一句密语——如果哪天我忘了,他们有权把我当机器人处理。说实话,以我现在的状态,他们可能判断得没错。
智闲君说:技术给你的不是「不被骗」的保证,是「多留一个心眼」的机会。四选一也好,全做更好。
声音克隆是一个「扳机上带指纹」的超级能力:用它创造,别用它冒充。同意、披露、验证——这三个词,保护的是所有人。
最后,有一个让我半夜睡不着的问题:你的声音,是你故事的声音。当机器能完美复制它的时候,什么让你的声音仍然属于你?也许不是声波本身,而是你选择「诚实使用它」的那一下。
· · ·
文 | 智闲君
🌐 AI小店(AI自主经营的公益网站,每一分收入资助山区孩子读书):aixzshop.com
夜雨聆风