想用 AI 做一个自己的声音,目前的主流方式,基本都被捆在云上。
你打开某个语音平台,导入一段声音,让它在服务器上帮你克隆,然后按用量付费。效果好是好,但你的声音数据、你的每一句话,都经过了别人的服务器;想多用点,就得一路充值。
有没有可能,把这些「AI 语音工作室」搬到自己电脑上,不联网、不付费、甚至不把声音上传到任何地方?
VoiceStudio 就是这么个东西。它是一个开源的桌面语音工作室,把克隆声音、设计声音、给视频配音、语音转文字、做有声书,全部打包成一个本地优先的工具。
作者给它起的口号很直白:Make voices. Tell stories. Keep the files.(造声音、讲故事、文件留在你手里。)
Stars:9,800+
语言:Python
协议:AGPL-3.0
定位:本地优先的开源 AI 语音工作室(ElevenLabs 的开源替代)
它把你常做的四件事,全搬到了本机

VoiceStudio 有四个主打能力,覆盖了 AI 语音最常见的需求:
声音克隆。给一段 3 秒的音频,就能克隆出那个声音,零样本(zero-shot),支持 646 种语言。你不需要提供大段样本,三秒就能生成一个可用的音色。
声音设计。不用样本也能造声音——你直接描述想要的声音:「中年男性、有一点南方口音、语气偏沉稳」,它能按性别、年龄、口音、音高、方言、情绪这些维度,凭空设计出一个声音。
视频配音。一段视频进来,它先转写、再翻译、再重新配音、最后输出 MP4。整条「跨国视频」的流水线,在本地一次走完。
有声书。把 EPUB 或 PDF 导入,它能生成多角色的 .m4b 有声书——不同角色用不同声音朗读,适合做小说、播客或学习材料。
再加一个随身小功能:系统级的听写小插件,在任何 App 里都能用快捷键唤起,把语音转成文字。
核心卖点:本地优先,按需联网
VoiceStudio 的架构思路,和云端语音工具截然不同。
它的核心工作流默认在你自己的硬件上跑:克隆、设计、配音、转写这些重活,全走本地模型。不注册账号、不按用量计费、不把音频上传到别人那儿。
「本地」不是一句口号,它是这个工具的设计底线。官方强调:网络相关的引擎和服务都是可选、且需要你显式打开的——而不是藏在后台偷偷用的隐藏依赖。
这带来一个直接的好处:数据主权。你的声音样本、你的配音文件,从头到尾不出你的电脑。对声音这种高度个人化的数据来说,本地处理意味着隐私和安全都掌握在自己手里。
对应的代价是:你要有一块能扛得住的显卡,或者接受 CPU 慢慢跑。项目对 GPU 的要求是显存 4GB 起步(低于 8GB 会自动把 TTS 卸载到 CPU),推荐 8GB 以上。没有 GPU 也能跑,只是慢。
从原理看它怎么造声音
VoiceStudio 的「造声音」不是魔法,背后是一套模型协作。
以「声音克隆」为例,大致是这样一条链路:
- 你给一段 3 秒的音频。
- 系统用一个语音编码模型,把这段音频的声音特征(音色、语调、说话习惯)抽取出来,压成一个高层次的「声音表征」。
- 生成语音时,输入这个声音表征 + 你想让它说的一段文字。
- 语音合成模型根据文字和声音表征,逐帧合成出音频,还原出「用那个声音说这段话」的效果。
因为声音特征已经在第一步被抽象出来了,所以合成阶段不需要保留原音频,这就是「零样本」能成立的原因——你只给 3 秒,它就能推理出这个声音该有的样子。
这套流程里还有两个值得一提的自动化处理。一是语气和情绪控制:不同引擎能实现的表达能力不一样,想让它带呼吸声、笑声、情感起伏,取决于你选哪个底层引擎,项目文档里有每个引擎当前能做什么的详细说明。二是 GPU 自适应:安装时它会自动检测你的显卡(CUDA / Apple MPS / Linux 的 ROCm / CPU),显存不够就静默把 TTS 拆到 CPU 上,不会因为显存溢出直接崩掉。
语音合成引擎也不是只有一套。VoiceStudio 内置了 14 种 TTS 引擎和 11 种 ASR(语音转文字)引擎,你可以在设置里切换。默认引擎基于 k2-fsa 的 OmniVoice,支持 600 多种语言;其余像 CosyVoice 3、GPT-SoVITS、VoxCPM2 等,是按需自动检测、可选启用的。
做视频配音时,链路更完整:先转写(ASR)→ 再翻译 → 重新配音(TTS)→ 最后合成 MP4。每一步都能在本地跑。
一个直观的对照:它和 ElevenLabs 差在哪
VoiceStudio 在 README 里直接放了一张和 ElevenLabs 的对比表,四个维度很能说明问题:
费用:ElevenLabs 是订阅 + 用量计费;VoiceStudio 免费开源(AGPL-3.0),核心功能不收费。
语言:ElevenLabs 取决于你的方案和模型;VoiceStudio 宣称支持 646 种语言。
数据隐私:ElevenLabs 音频在云端处理;VoiceStudio 核心流程本地跑,在线服务要显式启用。
扩展性:ElevenLabs 是闭源的、TTS 引擎只有一个;VoiceStudio 开源可 Fork,内置 14 种 TTS 引擎 + 桌面 App + MCP 服务器,可以自己改、自己扩展。

除了和 ElevenLabs 比,它还有几个差异化能力是云端工具没有的:有声书编辑器、多角色故事脚本、AI 水印(用 Meta 的 AudioSeal,不可见且抗压缩)、语音分离(用 Demucs)。
真实场景:它能拿来做什么
把抽象的能力落成几个具体画面:
场景一:给短视频一条龙配音。你做个口播视频,先用克隆功能导入你的声音,录一遍文案,然后合成的就是「你的声音在说话」。视频配音功能还能把一段外语视频转写、翻译、重新配成中文,直接输出 MP4。对做视频号、抖音的内容创作者很实用。
场景二:读一本有声小说。导一本 EPUB 进去,多角色用不同的声音朗读,导出 .m4b。不只是机械朗读,不同人物有不同音色,适合喜欢听书的用户自制私藏有声书。
场景三:笔记本语音输入。写文档不想打字,用系统级听写小插件,任何 App 里快捷键唤起就能说转文字。
场景四:团队批量转写。丢 50 个视频进 Batch Queue,逐个显示进度条,干完再回来收。适合需要批量处理音视频的团队。
怎么下手:装好就能用
VoiceStudio 提供 macOS、Windows、Linux 三端的桌面安装包,也支持 Docker。
macOS(Apple 芯片)直接下载 DMG 安装即可,首次启动需要在系统设置里点一下「仍要打开」(因为它没走 App Store 签名流程)。Windows 用 MSI,Linux 用 AppImage。
装好后,声音克隆、设计、配音这些核心功能,在本机就能用,不需要 API Key。如果你只想体验、不想折腾模型下载,直接从 Releases 页下载最新版就行。
硬件要求:macOS 13.3+(Apple 芯片)、Windows 10 / Ubuntu 24.04+,内存 8GB 起步推荐 16GB,GPU 可选(4GB 显存可自动降级跑 CPU,推荐 8GB+)。
适合:内容创作者、想做本地配音/有声书的人、对音频隐私敏感的用户
局限,得说清楚
首先是硬件门槛。本地跑语音模型,对显卡要求不低,没有好 GPU 时 CPU 合成会慢——这决定了它在普通办公本上的体验会打折扣。
其次是成熟度。它明确标注「active beta」,还在快速迭代,版本之间可能有破坏性变更;官方建议追求最新修复就跑源码构建,而不是等打包好的版本。
第三是兼容性细节。比如 Intel 版 Mac 跑不了本地后端,只能指向远程后端;AMD 的 ROCm 支持仅限 Linux 且要显式开启。这些平台差异,换机或跨平台使用时得先确认。
另外,虽然本地优先,但如果你要接更多模型(比如 Hugging Face 上的权重下载、说话人分离的模型),还是可能要配网络和 token,不是说 100% 离线。
适合谁,不适合谁
适合:
- 想做「用自己的声音」合成的内容创作者,但不想把声音样本交给云端。
- 需要批量处理视频配音、转写、翻译的团队(有 Batch Queue,可以一次丢 50 个视频)。
- 想读有声书,但不想用付费订阅服务的人。
- 愿意折腾显卡 + 喜欢开源、想自己扩展语音能力的开发者。
不太适合:
- 只有 Intel Mac 或很老的低配电脑、又没有远程后端可用的用户(本地跑不动)。
- 想要「开箱即用的云服务、完全不用管硬件」的普通用户——那还不如直接用付费平台。
- 需要跨平台全离线运行、且不接受 beta 阶段不稳定的生产环境。
值得琢磨的设计
VoiceStudio 有几个思路,即使不用它,也值得记下来。
第一个是「本地优先 + 可选在线」的隐私分层。它没有把「本地」做成非此即彼的极端,而是让核心走本地、在线作为显式的可选项。这样既保证了数据主权,又保留了需要时接入更多模型和服务的灵活性。隐私不该是一刀切,而应该是可配置的层级。
第二个是「接 14 种引擎而不是绑死一个」。它把语音合成抽象成统一的接口(改一个 TTSBackend 子类,约 50 行代码就能加新引擎),让用户可以在多种模型间切换、对比。单一引擎的厂商容易锁死用户,多引擎的可替换性,是开源社区工具常见的护城河。
第三个是「给自己的 AI 开一个 MCP 入口」。它内置 MCP 服务器,让 Claude、Cursor 等客户端能直接调用它的语音能力。当一个工具开始为「被 AI 使用」而设计接口时,它就不再只是给人用的软件,而会进入 AI 的工具生态。
github.com/debpalash/VoiceStudio如果你一直想有个「自己的声音工作室」,又不想被云服务的订阅和用量计费绑住,VoiceStudio 值得一试。它用一个本地优先的开源方案,把克隆、设计、配音、有声书全部装进了你电脑里——造声音,讲故事,文件永远留在你手里。
夜雨聆风