ARTICLE · 1157686
VoiceStudio 安装使用教程:把自己的声音接进视频和配音工作流
大家好,这里是 AI 落地应用实干家,感谢您阅读我的文章!
1. 这篇教程带你走完三步
VoiceStudio 是什么,前面已经聊过一遍,这篇不重复。这里只干一件事——把它从零装到能用,再用你自己的声音念出第一段稿。
仓库地址:
https://github.com/debpalash/VoiceStudio ,
官网:https://voicestudio.sh
整条路就三步:装好 → 克隆一个自己的声音 → 接进你的工作流。下面一段一段来。

2. 装之前,先看你电脑吃不吃得消
它的活儿全在本机跑,所以第一件事不是下载,是对照自己的机器。
有 N 卡(Windows / Linux),走显卡加速,最顺; 苹果 M 系列芯片,走 Metal 加速,一样顺; 只有集成显卡的老机器,也能跑,纯靠 CPU,就是慢,得腾出大概 5G 磁盘; Intel 芯片的 Mac,它只能当个界面用,得配一台远程机器在后面干活; 骁龙 X 那种 ARM 版 Windows,还在试验阶段。
一句话,手上没一块像样的显卡或者 M 芯片,能跑,但别指望快。
3. 安装:最省事的是让 Agent 去干
三条路摆在这儿。
去官网或者 GitHub 的 Releases 页下载桌面版,macOS 是 dmg、Windows 是 exe、Linux 是 AppImage 或 deb,双击装完就能开。
想自己折腾,官方也给了安装脚本,macOS 和 Linux 一行搞定,Windows 走 PowerShell。
但更推荐这条——让电脑里的 Agent 替你做。把下面这段丢给它:
有个提醒:现在桌面版只有 Electron 这一版,0.5.3 之前的老版本没法直接升上来,得单独重装一次。

4. 第一步:克隆一个你自己的声音
打开左边的「语音克隆」。
它自带几个现成的音色,只想试试水,挑一个直接用就行。
要用自己的声音,录一段干净的人声当参考——环境安静、不带背景音乐,5 到 15 秒就够。加进去存好,以后每条稿子都能随手调它。

5. 第二步:写稿、生成、导出
把稿子交给它,也能从文件导入现成的音频或视频。
生成前先定好音色、语言和语速。默认语速念普通文章可能偏慢,做口播的一般会往上提一点——先拿一小段试,听着顺口再批量。
点生成,等它跑完,逐段听一遍、把不顺的地方改掉,再导出音频。

6. 第三步:接进 Agent,配音变成流水线的一环
VoiceStudio 自带本地接口和 MCP。桌面应用开着的时候,Agent 就能连上它。
连上之后,你在 Agent 里说一句"把这段稿用我的声音读出来",音频直接出来,不用切软件、不用手动导出。提示词可以这么写:
这一步接好,配音就不再是单独一件事,而是整条内容生产线里的一个环节——写完稿,配音跟着就出来了。
7. 三个最容易卡住的地方
第一个,第一次生成要下模型。
默认引擎的模型有几个8.5G,网速一般的话得等一会儿,记得选国内镜像,进度在设置里的 Models 页能看。
第二个,像不像全看参考录音。
有底噪、有回声、有背景音乐,克隆出来就差一截,别拿一条吵吵闹闹的录音去喂它。
第三个,桌面应用必须开着。
走本地接口和 MCP 的时候,主程序没在跑,Agent 是连不上的。

8. 它的短板
- 吃硬件
没有独显或者 M 芯片,长内容得等; - 块头不小
模型几个 G 起步,磁盘紧张的先腾地方;
9. 总结
装它不难,难的是把"克隆—生成—接流水线"这三步串顺。串顺之后,稿子改完不用重录,一句话就有配音。做口播的、做课程的、做多语种内容的,都值得花半小时装上试一次。