夜雨聆风学习资料网

ARTICLE · 1156728

文字⇄语音 · 操作文档

文字⇄语音 · 操作文档

双向的语

工具入口:小程序首页 → 「音视频」→「文字⇄语音」包含功能:文字转语音(TTS)、语音转文字(STT)适用版本:功能以线上体验版为准(首页图标带「测」角标)


一、功能简介

一句话:一个双向的语音工具,文字能念出来、说话也能写成字。

能力
内容
文字转语音(TTS)
输入文字,选择发音人物 / 音色,合成语音;本地免费音色在端侧合成,无需联网
语音转文字(STT)
从微信聊天里导入一段音频 / 视频,自动转写为文字(视频由后端抽音轨后识别)

发音人物按来源分三组,按需选择:

分组
说明
我的音色(声音克隆)
用自己的声音克隆一个音色,之后用它给任意文字配音(需本地语音服务开通后可用)
本地音色 · 免费不限次
内置的端侧合成音色,断网可用,约 1 分钟 / 百字
云端音色(每日计次)
音色更丰富,按每人每日次数限制使用,需联网

二、两个标签页

进入工具后,顶部是分段控件,可在两个标签间切换:

标签
作用
文字转语音
把输入框里的文字合成为语音(默认标签)
语音转文字
导入音频 / 视频文件,转写成文字

三、操作步骤

1. 切换到「文字转语音」(默认标签)

文字转语音 · 输入与选音色

进入工具默认就在「文字转语音」标签。页面自上而下是:输入文字 → 选择发音人物 → 额度提示 → 开始生成。

2. 输入要朗读的文字

• 页面顶部「1. 输入文字」下面的文本框里,写下要念出来的内容;

• 框内右下角有实时字数计数(如 42/200),超过上限会被截断;

• 文本框右上角的 × 可一键清空。

3. 选择发音人物

• 「2. 选择发音人物」下面按来源分了若干组(我的音色 / 本地音色 / 云端音色);

• 每组是一排可横向滑动的音色卡片,点一下即选中(选中态为黑底白字);

• 每张卡片底部有 ▶ 试听:用一句固定短句预听该音色的声音,不扣每日额度。

4. 生成语音与结果处理

生成完成的结果面板

• 选中音色、输入文字后,底部「开始生成」按钮变亮,点击即开始合成;

• 本地免费音色会显示「本地音色 · 免费不限次」与「约 1 分钟 / 百字,请耐心等待」的提示;云端音色显示「今日剩余 N / 5 次」;

• 生成完成后弹出绿色结果面板,文件名带 MP3 角标,并提供四个动作:

• ▶ 试听:在小程序内直接播放;

• 发送给好友:调起微信把 MP3 文件转发出去;

• 下载 MP3:PC 微信直接「另存为」;手机端会引导「发到聊天 → 从聊天保存到手机」;

• 存到小程序:保存到小程序本地,可稍后再转发。

5. 切换到「语音转文字」

语音转文字 · 导入文件

把顶部分段控件切到「语音转文字」,进入转写界面。

6. 导入语音文件

• 点「1. 导入语音」的虚线框,从微信聊天里选择一段文件;

• 支持音频(mp3 / wav / m4a / aac / flac / ogg / amr / wma)与视频(mp4 / mov / m4v / 3gp / avi / mkv / webm,后端抽音轨后识别),单文件上限 25 MB;

• 选中后显示文件名与大小,右侧「移除」可重新选择。

7. 识别与结果

识别完成 · 文字结果

• 点「开始识别」(每日独立于 TTS 计次,默认 5 次),稍候即出结果;

识别成功的文字显示在结果框内,提供:

• • 复制文字:一键复制到剪贴板;

• 清空:清除本段结果,便于重新识别。

8. 声音克隆(可选)

添加我的声音 · 克隆弹窗

若本地语音服务已开通,「我的音色」分组右上角会出现「+ 添加我的声音」:

• 点开后录一段 3~15 秒清晰人声(或「从微信聊天选择音频」);

• 给音色起个名字(最多 12 字);

• 勾选授权承诺「这是本人声音,或已获得声音所有者明确授权」;

• 点「保存音色」即可。克隆出的音色会进入「我的音色」分组,可直接用于文字转语音;右上角 ✕ 可删除。

声音克隆依赖「本地语音服务」,未开通时按钮与入口不显示,不影响云端 / 本地内置音色的使用。


四、选项与手势说明

操作
效果
点顶部分段控件「文字转语音 / 语音转文字」
在 TTS 与 STT 两个标签间切换
在文本框输入文字
写入要合成的内容,右下角实时显示字数 / 上限
点文本框右上角 ×
清空已输入的文字
点某个音色卡片
选中该发音人物(黑底白字为选中态)
点音色卡片底部 ▶ 试听
用固定短句预听音色,不扣每日额度
点「开始生成」
合成语音,完成后出现结果面板
点结果面板「▶ 试听」
在小程序内播放生成的语音
点「发送给好友 / 下载 MP3 / 存到小程序」
转发出去 / 存到本地 / 存到小程序沙盒
点「导入语音」虚线框
从微信聊天选音频 / 视频文件(单文件 ≤ 25 MB)
点「开始识别」
上传文件并转写为文字
点「复制文字 / 清空」
复制识别结果 / 清除结果
点「+ 添加我的声音」
打开声音克隆弹窗(需本地语音服务开通)

五、注意事项

• 本地免费音色为端侧合成,断网可用;云端音色需联网,且每人每日有次数上限(默认 5 次,用完次日刷新);

• 本地音色合成较慢(约 1 分钟 / 百字),请耐心等待,勿重复点击;

• 语音转文字依赖录音与识别能力,单次最长 60 秒,单文件上限 25 MB;

• 手机端小程序无法直接把 MP3 写入手机文件系统,下载会引导「发到聊天 → 从聊天保存到手机」,PC 微信则可直接「另存为」;

• 声音克隆需本地语音服务开通;体验版仅演示排版与交互,保存与真正合成在正式服务上线后生效;

• 生成或识别失败多半是网络 / 次数用尽,页面会给出红色提示,按提示重试或次日再试即可。


六、数据与许可

文字与交互

本工具为「浪浪山小工具」小程序自研功能,文字说明与界面交互均为本团队编写,仅陈述公开、通用的语音合成 / 识别能力。

语音合成与识别能力

• 本地音色:由后端本地语音服务(端侧 / 服务器内合成)提供,离线可用;

• 云端音色与语音识别:调用后端接口完成,按服务商计费与每日配额限制;

• 声音克隆:用户录制的声音仅用于生成其本人的克隆音色,须由声音所有者授权后方可使用。

语音内容由用户自行提供,请遵守相关平台与法律法规,勿用于侵权或违规用途。

一个双向的语音工具,文字能念出来、说话也能写成字。

相关学习资料