ARTICLE · 1068009
Gemini 3.8配音更新:把产品说明做成双人讲解
你的小团队可能有这样的材料:一页功能说明、一组客户常问问题、几段新手操作步骤。它们写得完整,用户却不愿逐段读;改成视频,又要处理配音、语气和反复录制。
9 月 23 日,Google 发布 Gemini 3.8 Flash TTS 与 Flash-Lite TTS,把逐行表演控制、声音设计和双人对话作为重点。[1] 对开发者和产品经理,值得尝试的用法是:先把一段已经核实的说明,做成两个人一问一答的短音频,再决定是否接进产品。
最值得先改的,是脚本与生成流程。下面给出一套可复制的试做方案。本文依据官方发布、开发文档与价格页整理,未对音质、延迟或中文发音做亲测。

图:Google 官方发布素材。[1]
两个型号,先按工作内容选
Google 将 Flash TTS 定位于更细腻的表演、角色设计和长篇音频;Flash-Lite TTS 面向高吞吐、日常朗读和规模化配音。官方开发文档称两者使用相同的 API 结构与提示格式,可以通过模型参数切换。[1][2]
因此,做普通产品引导、FAQ 朗读,可以先以 Lite 建立基线;做角色对白、情绪变化明显的内容,再用 Flash 对比同一段台词。这里是选型建议,并不意味着 Lite 的中文效果已经经过本号验证。
还要区分 TTS 和实时语音系统。TTS 是把指定文本生成音频;接听用户、识别语音、理解问题、调用业务工具,再回答,是另一条完整链路。官方文档也将 TTS 与交互式 Live API 分开。[2] 仅接入配音接口,不等于客服已经能自主处理问题。
先把产品介绍拆成六句对话
第一轮不要生成整段课程或一小时播客。先用六到十句台词,覆盖一个具体问题,比如“新用户如何完成第一次导出”。下面是虚构产品的脚本骨架,方括号内容必须替换为你自己产品中已核实的事实:
A:我第一次使用[产品名],应该从哪里开始?
B:先打开[真实入口],准备好[必要材料]。
A:我完成[第一步]以后,就能直接导出吗?
B:还要检查[关键字段]。如果看到[实际错误提示],先处理[对应问题]。
A:这一步是否需要付费?
B:[准确说明套餐、费用或使用限制]。确认后,点击[真实按钮]即可。
让 A 代表第一次使用的人,B 负责解释。每句只承担一个信息点,尤其把金额、限制、错误处理分开。对话稿的价值在于替读者问出遗漏的问题;如果只是两个人轮流念宣传文案,听起来仍然像广告。
可以先把以下提示词交给文本模型,生成待审脚本:
请只依据我提供的产品资料,写一段六到十句的双人问答。A 是首次使用者,B 是产品讲解员。每句只表达一个信息点。保留费用、适用条件和限制;资料未说明的事项写成“待核实”,不要补造功能或承诺。输出“角色、台词、语气”三列,不添加宣传口号。资料如下:[粘贴已核实材料]。
审完以后再送入 TTS。文本模型负责整理脚本,TTS 负责演绎定稿。不要让配音环节顺便替你改产品事实。
接口接入:台词和导演说明分开放
这次最容易导致“怎么连提示词都念出来了”的地方,是文本字段的含义变化。3.8 文档明确把 text 视为逐字朗读的内容,持续语气放到 speech_metadata.style,说话人放到 speech_metadata.speaker。[2]
例如一轮台词的结构,可以按下面的字段关系组织。这是字段示例,不是完整请求:
type:text
text:第一次使用时,请先检查项目名称。
annotations:包含一个 type 为 speech_metadata 的对象
speaker:Guide
style:calm, clear, moderately paced
其中 speaker 和 style 都属于 speech_metadata 对象。给双人对话的每一轮明确填 speaker,并与声音配置里的角色名一致。不要把“请用平静语气朗读”写进 text 后期待模型自动忽略。
按官方示例,模型 ID 为 gemini-3.8-flash-tts 或 gemini-3.8-flash-lite-tts;双人请求在 generation_config.speech_config 中配置 speakers,并可使用 conversational 模式安排对话节奏。[2]
有三个限制值得在开发任务里单列:
第一,单次请求最多两位说话人,且文档限定使用预置声音。自定义设计或复制的声音用于多角色对话时,需要分别合成各角色轮次,再按文档拼接音频,不能默认直接塞进同一个双人请求。
第二,普通非流式请求默认返回 WAV。旧流程如果把返回数据当作无文件头的 PCM,再手动加一次 WAV 文件头,就需要调整;应依据返回格式保存,不能照搬旧版音频封装代码。
第三,暂停与持续语气不同。例如 <short pause> 是台词中的瞬时暂停标签;贯穿整句的语速或情绪,应写进 style。第一版产品说明没必要堆叠笑声和喘息标签,把清楚、稳定、信息完整放在前面。
以上是文档级接入核对,完整请求与所用 SDK 版本仍应以官方示例为准。官方页面仍有部分 Go 示例引用旧预览模型,复制代码前要检查模型名与输出格式,不要把整页示例当成完全一致的新版本代码。
费用可以先估,但别漏掉重做
截至 9 月 24 日读取的价格页,常规付费档、每百万 token 的价格为:[3]
Flash TTS:文本输入 0.50 美元,音频输出 9 美元。
Flash-Lite TTS:文本输入 0.50 美元,音频输出 6 美元。
上述价格标注有效至 2026 年 12 月 31 日;页面列出的 2027 年 1 月 1 日起价格分别变为输入 1 美元、Flash 音频输出 18 美元、Lite 音频输出 12 美元。长期预算不要只用当前价格。
官方按每秒音频 25 个 token 换算。假设最终生成 10 分钟音频,就是 15,000 个音频 token:当前 Flash 的纯音频输出费约 0.135 美元,Lite 约 0.09 美元。
这是单次输出部分的算术估算,不是成品报价。文本输入、失败与重生成、脚本处理、剪辑及人工检查都没有包含。即使接口费用很低,反复修改事实和口播节奏,仍可能成为主要工作量。
价格页另有免费档,并注明免费档数据可用于改进产品。尝试时先用公开说明或脱敏脚本,账户可用性、配额与适用条款另行核对;不要把“免费档存在”理解为任何账号都可以无限生成。
听完后,用这张清单决定是否上线
拿同一份已定稿脚本,分别生成候选版本,记录模型、声音、style、时间、重做次数和费用。听评时先不告诉同事哪个版本用了更贵的型号,让他们按同一规则判断:
□ 产品名、金额、日期和操作按钮是否读对?
□ 是否漏读限制条件,或增加脚本没有的承诺?
□ 两个角色是否能分清,是否出现串音色或换角色?
□ 导演说明是否被念出,停顿是否打断语义?
□ 音量、段落衔接、开头结尾是否正常?
□ 只听音频的新用户,能否说出下一步该做什么?
保存原始返回音频与完整脚本、配置;裁剪或降噪后的公开版本另存,别覆盖原件。这样出现误读时,才能判断问题来自脚本、生成还是后期处理。
如果要复制真人声音,Google 要求权利及匹配的口头同意验证,并列出了 AI Studio 声音复制的地区限制。官方还说明生成音频带有 SynthID 水印。[1] 普通产品介绍可以先用预置声音,减少管理声音授权的额外工作。品牌声音微调的 voice remixing 在发布稿里仍是“即将推出”,不能当作已经可用。
对小团队而言,今天可以交付的不是一套庞大的音频平台,而是一段事实准确、能帮助新用户完成操作的双人讲解。先验证这段音频确实减少理解障碍,再把同样的脚本规范和验收方法扩展到更多功能。
资料来源
[1] Google,Gemini 3.8 text-to-speech says hello,2026-09-23。产品定位与能力来自厂商发布,非本号音质实测。
https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-8-text-to-speech/
[2] Google AI for Developers,Text-to-speech generation,2026-09-24读取,页面标注2026-09-23更新。
https://ai.google.dev/gemini-api/docs/speech-generation
[3] Google AI for Developers,Gemini Developer API pricing,2026-09-24读取。采用两款TTS的Standard付费档,非其他Gemini模型价格。
https://ai.google.dev/gemini-api/docs/pricing