ARTICLE · 1069274
AI大模型热点|Gemini 3.8推出两款TTS模型,NVIDIA开源说话人分离模型
AI大模型热点|Gemini 3.8推出两款TTS模型,NVIDIA开源说话人分离模型
◆Google开放Gemini 3.8 Flash TTS与Flash-Lite TTS
Google DeepMind提供两款Gemini 3.8文本转语音模型:Flash TTS面向语音设计和双人对话生成,Flash-Lite TTS面向视频配音、播客等日常生成任务。官方页面称,两者支持通过自然语言控制口音、音色、语速和表达方式,并可在Google AI Studio试用。
DeepMind模型卡列出文本输入上限为8K Token、音频输出最高64K Token,并将两款模型列在Gemini API和AI Studio的可用渠道。不同渠道的开放节奏、配额和价格可能不同;面向实际业务时,还需要检查声音授权、长文本稳定性、中文发音、角色一致性和生成时延。
◆NVIDIA开源Nemotron 3 Diarization说话人分离模型
NVIDIA发布Nemotron 3 Diarization开放权重模型,定位是识别录音或实时音频中“谁在什么时候说话”。NVIDIA在Hugging Face技术文章中称,该模型有1亿参数,支持最多8位说话人,并在Voice Arena的Diarization-Bench取得14.72%的说话人错误率(DER)。这属于厂商报告的基准成绩,部署前应使用自己的会议、电话或访谈录音复测。
说话人分离与语音识别是两个环节:前者给语音片段分配说话人标签,后者负责识别文字。把两者接在一起可生成带说话人标记的转写,但重叠讲话、远场收音、口音和频繁插话都可能导致错标。模型的开放权重降低了接入门槛,可靠性仍要按具体语言和录音条件评估。
◆参考来源
Gemini Audio模型页|Google DeepMind Gemini 3.8 Audio模型卡|Google DeepMind Know Who Spoke When: Build Real-Time, Multi-Speaker AI|NVIDIA / Hugging Face Nemotron-3-Diarization模型|Hugging Face