不知道大家最近有没有体验过 ChatGPT 新上线的实时语音聊天?
我前两天跟它连续聊了快两个小时,中间想到什么就说什么,还能随时打断它,切到别的话题聊几句再绕回来,整体的交互体验还是蛮丝滑的。
不过有一个细节我印象很深,就是它在实时对话过程中同步转录出来的文字,我几乎没发现任何错误,准确率相当高,而且转成中文文字基本上没什么延迟,说完话文字几乎同步就出来了。
当然,也有两个地方让我觉得有点遗憾:一是我本来希望它能在聊天过程中顺手帮我生成一版规划文案,结果没做到;二是它说中文时那种语调总感觉像是老外在讲中文,有点儿别扭。
我们平时在搭建视频转口播稿、视频翻译这类 skill 工具的时候,如果让 AI 帮你出技术方案的话,你会经常在技术栈里看用到一个叫 Whisper 的开源工具,它因为完全免费、可本地部署、支持 99 种语言,至今依然是个人开发者做本地转录最常见的默认起点,尤其是 faster-whisper 这类加速版本。
也正因为这个原因,OpenAI 官方每次公布新转录模型的基准数据时,都会把 whisper 作为对比参照系,这次也不例外。
昨天,OpenAI 就正式在 API 里开放了两款新的转录模型。一个是 GPT-Transcribe,另一个是 GPT-Live-Transcribe。

前者专门处理已经录制完成的音频文件,比如像一些会议录音、播客什么的,做异步批量转录。后者则是保持连接的实时在线,边说边把文字吐出来,也就是大家理解的流式输出,官方给的定位是「低延迟实时转录」。
这一次更新可以理解为是对上一代 gpt-4o-transcribe、gpt-4o-mini-transcribe,以及此前的实时转录模型 gpt-realtime-whisper 的正式换代。
在官方此次公布的基准测试数据中,在有上下文信息的场景下,GPT-Transcribe 的语义准确率能到 45.2%,而上一代 gpt-4o-transcribe 只有 26.3%。

放到 Common Voice 22 种语言的测试集上,GPT-Transcribe 的错误率是 19.27%,whisper-1 则是 40.37%,错误率相对下降了约52%。

在更贴近真实场景的录音测试里,GPT-Transcribe 的错误率是 8.98%,同样明显低于 whisper-1 的 15.21%。

而实时转录这条线上,GPT-Live-Transcribe 相比上一代 gpt-realtime-whisper 也是全面小幅领先,比如真实录音场景下错误率是 9.60%,上一代则是 11.65%。

两款新转录模型都支持 57 种语言,官方在视频演示里也特别提到,过去容易出错的几个环节,比如浓重口音、多语言混说、很短的应答、专有名词和数字,这次都做了针对性优化。
开发者还可以给模型三种上下文提示,比如可以自由描述录音场景的 prompt、列出容易出错的专有名词或术语的 keywords,以及告诉模型录音里可能出现哪些语言的 languages 列表。
上面的视频里有一段演示,就是主讲人在同一段录音里从英语切到西班牙语,模型没有中断识别,转完之后又切回英语,转录照样儿跟上了两次切换。
另外背景噪声的抗干扰能力也做了升级,即便录音里有乐器演奏的背景音,转录依然能保持非常准确。
不过这两款新转录模型也并非是万能替代品,因为它们不带说话人分割、不生成词级时间戳和 srt/vtt 字幕,也不做翻译。如果你有这些需求就还得用上一代的 gpt-4o-transcribe-diarize 或者 whisper-1 来解决。
所以选型上也很好区分。
如果你手头上是已经有了录好的音频文件想转录,那就可以用这次能力升级幅度最大的 GPT-Transcribe 模型,完全可以取代 whisper,转录效果会提升不少。
那如果你对接的是麦克风、通话这类实时音频流的话,就得用 GPT-Live-Transcribe 来处理了。
价格方面我也看了一眼。
GPT-Transcribe 每分钟是 0.0045 美元,比上一代 gpt-4o-transcribe 约 0.006 美元每分钟的价格还要便宜。
GPT-Live-Transcribe 是每分钟 0.017 美元,跟上一代 gpt-realtime-whisper 基本持平,算是同价换代了。
两款模型目前都是通过 Chat Completions、Responses 接口开放,GPT-Live-Transcribe 额外支持 Realtime 端点。
对于普通用户来讲,你要知道这次开放的是开发者侧的 API 能力,跟你在 ChatGPT 里用的实时语音聊天是两码事,它不是一个完全产品可视化的东西,个人开发者是可以用它们来搭工作流的。
写在最后
OpenAI 不仅在大语音模型(LLM)上持续保持业界领先,也开始在语音系列模型上发力。
说明 OpenAI 并不是把语音只当成一个孤立的聊天功能在做,而是在按照基础设施的思路在搞。
用户这头感受到的是丝滑的对话体验,而开发者这头能拿到的是可以随意组装的转录能力。
两者背后是同一套技术积累在不同场景里的落地。
如果你之前自己开发的小工具一直在用开源的 Whisper,那这次可以考虑换一下自己的工具链组合了。
既然看到这儿了,如果觉得还不错,帮忙随手点个「赞」、「在看」、「转发」三连;如果想第一时间收到推送,也可给我加个星标★,非常感谢!
夜雨聆风