乐于分享
好东西不私藏

语音 AI 公司 Fish Audio 再融资 5200 万美元,22 人团队 ARR 达 2100 万美元;OpenAI 新推两款语音转录模型支持专业术语和多语言丨日报

语音 AI 公司 Fish Audio 再融资 5200 万美元,22 人团队 ARR 达 2100 万美元;OpenAI 新推两款语音转录模型支持专业术语和多语言丨日报
本期编辑:@三水@鲍勃

01

有话题的技术

1、OpenAI 发布 GPT-Live-Transcribe 与 GPT-Transcribe 转录模型:流式延迟可调,最低每分钟 0.0045 美元
已关注
关注
重播 分享

OpenAI 推出 GPT-Live-Transcribe 与 GPT-Transcribe 两款语音转录模型,分别面向实时音频流和已完成录音。前者可在说话过程中持续返回增量文本并调整延迟,后者侧重高准确率文件转录及 WebSocket 语音轮次转录,两款模型均支持上下文、关键词和多语言提示。

  • GPT-Live-Transcribe 支持实时增量转录与延迟调节:模型通过 Realtime API 接收麦克风、通话或媒体流,在语音持续输入时返回 transcript delta;开发者可降低延迟以更早获得部分文本,也可提高延迟以换取更完整的上下文和转录质量。

  • GPT-Transcribe 覆盖文件转录与 WebSocket 已提交语音轮次:模型支持对完整录音进行一次性或流式文件转录,也可在 Realtime 会话中转录已经提交的语音轮次;文件转录接口为 /v1/audio/transcriptions,单个文件上限为 25MB。

  • 新增三类转录上下文输入:两款模型均支持通过 prompt 提供录音场景,通过 keywords提示产品名、缩写等专有词,并通过 languages 指定一个或多个预期语言,用于改善专业术语、多语言音频和语码转换的识别。

  • 实时与文件转录采用两档定价:GPT-Live-Transcribe 按音频时长计费,每分钟 0.017 美元;GPT-Transcribe 每分钟 0.0045 美元,低于 GPT-4o-Transcribe 的每分钟 0.006 美元。

  • 成为新转录项目的默认推荐模型:OpenAI 将 GPT-Live-Transcribe 作为实时音频转录的推荐入口,将 GPT-Transcribe 作为录音文件转录的推荐入口;原有 GPT-4o-Transcribe、GPT-4o-mini-Transcribe 等模型仍可继续使用。

https://x.com/OpenAIDevs/status/2082201169443905798

(@OpenAIDevs@X)

2、韩国语音 AI 公司 Supertone 调整语音 AI 产品线:Play、API 与 Voice Builder 8 月 31 日停服,Shift、Clear、Air 转移至新运营方

韩国语音 AI 公司 Supertone 宣布调整旗下语音 AI 服务运营方式:Supertone Play、Supertone API 与 Voice Builder 将于 2026 年 8 月 31 日停止服务,新用户注册和付费已于 7 月 23 日关闭。实时变声器 Shift、音频降噪工具 Clear 与实时语音增强产品 Air 将转移至新的运营方,现有许可证和已购买声音继续有效。

  • Play、API 与 Voice Builder 于 8 月 31 日停止服务:三项服务将在 2026 年 8 月 31 日终止访问;Play 与 API 已于 7 月 23 日停止新用户注册和新增付费,现有用户需在停服前完成音频、声音配置及相关数据备份。

  • Shift、Clear 与 Air 转移至新运营方:实时变声、语音分离和实时音频增强产品不会随 Supertone Play 一并关闭,而是由新的所有者继续运营;官方表示现有许可证及已购买声音资产保持有效。

  • Supertone API 停止新增调用接入:API 原支持 31 种语言、200 余种预设声音、50 余种情绪风格,以及约 10 秒参考音频的声音克隆;随着新注册和购买关闭,依赖其 REST API、Python SDK 或 TypeScript SDK 的应用需要迁移至其他 TTS 服务或本地模型。

  • Supertonic 开源模型同步停止维护:Supertonic GitHub 仓库将归档,官方不再开发新版本或提供技术支持;最后公开版本为 99M 参数的 Supertonic 3,支持 31 种语言、ONNX Runtime 本地推理和 44.1kHz 16-bit WAV 输出。

  • 开源权重可继续本地部署,Voice Builder 不再生成新声音:Supertonic 的代码、ONNX 权重和多语言 SDK 不依赖云端服务,仓库归档后仍可下载和运行;但用于生成 Supertonic 2、Supertonic 3 自定义声音配置的 Voice Builder 将随停服下线。

https://www.supertone.ai/en

https://github.com/supertone-inc/supertonic/blob/main/README.md

(@Supertone)

3、Fish Audio 完成 5200 万美元种子轮融资:S2.1 Pro 单卡 H200 吞吐超 8000 tokens/s,ARR 达 2100 万美元
已关注
关注
重播 分享

Fish Audio 宣布完成 5200 万美元种子轮融资,由 Coreline Ventures 与今日资本领投。成立一年内,团队从 3 人扩展至 22 人,发布 4 款 TTS 模型和 1 款 STT 模型,平台用户超过 800 万,ARR 从零增长至 2100 万美元;企业及开发者业务已贡献约三分之二收入。

  • 单卡 H200 吞吐超过 8000 tokens/s:Fish Audio 重构完整推理栈并开发自定义 FP8 算子,使新推出的语音模型 S2.1 Pro 在单张 NVIDIA H200 上实现每秒 8000+ token,降低单次请求推理成本,并支撑 API 免费开放策略。

  • 支持 83 种以上语言与 1.5 万条自然语言控制指令:S2.1 Pro 覆盖 83 种以上语言,可通过超过 1.5 万种自然语言指令控制词级情感表达,并重点优化带口音英语、普通话、日语、韩语和西班牙语。

  • 盲听测试偏好率达到 66%:Fish Audio 披露,在与领先竞品的盲听比较中,66% 的听众更偏好 S2.1 Pro;该结果来自真实用户偏好驱动的后期训练体系。

  • 一年发布 5 款音频模型,社区积累超 200 万个声音模型:团队在一年内推出 4 款 TTS 模型和 1 款 STT 模型,平台累计超过 800 万名创作者、开发者和企业用户,社区语音模型数量超过 200 万。

  • 下一阶段扩展至 Audio LM 与语音到语音模型:融资后,Fish Audio 将研发范围从 TTS 扩展至音频理解语言模型和语音到语音系统,同时继续投入 API、开发者工具、本地化部署、零数据保留及符合 HIPAA 标准的企业配置。

https://fish.audio/blog/fish-audio-52m-seed-funding/

(@Fish Audio@X)


02

亮点的产品

1、Mirage 发布 Avatar X 数字人模型:10 秒视频生成 AI Twin,联合建模声音、微表情与肢体动作
已关注
关注
重播 分享

Mirage 发布 Avatar X 数字人生成模型,并将其接入 Captions 的 AI Twin 功能。用户录制 10 秒校准视频后,即可基于新脚本生成保留本人外观、声音和动作习惯的数字分身视频,支持横屏、竖屏及多语言内容生成。

  • 10 秒视频完成数字分身校准:Avatar X 仅需用户录制 10 秒视频,即可提取人物身份、声音和行为特征;Mirage 官方对比显示,HeyGen 需要 15 秒,Synthesia 需要 1–5 分钟。

  • 声音、表情与动作统一生成:模型不采用静态照片叠加嘴型的传统数字人管线,而是联合生成声音、眼神、微表情和肢体动作,使语音节奏能够同步驱动面部与身体表现。

  • 支持笑、哈欠、坏笑与惊讶等细粒度表情:Avatar X 面向完整人物表演建模,可生成笑声、哈欠、坏笑和倒吸气等细微反应,并在连续视频中保持人物身份一致性。

  • 同一 AI Twin 可修改服装、背景与语言:完成数字分身创建后,用户可通过脚本或提示词更换人物服装、拍摄环境和输出语言,无需重新录制真人素材。

  • 已接入 Captions,支持横屏与竖屏生成:Avatar X 当前用于 Captions 的 AI Twin 和 AI Avatar 功能,可根据脚本生成横屏或竖屏数字人口播视频;相关能力包含在 Captions Max 及更高等级订阅中,Max 价格为每月 24.99 美元。

https://x.com/trymirage/status/2082120270618530053

(@Mirage)

2、Kaltura 支撑世界杯 13 亿次播放与 700 万峰值并发:AI 智能体参与直播运维,并预告 Agentic Avatar 实时观赛交互

Kaltura 为欧洲、亚洲和中东的广播商及电信运营商提供 2026 FIFA 世界杯直播基础设施,赛事期间累计处理超过 13 亿次播放会话,峰值并发达到 700 万,覆盖约 4000 万台注册设备。平台同时引入 AI 智能体辅助六套生产环境运维,并预告面向体育直播的 Agentic Avatar,通过语音、文本和数字人形象为观众提供实时交互服务。

  • 13 亿次播放与 700 万峰值并发:Kaltura 驱动的电视服务在世界杯期间累计承载超过 13 亿次播放会话,峰值同时在线会话达到 700 万;整体直播需求较 2022 年世界杯增长约 86%。

  • 六套生产环境覆盖三大区域与 4000 万台设备:平台在欧洲、亚洲和中东同时运行六套独立生产环境,覆盖约 4000 万台注册设备,并在比赛活跃阶段每日监控约 3000 万台设备。

  • 单体后端重构为独立微服务:Kaltura 在 2022 年世界杯后的四年内完成媒体与电信平台重构,使认证、权益校验、播放等服务能够独立扩缩容,并通过服务隔离限制局部故障对整体直播链路的影响。

  • AI 智能体接入实时运维链路:工程团队使用 AI 智能体汇总环境健康状态、结合比赛进程监控流量与系统负载,并按需分析日志、请求量和错误模式;Kaltura 称,部分原需数小时完成的排查工作可缩短至数分钟。

  • Agentic Avatar 面向实时体育内容发现与观众服务:Kaltura 预告将 Agentic Avatar 扩展至体育与娱乐直播,通过语音、文本和可视化数字人提供实时对话,可用于内容发现、个性化观赛引导,以及套餐和订阅方案说明;官方尚未披露实际部署客户、响应延迟或正式上线时间。

https://corp.kaltura.com/blog/kaltura-delivers-2026-fifa-world-cup/

(@Kaltura)

3、XMOS 发布 VocalFusion XVF3620 语音处理器:芯片内集成 AI 降噪、全双工 AEC 与双麦克风波束成形

XMOS 推出 VocalFusion XVF3620 语音处理器,将 AI 降噪、全双工声学回声消除、双麦克风波束成形和自动增益控制集成至单芯片语音处理链路。该芯片面向智能家居、对讲设备、服务机器人和工业语音终端,可在交通、雷雨、空调及高噪声公共场所中改善语音采集,并支持播放音频期间的语音打断。

  • 单芯片集成完整数字语音处理链路:XVF3620 在芯片内完成 PDM-to-PCM 转换、双麦克风波束成形、AI 降噪、多频段压缩、均衡和自动增益控制,减少外部 DSP 与多芯片音频处理链路。

  • 全双工 AEC 支持播放期间语音打断:处理器集成快速自适应声学回声消除和残余回声过滤,在扬声器播放音频时继续提取近端语音,面向语音助手、对讲和机器人场景提供 barge-in 能力。

  • AI 降噪同时处理背景噪声与混响:降噪模型基于多类真实环境噪声训练,可分离语音与交通、雨声、雷声、空调及餐饮场所噪声,并针对混响进行抑制;模型还可根据具体应用和语音识别引擎进行调优。

  • XCORE 并行架构同时执行 AI、DSP 与接口任务:XVF3620 基于 XCORE 的确定性并行处理架构,使降噪、回声消除、波束成形和控制任务能够并行运行,避免不同实时任务之间相互阻塞。

  • 提供 USB、I²S 与多类控制接口:音频接口支持 USB 及主从模式 I²S,控制接口支持 I²C、UART 和 USB HID,并可直接连接 PDM 麦克风;XMOS 同步提供双麦克风 XK Voice L71 开发套件,用于 USB 外设或嵌入式语音产品原型验证。

https://www.xmos.com/xmos-launches-ai-voice-processing-in-new-vocalfusion-xvf3620-voice-processor

(@XMOS)

4、AI 会议笔记 Granola 发布 Apple Watch 版:一键启动转录,跨 iPhone、Mac 与 Windows 自动同步
已关注
关注
重播 分享

Granola 推出 Apple Watch 应用,将 AI 会议记录扩展至散步沟通、白板讨论和咖啡会谈等脱离电脑的线下场景。用户可从手表一键启动对话记录,结束后自动在 iPhone、Mac 和 Windows 客户端生成并同步会议笔记。

  • Apple Watch 一键启动会议记录:用户点击手表即可开始记录,界面会变为绿色并播放提示音,用于确认应用正在工作;再次点击即可结束,处理后的笔记会在其他终端显示。

  • 日历提醒与表盘复杂功能降低启动成本:针对已排期会议,应用会在开始前通过轻触提醒用户启动记录;临时对话则可通过表盘复杂功能直接新建笔记,无需先打开 iPhone 或电脑。

  • 跨 iPhone、Mac 与 Windows 自动同步:由 Apple Watch 发起的笔记会同步至 Granola 的手机和桌面客户端,用户可继续查看、编辑和处理会议内容。

  • 支持通过 Granola MCP 向 AI 工具提供会议上下文:手表采集并生成的笔记可继续接入 Granola MCP,作为外部 AI 应用的上下文来源,而非停留在独立的手表转录记录中。

  • 免费上线,要求 watchOS 11 或更高版本:Granola Apple Watch 应用已开放使用,用户需安装或更新 iPhone 版 Granola,并在登录后完成手表端设置。

https://x.com/cjpedregal/status/2082104366689821049

(@Granola@X)


03

有态度的观点

1、Dario Amodei:从未主张禁止开源权重模型

Anthropic CEO Dario Amodei 于当地时间 27 日发布博文,就外界关于 Anthropic 支持禁止开源权重模型的传言作出回应。

Amodei 在博文中明确表示,「Anthropic 从未主张禁止开源权重模型」,并强调不具备危险能力的开源权重模型「是一种公共品」,能为企业、开发者和研究人员带来价值。

他同时指出,即便是来自中国的开源权重模型,也不在他所担忧的范畴之内。

此外,他还对 AI 被用于「生物攻击」表示担忧,并认为开源权重模型在这类场景下风险更高,原因是难以对其施加护栏或进行使用监控。在应对措施上,Amodei 支持限制中国获取高性能芯片,并呼吁正式打击蒸馏行为。

此前,英伟达创始人兼 CEO 黄仁勋在 X 平台发布首条帖文,转发了一封由英伟达、Hugging Face、Meta、微软、Mistral 等多家 AI 公司联署的公开信,呼吁政策制定者不要对开源权重 AI 模型实施「过早的限制」。

( @APPSO)


04

Real-Time AI Demo

1、开发者用 Three.js + Kimi K3 + Agora,做了一台能「拨号聊天」的复古 AI 电话
已关注
关注
重播 分享

开发者 @zicojzc:

我用 Three.js 和 Kimi K3 开发了一款复古风格的旋转式电话。我在桌子上留了张便条:只要拨对号码,你或许就能与 @elonmusk 交谈了。

由 Agora 提供支持的语音人工智能技术。声音已开启。

https://x.com/zicojzc/status/2081950728315404354

Live demo here: 

https://rotary-dial-phone.vercel.app


05

社区黑板报

招聘、项目分享、求助……任何你想和社区分享的信息,请联系我们投稿。(加微信 creators2022,备注「社区黑板报」)

1、今日分享:pre-voice interfaces

已关注
关注
重播 分享

加入我们的 Voice Agent 和 Physical AI 社区

RTE 开发者社区持续关注 Voice Agent、Physical AI 等语音对话驱动的下一代人机交互界面。如果你对此也有浓厚兴趣,也期待和更多开发者交流(每个月都有线上/线下 meetup,以及学习笔记分享),欢迎加入我们的社区微信群,一同探索人和 AI 的实时互动新范式。

加入我们:加微信 Creators2022,备注身份和来意(公司/项目+职位+加群),备注完整者优先加群。

更多 Voice Agent 学习笔记:

OpenAI Realtime API 重磅更新:锚定语音模型「深度推理+自主执行」演进路径|Voice Agent 学习笔记

OpenAI 揭秘 Tolan 背后 AI 技术:如何让语音智能体拥有连贯记忆和稳定人格?丨 Voice Agent 学习笔记

如何用 Fun-ASR-Nano 微调一个「听懂行话」的语音模型?丨Voice Agent 学习笔记

如何让你的语音助手有眼力见——Turn Detection 的 5 种解法丨Voice Agent 学习笔记

Pion 创始人聊 WebRTC、AI、SIP 和 QUIC I Voice Agent 学习笔记

2025 年语音 AI 趋势十大洞察丨Voice Agent 学习笔记

硅谷顶级 VC 如何看语音 AI?Greylock 合伙人揭秘 Voice Agent 构建的三层策略

AI 客服还不够聪明,但已超过月薪五千的人类丨RTE Meetup 回顾

引爆 AI 会议工具潮流,Granola 打造 2.5 亿美元估值产品的秘密丨Voice Agent 学习笔记

活动回顾丨主动式语音 AI:全双工加持,让 AI 既会抢答也懂适时沉默丨RTE Meetup

写在最后:

我们欢迎更多的小伙伴参与「RTE 开发者日报」内容的共创,感兴趣的朋友请通过开发者社区或公众号留言联系,记得报暗号「共创」。
对于任何反馈(包括但不限于内容上、形式上)我们不胜感激、并有小惊喜回馈,例如你希望从日报中看到哪些内容;自己推荐的信源、项目、话题、活动等;或者列举几个你喜欢看、平时常看的内容渠道;内容排版或呈现形式上有哪些可以改进的地方等。