夜雨聆风学习资料网

ARTICLE · 1042059

AI 同传杀到 2.3 秒,翻译软件的苦日子来了

AI 同传杀到 2.3 秒,翻译软件的苦日子来了

QUOTE

翻译的终点不是「翻得对」,而是「听得懂、跟得上、像人话」。

—— 冲浪信号

上周开了一场跨国会议,对面德国同事噼里啪啦讲了一分钟,这边的实时翻译字幕还停在半句上。等字幕追上来,人家已经讲到下一个议题了。

那一刻我真的在想:同声传译这东西,什么时候才能真的不拉胯?

没想到,答案来得比想象中快。

本文看点

01

2.3 秒,追平人类同传

02

三项新能力,专治机翻味

03

保留你的音色,替你开口

01

LAUNCH

千问今天放大招:同传延迟降到 2.3 秒

9 月 19 日,阿里千问发布了同声传译大模型 Qwen3.8-LiveTranslate,专门干一件事:实时同传。

核心变化就一个数字——字均延迟从 2.8 秒降到 2.3 秒

可能有人觉得,0.5 秒而已,有啥好吹的?

但你要知道,人类专业同传译员的延迟,也就在 2 秒上下。AI 把延迟压到 2.3 秒,意味着它已经摸到了人类同传的水平线,而且是全天候在线、不喝水不上厕所的那种。

翻译行业那句话怎么说来着:同传拼的不是词库,是「开口的时机」。翻得再准,慢了半拍,信息就断在空气里了。

而 2.3 秒这个数字,是模型架构重新设计的结果,不是简单堆参数堆出来的。它靠的是 Interleave 架构,把「听」和「译」揉进同一条流水线里,边听边译,而不是听完一整句再动手。

2.8

上一代 · 秒

2.3

新一代 · 秒

— 字均延迟(LAAL)对比

02

FEATURES

三项新能力,专治「机翻味儿」

光快还不够,翻译得准、听得懂、有上下文,才是真本事。这次千问一口气加了三个能力:

第一,实时说话人分离。会议里四个人轮着说,谁说的哪句话,分得清清楚楚,音色还能保持稳定。再也不用担心「这句话到底是谁讲的」。

这个能力有多实用?你去开一次有多方参会的线上会就知道——字幕上全是「说话人1、说话人2」,根本对不上人,等于白翻。

第二,原文译文同帧同出。双语同屏,字幕原文在上、译文在下,两边对照着看。这对学外语的人来说简直是福利,还能顺手纠正自己听错的词。

第三,长上下文消歧。联系前文理解当下——人名、专业术语这种「单词都认识、连起来不知道在说啥」的东西,翻译精度上了一个台阶。

比如上周那个会,德国同事说了个「Lieferkette」,直译是「交付链」,其实是供应链的意思。没有上下文,机翻能给你翻成「交货的链子」。

说白了,这不再是逐句翻译,而是带着语境的「理解性翻译」

— 说话人分离示意

03

TECH

背后的技术,一句话讲明白

听不懂「Interleave 架构」「Hybrid MoE」没关系,我用大白话给你翻译一下。

以前做同传,是「听一句→翻译一句→再说一句」三步走,每步都有延迟,叠起来就卡。

Qwen3.8-LiveTranslate 用的是 Thinker–Talker 双模块:Thinker 负责把视频、音频、原文、译文编进同一条时间线,边听边理解边出译文;Talker 负责把译文说出去,还能保留原说话人的音色

对,你没看错——AI 同传出来的声音,是你的音色、说外语。这就不只是「翻译」,是「替你开口」。

「你用中文说话,对面老外听到的是自己的母语,而且声音还是你的。」

想象一下:你用中文说话,对面老外听到的是自己的母语,而且声音还是你的。这种体验放在两年前,只会出现在科幻片里。

评测上也不虚:在覆盖 14 个语向的多说话人长音频评测集上,翻译忠实度、流畅度、简洁度、说话人分离错误率四个维度,都优于行业主流实时同传系统。在 FLEURS 音频测试集的 70 个语言方向上,同样全面领先上一代。

04

SCENES

对普通用户意味着什么?

你可能会说,我又不开国际会议,跟我有啥关系?

关系大了。同传是 AI 里少有的、普通人立刻能用上的能力

看直播

追生肉剧、看外语直播,不再需要等字幕组

出国

对着菜单、路牌、店员直接说

学习

上网课、听海外播客,第一遍就听懂

开会

跨国会议,不用再假装点头、其实啥也没听懂

而且这代模型是「开源党的老朋友」千问出的,体验链接已经开放,API 同步上线。不是 PPT 产品,是真能上手试的那种。

— 双语字幕,实时跟读

05

THOUGHTS

说点我的想法

先算笔账。一线城市同传译员按天收费,一天四五千起步,国际会议更贵,动辄上万。这还只是请得起同传的公司才能享受的服务。

而 AI 同传的边际成本,趋近于零

这不是说同传译员要失业,而是说「实时翻译」这件事,第一次从少数人的特权,变成了人人可得的默认能力。这种下沉,历史上每次都会带来一波新的使用场景——就像当年在线翻译让「查词」不再需要翻字典一样。

再说回产品本身。AI 同传这条路,几家公司都在卷。但这次千问给行业提了个醒:翻译的终点不是「翻得对」,而是「听得懂、跟得上、像人话」

2.3 秒的延迟,背后是模型架构的重新设计。这说明国产模型在「实时交互」这类硬场景上,已经能正面掰手腕了。

当然,延迟 2.3 秒不等于完美。方言、口音、嘈杂环境,都还是待解决的难题。同传这行也不会一夜消失——越是高规格的商务谈判、国际会议,越需要人来兜底。但方向对了,剩下的只是时间问题。

翻译软件的苦日子,可能真的要来了。

END

我是冲浪信号的小弟,一个爱聊互联网资讯、数码产品和使用心得的普通网友。如果你对 AI 同传有自己的看法,欢迎留言聊聊。

点赞在看转发

如果今天这篇有收获,欢迎三连,我们下篇见。

相关学习资料