你跟现在的语音助手说话,像在对讲机里排队:你说完,它才能开口;你想插一句,得先等它闭嘴。7月15日,阿里巴巴发布实时语音模型 Qwen-Audio-3.0-Realtime,想把这个"半双工"的别扭感彻底改掉。
它终于能"边说话边办事"了
过去两年,语音大模型最大的尴尬是"能聊不能办事"。你问它明天北京天气,它能流畅地陪你聊,但真要订票、查库存、查订单,还得你自己切回屏幕去点。
Qwen-Audio-3.0-Realtime 把 Agent 工具调用这条线补了上来。官方公布的链路是这样的:你一句话下去,它判断该不该调工具、调哪个,把外部接口的结果拉回来,自动融进这一轮的对话记忆;你接着追问,它能接着上一轮的工具结果往下走,而不是每问一次都从零开始。
这意味着语音助手第一次有了"执行力",而不只是"陪聊力"。模型分两个版本,Plus 侧重推理、Flash 侧重响应速度,已经在阿里云百炼上通过 WebSocket 接口开放。你被"只会聊天、不会干活"的语音助手坑过吗?评论区举个手。会说话的,终于也会干活了。
打断、插话、共情:从"对讲机"走向"打电话"
真正让人感到"不像机器人"的,是它的双工能力。
模型内置了一个多模态双工控制模块,支持声纹级背景过滤——嘈杂环境里对话照样流畅,不会被环境噪声打乱节奏。你也可以在它说话时随时插话,它边说边听,不会抢词,也不会装聋。
语气也不再是机械朗读。它会根据语境动态调整语气、节奏、音调和情感表达,还支持音色克隆。说人话,也开始像人了。
这两条升级线(共情对话、双工流畅度),加上前面的智商和工具调用,凑成了官方说的"又快又聪明"。
智商和反应,这次它都保住了
做实时语音最难的不是"快",而是"快了还不降智"——反应一提速,智商往往跟着掉。
Qwen-Audio-3.0-Realtime 交出的成绩是:在 Artificial Analysis 的语音评测里,综合排名超过 OpenAI 的 GPT-Realtime-2;在 S2S 语音指令遵循的公开评测 VStyle 上拿到 SOTA。
更直观的是 VoiceBench:Plus 版在标准提问下得分 92.5,换成口语化提问降到 90.5,只掉了 2 分。真人说话本来就啰嗦、含糊、爱省略,能扛住这种"随意性",才是它能不能走出 Demo 的关键。
上下文它最多能记住 50 个音频轮次、累计 300 秒的语音,默认 20 轮、可调到 50。客服、教培、娱乐陪伴这些要长时间对话的场景,总算够用了。
语音 AI 的下半场,比的不是谁更像人,而是谁更能替你把事办了。 你平时用语音助手,是真用来办事,还是只图个"陪聊"?评论区聊聊 👇
关注我,下一篇继续聊 AI 语音这条线的进展;觉得有用,点个「在看」👇
夜雨聆风