ARTICLE · 1025013
谷歌让AI边说边办事,语音助手开始告别干等
对着语音助手说完一件事,最让人拿不准的,常常是随后那段安静。它听见了吗?是在查资料,还是已经卡住了?再说一句,会不会打断刚才的任务?
谷歌9月15日发布的 Gemini 3.8 Live 和 Extended Thinking 版本,想改变的就是这段等待。按照官方介绍,模型可以继续与用户对话,同时在后台调用工具;更复杂的推理,也能和说话一起进行。
语音助手开始尝试把「聊天」和「干活」接在同一段交流里。真正需要观察的,是它能不能一边保持对话,一边把事情做完整。
01
等待时能说清进度,比一直安静更有用
很多人都有类似的沟通习惯。找同事帮忙查一条信息,对方回一句正在查,你就知道请求已经收到。如果需要更多材料,也能在这时补上一句,不必一直盯着聊天框。
这次更新把类似的交互带进语音任务。谷歌介绍,模型可以在后台执行工具和接口调用,同时继续对话。这里的接口,可以理解为助手向日历、查询系统或其他软件发出请求的通道,具体能做什么取决于应用接了哪些工具。
Extended Thinking 版本还会在处理复杂任务时给出简短回应或进度说明。它说正在检查,可以让等待过程更清楚,但这句话只能表示正在处理,不能代替完成结果。
如果系统正在查可用时间,却把话说得像预约已经办妥,声音越自然,反而越容易让人误会。好的进度提示需要对应真实状态,查到了什么、还缺什么、有没有失败,都要分得开。
对使用者来说,可以保留一个简单习惯:听见开始处理之后,继续等到具体结果。涉及日程、订单或资料更新时,再看目标系统里的记录。助手有没有一直说话,与任务有没有完成,是两件需要分别确认的事。

02
边看边聊,少一次截图和复制
谷歌还介绍,标准版 Live 可以处理近实时的视觉输入,让对话带上用户眼前的内容。官方示例中,它能结合视觉信息指导员工入职,也展示了看着画面进行交流的过程。
这类能力的价值,是把原来需要解释半天的背景直接带进来。讨论一份草图时,口头说右边那块要挪一下,如果助手确实看到了同一块内容,交流就不必每次从页面名称、位置和上下文重新开始。
Extended Thinking 的官方演示还包括,根据草图和连续的口头反馈形成网页组件。它说明了一种协作方向,但我们没有亲测,不能据此保证随口说几句就能交付可上线的网页,更不能把演示理解为任何软件都可以直接操控。
视觉输入也有需要核对的地方。用户看到的画面可能已经翻页,助手参考的内容是否同步了;一句改这里,指的是哪一行、哪个版本,都可能影响结果。省去描述背景的步骤后,确认指代仍然有用。
准备试这类功能时,可以先选一页不含敏感资料的草图或文档,明确指出要讨论的位置,让助手复述它理解的对象。双方看的是同一份东西,再继续修改,通常比发现做错对象后整段返工更省事。

03
你补充一句,后台任务也得跟得上
语音交流很少像填表那样一次说齐条件。人会想起遗漏的信息,也会改变主意。正在查一个时间,用户又补充只考虑下午,这样的插话很平常。
官方展示了多步预订和异步工具调用。异步的意思是,请求发出去后不必停住整段对话等待返回,结果到达时再继续处理。这能改善交流节奏,却也让应用需要协调更多状态。
如果旧条件的查询还在运行,新条件已经来了,系统要知道哪个结果仍然有效。否则,用户明明改了时间,助手最后却拿着上一轮的结果继续操作,表面上对话顺畅,实际事情走偏了。
公告证明的是模型提供了并行对话和后台执行的能力,不能由此推断每个接入应用都已做好取消、改口和重复提交保护。这些还要由具体产品实现并验证。
对于准备接入语音助手的团队,中途补条件应该成为一次明确的试用场景。先提出查询,再改变一个关键条件,检查旧结果有没有被排除。如果任务已经提交,界面和语音也应让用户知道,接下来需要修改,而不是继续把它当成未完成的查询。

04
榜单上的分数,不能直接搬进客服电话
谷歌公布了几组测试成绩。Extended Thinking 在一项语音任务测试中得到百分之六十八点六,在另一项银行业务语音测试中是百分之三十五点一。两项测试的任务与条件不同,这些数字不能直接当作某家企业上线后的办事成功率。
差异本身提醒我们,语音助手的评估需要落到任务上。声音自然、反应快、知识问答答得好,都有价值;但真实业务还要经过听懂条件、查询数据、选择工具和提交操作等环节。
例如,一次预约的结果是否正确,要检查时间、对象、数量以及最终是否写入系统。把其中某一步的表现很好,直接扩成整件事都可靠,会漏掉后面的错误。
产品团队可以准备一小组来自真实工作的测试,但先用脱敏或模拟数据。除了顺利完成的情况,还要放进中途改口、工具超时、查询无结果、重复请求。看它是否明确告知失败,能否停在人工可以接手的位置。
一次试用有没有通过,要看任务结束时留下了什么。 有可核对的记录,有清楚的失败说明,用户知道接下来谁来处理,这比一段始终流畅、最后却没有结果的对话更有用。

05
真正省下的,是反复交代和来回确认
这次两款模型的定位有所区别。Live 偏向规模化使用和成本效率,Extended Thinking 偏向复杂任务与多步推理。官方没有在这篇公告里给出统一价格,不能只凭模型名字替用户算出省了多少钱。
开放入口也分开推进。两款模型开始向开发者接口和 Google AI Studio 推出;企业入口包含私有预览和后续计划。普通用户侧涉及 Search Live、Gemini Live,以及带相应订阅条件的办公应用入口。看到发布消息,还要核对自己实际使用的产品是否已经开放。
如果只是想判断它对自己有没有帮助,不必一开始就交出一个很长的任务。可以从一段资料查询、一份草稿讨论开始,观察自己是否少讲了一遍背景、等待时能否继续补充信息、最后是否拿到了所需结果。
给团队算成本时,也别只看助手回复用了多久。把核对结果、修正错误、手动补完的时间一起算进去,才接近实际收益。原来五分钟能做完的小事,换成语音后还要花十分钟确认,就暂时不值得自动化。

乾元数创的判断是,这次变化值得关注,因为它开始处理人与软件协作中很常见的一段空白:任务还没结束,交流却先停住了。能边聊边做,让人有机会在事情进行中补信息、纠正方向,也更容易知道发生了什么。
下一步就看这些能力进入具体应用后,能否把进度与结果都交代清楚。我们需要的,是说完一件事后少操一点心,而不只是等待时多听几句话。