ARTICLE · 1025842
谷歌让AI边聊边干活:语音助手最烦人的等待,要变了
谷歌让AI边聊边干活:语音助手最烦人的等待,要变了你和AI说话时,最扫兴的瞬间,往往是它突然安静了。 北京时间9月16日,谷歌发布Gemini 3.8 Live及其Extended Thinking版本。新变化很具体:AI可以继续和你交谈,同时在后台推理、调用工具、推进任务。语音助手开始尝试接走对话中间那段等待。官方发布[1] 但“嘴上一直有回应”和“事情确实办好了”,仍然是两回事。看懂这次更新,要把耳朵听到的流畅,与最后拿到的结果分开。 
Google官方发布图,两个新实时语音型号在同一公告中亮相。图片来源[2] 这次有两个版本。3.8 Live侧重对话效率和成本;Extended Thinking侧重更复杂的推理。它们追求的共同体验,是交谈过程中还能接着做事。 谷歌展示了几个很生活化的方向:AI看着棋局与人互动,结合屏幕内容回答新员工的问题;另一个演示则把手绘草图和口头修改要求,变成网页组件。这些是官方演示,不是本文亲测,更不能视为任何人都能稳定复现的保证。 过去遇到复杂要求,用户常常得先把话说完整,再等一个结果。若中途想起来“预算再低一点”“刚才那个条件不算”,就要重新解释。新一代实时语音模型想缩短的,正是这种沟通断点。 比如安排聚餐,你可能先说人数,接着补一个时间限制,又临时改变地点。这是用来理解能力的假设场景:好助手需要保留已确认的条件、接住新条件,还要说明哪些安排仍在查询。仅仅回答一句“好的”,远远不够。 因此,最有价值的变化不是声音更像人,而是你能在事情进行到一半时,继续参与和纠正。 
Google棋局互动演示第10秒静帧。实际画面是屏幕棋局;用于展示交互场景,不代表本文实测。演示出处[3] 谷歌的开发者公告把关键能力称为“异步函数调用”。用普通话解释,就是AI发起一次查询或操作后,不必等外部工具返回,才能继续输出语音。开发者说明[4] 这很像请同事帮忙查一个空闲会议室。他可以一边打开系统,一边问你是否需要投影设备。对话和查询同时推进,等待就不再是一段完全空白的时间。 但这里至少有三种状态:它听懂了,它正在做,以及它做完了。产品如果把三者都包装成同样自信的声音,体验越自然,误会反而越容易发生。 谷歌还提供实时视觉上下文,让对话参考用户正在展示的内容;开发者可为复杂任务配置思考方式。它并不意味着AI获得了随意操作所有软件的能力。工具能做什么、账号有没有权限、最终结果如何返回,仍由应用接入决定。Live API说明[5] 这也解释了为什么语音模型升级,不会自动让每个客服都升级。企业还要接通订单、库存、预约等系统,并处理取消、超时和转人工。模型把对话接得更顺,只是整条服务流程的一部分。 
Google员工入职助手演示第10秒,结合屏幕与语音进行交互。画中演示者身份未核实,不作姓名推断。演示出处[6] 一个容易被忽略的细节是,谷歌的思考模式文档专门区分了“仍在进行”和“已经空闲”的交互状态。因为同一次请求里,模型可能开口好几次,应用不能把它说完一段话,就当成整个任务已经结束。思考模式文档[7] 这会直接影响界面上的按钮和提示。假设助手还在查询候选地点,用户说“算了,换成线上”,应用就需要处理正在进行的工作,避免旧请求稍后返回时覆盖新要求。这里描述的是产品应当解决的问题,并非宣称所有接入产品已经做到。 对用户来说,值得期待的提示会更具体:查到了哪些条件,还剩哪一步,什么时候需要本人确认。语气是否热情,应该排在这些信息之后。 这场变化和中国读者并不远。阶跃星辰已经公开StepAudio 3 Realtime页面,将全双工、边想边说和工具完成任务列为核心能力。“全双工”关注双方能否自然插话,不必机械地轮流说完整段话。阶跃官方页面[8] 两家放在一起看,竞争方向很清楚:语音AI既要接住聊天节奏,也要把意图送进真实工作流程。厂商有共同方向,并不代表实现细节、中文体验或可靠性已经相同。 
阶跃StepAudio 3 Realtime官网视频封面,展示街头交流场景。属于官方宣传素材,不作为实际对话效果或人物身份的证明。图片来源[9] 数字尤其需要分开读。谷歌在官方公告[10]中披露,Extended Thinking的τ-Voice成绩为68.6%,在Sierra的τ-Voice-banking上为35.1%。这是不同任务集合上的评测结果,不能拿其中一个数字当成所有现实事务的成功率,更不能理解为银行业务已经可以无人托管。 
Google公告所载τ-Voice评测图,68.6%是该评测成绩,非现实事务总体成功率。另一项银行任务评测与本图不是同一集合。图表来源[11] 比排名更有用的问题是:评测到底让AI做了什么,是否要调用工具,怎样判断任务结束,出错时由谁兜底。ServiceNow的EVA-Bench也把语音交互体验与任务完成放在一起考察,提醒我们不能只凭“听起来顺”判断助手好坏。评测项目[12] 中文用户还会遇到口音、人名、地址、背景噪声和临时改口。同一段演示中的好表现,不能替代你自己那段复杂通话。这些都是判断落地质量时该保留的问题,本文没有做跨模型实测排名。 我的判断是,客服、售前咨询、员工培训,以及需要看着画面解释问题的人,会先感受到这类能力的价值。他们的工作常有一个共同点:信息不是一次给齐的,需要边问边补。 普通用户未必会先下载一个新工具,也可能是在已有的搜索、办公或服务入口里遇到它。谷歌表示,两个版本从发布日起逐步推出;开发者可通过API和AI Studio接入,消费者入口涉及Search Live、Gemini Live和部分Workspace订阅功能。推出范围[13]逐步推出不等于所有地区、账号和套餐已经同时可用。 
Google Search Live官方演示第10秒,用手机画面辅助对话。原片展示现实物品的排查场景,不等于任何问题都能自动解决。演示出处[14] 对中国读者,眼下更有用的行动,是拿一件真实、低风险的小事检验你已经能用到的语音助手。比如把一份公开活动通知整理成出行准备清单,中途改一次人数,再补一个限制条件。 看它能否接住改口,保留正确条件,最后交付一份能核对的清单。这个练习不需要付费追新,也不需要交出敏感资料。若它只是持续说“明白”,却漏掉了关键条件,声音再自然也没有省下你的工作。 语音AI会越来越容易让人忘记自己在和机器交流。真正值得买单的进步,是交流结束后少了一件需要你重新做的事。把注意力留给结果,才不会被那句流畅的“已经帮你处理好了”带着走。 你更愿意让语音AI边查边汇报,还是等它确认结果后再开口?欢迎留言,说说哪种更让你安心。 如果这篇帮你看清了语音AI的新变化,可以点个在看,或分享给经常用语音办事的朋友。 
回复“工具箱”,获取《奇点纪 AI 工具箱·海外篇》持续更新清单。 [1]官方发布:https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-8-live-gemini-3-8-live-extended-thinking/ [2]图片来源:https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-8-live-gemini-3-8-live-extended-thinking/ [3]演示出处:https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-8-live-gemini-3-8-live-extended-thinking/ [4]开发者说明:https://blog.google/innovation-and-ai/technology/developers-tools/build-real-time-voice-applications-gemini-audio/ [5]Live API说明:https://ai.google.dev/gemini-api/docs/live-api [6]演示出处:https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-8-live-gemini-3-8-live-extended-thinking/ [7]思考模式文档:https://ai.google.dev/gemini-api/docs/live-api/thinking [8]阶跃官方页面:https://static.stepfun.com/blog/stepaudio3/realtime/ [9]图片来源:https://static.stepfun.com/blog/stepaudio3/realtime/ [10]官方公告:https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-8-live-gemini-3-8-live-extended-thinking/ [11]图表来源:https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-8-live-gemini-3-8-live-extended-thinking/ [12]评测项目:https://servicenow.github.io/eva/ [13]推出范围:https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-8-live-gemini-3-8-live-extended-thinking/ [14]演示出处:https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-8-live-gemini-3-8-live-extended-thinking/

你不必等它想完,再补下一句话

嘴上在说,后台也要真的有进展

国内也在追,但别把流畅当成功率


最先改变的,是那些需要反复确认的小事

📎近期精选
关注奇点纪并设为星标,持续看懂AI的新变化。

引用链接