乐于分享
好东西不私藏

AI时代的第一入口,不是APP,而是语音

AI时代的第一入口,不是APP,而是语音
   
 

AGENTOS · VOICE-FIRST INTERACTION

 

AI时代的第一入口,
不是APP,而是语音

 

低延时 · 边听边说 · 边思考边执行 · 多模态协同

   

我越来越相信,AI时代的第一入口,不是APP,也不是更大的屏幕,而是语音。

这不是因为语音听起来更有未来感,而是因为AI正在从“等待指令的软件”,变成“理解目标、持续沟通并完成任务的智能体”。当计算机开始主动理解人,最自然的方式就不应该再是让人去适应菜单和按钮,而是让机器适应人的表达。

我在思考aiweiOS的时候,越来越明确一个方向:未来的AgentOS,首先应该是一套会听、会说、会理解、会执行的系统。语音不是其中一个功能,而是它面向人的第一层操作系统。

SECTION 01

一、过去的电脑,要求人学习它

过去几十年,计算机交互一直在变得更简单。

最早是精确的指令输入。后来有了图形界面,用户可以用鼠标点击图标、打开菜单、填写表单。键盘、鼠标和屏幕极大降低了计算机的使用门槛,但它们仍然有一个前提:你必须知道自己要找什么,也必须知道这件事应该在哪个APP里完成。

所以,我们每天都在学习各种软件的操作路径。

发一张发票,要打开某个系统;整理会议,要进入某个工具;控制一盏灯,要找到对应的设备页面。很多时候,我们并不是在完成工作,而是在学习软件希望我们怎样完成工作。

AI改变的,恰恰是这个前提。

人通常只知道自己想要什么,却未必知道应该点击哪里。我们会说:“把今天的会议整理成三条结论,发给参会的人。”但我们不会先思考应该打开哪个应用、调用哪个接口、填写哪些字段。

语音的价值,就是把“操作路径”重新交还给机器。

你表达的是目标,AI负责理解目标、拆分任务、调用工具并返回结果。交互从“人适应软件”,变成“软件理解人”。

SECTION 02

二、语音表达的不是文字,而是完整意图

文字可以表达信息,但语音能够表达更完整的人。

同样一句“你看着办”,可能是信任,也可能是不耐烦;一句“还行吧”,可能是真正认可,也可能是在委婉拒绝。语速、停顿、重音、语气和呼吸,都会改变一句话的含义。

这就是我认为语音比文字更适合AI陪伴和智能体交互的原因:它不仅传递“说了什么”,还传递“为什么这样说”和“说这句话时处在什么状态”。

未来的AI如果只能把语音转成文字,再把文字交给模型处理,它仍然没有真正理解人。真正的语音智能,应该同时理解语言、语气、情绪和上下文,再用合适的语气、表情或行为回应。

这对陪伴机器人、儿童教育、银发照护、AI导览、车载助手和家庭智能设备都很重要。很多需求并不是一个按钮能解决的,也不是一段文字能完整承载的。人在真实世界里沟通,本来就是多模态的。

SECTION 03

三、语音最重要的价值,是不打断人的生活

屏幕是一种很强的交互方式,但它需要人停下来、看过去、伸手操作。

语音则可以进入正在发生的生活。

做饭的时候,可以让AI记录突然想到的事情;开车的时候,可以继续完成信息查询;走在展馆里,可以随时问展品背后的故事;老人不需要学习复杂的菜单,也可以直接说出自己的需求;机器人在房间里工作,也不必要求人一直盯着一个屏幕。

这也是为什么AI硬件会重新变得重要。

如果AI只存在于浏览器和APP里,它仍然是一个需要被打开的工具。只有当它进入耳机、眼镜、音箱、机器人、汽车和家庭设备,语音才真正拥有了“随时在场”的意义。

未来的电脑不一定消失,但它的屏幕、键盘和鼠标可能会逐步退到后台。人只需要自然地说话,必要时再用视觉、触摸和空气投影完成确认。

这不是语音取代所有交互,而是交互开始回到人的本能:说话、倾听、观察和行动。

SECTION 04

四、真正可用的语音Agent,必须解决五个问题

语音交互看起来简单,真正做起来却比一个聊天框复杂得多。

第一,低延时。

如果你说完一句话,AI过了很久才回答,交流就会变成轮流提交表单。人的对话有自然节奏,低延时不是体验优化,而是语音交互能否成立的前提。

第二,边听边说。

人不会等对方完全说完才思考。AI也应该能够流式识别、流式理解、流式回应,并且允许用户随时打断。不能打断的语音助手,本质上仍然是语音版的问答框。

第三,边思考边执行。

AI不能只回答“应该怎么做”,还要能够调用工具、控制设备、查询信息、修改任务状态。语音交互的终点不是生成一段话,而是让真实世界发生变化。

第四,真正懂人。

它要记得你的偏好、正在做的事情和前后语境,也要听懂语气里的犹豫、焦虑和兴奋。没有记忆和情感理解,语音只能做到“听见”,还做不到“理解”。

第五,可以持续进化。

每一次交流都应该让系统更了解用户,也让用户更清楚如何与它协作。未来的Agent不是一次性购买的功能,而是一个随着使用不断成长的伙伴。

SECTION 05

五、语音优先,但不会只有语音

我并不认为未来会回到一个只有声音的世界。

复杂数据需要屏幕,精确选择需要触摸,空间任务需要视觉,危险操作需要明确确认。真正的下一代交互,应该是语音优先、多模态协同:先用语言表达意图,再用视觉、触摸、表情和动作完成理解与确认。

它的方向不是让人学习更多操作,而是让机器理解更多人。

这也是我理解的AgentOS应该具备的样子:低延时,边听边说,边思考边执行,能懂人,而且可以持续进化。它不只是把大模型装进设备,而是让设备拥有持续沟通、长期记忆和真实执行的能力。

AI时代真正的交互革命,不是我们发明了一个更复杂的按钮,而是终于可以不再依赖按钮。

当人可以像和另一个人一样自然地与电脑沟通,计算机才真正从“工具”开始变成“伙伴”。而语音,可能就是这条路上最重要的第一步。

SECTION 06

六、最近几个项目,正好说明了语音AI的完整技术栈

最近我在关注几个代表性项目。它们有一个共同点:都没有把语音理解成“把文字读出来”,而是在解决实时沟通、持续任务和真实执行的问题。

ChatGPT 的 Live 语音体验,代表了产品形态。

OpenAI对Live的定位,是可以同时听和说,让轮流发言、打断和连续对话更自然。它还可以在同一个语音会话里结合文字、图片、记忆和搜索。它给人的启发是:语音AI的核心不是“回答得像不像人”,而是对话能不能持续,用户能不能随时改变方向,AI能不能记住上下文。

Qwen Audio Agent,代表了语音运行时。

它的项目介绍里有一句很准确:让Agent持续说话、工作并保持在场。用户和AI说话的过程中,后台任务可以继续执行,任务完成后再自然地回到当前对话。这正是我理解的“边听边说、边思考边执行”,而不是把一次对话切成几个互不相干的请求。

LiveKit Agents,代表了实时通信和编排基础设施。

它把WebRTC、语音流、转向检测、打断处理、STT-LLM-TTS流水线、实时语音模型、工具调用和多Agent协作组织起来。它解决的不是“哪个模型最聪明”,而是如何让一个AI Agent在真实网络和真实设备中稳定地参与一场持续对话。

从工程角度看,这三个项目刚好对应三层能力:ChatGPT Live是产品体验,Qwen Audio Agent是语音运行时,LiveKit是实时媒体和Agent基础设施。

这也说明了一个常被忽略的事实:语音AI不是接一个模型就结束了。真正的产品还需要低延时传输、会话管理、记忆、权限、工具调用、设备控制和异常恢复。谁只关注模型参数,谁就很难把语音真正做进机器人、汽车和家庭设备。

SECTION 07

七、乔布斯早就想到了:书本是单向的,AI可以变成双向的

乔布斯在1983年的Aspen演讲里谈到,书本是非常伟大的媒介。它可以让一个人直接读到 Aristotle 和 Plato 的思想,中间不需要老师或其他人转述。但他紧接着说,书本有一个问题:你不能向 Aristotle 提问。

随后,他提出了一个当时非常大胆的设想:如果机器能够记录一个人一生的思想方式、原则和看待世界的方式,那么即使这个人已经离世,后来的人仍然可以向这台机器提问:“Aristotle会怎么想?”

今天回头看,这段话已经不只是对计算机的预测,更像是在描述AI时代的知识形态。

书本把古人的思想带到了今天,但它是一种单向传播。我们可以阅读、理解、质疑,却无法获得回应。AI则可能把这种关系改造成双向交互:我们可以追问,可以要求举例,可以让它换一种方式解释,也可以把新的问题带回到一个人的思想体系里。

如果一个人的一生都被认真记录,包含他的文字、声音、经历、判断和与他人的真实对话,那么在他离开之后,后人也许可以通过语音与一个“基于其记忆和作品的AI”互动。

但这里必须保持清醒:这不是一个人真正回来了,更不是数字化就等于灵魂复活。它只能是一个有来源、有边界、有不确定性的记忆接口。谁授权记录,哪些内容可以使用,后人是否有权访问,AI回答时如何标注推断,都必须被认真设计。

我认为,这正是语音成为基础交互形态的更深层原因。

知识不是一张静态网页,记忆也不是一个文件夹。人真正理解一个人,往往是在不断追问、回应、补充和修正中完成的。自然语音让这种关系第一次有机会在机器里重新出现。

从书本到电脑,从电脑到Agent,媒介一直在变得更加互动。下一代计算机最重要的变化,也许不是它能显示多少信息,而是它能否像一个真正的交流对象一样,听懂你、回应你,并和你一起把事情做完。

这也是我持续做aiweiOS的原因:让AGI不只停留在云端和屏幕里,而是通过自然语音进入耳机、机器人、汽车和每一个家庭。技术最终要回到人的生活,而语音,是它回到生活最自然的入口。

资料来源

  • OpenAI ChatGPT Voice 官方说明
  • Qwen Audio Agent 官方仓库
  • LiveKit Agents 官方文档
  • Steve Jobs Archive:1983 Aspen 演讲

以上,既然看到这里了,如果觉得不错,随手点个赞、在看、转发三连吧,如果想第一时间收到推送,也可以给我个星标⭐~谢谢你看我的文章,我们,下次再见。

作者:胡楠楠,aiwei.ai公司联合创始人、CTO&FDE,前华为、腾讯金牌架构师。持续分享最新AI工具、Agent、端侧AI和AI硬件实践,欢迎关注。