乐于分享
好东西不私藏

AI助手听得懂我说话,但它不会说话

AI助手听得懂我说话,但它不会说话

昨天傍晚我在跑步。

跑到一半,突然想把一个憋了很久的想法理清楚——

我天天用的AI助理,有一个明显的短板:它听得懂我说话,但它不会说话。

什么意思?

这里得先分清两件事。

豆包、元宝这类对话AI,语音交互早就打通了——你说话,它开口回,来来回回像打电话。这没什么好提的。

我说的是另一类东西:智能体平台。我在上面搭了自己的AI助理,它能接任务、跑流程、交付结果,相当于我的"AI员工"。在这个场景里,语音输入早就解决了——我用语音说,它秒懂;但它回复我,只能弹出一屏文字,不会开口。

问题来了:

开车的时候,谁敢低头看屏幕?

做饭的时候,两只手都是油。

跑步的时候,眼睛根本离不开路面。

我的AI助理就在手机里,我却"看"不到它。

这种感觉很怪:一个 24 小时待命的助理,一到我的碎片时间就集体失声。

而碎片时间,恰恰是我最需要它的时候。

我不是心血来潮——作为这个平台早期试用群的老用户,我一直跟他们的客服有交流。最近ChatGPT升级了语音交互,全世界用户都在夸——这件事不难,就看想不想做。

换作以前,这种"不爽"到我这就结束了。抱怨两句,忍着。

但昨天我没有停在抱怨。

跑完步,我跟AI助理说:帮我把这件事整理成一条产品建议。

三分钟后,一条结构完整的建议出来了:痛点是什么、哪些真实场景被卡住、对标谁、技术上为什么可行、建议加哪三个功能——

一键朗读AI的回复;

会话级自动朗读开关;

连续语音对话模式。

我把它发到了平台的官方建议邮箱。

发出去那一刻我还想:这封邮件,大概率石沉大海。

结果,不到一分钟,回信来了。

不是"已收到,感谢反馈"的自动回执。

是一封逐条拆解我建议的回信:三个功能设想逐条分析;确认了平台已有的语音能力清单;最后明确写了一句——

"语音朗读是交互闭环的关键一环,会重点反馈。"

我盯着这封信看了半天。

给我回信的,是平台的官方AI客服。

也是一个AI。

也就是说:我让AI帮我把建议整理好,发给另一个AI,它秒回了我——中间没有任何人类参与。

那一刻我有种奇妙的感觉:帮我干活的那群家伙,和收我建议的那位,是同一个物种。

一个靠AI干活的人,给造AI的平台提建议,再被AI接住。

这就是这个时代才有的故事。

今天早上我在想:这件事里,最值钱的是什么?

不是建议本身,也不是那条秒回。

体感

"AI不会说话"这件事,用这个平台的人有几千万人,人人都碰到过。产品经理会不知道吗?他们大概率知道。

但知道,和体感,是两回事。

产品经理的待办清单里有一百件事,"语音朗读"可能排第87位。而一个真正把AI当助理用的人——开车在用、跑步在用、做饭也在用的人——这个短板每天都硌着他,一天硌好几回。

产品的漏洞,坐在办公室里的人看不见,天天用的人躲不开。

这不是我第一次靠体感抓到东西。

这几年我做AI,所有真正有用的打法,没有一条是从教程里学来的,全是实战里硌出来的:

哪个环节AI能顶上、哪个环节必须人上——用出来的;

什么指令在我的行业里好使——喂出来的;

团队里谁能带AI、谁带不动——试出来的。

29年做保险,我给上万个家庭讲过"风险"。我最深的一个体会是:客户对风险的所有理解,都来自他真正疼过一次。

产品洞察也一样。

体感,是这个时代最稀缺的产品洞察。

它没法靠问卷获得,没法靠头脑风暴获得,甚至没法靠聪明获得。只有一条路:把自己泡在真实使用里,泡到问题自己浮出来。

回到那条建议。

它会不会被采纳?不知道。也许排期很长,也许优先级不够。

但我不着急,也不指望一封邮件改变什么。

我在乎的是另一件事——

当一个新时代的工具出现时,大多数人的姿势是"等它变好用";少数人的姿势是"把它用到底,然后告诉造它的人:哪里还不好用"。

前一种人,是用户。

后一种人,是和这个时代一起造东西的人。

哪怕,只是提一条建议。

共勉。