AI 最自然的形态,早就被贾维斯演示了
一个无处不在的 AI 助手,可以用语音和你交流,自主工作,连接各种设备和工具,最后把结果展示给你。人只需要把事情交代出去,剩下的交给它完成。
我最近基于 Hermes 做一个前端手机软件,解决的就是这个问题:人在不方便看屏幕、不方便打字的时候,能不能自然地和 AI 交流。比如户外、轻运动、开车,或者手上拿着东西时,直接口述任务,听 AI 反馈,等它把文件、图片或消息发回手机,也可以发到飞书、QQ 或其他指定的人那里。
这个想法来自我对最新版 Hermes 语音能力的一次测试。Hermes v0.20.0 提供了所谓的 “全双工” 实时语音对话能力:回复过程中麦克风保持开启,用户可以随时打断,比 “说完一段、等它处理、再听它朗读” 自然很多。
但实际测试下来,它的底层仍然能明显感受到语音转写、模型思考、语音输出这几个环节。它可以被打断,也可以流式输入、流式输出,但整个任务本质上仍是一条串联链路。
和豆包的实时语音通话对比也很明显。豆包响应快、可打断、等待不超过一秒,适合陪伴和轻量任务;Hermes 这类 Agent 能调用更大的模型和更多工具,处理复杂任务,但等待更长。
实际上,把转写、思考和朗读拆开看,前后两端耗时并不长,真正耗时的是模型思考和调用工具的过程。
所以这是一个取舍问题:是要快速响应,还是要能干活?
答案很清楚:我不要一个反应很快、却只能陪你聊天的 AI,我更想要一个反应可以慢一点、但能把事情真正做好的聪明人。既然选择更大的模型和 Agent,就是因为它能理解复杂任务、调用工具、持续工作,最终交付结果。为了快一秒钟,把 Agent 变成只会接话的傻子,没有意义。
所以,我做这个软件的思路很明确:完全信任 Hermes Agent 的工作能力,再给它接上耳朵和嘴巴,把原本主要在桌面端运行的 Agent 转移到手机上,进一步扩展使用边界。
文字问答、代码提示、Vibe Coding 之后,AI 正在进入一个新的阶段:离开屏幕,回归自然。在每一个不方便用电脑的时候,在每一个享受阳光的午后,在每一个深度思考的夜晚,人只需要开口,Agent 就可以开始工作。
这大概就是我期待的贾维斯:它不要求人一直围着屏幕生活,只在人的生活之外持续工作,把结果送回来。
夜雨聆风