ARTICLE · 1046762
语音输入法才会AI最好的工具
人机之间 / NOTES ON HUMAN × AI
用 AI 时
你懒得打出来的话
可能最重要
多说一点,把话说完整
开篇 / OPENING
我们不缺少想法,
缺的是把它们说完整的时间。
最近看到桌面版的微信增加鼠标长按语音输入功能,鼠标移动到对话框,会有一行提示:按住鼠标 语音输入文字。
最近用了几天,发现还挺好用的,轻声说话也可以准确识别。

图 / 微信 PC 版对话框里的语音输入入口
这件事让我想到,在 AI 时代,语音输入是目前很多人使用 AI 时最容易忽视的一个功能。
为什么?
我们先问自己一个问题:你每天和 AI 交流,到底有多少信息,在输入之前就被自己压缩或省略了?
提到语音输入,大家很容易想到速度:说话比打字快,可以少敲一些键盘。
但在 AI 时代,它有另一个作用:
让我们更愿意把事情说完整,告诉 AI 更多的上下文内容。
01
很多细节,是因为嫌麻烦才没说
假设你想让 AI 帮你写一封邮件。
打开输入框,你可能会打:
“帮我写一封邮件,催一下客户的项目进度,语气客气一点。”
需求表达清楚了吗?似乎清楚了。
但你心里其实还有很多事:
这个客户合作了两年,关系一直不错。上周已经催过一次,对方说负责人出差了。你着急,是因为内部排期快撑不住了。你希望这周能拿到明确回复,但又不想让对方觉得你在追责。
这些信息你都知道。
只是把它们一条条打出来,有点麻烦。于是你想:先这样吧,看看 AI 怎么写。
AI 最后给你一封措辞礼貌、内容标准的催办邮件。没什么大错,但总觉得差点意思。
差的那些意思,就是你在打字的时候自动省略的细节和内容。
这些背景、顾虑、限制和期待,就是使用 AI 时经常说的“上下文”,是让 AI 产出的结果符合我们意图的关键要素。
02
语音输入大大降低了“值得说出来”的门槛
打字时,我们经常在心里做一些小小的判断:
这件事值得专门补一句吗?
事情的背景、顾虑、之前失败的尝试,单独看每个点可能都未必重要。
为了省事,我们在打字的时候会自动忽略它们,只留下最简短的一两句话。
说话的时候,补充这些信息往往更自然:
“对了,还有个情况……”
“我之所以着急,是因为……”
“之前试过一次,但那个方向不太合适……”
这些顺口带出来的话,恰好能告诉 AI:为什么要做、有哪些限制、什么结果才算合适。
过去,我们可能要有足够强的表达欲和动力,才愿意打出一大段字。并且很多人对写字有一种“完美主义”,导致文字停留在大脑中,没有真的输出。
但语音输入让这个门槛大幅降低:有一点想法,就可以先开口说出来。可以先记录下来,一点点积累,然后让 Agent 理解所有的碎片信息。
输入成本降低后,一些原本不会被表达的信息,开始进入 AI 对话。
03
人并不总是想清楚了才开口
很多人还有一个习惯:总是先把问题想清楚,再去问 AI。
可很多时候,我们只有一种模糊的感觉。
觉得这个方案哪里不对,又说不上来。想写一篇文章,有几个零散的念头,但还没形成结构。
面对空白输入框,我们会开始纠结:第一句话怎么写?先讲背景还是先讲结论?这样会不会太乱?
语音提供了另一种开始方式。
你可以先讲眼前的事,讲一个例子,讲自己的犹豫。说到一半,才发现真正介意的是什么。
表达本身,
也可以是思考的过程。
对 AI 来说,这些尚未整理好的材料,也可能足以支持下一步:归纳问题、找出矛盾,或者提出一个你还没想到的追问。
“干中学,说中想”,你不必一开始就交出一份完整的需求文档。
04
选语音工具时,我更在意这四件事
我觉得,挑选语音输入工具时有四件事值得留意。
01 你主要说什么。
中文日常、中英混输、英文编程指令,可能适合不同的工具。最有价值的测试材料,就是你每天真正会说的那些话。
02 说完以后,还要等多久、改多久。
一段话虽然识别出来了,如果要等很久,或者反复改错,表达还是会被打断。识别准确率只是体验的一部分。
03 自动整理有没有改变原意。
有些工具会主动删除重复、调整语序、归纳成列表。这些处理是否合适,要看你是在写一封成稿邮件,还是在向 AI 补充任务背景。
04 你准备在哪里说。
办公室里,需要考虑声音大小,以及嘴到麦克风的距离。如果为了让软件听清,必须不断前倾、凑近、提高音量,或者担心打扰同事,输入门槛就又升回来了。
05
我目前更推荐哪款软件、硬件工具?
我自己用过豆包输入法、微信输入法、Typeless 和秘塔回响四个语音工具。
单论识别准确度和耳语识别,在我的使用场景里,Typeless 是表现最好的一个。不过,目前它的免费额度已经从每周 8000 字降到了每周 2000 字。此外,Typeless 默认会自动整理你的表述,输出的结果是结构化的内容。
通用的语音工具目前我更推荐豆包输入法。
原因很直接:它对日常中文的理解已经足够满足我的需要,语音识别延续了豆包的体验;手机和电脑都有客户端,免费。
它未必在每个场景下都是最强的,但这些条件组合起来,让我更愿意随时开口。
这恰好回到了文章最初的话题:我们希望降低表达的门槛。如果每次准备多说几句,都要想着“这周还剩多少额度”,就可能又开始省略那些本来想补充的细节。
硬件设备的选择,我建议遵循最小成本原则。淘宝上有不少 20 元左右的有线麦克风,我使用下来效果不错。
如果觉得有线的麦克风不方便,预算提高到百元级别,可选的蓝牙麦克风不少。感谢中国制造业的强大。
END
下一次,多说一点
原本准备省略的话
更多文字不必然带来更好的回答。语音也会产生重复和无关内容。
但对于那些需要交代背景、描述感受、梳理想法的任务,它值得一试。
下一次向 AI 提问时,可以多说几句:
你为什么要做这件事?
你之前试过什么?
你最担心什么?
什么样的答案,即使看起来正确,你也不会采用?
不必刻意凑成一篇长篇大论。把那些你知道、却原本懒得打出来的信息补上,就够了。
AI 的产出能否更贴近你的意图,有时取决于你是否愿意再多讲一点。
而语音输入的价值,就在于让这“一点”,变得更容易。