夜雨聆风学习资料网

ARTICLE · 1046762

语音输入法才会AI最好的工具

语音输入法才会AI最好的工具

人机之间   /   NOTES ON HUMAN × AI

用 AI 时
你懒得打出来的话
可能最重要

多说一点,把话说完整

开篇 / OPENING

我们不缺少想法,
缺的是把它们说完整的时间。

最近看到桌面版的微信增加鼠标长按语音输入功能,鼠标移动到对话框,会有一行提示:按住鼠标 语音输入文字。

最近用了几天,发现还挺好用的,轻声说话也可以准确识别。

图 / 微信 PC 版对话框里的语音输入入口

这件事让我想到,在 AI 时代,语音输入是目前很多人使用 AI 时最容易忽视的一个功能。

为什么?

我们先问自己一个问题:你每天和 AI 交流,到底有多少信息,在输入之前就被自己压缩或省略了?

提到语音输入,大家很容易想到速度:说话比打字快,可以少敲一些键盘。

但在 AI 时代,它有另一个作用:

让我们更愿意把事情说完整,告诉 AI 更多的上下文内容。

01

很多细节,是因为嫌麻烦才没说

假设你想让 AI 帮你写一封邮件。

打开输入框,你可能会打:

“帮我写一封邮件,催一下客户的项目进度,语气客气一点。”

需求表达清楚了吗?似乎清楚了。

但你心里其实还有很多事:

这个客户合作了两年,关系一直不错。上周已经催过一次,对方说负责人出差了。你着急,是因为内部排期快撑不住了。你希望这周能拿到明确回复,但又不想让对方觉得你在追责。

这些信息你都知道。

只是把它们一条条打出来,有点麻烦。于是你想:先这样吧,看看 AI 怎么写。

AI 最后给你一封措辞礼貌、内容标准的催办邮件。没什么大错,但总觉得差点意思

差的那些意思,就是你在打字的时候自动省略的细节和内容。

这些背景、顾虑、限制和期待,就是使用 AI 时经常说的“上下文”,是让 AI 产出的结果符合我们意图的关键要素。

02

语音输入大大降低了“值得说出来”的门槛

打字时,我们经常在心里做一些小小的判断:

这件事值得专门补一句吗?

事情的背景、顾虑、之前失败的尝试,单独看每个点可能都未必重要。

为了省事,我们在打字的时候会自动忽略它们,只留下最简短的一两句话。

说话的时候,补充这些信息往往更自然:

“对了,还有个情况……”

“我之所以着急,是因为……”

“之前试过一次,但那个方向不太合适……”

这些顺口带出来的话,恰好能告诉 AI:为什么要做、有哪些限制、什么结果才算合适。

过去,我们可能要有足够强的表达欲和动力,才愿意打出一大段字。并且很多人对写字有一种“完美主义”,导致文字停留在大脑中,没有真的输出。

但语音输入让这个门槛大幅降低:有一点想法,就可以先开口说出来。可以先记录下来,一点点积累,然后让 Agent 理解所有的碎片信息。

输入成本降低后,一些原本不会被表达的信息,开始进入 AI 对话。

03

人并不总是想清楚了才开口

很多人还有一个习惯:总是先把问题想清楚,再去问 AI。

可很多时候,我们只有一种模糊的感觉。

觉得这个方案哪里不对,又说不上来。想写一篇文章,有几个零散的念头,但还没形成结构。

面对空白输入框,我们会开始纠结:第一句话怎么写?先讲背景还是先讲结论?这样会不会太乱?

语音提供了另一种开始方式。

你可以先讲眼前的事,讲一个例子,讲自己的犹豫。说到一半,才发现真正介意的是什么。

表达本身,
也可以是思考的过程。

对 AI 来说,这些尚未整理好的材料,也可能足以支持下一步:归纳问题、找出矛盾,或者提出一个你还没想到的追问。

“干中学,说中想”,你不必一开始就交出一份完整的需求文档。

04

选语音工具时,我更在意这四件事

我觉得,挑选语音输入工具时有四件事值得留意。

01   你主要说什么。

中文日常、中英混输、英文编程指令,可能适合不同的工具。最有价值的测试材料,就是你每天真正会说的那些话。

02   说完以后,还要等多久、改多久。

一段话虽然识别出来了,如果要等很久,或者反复改错,表达还是会被打断。识别准确率只是体验的一部分。

03   自动整理有没有改变原意。

有些工具会主动删除重复、调整语序、归纳成列表。这些处理是否合适,要看你是在写一封成稿邮件,还是在向 AI 补充任务背景。

04   你准备在哪里说。

办公室里,需要考虑声音大小,以及嘴到麦克风的距离。如果为了让软件听清,必须不断前倾、凑近、提高音量,或者担心打扰同事,输入门槛就又升回来了。

05

我目前更推荐哪款软件、硬件工具?

我自己用过豆包输入法、微信输入法、Typeless 和秘塔回响四个语音工具。

单论识别准确度和耳语识别,在我的使用场景里,Typeless 是表现最好的一个。不过,目前它的免费额度已经从每周 8000 字降到了每周 2000 字。此外,Typeless 默认会自动整理你的表述,输出的结果是结构化的内容。

通用的语音工具目前我更推荐豆包输入法。

原因很直接:它对日常中文的理解已经足够满足我的需要,语音识别延续了豆包的体验;手机和电脑都有客户端,免费。

它未必在每个场景下都是最强的,但这些条件组合起来,让我更愿意随时开口。

这恰好回到了文章最初的话题:我们希望降低表达的门槛。如果每次准备多说几句,都要想着“这周还剩多少额度”,就可能又开始省略那些本来想补充的细节。

硬件设备的选择,我建议遵循最小成本原则。淘宝上有不少 20 元左右的有线麦克风,我使用下来效果不错。

如果觉得有线的麦克风不方便,预算提高到百元级别,可选的蓝牙麦克风不少。感谢中国制造业的强大。

END

下一次,多说一点
原本准备省略的话

更多文字不必然带来更好的回答。语音也会产生重复和无关内容。

但对于那些需要交代背景、描述感受、梳理想法的任务,它值得一试。

下一次向 AI 提问时,可以多说几句:

你为什么要做这件事?

你之前试过什么?

你最担心什么?

什么样的答案,即使看起来正确,你也不会采用?

不必刻意凑成一篇长篇大论。把那些你知道、却原本懒得打出来的信息补上,就够了。

AI 的产出能否更贴近你的意图,有时取决于你是否愿意再多讲一点。

而语音输入的价值,就在于让这“一点”,变得更容易。

相关学习资料