ARTICLE · 1121352
听写软件按月收费?这个免费的我把安装包都验了,有两个坑
听写软件按月收费?这个免费的我把安装包都验了,有两个坑
你一天要敲多少字?回消息、写周报、记会议纪要,手指在键盘上,脑子里那句话还没说完。
听写软件就是为这个场景做的:按一个键说话,字自己落到光标那儿。Wispr Flow 这类工具把这件事做得很顺——识别准,能顺着上下文把你的口语收拾成一句能直接发出去的话,还跨平台。它按月订阅,钱花在哪儿你也是清楚的。
今天这个项目叫 SpeakoFlow,干的是同一件事,MIT 协议全开,语音识别在你自己的电脑上跑。
门槛先交底,一共三条:Windows 安装包没有数字签名,装的时候系统会弹警告;Windows 上有人遇到过启动报错,缺一个系统运行库;如果你要它的"AI 清理"功能,得另外下一个 795 MB 的模型,而且目前只认英文。 三条能接受,再往下看。
它到底能替你干什么
一句话:按一下快捷键说话,字直接打进你正在用的任何软件里。
不用切窗口。你在微信里、在 Word 里、在代码编辑器里,按快捷键开始说,松开就出字。可以边说你边看它往上蹦,也可以等你说完一次性出。
转写是纯本地的。它内置 whisper.cpp 和 Parakeet 两种引擎,跑在你自己的显卡或 CPU 上。你的声音不出这台电脑——这是它跟云端听写最实在的区别。
它会顺手把你说的废话去掉。说"呃"、"那个"、说到一半改口,这些按你说的规则清理。还能给它设一个语气:正式、友好、简洁,或者你自己写一条要求。
说话能干的活不止打字。对着它说一句"嘿 Flow,把这件事回给老王,语气客气点",它把成品给你。开一个悬浮小窗就能用语音跟它聊,答案还能读出来——用的是本地 Kokoro 语音合成。
它还能看你屏幕。按个快捷键截一张图丢给模型,问它"这个报错什么意思"。
你原来付的是什么钱
Wispr Flow 这类听写软件的收费逻辑,是把"说出话"和"说出能用的话"拆成两层。
底下那层是转写:声音变成文字。往上那层才是它真正卖的东西——把口语里的口水话、错字、重复清掉,让它变成你能直接发出去的文本;再加上跨应用的自动格式、你自己的词库和语气记忆。
免费额度通常卡在字数额度和功能层上:超了就限速或断供,跨设备同步、自定义词库、某些平台的完整支持,都往后放。
SpeakoFlow 干的是同一件事,但它把"干净文本"这一层交给你自己在本地跑的小模型,不设额度。那个小模型占多少硬盘,下面门槛里算给你听。
技术拆解(说人话)
它是 Rust 加 Tauri 做的,整个仓库只有这两种主力语言。Rust 那部分管转写和系统集成,Tauri 那部分是界面。
这样选的结果,直观上就是三件事。
安装包不大。Windows 那个 33 MB 出头,macOS 的 31 MB 出头——里面装着 App 本体,模型是后面按需下的。很多同类工具光装完就几百兆。
转写不联网。语音引擎跟着 App 一起装在本地,识别在你自己机器上完成。
能接你自己已有的模型。它认 .gguf 和 Whisper 的 .bin 文件,你可以直接指向硬盘上已有的模型,它读原文件,不复制不搬动。你之前为别的工具下过模型的话,这步能省掉一次重复下载。判断文件类型它是读 GGUF 头,不是看文件名,所以三个都叫 model.gguf 也不会认错。
项目里有 20 个语言包,包含简体中文和繁体中文的界面翻译。简中那份 74.5 KB,英文原文 74.7 KB,基本是等量翻完的。界面上能用中文,对国内用户算加分。
实测记录(2026-09-24)
我做了这些,都是可复现的。
① 真下载了两个平台的安装包,核对官方哈希。
Windows x64 安装包 SpeakoFlow_1.4.0_x64-setup.exe:33,283,275 字节,6 秒下完。本地 sha256sum 算出来 87eebf95…e109f4,和 GitHub release 接口里这个资产的官方 digest 字段逐位一致。
macOS x64 的 SpeakoFlow_1.4.0_x64.dmg:31,283,761 字节,5 秒下完,本地 SHA256 7ae79ff2…82743,同样和官方 digest 对得上。
② 拆开看了安装包的真面目。
Windows 那个虽然叫 x64,PE 头里 machine 字段是 0x14c,也就是 32 位的安装器外壳,带 Nullsoft 标记——NSIS 打包的,这是 Tauri 在 Windows 上的常规做法,装完之后跑起来才是 64 位程序。
③ 查了数字签名。
结果是 NotSigned。安装包没有代码签名证书,Windows 会弹 SmartScreen 警告,得点"更多信息 → 仍要运行"。这一条作者自己也在 README 里写了,还列在 roadmap 第一位。
④ 探了模型下载源。
README 的引导脚本要从 blob.handy.computer 拉一个 1.8 MB 的语音活动检测模型。我这里实测能连通(HTTP 200,走 Cloudflare)。但它终归是海外主机,网不好的时候会是首次使用的卡点。
⑤ 我没做的:没在你机器上安装它,也没真的对着它说话测识别准不准。转写准不准、快不快,取决于你选哪个模型、用什么显卡,光看别人跑分没用。
⑥ 顺手查了 issue。最近 4 条关掉 2 条,一条 3 天关、一条 11 天关。还开着一条值得你知道——有位 Windows 11 用户装完后启动报 vulkan-1.dll was not found,卡在打不开(2026-09-21 提出,作者回了一条)。这是走 GPU 渲染路径带来的依赖,显卡驱动老或者虚拟机里的机器容易踩到。
使用门槛,一条条算
- 系统
:Windows 10/11、macOS、Linux 三端都有现成安装包,不用自己编译。macOS 有 Intel 和 Apple Silicon 两个包。 - 签名
:没有。Windows 会弹 SmartScreen;macOS 首次打开可能要右键"打开"绕过 Gatekeeper。 - 硬盘
:App 本体几十兆。转写模型另算,几百兆起步;AI 清理那个 SpeakoFlow Mini 是 795 MB。 - 网络
:日常转写不需要网。首次下模型要联网,源在海外,慢的话这步得等。 - 语言
:界面有简体中文。AI 清理那个模型目前只支持英文——你说中文它能转写,但"清掉口水话"这一层对中文还没有。 - 系统运行库
:Windows 上可能需要 Vulkan 运行库,就是上面那个报错的来源。 - 显卡
:CPU 也能跑,就是慢。想让它跟手,有块像样的显卡差别很大。 - 账号
:不用注册,不用登录。 - 许可证
:MIT,很宽松,拿去改拿去用都行。
什么情况下值得装,什么情况下先别急
值得装的:
你每天写字量大,手腕开始疼了,想换成说话。 你写的内容以英文为主——它的清理和润色这条链在英文上最完整。 你在意隐私,不想把语音传到别人的服务器上。 你有一台带独显的机器,不介意折腾一次模型。 你正在用按月订阅的听写软件,想先看看免费方案能不能接上。
先别急的:
你主要说中文,还想要"说完自动变成干净句子"——这一层中文还没到位。 你的机器是几年前的轻薄本、没独显,转写会明显迟钝。 你不想碰命令行,也不想等几 GB 的模型下载。 你在公司电脑上装东西要 IT 审批,未签名安装包基本过不去。
我的判断
这个项目最值的地方,是它把"转写"从订阅制里拿了出来,而且真做成了三平台都能装的成品——不是那种只给源码、让你自己编译的仓库。
它现在的位置有点像早期的本地大模型工具:骨架齐了,细节还在补。安装包没签名、Windows 缺运行库会报错、AI 清理只认英文,这三条是真缺点,不是小瑕疵。
我的建议是:如果你用英文写东西多,现在就可以装上试,成本大概是半小时下载加配置。如果你主要写中文、又指望它一句话出成品,可以先收藏,等它的中文清理模型出来再说——作者把"更多语言支持"写进 roadmap 了,但没给时间表。
它还有个容易被忽略的用法:翻译。你说中文,它在本地给你出干净的英文,不走云端。写英文邮件又怕自己措辞不准的人,这个可能比清理模型更实用。
仓库地址:github.com/AbhishekBarali/SpeakoFlow
你现在打字量最大的是哪件事,回消息还是写文档?我挺好奇有没有人跟我一样,最想用语音搞定的是那种不想写但又必须写的周报。
数据说明: 数据截至 2026-09-24。本文所有 Star、Fork、Issue、创建与提交时间、release 资产体积与下载量、哈希值,均取自当天的 GitHub 接口实查结果与本机实测;模型下载源连通性为当日实测。收费模式只讲结构不写金额——不同渠道口径不一致,具体请以官方页面为准。
利益无关声明: 本文与 SpeakoFlow 及文中提及的 Wispr Flow 均无任何商业关系,未收取任何费用,也没有提前拿到作者的任何材料。