ARTICLE · 1100032
一个本地免费语音转文字的软件推荐:安全,快速,批量处理,在线视频直转,在线视频下载,一键搞定!
导读 · INTRO
受够了录音转文字按分钟收费、限制时长?更担心公司内部会议与敏感录音上传泄密?我做了一款彻底离线运行的免费桌面工具“闻见 EchoSmith”:断网可用,一小时音频约两分半转完,自动分句出字幕,支持批量处理与在线视频直转,代码完全开源。
不知道你有没有经历过这种让人头疼的场面:
好不容易录完两小时的行业讲座、客户访谈或者部门复盘会,到了整理纪要时,只能戴上耳机开 1.5 倍速,听一句敲一句。暂停、倒退、继续听……整整折腾一个通宵,手指头敲到酸痛,效率还低得可怜。
网上的在线转写服务确实不少,但痛点也很明显:要么免费试用只给寒酸的 10 分钟,随后就要按分钟计费或者掏几百块买月卡;更关键的是隐私安全——公司的财务报表、敏感会议记录、未公开的独家访谈,谁敢轻易上传到第三方的云端服务器上去?万一数据泄密,后果难以承受。
我自己平时也有大量的讲座与访谈录音要整理,被各种收费限制和网络延迟折腾了几轮之后,索性利用业余时间自己动手,做了一款完全跑在本地、断网可用的桌面端语音转文字工具——闻见(EchoSmith)。
它完全免费,源代码全部公开(MIT 协议),macOS 与 Windows 都能直接下载安装。以下是软件介绍视频,可点开播放。
(上面这段 58 秒的实机演示,展示了它的转写流程与操作体验)
PART 01
很多号称“本地运行”的软件,背后悄悄留着后门往云端发数据。闻见从底层设计上就切断了这种可能:它的核心识别引擎与模型权重完全内置在本机。
- 强大的本地模型
:底层采用阿里巴巴 FunAudioLLM 团队开源的 SenseVoice 语音识别模型,配合高性能的 sherpa-onnx 本地推理引擎。 - 开箱即用零折腾
:模型经过 INT8 量化,体积压缩到了 228MB,我已经完整打包进了软件安装包。安装好直接就能用,不需要你配置复杂的 Python 环境,也用不着四处找网盘下载模型权重。 - 拔掉网线照样跑
:转写过程中哪怕断开 Wi-Fi 或开启飞行模式,它照样流畅运行。商业机密、内部采访、私人语音素材,自始至终安安静静躺在你自己的固态硬盘里,谁也带不走。
PART 02
本地跑 AI 模型,很多人最担心两件事:速度慢如蜗牛,或者风扇狂转导致电脑卡死。
闻见在这两点上都下了功夫。在我自己的 Mac(Apple M1 Max)上实测,闻见的实时率(RTF)只有约 0.042。
通俗地说,一段长达 60 分钟的录音,转写只需要大约 2 分半钟。
应用启动后会自动检测你电脑的 CPU 核心数,合理分配多线程并行计算。整个转写过程的内存占用稳定在 500MB 左右,非常轻巧克制。后台默默跑着任务,你前台写文档、回邮件、看网页,完全感受不到任何卡顿。
PART 03
用过普通转录工具的朋友都有体会:最让人崩溃的,往往是软件吐出来一整屏密不透风、连标点和换行都没有的“文字砖头”。几万字挤成一团,光是看一眼就让人眩晕。
闻见在进入识别前,会先调用 Silero VAD(语音活动检测)模块扫描音频。它能够灵敏地识别出说话人的呼吸停顿和句间留白,顺着语流的停顿把整段音频自动切分成自然的一句一句,再逐句识别。
这样转写出来的文字,天然就带有清晰的换行与断句,校对和阅读极为轻松。
如果你平时做视频剪辑、播客运营或者上网课做笔记,这个功能尤其省心:勾选导出 SRT 字幕格式,它会生成带有精确时间轴的字幕文件。直接把 SRT 拖进剪映、Premiere 或者 Final Cut Pro,省去了大把手工打轴的时间。
PART 04
手头如果积攒了一整个学期的网课,或者几十段分散的采访录音,一个一个手动上传、等待、下载简直是折磨。
在闻见的“批量转写”面板里,你可以把一整个文件夹的所有音视频文件直接拖进去,勾选需要的格式(纯文本 TXT、带时间轴的 SRT 字幕、适合程序处理的 JSON),点击“开始转写”,就可以放手去喝咖啡了。
转写完成后,生成的文件会自动按照相同的文件名,保存在原始文件所在的文件夹里。比如丢进去一个 第二讲.m4a,处理完后旁边就会规规矩矩多出 第二讲.txt 和 第二讲.srt,连手动归档和重命名的麻烦都省了。
兼容的格式覆盖很广:
- 音频
:MP3、WAV、M4A、FLAC、OGG、AAC、WMA、AIFF、CAF 等; - 视频
:MP4、MOV、AVI、MKV、WEBM、M4V 等(不需要提前把视频里的音频抽出来,直接把视频文件拖进去即可转写)。
PART 05
有时候在 B站、YouTube、抖音或者 Twitter/X 上看到一段很有深度的演讲、行业分析或者公开课,想把里面的干货提炼成思维导图或读书笔记,但手头没有音频源文件怎么办?
闻见内置了开源抓取工具 yt-dlp。在“在线视频”页面里,只需要把网页链接复制粘贴进去,点击解析,软件就会自动将音频拉取下来,并无缝切入本地转写流程。
做知识库沉淀、写行业研报、整理网络素材时,这一套组合拳非常趁手。
PART 06
闻见目前最新的版本是 v1.4.5,同时支持 macOS(Intel 芯片与苹果 Apple Silicon 芯片通用)以及 Windows 64 位系统。
安装包可以在 GitHub Releases 页面免费下载:
github.com/JingZhaoQi/EchoSmith/releases
- macOS 用户
:下载 EchoSmith_1.4.5_universal.dmg - Windows 用户
:下载 EchoSmith_1.4.5_x64-setup.exe(安装版)或.msi文件
macOS 用户首次打开提示:由于个人开源项目没有购买苹果昂贵的开发者签名公证证书,Mac 系统首次打开时可能会提示“无法打开,因为无法验证开发者”。解决非常简单:在“访达 - 应用程序”里找到 EchoSmith,右键点击选择“打开”;或者打开“终端”,复制执行下面这行命令按回车,之后就能像普通应用一样直接双击运行: xattr -cr /Applications/EchoSmith.app
如果你此前安装过旧版本,建议直接升级到 v1.4.5。最新版更新了 yt-dlp 核心,修复了 B站与 YouTube 视频解析偶现失效的问题,并优化了 macOS 退出后的后台进程清理逻辑。
PART 07
闻见采用宽松的 MIT 协议 完整开源,项目主页在 GitHub:
github.com/JingZhaoQi/EchoSmith
工具依托于众多优秀的开源项目(SenseVoice、sherpa-onnx、Silero VAD、yt-dlp、Tauri 与 FastAPI),在这里向这些项目的贡献者们致谢。
如果这款工具刚好能帮你把繁琐的录音听写和字幕打轴自动化,省下买付费软件的钱,欢迎在 GitHub 上给它点一个 Star,也欢迎转发给身边经常需要整理会议纪要、听讲座、做视频的朋友。
使用中如果遇到任何细节问题,或者有什么实用功能希望添加,可以在 GitHub 提 Issue,也可以直接在本文留言区告诉我。