夜雨聆风学习资料网

ARTICLE · 1125633

6199万下载的阿里 SenseVoice:234M、70ms、50种语言,哪个才是你能用的?

6199万下载的阿里 SenseVoice:234M、70ms、50种语言,哪个才是你能用的?

↑阅读之前记得关注+星标⭐️,😄,每天才能第一时间接收到更新

大家好,我是杰克王,AI 算法 6 年老兵。

10 月 3 日下午,有自媒体号发了一篇 SenseVoice 的核验文,把官方 README、论文、ModelScope、GitHub 接口全翻了一遍。

我 10 月 4 日又把接口重新拉了一遍,发现一个很有意思的细节:他文里写的 ModelScope 下载量是 6189 万,我这边已经变成 61994003。一天不到,又多出来十万次下载。

一个 2024 年发布的老模型,2026 年还在被这样下载。问题也来了:这么多人转的那几个数字,到底哪一个才是你真正能用到的?

先给几个数字

61994003。这是 ModelScope 上 iic/SenseVoiceSmall 的当前下载量,Stars 只有 677。下载量和 Star 差着两个数量级,说明它主要被当工具用,不是被当项目围观。

9432 / 836。GitHub 现在的 Star 和 Fork。仓库 2024 年 7 月 3 日创建,最近一次 push 是 2026 年 9 月 30 日。

940019376 字节。模型在 ModelScope 的存储体积,约 940 MB。放在今天的语音模型里,还是轻量档。

234M / 70ms。论文 Table 7 里,SenseVoice-S 是 234M 参数,RTF 0.007,10 秒音频延迟 70ms。Whisper-S 是 224M、518ms,Whisper-L-V3 是 1550M、1281ms。(来源:FunAudioLLM 论文,2024-07-04)

这组数字说明,它不是新东西,但它还在真实世界里继续干活。

它到底能干什么

官方定义很清楚:SenseVoice 一个模型做四件事,语音识别、语种识别、情感识别、音频事件检测。

输出不是 plain text,而是一串带标签的富文本,前面会长这样:<|en|><|NEUTRAL|><|Speech|><|withitn|>。仓库自带 WebUI,python webui.py 就能起。

但有一条边界必须先说死:说话人分离不是 SenseVoiceSmall 这个 checkpoint 自己的能力。 你在演示里看到"区分谁在说话",那是 FunASR 把 FSMN-VAD 和 CAM++ 这些独立模型组合起来的 pipeline。官方 2026 年把这句话写进了 README,就是为了纠正早期传播的误会。

最硬的一手:标签表

真要看这个模型的边界,别看媒体稿,看数据准备小节。

情感标签 7 个:HAPPY、SAD、ANGRY、NEUTRAL、FEARFUL、DISGUSTED、SURPRISED。README 参数里还有一个 emo_unk,表示情感未定;ban_emo_unk 默认 False,打开后所有句子都会被强行赋一个情感标签。

事件标签 8 个:BGM、Speech、Applause、Laughter、Cry、Sneeze、Breath、Cough。语种标签 5 个:zh、en、yue、ja、ko。

对照 2024 年某篇传播最广的报道,它写情绪类型是"高兴、悲伤、愤怒和中性"四种。少写了 FEARFUL、DISGUSTED、SURPRISED 三种。这个细节不大,但读者会误以为模型只能分四类情绪。

官方还有一句很实在的话:SenseVoice 只在语音数据上训练,做事件检测可以,但和专业事件检测模型比还有差距。愿意自己把边界写出来,这比满屏 SOTA 更像工程团队。

速度:正确答案不是一个数

中文 README、英文 README、论文正文,都写 5 倍 / 15 倍:比 Whisper-Small 快 5 倍以上,比 Whisper-Large 快 15 倍。

网上还有核验文抓到过一个更乱的口径:ModelScope 页面写 7 倍 / 17 倍,同一页还同时存在 15 倍。这个说法我今天没法在同一个 ModelScope API 里复现,现在接口返回的 ReadMeContent 已经回到 70ms、15 倍。

所以以后再看到"比 Whisper 快几倍",别急着争 5 还是 7。先问一句:你看的是论文、README、模型页,还是媒体二手稿。引用速度不带文档版本,就是在替某一份旧页面站队。

234M、50种语言、40万小时:三个坑

第一个坑,234M 只出自论文 Table 7。GitHub README 和 ModelScope 页面都没有直接写参数,只说"与 Whisper-Small 相当"。(来源:FunAudioLLM 论文,2024-07-04)

第二个坑,50 多种语言不是你能下载的 Small。论文摘要写得很清楚:SenseVoice-Small 服务 5 种语言,SenseVoice-Large 才支持 50+。而 Large 没有开源。官方 2026 年 README 也补了这句:研究范围是 40 万小时、50+ 语言;当前公开 checkpoint 支持中、粤、英、日、韩。(来源:FunAudioLLM 论文,2024-07-04;SenseVoice README,2026-10-04)

第三个坑,训练数据量也有两个口径。论文摘要是 over 300k hours,README 和 ModelScope 后来写超过 40 万小时。论文更早,README 更新,两个都引才算完整。

至于"中文与粤语提升 50% 以上",官方 README 和论文都找不到。官方对应表述是定性的"明显的效果优势",没有百分比。这个 50% 应该标注为媒体说法,不是官方结论。

许可证:最容易踩坑的一节

代码和权重不是一套协议。

GitHub 仓库源码是 MIT,LICENSE 文件和 API 字段都对得上。模型权重单独发布,README 指向 FunASR 模型开源协议。

麻烦在 ModelScope API。它的结构化 License 字段返回的是 Apache License 2.0。这个字段比 FunASR 模型协议宽松得多,如果照着它做合规判断,方向会错。

官方在 GitHub issue 286 里给过明确澄清:FunASR 自研模型权重,包括 SenseVoice,可以商用,但必须署名并保留模型名称;第三方或社区模型要按各自许可证走。提问场景还是付费桌面软件本地集成,官方回复是 permitted。

一句话:能商用,但要署名;官方权重按 FunASR 模型协议,GGUF 这类第三方转换版单独看条款。

生态:这才是它活到 2026 的原因

官方 README 列的三方工作,已经很能说明问题。

sherpa-onnx 支持 C++、C、Python、C#、Go、Swift、Kotlin、Java、JavaScript、Dart 十种语言,覆盖 iOS、Android、树莓派。SenseVoice.cpp 做纯 C/C++ 推理,支持 3/4/5/8 位量化。streaming-sensevoice 用分块推理换伪流式。还有 llama.cpp / GGUF 路径,单二进制、内置 VAD、不需要 Python。

HuggingFace 页面显示,SenseVoiceSmall 上个月还有 18003 次下载,100 个 Spaces 在用它。

另一个信号是,阿里云百炼的 sensevoice-v1 托管服务已经在通知下线,帮助文档也建议迁移到 Paraformer/Fun-ASR 或其他非实时识别。托管服务会退,开源 checkpoint 和下游 runtime 还在。

仓库还改过名:老地址 FunAudioLLM/SenseVoice 现在 301 到 QwenAudio/SenseVoice。很多旧文章和模型页还写老地址,靠重定向活着。

谁该用,谁不该用

该用的人很清楚:做中文、粤语、英文、日文、韩文转写,想顺带拿情感和事件标签,尤其是要跑在 CPU、边缘端、树莓派、移动端的人。这个价位和体积里,它还是很能打。

不该用的人也要说死:要 50+ 语种全覆盖的,别找 Small;要严格说话人分离的,去配 FunASR pipeline,别指望 checkpoint 自己吐;要做专业声音事件检测的,官方都说有差距;做英文 LibriSpeech 极致 WER 的,论文 Table 6 里 Whisper-L-V3 在 test_clean 和 test_other 上还更低。(来源:FunAudioLLM 论文,2024-07-04)

我自己不会把它叫"Whisper 杀手"。更准确的说法是:在五语种富文本转写这个窄场景里,它把一个老问题做到了工程可用。

一个能带走的词:现货口径

这件事最值得带走的不是 70ms,也不是 234M,而是四个字:现货口径。

以后看任何模型新闻,先问四个问题:论文说的是哪一版?README 现在写的是哪一版?模型卡接口返回的是哪一版?我能下载的 checkpoint 是哪一版?

研究口径负责想象力,现货口径负责能不能上线。

媒体可以混着写,工程师不能。你部署的不是新闻稿,是那个 940 MB 的文件。

最后说一句判断

SenseVoice 最有趣的地方,不是它两年后还强,而是它逼着阿里自己出来补文档:澄清 Small 只有五种语言,澄清说话人分离是 pipeline,澄清商用范围,澄清事件检测边界。

这说明开源模型竞争已经进了下半场。上半场比谁发得快,下半场比谁把口径、许可证、复现脚本和下游生态收拾得干净。

模型会老,新闻会旧,能被核对的事实才会一直留在仓库里。

觉得有收获,点个在看支持一下 👇

感谢阅读。我是杰克王,欢迎加微交流 🚀

相关学习资料