夜雨聆风学习资料网

ARTICLE · 1020439

我做了一个不联网的 AI 字幕工具

我做了一个不联网的 AI 字幕工具

给视频加字幕这事儿,体验一直挺别扭。剪映得把几百 MB 的视频传到云端,在线工具免费额度只够试两条,自己跑 Whisper 还得配 Python 和显卡。

更微妙的是隐私。处理还没发布的素材或朋友采访录像时,每次点「上传」,心里都会咯噔一下:这视频会躺在谁的服务器上待多久?

所以我做了个叫 SubLocal 的工具。语音识别和字幕翻译全部在手机上完成,不联网,素材从头到尾不出设备。

选个视频,App 在本地把音频解码出来,交给离线模型生成带时间轴的字幕。需要翻译的话,本地跑的 Gemma 4 直接翻。第一次用得下几百 MB 到两三个 GB 的模型,但下完之后,断网开飞行模式照样出字幕。

识别用的是阿里达摩院的 SenseVoice 和 NVIDIA 的 Parakeet,翻译用 Google 的 Gemma 4。手机跑大模型卡不卡?说实话取决于机型,近几年的基本能接受。

拿它干啥?剪辑前出稿、导双语字幕看生肉、把录音变文字稿。它没有账号体系,所有记录都存在手机本地。

有些素材就是不该离开你的手机,比如还没发的片子、朋友的访谈、家人的聚会。

原文我做了一个不联网的 AI 字幕工具
陕西,1小时前,

相关学习资料

返回首页浏览学习资料