乐于分享
好东西不私藏

Skill:把任何视频做成中文解说,插件有点狠

Skill:把任何视频做成中文解说,插件有点狠

今天刷 GitHub 的时候,我看到一个挺有意思的项目。

名字叫 video-recap-skills

它干的事很直接:把一个视频丢进去,然后让 Claude Code 按流程把它做成一条中文解说 recap。

不是只帮你写几句解说词。

而是从理解视频、写解说、配音、混音、字幕,到最后导出成片,整个链路都给你串起来。

我第一眼觉得有意思的点,不是“AI 又能剪视频了”。

而是它用了一个很适合 Agent 的拆法:

确定的活交给脚本,拿不准的活交给 Agent。

这句话其实挺关键。

很多 AI 视频工具最大的问题,是一上来就想做“全自动”。

全自动理解,全自动写稿,全自动剪,全自动出片。

听起来很爽,但实际落地很容易翻车。

因为视频这东西太容易出细节问题了:

哪句话该保留,哪个镜头该压一下,解说是不是抢戏,字幕节奏对不对,背景音乐会不会盖住原声。

这些东西不是一句“生成视频”就能稳定解决的。

这个项目的思路更像是:

别把所有事都塞给大模型。

能用 ffmpeg 稳定做的,就用 ffmpeg。

能用 JSON 传递的,就用 JSON。

需要判断、组织、写稿的地方,再让 Agent 上。

它的大概流程是这样的:

先分析视频。

抽帧、识别语音、理解场景,把视频里发生了什么整理成一个 brief。

然后 Agent 根据这个 brief 写解说脚本。

脚本不是随便写一段文字,而是要和时间线对上。

再往后就是 TTS 配音、混音、字幕、渲染。

如果你想把长视频压成更短的解说版,它还有剪辑模式。

最后产物就是一个 recap 视频。

这套东西让我觉得有意思,是因为它不像很多 demo 那样只展示一个“看起来能跑”的结果。

它把中间产物都留出来了:

narration.jsontimeline.jsonasr_result.jsonvlm_analysis.jsonsubtitles.srt……

也就是说,如果哪一步出问题,你是能追的。

解说词不对,你改 narration。

字幕时间不对,你看 srt。

混音不舒服,你调 assemble。

这比一个黑盒按钮靠谱多了。

更让我眼前一亮的是,它还支持导出剪映草稿。

README 里这张图我挺喜欢。

你看它不是简单给你一个 mp4。

它会把原片片段、解说、BGM、字幕分成独立轨道。

这就很像我一直想要的那种状态:

AI 先把粗活干掉。

人再进去做最后的精修。

尤其是做短视频、影视解说、课程切片、直播切片这类东西,很多时候最烦的不是“不会剪”。

而是从零开始太累。

原视频要看。

重点要找。

字幕要对。

配音要放。

BGM 要压。

最后还要进剪映里调。

如果 AI 能先生成一个可编辑草稿,哪怕它只有 70 分,也比你面对一条空时间线舒服很多。

因为人不是从零开始,而是在一个已有结构上改。

这点很重要。

我现在越来越觉得,很多 AI 工具真正有价值的地方,不是替人完成最终作品。

而是把“开工成本”降下来。

让你从空白页面、空白时间线、空白项目,变成一个已经铺好底稿的状态。

剩下的部分,人来判断,人来调整,人来拍板。

这个项目还有一个挺现实的点:本地不要求 GPU,也不用下载一堆模型。

它主要依赖 ffmpeg,再配一个小米 MiMo 的 API Key。

ASR、VLM、TTS 都走 MiMo。

所以它更像一个 Claude Code 里的视频工作流插件,而不是那种重型本地 AI 视频系统。

安装方式也挺“Agent 化”:

直接对 Claude Code 说:

安装这个插件:https://github.com/worldwonderer/video-recap-skills

然后准备 ffmpeg 和 API Key。

使用的时候也不是点一堆按钮,而是直接说:

给 /path/to/video.mp4 做个解说。这是《庆余年》第一集,主角是范闲。

或者:

把 /path/to/long.mp4 剪成十分钟左右的解说短片,字幕压进画面。

这就是 Skill / Agent 工作流比较迷人的地方。

它不像传统软件那样所有能力都藏在按钮里。

也不像纯聊天机器人那样只会给你一段建议。

它是把一套真实可执行的流程,包装成一句自然语言就能调用的能力。

当然,这东西也不是适合所有人。

如果你只是偶尔剪一条生活 vlog,可能没必要折腾。

如果你追求完全精细的影视剪辑,它也不可能替代专业剪辑师。

但如果你经常做:

  • 影视 recap
  • 课程视频转解说
  • 长视频压缩成短视频
  • 直播素材初剪
  • 视频内容二次整理

那这个思路就值得看一眼。

我最喜欢的不是它现在已经完美。

而是它给了一个很清晰的方向:

视频生产以后可能不是“AI 一键生成成片”,而是“AI 先搭好可编辑工程”。

这比一键出片更务实。

也更接近真实创作者的工作方式。

因为真正剪视频的人都知道,成片不是终点。

可控、可改、可追溯,才是长期能用的东西。

项目地址也放一下:

https://github.com/worldwonderer/video-recap-skills

我准备继续研究一下它的剪映草稿导出部分。

如果能把这种思路接到自己的素材工作流里,后面做切片、解说、复盘视频,可能会省不少重复劳动。

如果你也感兴趣,或者需要相关资料、ComfyUI流程,欢迎加我微信👇👇👇

都看到这里了,不关注一下嘛👇👇👇