乐于分享
好东西不私藏

AI剪辑工具火了!让Claude帮你剪视频,全程不用手动操作

AI剪辑工具火了!让Claude帮你剪视频,全程不用手动操作

你有没有过这样的经历:对着好几小时的素材发呆,不知道从哪里下手;改了一版又改一版,来回沟通耗费大量时间。

最近 browser-use 团队开源了一个工具叫 video-use,把 AI 代理接入了视频剪辑流程。简单说就是:你负责做决策,AI 负责执行。

它是怎么工作的

把原始素材放进一个文件夹,然后用自然语言告诉 AI 你想要什么。AI 会自动完成转录、分析、剪辑、渲染,最后输出一个可以直接用的视频文件。

整个过程中,你不需要打开任何剪辑软件,不需要手动标记入出点,只需要最后看一遍结果是否满意。

背后的技术依赖两个关键组件:ElevenLabs Scribe 负责音频转录,能输出精确到每个词的时间戳;FFmpeg 负责所有音视频处理操作。AI 代理在这两者之间充当协调者,根据转录结果判断在哪里剪辑,生成对应的 FFmpeg 命令执行,最后自己检查输出质量。

有一点值得注意:AI 不是直接看原始视频数据,而是分析一份叫 takes_packed.md 的转录文档。这样信息密度更高,处理效率也更高。剪辑边界严格对齐词边界,不会在单词中间切割。每段剪辑完成会自动渲染预览,AI 先检查音频是否有爆点、画面是否跳帧,确认没问题了才交给用户。

安装配置

整个安装流程可以在 AI 代理的 shell 环境下完成,不需要手动操作浏览器或桌面应用。以 Claude Code 为例,基本步骤是:克隆仓库、符号链接到 skills 目录、安装 Python 依赖、安装 FFmpeg、配置 ElevenLabs API Key。

两个必选项需要提前准备:ElevenLabs API Key 是必须有的,因为转录功能依赖 Scribe 接口,目前没有免费额度可以绕过。FFmpeg 也是必装的,macOS 用户通过 brew install ffmpeg 解决,其他系统参照官方文档。yt-dlp 是可选依赖,用于直接下载在线视频作为素材来源。

六个阶段的工作流

video-use 把剪辑分为六个阶段:清点、预检、沟通、策略确认、执行、自评估。

清点阶段,AI 代理遍历素材目录获取每段视频的元数据,然后批量转录所有文件,汇总成 takes_packed.md 作为后续决策的依据。代理还会生成一两个时间线可视化图像,让素材情况一目了然。

预检阶段,代理扫描转录文本,标记出明显的口误、重复表达、重录片段位置。这份清单不直接删除,而是作为剪辑策略的参考。

沟通阶段是最接近传统剪辑协作的部分。代理用自然语言描述素材特点和存在的问题,询问你的剪辑目标、时长要求、风格偏好,以及哪些片段必须保留、哪些必须删除。这个阶段的交互质量直接决定后续剪辑方向的准确性,而且提问会根据具体素材动态调整,不是用固定模板走流程。

策略确认阶段,代理提出一个简短的剪辑方案,涵盖结构安排、音调选择、调色方向、字幕样式和预估时长。你确认后,代理才开始实际执行。

执行阶段生成一份 EDL 文件,这是整个剪辑操作的蓝图。EDL 以 JSON 格式记录每个片段的源文件、时间范围和选择理由。每一段提取后立即应用调色和音频淡入淡出,然后暂存待合成。

自评估是这个工具区别于其他自动化剪辑方案的核心环节。代理渲染输出后,会检查每个切割点前后1.5秒的画面是否存在跳帧、音频是否存在爆点、字幕是否被动画遮挡。同时抽查开头结尾和中间几个节点,确保整体一致性。如果发现问题,修复后重新渲染,最多循环三次。三次仍有问题则向用户报告,由人工判断。

音频优先的剪辑逻辑

这个工具的设计哲学是把音频作为剪辑的主要依据,视觉信息只在必要时介入。

这个选择有其合理性。大多数视频内容中,语言是信息的主要载体,停顿、语气、节奏都是编辑决策的关键参考。相比之下,视觉镜头的质量差异往往不如音频流畅度对观看体验的影响大。

实际操作中,代理首先识别所有静音间隔和词边界,这些位置天然适合作为剪辑点。静音超过400毫秒的区域是最干净的切割候选,150到400毫秒的短语边界需要配合视觉检查。更短的间隔保持原样,避免过度剪辑破坏语速感。

笑声、掌声、叹息等音频事件被当作节奏标记处理。剪辑时通常保留这些片段的完整上下文,让情绪高点完整呈现,因为这类片段本身就是视频节奏的一部分。

字幕和源文件保护

字幕生成支持自定义样式。默认配置是2词分块、全大写、白色描边字体,适合快节奏的社交媒体内容。也可调整为一整句话一行,或根据内容类型选择不同排版。字幕文件在滤镜链最后一步烧录进视频,确保不会被动画元素遮挡。这个顺序如果调换会导致字幕被覆盖,是少数无法事后修复的技术约束。

所有操作都在 edit/ 子目录下进行,原始素材文件始终保持不变。AI 代理的技能目录和用户素材目录严格分离,session memory 记录在 edit/project.md 中,下次打开可以继续上次的进度。即使对 AI 的剪辑结果不满意,原始素材随时可以重新处理,不需要重新拍摄。

它的边界在哪里

video-use 不适合所有场景。它依赖转录质量,音频本身嘈杂或存在大量背景音乐干扰时,识别准确率会明显下降。它擅长处理说话类视频,对纯音乐 MV 或无旁白的视觉效果集帮助有限。它没有预设模板,每一次剪辑都需要人工确认方向,自动化程度存在上限。

有一点需要想清楚:这个工具始终需要一个明确的方向输入。即使自评估机制能保证剪辑质量的下限,但剪辑怎么做、做给谁看这类问题,AI 给不了答案。它负责执行,不负责判断。