试了一圈 AI 剪辑工具,我决定自己做一个
不知道你有没有见过这样的标题:“有了这个Skill,一键帮你搞定视频剪辑”,特别是HyperFrames刚出来的时候,这种文章满天飞。
"一句话生成视频""一键出片"。听起来很诱人,但真正拿来做过几条视频之后就会发现——剪辑这件事,几乎不可能一次完成。
不是它们不好用,而是大多只解决整条链路里的某一小段——有的能下载素材,有的能生成脚本,有的只管裁切拼接。素材搜索、脚本、分镜、配音、配乐、质检,散落在完全不同的工具里。
所以我根据自己的需求和做短视频时不断踩坑、不断补流程的经验,整理成了一个开源项目:VideoEditAgent。
它不是又一个承诺"一键生成完美视频"的工具,而是一套让 AI Agent 参与完整视频制作过程的工作流。核心思路只有一句话:每个关键节点都可以确认、可以调整、可以追溯。
整个流程分六个阶段:
1. 大纲与脚本确认。 输入可以是一句话、一个链接或一组素材。Agent 先分析主题,比较切入角度,生成大纲和口播脚本。大纲先确认,脚本再确认,不会直接跳到成片。
2. 素材搜索与整理。 脚本确认后,Agent 逐句检查素材能否支撑内容。不足时自动调用搜索、抓取、下载等工具补充官方视频、产品截图和其他可用素材,每条记录来源和授权状态。
3. 生成剪辑方案。 素材就绪后不直接开剪,而是先输出一套完整方案:叙事结构、语义分镜、镜头顺序与时间码、转场理由、字幕动效、输出规格。执行以 EDL + FFmpeg 为主,也可接入 Premiere、Resolve 等专业软件。
4. 配音与时间戳对齐。 我自己用小米 Mimo 做中文口播,公开版本支持接入任意 TTS 或真人录音。音频生成后调用 Whisper 等工具生成词级时间戳,字幕和画面切点全部以真实人声为准。
5. 配乐。 Agent 从 Openverse 等开放许可来源搜索候选,统一响度生成试听版本供用户对比,选定后才进入混音。
6. 预览与质检。 成片前先跑一轮自动检查:切点、字幕同步、黑帧、音频爆点、动态镜头构图。自检通过后交用户确认,确认后才正式渲染。
写在最后:
VideoEditAgent 真正想解决的,不是"怎样更快地导出一个视频",而是怎样把从大纲到成片的每一步,放进同一条可以反复调整的流程里。
目前开源的是整套工作流、文档、模板、门禁和通用工具接口。
📎 项目地址:github.com/howardrock88/videoeditagent
希望这个项目对你有所帮助,也欢迎大家来交流。
#视频剪辑#skill #AIAgent
夜雨聆风