夜雨聆风学习资料网

ARTICLE · 1150297

两篇喊「卸载剪映」的 AI 剪辑爆文,作者都没把话说满

两篇喊「卸载剪映」的 AI 剪辑爆文,作者都没把话说满

两篇喊「卸载剪映」的 AI 剪辑爆文,作者都没把话说满

这半个多月,公众号上「用 AI 自动剪视频」的小号文章,转发高得有点离谱。

作者(发布日期)
阅读 / 转发
做法
可可AI轻创业(09-17)
29471 / 4794
不装 Skill,对话着剪生活素材
阿胖 AI 手记(09-29)
18851 / 3767
三个 Skill 串起来剪口播
AI陈工(09-17)
6209 / 1329
自己搭的剪辑流水线
AI灵感反应堆(10-03)
3821 / 1072
装 7 个视频 Skill,剪静音、出字幕

算一下转发和阅读的比例,这四篇在 16% 到 28% 之间,差不多每 4 到 6 个点开的人里,就有 1 个转了出去。

剪视频是很多人的痛点,大家都想存一份、转一份。

我把转发排前两位的可可和阿胖对着读了一遍。两个人走的是两条很不一样的路,说的几句实话却很像。

可可的路子,不装 Skill,对话着剪

可可剪的是生活素材,孩子在树屋、跳竹竿舞这类视频。她在文章开头说,剪几十秒的视频,往往 2 小时打底,所以素材一直攒着没剪。

她的做法大致是这几步。

  1. 把要剪的视频放进同一个文件夹,让 WorkBuddy 自己去读
  2. 先让它确认能看画面、能听声音。她的意思是,不能只根据文件名编个故事
  3. 让它把素材整理成时间轴,再给 3 套方案。她那组素材拿到的是温情纪实、高光片段、教育理念三个方向,每个都带时长、镜头顺序和封面文案
  4. 选一个方案,把尺寸和要求一起说清楚。比如横屏素材要做成 3:4 竖屏,她让它上下用模糊背景填充,别直接裁掉
  5. 要两个版本,带字幕和无字幕各一份
  6. 看完成片,直接说哪里不对

第 2 步看着像句废话,其实挺要紧。我的判断是,不少这类剪辑工具并没有从头到尾「看」画面。拿开源剪辑 Skill video-use 来说,它的项目说明写得很直白,模型从来不看视频,它是在「读」。先把声音转成带时间戳的文字,只有碰到拿不准的停顿、要比较几遍重录时,才截一张胶片条加波形的图来看一眼。

可可那组素材是孩子在玩,没几句台词。AI 要是只能听、不能看,剪出来的东西就只能靠文件名去猜。所以她先问一句能不能看、能不能听,比一上来就要成片稳当得多。

第 6 步挺有意思。她看到竹竿舞后半段衔接不顺,像卡住了,就告诉它。它回去排查,找出了三个原因。准备动作和起跳被拆开了,中间切掉一截;后半段连用了几个相似的跳跃镜头,看着像重复;每段画面各取各的原声,画面一换,儿歌也跟着断。后来它把音轨改成连续一段原声,在这段声音上剪画面,留下了一个 18.8 秒的版本。

她还补了一个小经验,提修改意见时,能说出具体是第几秒,就把时间带上,它找起来更直接。

她特别提了一句,这篇教程里没有要先安装的剪辑 Skill,指令里也没有点名调用某个技能。WorkBuddy 要是读不了视频,先让它检查缺什么工具。

阿胖的路子,三个 Skill 剪口播

阿胖剪的是口播视频,中间穿插录屏讲解。他的流程分三段,每段一个 Skill。

  1. 粗剪和精剪。先用 auto-editor 按声音找出停顿、静音和空白,剪掉;再把结果交给 video-use,结合语音转写,删掉口误、说错重说的那一遍、重复的表达
  2. 动效包装和素材安排。用 erduo-broll-loop-engineering,它先理解整条视频讲什么,按字幕拆镜头,判断哪里加动画、哪里放图片或录屏。整片开做之前,先出一个五镜头的试看片给他确认风格
  3. 音效和 BGM。他把自己喜欢的音效打包放进一个文件夹,让 AI 在标题、重点卡片、步骤切换这些位置插音效,BGM 压在人声下面

他给的提示词里有几句约束,思路我觉得值得抄。

不要把正常的换气和自然停顿剪得太狠。 遇到无法确定是不是口误的地方,优先保留。 音效不要互相重叠,也不要盖住人声。 无法确认使用条件的素材不要用。

尤其是末尾那句。让 AI 自己找配乐时,他要求记录素材来源和使用条件,确认不了的就别用。这一步省掉,后面可能有版权麻烦。

这三个 Skill,项目页上写了能做到哪一步

阿胖串起来的三个工具,代码都公开在 GitHub 上,项目页能直接打开。我对着读了一遍,有几处跟他文章里说的能对上,也有几处得提前知道。

auto-editor 是个命令行程序。项目说明里讲,它主要靠分析音量来自动剪。正式剪之前,先把「死区」去掉,多数时候就是静音,他们管这叫 first pass,头一遍粗剪。默认会在留下的片段前后各留 0.2 秒余量,觉得剪得太紧,可以用 --margin 把余量调大。

这里有个容易踩的地方。它默认看声音,素材里要是没人说话,比如一段风景空镜,我的理解是按音量剪,很可能把大段都当成静音剪掉。项目页给了另一种办法,改成按画面运动剪,画面几乎不动的部分才去掉。

video-use 接着做语义那一层。项目页列了它能做的几件事,剪掉嗯、呃这类口头词和开头说错的半句,去掉两遍录制之间的空档,按你要的样式烧字幕,渲染完还会在每个剪切点自己检查一遍,过了再给你看。

它有两条规矩,跟阿胖那几句约束对得上。一条是剪的计划要先用大白话说给你听,你点头之前,它不动刀。另一条写在剪辑环节的规则里,实在躲不开的口误,要是找不到更好的一遍来替换,就留着,并写明原因。阿胖那句「拿不准是不是口误,优先保留」,走的也是这个思路。

还要注意,它的转写靠 ElevenLabs 的 Scribe。安装说明里写了,得自己准备一个 ElevenLabs 的 API Key,没有它,什么都转写不了。

erduo-broll-loop-engineering 是三个里门槛高的。它要的是完整的 SRT 字幕文件加一份设计要求,按字幕的意思分镜、做动画。作者在 README 里自己写了,这个项目是多角色接力,整体偏重,安装、理解和维护的门槛都更高;做日常口播,他推荐的是自己另一个更轻的工具 Agent Motion。

阿胖说的五镜头试看片,在项目说明里也找得到。v1.0.1 写的是先做 5 个镜头的样片,用户没选之前,不启动完整长片。到了 v1.1.0,作者把固定的 5 镜样片拿掉了,改成只有风格拿不准、或者转场复杂时,才先做有代表性的片段来看。

也就是说,你现在去装,流程未必跟阿胖文章里一模一样。

项目页还公开过一次 v1.0.0 的生产记录。一份 179.866 秒的字幕,从导演环节开始到头一次出完整预览,用了大约 242.05 分钟,作者自己标了没达到 120 分钟以内的目标。三分钟的片子跑了四个钟头。阿胖说动效这一步很费额度,看完这份记录,我一点不意外。

两个人都说了的实话

说实话,两篇标题都喊「卸载剪映」,正文里两个人都没把话说满。

阿胖写了好几处。

  • 粗剪加语义精简大概要几十分钟,没有很多人吹的几分钟就搞定那么快
  • 刚开始要跟 AI 多来回几轮,调出自己要的节奏。有人想说话自然一点,他要的是更紧凑、更连续
  • 两个剪辑 Skill 未必一次就把停顿、口误清干净,尤其刚开始用的时候,所以他还要导回剪映自己审一遍
  • 动效包装那个 Skill 很费额度。这一段他没在 WorkBuddy 里跑,用的是 OpenAI 家的编程工具,他说自己是 Plus 用户,一条 5 分钟左右的视频,要花掉周额度的 50% 到 60%
  • BGM 和音效建议固定下来,能少一些 AI 抽卡
  • 一点都不用剪映,他说现在还做不到。他的分工变成了 AI 负责把视频做出来,他负责验收和微调

可可也说,她 5 个多月前试过让 AI 剪片,没成功;这次顺了,但出片效果还有很大空间要调。

我顺手翻了下剪映官网。它的 AI 工具里列着「智能剪口播」,说明写的是「AI识别无效词,对着文本剪口播」;还有「智能解说粗剪」,能生成解说词再粗剪;「AI音效」写的是理解视频内容后匹配音效。去停顿、删口误、配音效这几样,剪映里本来就有对应的功能。

我的判断是,两位作者换掉的,是过去那一长串手动拖时间轴的操作。剪映作为审片和微调的地方,还留在他们的流程里。阿胖剪完导回剪映再审一遍,说的就是这个。

还有一点要说清楚,两篇里的播放量和效果,都是作者自己说的,我没法核实。上面的步骤,也都是按他们公开写的内容整理的。

头一回试,挑什么样的素材

按两位作者的写法和这几个工具的说明,我觉得头一回试,素材挑对了,比提示词写得漂亮更省事。下面几条是我的判断,不是哪家写的规则。

先挑短的。一分钟以内,一两个文件就够。素材一多,AI 整理时间轴要更久,你看成片、提意见、等它改,每一轮都跟着变长。

再挑声音干净的。口播这条路,auto-editor 按音量找静音,video-use 先转写再剪,两步都先吃声音。背景音乐压过人声、几个人抢着说话、户外风噪大,转写和找停顿都容易偏。

生活素材反过来,要画面能看。可可那条路靠 AI 读画面、排镜头,光线太暗、晃得厉害的片段,排出来的方案你多半也不想用。

挑你自己拍的。可可剪的是自家孩子,阿胖剪的是自己的口播和录屏。素材是自己的,版权这关少一层,配乐另说。

别拿急活练手。阿胖说光粗剪和精简就没有几分钟搞定那么快,动效那段还很费额度。拿一条明天就要发的片子去试,压力最后还是落回你自己身上。

开场的话可以照可可的前三步来写。先别让它剪,让它把看到的东西和方案交出来。

这个文件夹里是我要剪的素材。先别剪,先告诉我三件事: 1. 你能不能看到画面、能不能听到声音,缺什么工具; 2. 按时间顺序列出每段素材里发生了什么,标上起止秒数; 3. 给我 3 套剪法,每套写清时长、镜头顺序和封面文案。 我选完方案再开始剪。

第 2 条那张时间轴,顺手对一遍。哪段它说错了内容,说明它看画面这一步有问题,后面的方案也别急着选。

这几处,人还得自己盯

把两篇的流程和三个项目页摆在一起看,AI 接走的是重复、费时间的那部分。下面这几处,两位作者都没交出去。

方向得你定。可可在 3 套方案里自己选,阿胖要先看五镜头试看片定风格,video-use 也规定计划没被确认前不动刀。AI 能给选项,选哪个它替你拿不了主意。

节奏得你看。竹竿舞那段卡顿,是可可看完成片自己发现的,AI 回去才找出三个原因。你说得出是第几秒,它才好改。

口误和正常停顿,得你分。阿胖专门写了「别把换气剪太狠」「拿不准就保留」。哪句是说错重来,哪处停顿是故意留的,说话的人自己心里有数。

字幕得你读。转写出来的字幕,我的判断是人名、产品名、方言词容易出错,导出前从头到尾读一遍,比发出去再改省事。

配乐和素材来源得你核。阿胖让 AI 记下来源和使用条件,确认不了就不用,这一条他没交给 AI 拍板。

还有出镜的人。素材里有家里孩子、有路人的脸,发不发、要不要打码,是你的决定,AI 不会主动问你。

你该走哪条路

你的素材
更接近谁
人要盯的地方
生活、活动、旅行素材
可可,对话着剪
选方案、看衔接、点出具体第几秒的问题
口播、录屏讲解
阿胖,装 Skill 串流程
审口误有没有剪干净、试看片定风格、配乐来源
两种都有,刚开始试
先走可可那条
先跑通一条,再考虑装 Skill

可可在文末的建议我挺认同,先把自己的素材跑通,以后要是经常剪同一类内容,再把确认过的规则整理成自己的 Skill。

想试的话,从手里一段不超过一分钟的素材开始,先让 AI 确认它能看画面、能听声音,再让它给 3 套方案,别一上来就让它直接出成片。

参考来源

来源
内容
可可AI轻创业(2026-09-17)
对话式剪辑步骤、排查衔接问题、不装 Skill 的说明
阿胖 AI 手记(2026-09-29)
三个 Skill 的流程、提示词约束、耗时和额度、仍需剪映审核
auto-editor 项目页
按音量剪静音、默认 0.2 秒余量、可改按画面运动剪
video-use 项目页
读转写而不看画面、先确认计划再剪、躲不开的口误保留、需 ElevenLabs Key
erduo-broll-loop-engineering 项目页
门槛自述、v1.0.1 五镜样片、v1.1.0 改动、v1.0.0 生产耗时
剪映官网
智能剪口播、智能解说粗剪、AI音效

相关学习资料