ARTICLE · 1087214
AI做视频!全过程详细拆解
我最新一期视频讲的是我自己怎么用 AI 做视频,片长 7 分半。画面按配音拆成了 12 段,我开了多个 Agent 对话同时做,片子里还有 8 处 AI 生成的动画插片。这些插片的图和视频,都是我自己在 ChatGPT 网页端和 Google Flow 里手动生成的,Agent 只负责写提示词和操作步骤。
我的做法离“一句话出片”还很远。Agent 能写规则、拆任务、做动画、配音效,但画风定成什么样、设计图过不过、哪一版能用,都要我自己拍板。时间线定下来以后也不能随便改,改一处,后面的动画、音效和字幕都要跟着重新对齐。
如果你也想用 Agent 做视频,下面按实际顺序写这套流程,每一步谁来做、留下什么文件、哪里最容易返工,最后单独讲它的限制。用到的 SOP、规则和提示词,我整理进了一个公开仓库,文末有地址,可以拿去改成你自己的。

图 1 视频开场最后停住的画面。工具选择、画面设计、动画制作、声音和封面五个环节,整理成 SOP、规则和经验三类文件,放进 GitHub 仓库 Table-VideoSOP。
先看全貌。前两步在系列开始前搭好,之后每一期从第三步开始。
步骤 | 我来做 | AI 来做 |
1 准备工具 | 选定工具路线 | 按一句话请求安装 FFmpeg 等工具 |
2 规则与画风 | 建好 AGENTS.md,找参考图,看测试结果拍板 | 出静态设计图和动态测试,把确认结果写成 DESIGN.md |
3 文案与配音 | 写稿,自己读一遍,配音,剪配音出字幕 | 这一步主要靠我 |
4 拆分段 | 审分段表,选哪些段落做生视频 | 按配音拆段,逐段写清三件事,标出重点审查项和生视频候选 |
5 生图生视频 | 在 ChatGPT 网页端生图,在 Google Flow 生视频 | 写提示词和操作步骤 |
6 分段制作 | 按分段开对话,审设计图、动画标注和样片 | 建目录,写开工提示词,出设计图和标注,做动画 |
7 开场 | 否掉第一版,细看第二版 | ChatGPT 出方案并整理成 MD,交给 Codex 制作 |
8 总装与封面 | 听音效和 BGM,查字幕遮挡,生成封面 | 拼接,按动作时间戳配音效,写封面提示词 |
9 复盘 | 决定改哪些规则 | 梳理返工和遗漏 |
01工具各管一件事,ChatCut 我只拿来剪配音
第一步先装 FFmpeg。它是处理音视频的开源命令行工具,装好以后,AI 就能通过代码去剪辑、拼接和处理音视频。安装不用自己查教程,在对话框里让 Agent 帮你装就行。
做动画的工具,常见的有 ChatCut、HyperFrames 和 Remotion,我选了 Remotion。在动画精修、复杂运镜和景深这几方面,我用下来觉得 Remotion 比 HyperFrames 强。之前做 WorkBuddy 那期视频我用的是 HyperFrames,其他几期都是 Remotion,你可以找来对比着看。
ChatCut 做图形动画很弱,插件里也做不了真正的三维摄像机动画,高级一点的功能还要额外付费。对我来说,它最有用的只有一个可视化时间线。我现在只拿它剪配音、出字幕,先用它粗剪,再到时间线上手动调整。
录屏我用的是开源的 Recordly,上手就能用,自带动画效果。
02开工前先写两份规则,设计规则得自己做
正式开始制作之前,我会先在项目目录里建一份 AGENTS.md。这是写给 Agent 看的项目规则,我用的 Codex 开工时会先读它。里面主要管两件事。
一是项目路由,告诉 Agent 做什么任务时该先读哪份经验。比如任务涉及录屏剪辑,就先读录屏剪辑的经验;要拼全片、配 BGM 和音效,就先读声音和字幕的验收经验。二是常见的注意点。像用 Remotion 做动画时,要把关键动作的时间戳记下来,最后配音效才能对得准。

图 2 我项目里 AGENTS.md 的原文片段。上面标出的一条是路由,录屏类任务先读哪份经验;下面“动画动作与音效对点”一节要求单次音效写成精确秒点,比如 SFX @ 00:01.250。
这些规则和经验你可以直接拿去用,也可以在上面改。只有设计规则,建议你自己做。它关系到整条片子的视觉,也决定你做出来的视频有没有自己的味道。
设计规则要靠两轮测试定下来。
第一轮是静态测试。背景选什么颜色,卡片倒角多大,字体用什么,IP 角色放进去协不协调,这些都让 Agent 出设计图,用眼睛对比。我的 IP 是一只叫黑蛋的圆球折耳猫。参考图可以先去 Dribbble、Pinterest、Behance 这类设计网站找,丢给 Agent 以后再用嘴微调,一张图比一大段描述好沟通得多。

图 3 视频里的静态测试。同一张“拆解任务”卡片先改倒角、再放进黑蛋,最后 A、B 两版并排比较,选中的一版打勾。
第二轮是动态测试,关键词是“迪士尼动画十二原则”,也就是蓄力、惯性、跟随这些。我十几年前学 AE 学的就是这套东西,没想到现在还能用上。跟 Agent 说一句按迪士尼动画原则来,它能听懂。
测试时重点看图形怎么变换,比如一个方块怎么连续变成一台电脑。再看图形之间的交互,像小球撞到另一个图形上,被撞的图形有没有受力被带动的感觉。跟随和次要运动,还有运动时的挤压和拉伸,也要一起看。

图 4 视频里的动态测试。①② 同一个方块连续变成电脑;③④ 小球撞上去以后,被撞的图形往前滑开。
如果你不喜欢这种传统的、弹来弹去的图形动画,也可以更粗暴一点,拿一段你喜欢的图形运动视频,让 AI 拆解学习以后再测试。
静态和动态测试都满意以后,让 Agent 把结果写成 DESIGN.md,这就是你这个系列的基础风格。到这一步,项目里有了三份文件。

图 5 AI 生成插图。SOP 定制作顺序;Agent 做任务前查 AGENTS.md,找到该读的经验;画面长什么样、怎么动,写在 DESIGN.md 里。
文件 | 管什么 |
SOP | 制作顺序,先做什么、后做什么 |
AGENTS.md(项目规则) | 当前任务该读哪份经验,以及常见注意点 |
DESIGN.md(设计规则) | 画面长什么样,该怎么动 |
这三份文件要在系列开始前搭好,之后才轮到每一期的文案和配音。
03文案和配音先定下来,后面的画面都跟着它走
文案我没什么经验,每次做视频卡得最久的就是这一步。我试过的几个“去 AI 味”写作 Skill,对我都没起作用。
配音可以用 AI 来做,但稿子我建议你自己读一遍。有些问题眼睛看不出来,一读出声就发现了。
配音和字幕出来以后,才进入后面的制作。整套流程以这条配音为准,画面、音效和字幕都按它的时间来排。

图 6 AI 生成画面。视频讲到“文案卡得最久”时用的插片,黑蛋对着空白稿纸和几个纸团发愁。
04拆分段时,每一段先回答三件事
接下来让 Agent 按流程,根据配音把片子拆成制作分段,这一期拆成了 12 段。写每一段的任务时,流程要求 Agent 先写清三件事。
1这段配音已经说了什么。
2画面要补充配音里没有的哪些东西。
3屏幕上真正需要留下的信息是什么。
很多人做的动画不好看,一个重要原因是没想清楚画面的用处。
画面要给出配音之外的东西,比如一个对象怎么变化、两件事之间什么关系。
要是整段画面只把配音文字再打一遍,让字飞来飞去,那跟做个 PPT 没什么区别。

图 7 本期制作大段表节选。原表每一段有十几列,这里只留下对应三件事的三列,D04、D11 两段的文字照原表摘录。
表里最难写的是“画面必须新增”这一列。拿 D11 来说,配音讲的是改了时间要重新对齐和渲染,画面就得让人看到同一个剪点挪动以后,画面、音效、字幕具体怎么错开,哪些已经做好的部分不受影响。这一段最后做成了图 14 的样子。

图 8 视频里的一组对照,两边讲的是第 04 期同一段配音。左边把配音原话原样做成字卡;右边是第 04 期实际做出来的画面,原始要求被压缩走样以后,后面几项任务接连出错。
拆完以后,Agent 还会告诉我哪几段需要重点人工审查,并筛出适合做生视频的段落,交给我选。
05生图生视频我手动做,Agent 只写提示词
我选定要生视频的段落以后,Agent 会通过项目规则读到我积累的生视频经验,把全套生图、生视频的提示词和操作步骤写好。
生图我自己去 ChatGPT 的网页聊天端做。一是我感觉聊天端的出图质量比 Codex 里好一些,二是能省 Codex 的用量。生视频我用 Google Flow,主要也是为了省钱。
下面是 Agent 为其中一段插片写的提示词节选。每张参考图只负责一件事,动作按这条视频自己的时间写到毫秒,音效也标了准确的时间点。
参考图逐张分工: 图1=黑蛋身份基准,只锁定长相、球体比例、虎斑、折耳、大眼和短肢;不继承图中英文、底色、真实毛发或照片质感。 图2=唯一水彩画风,只锁定清亮综合色彩、手绘线条和水彩材质;不继承图中的人物、树林构图或角色身份。 …… 动作合同:以下时间全部从这条原片的00:00.000开始,不是全片时间,不是前一镜延续时间。每个动作只发生一次。 …… 00:02.200:短爪掌面与被掀起的纸角接触。 …… SFX @ 00:02.200:软爪压纸的轻扑声 |

图 9 AI 生成画面。按这份提示词在 Google Flow 生成的插片,黑蛋用短爪按住画纸的一角。
生成结果不一定完全照提示词走。模型没做准计划里的时间点时,就以实际画面为准,重新标动作和音效的时间。
生视频的段落主要用来展示自己的 IP 形象,这也是你拿到这套流程以后最需要自己改的部分。我的经验是针对 Google Flow 写的,换别的生视频模型,提示词写法会不一样,让 Agent 去读那个工具的官方文档就行。
06分段确认后,开多个对话同时做
我审过制作分段表,确认没问题以后,Agent 会按流程自动建好每一段的独立目录,再把各段的开工提示词写好。接下来我一边自己生图生视频,一边按分段开对话,分了几段就开几个,让它们分别开始跑。
我的流程不会让 Agent 直接做出整段成片。每一段先出设计图和动画标注,我初审以后再开始做视频。动画标注写的是每个动作从第几秒开始、在哪里接触、什么时候停稳。要是跳过这一步就开始做视频,后面一旦要大改,token 消耗会顶不住。token 是模型计算用量的单位,改得越多,花得越多。

图 10 视频里的全片设计总览。各段的设计图放在一起先审,开场单独制作,所以留了空位。
画面比较复杂的时候,比如涉及连续的状态转换,我还会先让它做几秒钟的样片测试。摄像机运镜和节奏控制的经验,Agent 也会按项目规则自己去读。
07开场单独打磨,第一版方案直接否掉
现在的流程会把开场也当成一个制作分段,不过开场我一般单独做,因为想让它更抓眼球一点。
我的方法是到 ChatGPT 里把思考强度拉到 Pro,再把文案和素材丢过去,让它帮我设计开场。有个小经验,它给的第一版方案我不看,直接否掉,让它自己反思,再给第二版。第二版我才仔细看,没问题就让它整理成能交给 Codex 制作的 MD 文档;有问题就提出具体思路,打回去重来。
这只是我的个人习惯,不保证第二版一定更好。

图 11 AI 生成画面。视频里用这段插片表现“第一版直接否掉”,黑蛋把第一块方案板推了回去。
08总装时,前面记下的时间戳用来配音效
各段做好以后进入组装拼接,再处理音效、BGM 和字幕。人声、音效和 BGM 的音量范围,我都写进了经验文件。
配音效时就用到了前面记下的动作时间戳。撞击、接触、停稳这些动作都有准确的时间点,音效照着卡上去就行。

图 12 视频里的对点示意。小球撞上图形的那一刻,时间线上标出 SFX @ 00:06.717。
音效和 BGM 具体怎么配,我还没多少经验,都是先让 Agent 发挥,再靠自己的耳朵听。这部分我还在学,以后有好方法会更新到工作流里。字幕主要靠自己检查,看有没有挡住画面里的关键内容。
最后做封面。我每期会找两张参考图交给 Agent,一张负责画风,一张负责构图,再让它写出各个平台封面的提示词,我自己去生图。
09做完以后,把返工写回经验
到这里,一条可以发布的视频就做完了。做完以后还有一件重要的事,就是把经验记下来。我会让 Agent 帮我梳理三类问题。
1这次哪些地方返工过。
2哪些事它没主动做,要我反复提醒。
3哪些地方我当时没注意到,改一改流程就能提高效率。
每次制作都可能碰到新问题、新的坑,把这些总结下来,后面才能越做越顺。

图 13 视频里展示的一份经验文件《配音驱动连续 MG 制作与返工经验》,MG 指图形动画。标出的一条写着“每句配音都有对象状态在变化”。
10这套流程最大的限制,是时间线定了就不好改
这套流程以最初定下的配音为基准。后期也能小改配音,但没有在剪映、PR 里拖时间线那么方便。时间线一动,后面的动画、音效和字幕都要重新对齐,相关画面还得重新渲染,让 Agent 来回改会很耗 token。
所以它只适合在确定好的时间线上做内容,不适合频繁调整剪辑结构,这是它目前最大的限制。

图 14 视频里的错位示意。配音中间的一段挪了位置以后,后面对应的画面、音效和字幕都对不上了。
最近用 Computer Use 让 AI 操作剪映、达芬奇,是一个新方向。Computer Use 就是让 AI 看着屏幕点鼠标、敲键盘去操作软件。我也在试,但远没有营销号说的一句话就能剪完出片那么简单。token 消耗和最终完成度我都还在测试,而且在 Windows 下 Computer Use 不能后台操作,这也是个大问题。后面如果真能提高效率,我再分享出来。
11拿到仓库以后,最该自己做的是两件事
这套 SOP、规则和经验都放在我的公开仓库 Table-VideoSOP 里,地址是 https://github.com/duoduoler-ops/Table-VideoSOP。仓库的 README 按 9 个步骤写好了可以复制使用的提示词,从初始化项目、建立 DESIGN.md,一直到封面和发布材料。

图 15 GitHub 仓库 Table-VideoSOP 的首页。SOP 在 docs 目录,提示词和模板分别在 prompts、templates,经验文件在 experience。
拿到以后,你要做的最重要的就两件事,一是选好你自己的 IP,二是做好你想要的设计规则。
具体步骤和提示词去仓库里看,这里不重复。生视频、运镜这些规则,也可以在我的基础上改。

图 16 AI 生成插图。现成的 SOP、规则和经验可以直接拿来用,IP 和设计规则这两处空位要自己填。
如果你照着做完了一个视频,别忘了把新踩的坑、新解决的问题记下来,写回你自己的规则里。