乐于分享
好东西不私藏

做短视频半年,我把 AI 工具串成了一条流水线(附完整流程)

做短视频半年,我把 AI 工具串成了一条流水线(附完整流程)

先说一下背景。

我是老刘,搞了半年 AI 工具相关的自媒体。公众号「老刘ai实战笔记」,每天两三百阅读。

说实话,挺迷茫的。

但有一条路是走通的——用 AI 做短视频。从文案到配音到剪辑,我摸索了半年,踩了不少坑,最后搞出了一套免费工具链。

今天掏心窝子分享一下,希望对同样在做的朋友有用。


第一步:找素材,别从零开始

很多人做短视频最大的问题是——每次从零开始。

写稿、找素材、配音、剪辑,一条视频耗半天。写了一周,人就废了。

我现在的做法是:建素材库

把你刷到的爆款视频、金句、观点,全部存下来。文案提取我用的是 TranscriptGenerate,免费的。

怎么用?

  • 复制视频链接,粘贴进去
  • 等几秒,全文就出来了
  • 复制到备忘录,打上标签

我建了一个文件夹叫「选题库」,按话题分类。有了这个库,你永远不会没东西写。


第二步:AI 写文案,别自己憋

有了素材库,下一步是写稿。

以前我都是自己写。打开文档,对着空白页面发呆半小时。后来我换了个思路——让 AI 做初稿,我来改

工具:Codex CLI(OpenAI 官方命令行工具)

具体步骤:

1. 从素材库里找 3-5 条相关文案

2. 扔给 AI,告诉它:"帮我用这些素材写一条 60 秒短视频文案,口语化,不要太正式"

3. AI 出初稿,我改 2-3 遍

关键技巧:不要让它一次写好。告诉 AI 你要的语气、时长、目标观众,它才能写出能用的东西。

一份 60 秒的脚本,原来我写要一小时。现在 10 分钟搞定。


第三步:配音,别用自己的声音(除非你是天选之人)

很多人纠结配音。

用自己声音?不够好听。用 AI 配音?怕太假。

说实话,现在的 TTS 已经很强了。我用的是 edge-tts(微软的免费 TTS),选 Yunyang 这个声音,调到 +20% 语速、-3Hz 音调,效果很自然。

操作就一行命令:

```

edge-tts --voice zh-CN-YunyangNeural --text "文案内容" --write-media output.mp3

```

踩坑提示:语速别调太快。我之前为了省时间调到 +50%,听起来像 2 倍速,观众直接划走。+20% 最稳。


第四步:配画面,用电影素材

画面是短视频的灵魂。很多人这里卡住——找不到合适的素材。

我的做法比较野:用电影素材

建一个电影素材库,按情绪分类(孤独、挣扎、励志、觉醒)。做视频的时候,根据文案情绪选对应的画面拼接。

拼接参数(给懂的人看):

```

分辨率:1920×1440(4:3 竖版)

帧率:30fps

编码:h264,CRF17(无损)

```

关键规则:拼接时用 `-c copy` 直通原画质,不要重编码。一条 60 秒视频,拼接只要 3 秒。


第五步:合成输出

有了文案配音 + 画面素材,最后一步是合成。

流程:

1. 选画面 → 按文案情绪排序

2. 拼接画面(`-c copy` 直通)

3. 替换音频(配音 + BGM)

4. 调整音量(BGM 0.15,配音 1.0)

5. 导出成品


这套流程的真相

说实话,这套流程不是什么黑科技。

工具都是免费的。流程也不复杂。关键就两点:

1. 建库 — 把素材积累起来,不要每次都从零开始

2. 跑通 — 把工具串起来,形成一条流水线

我现在的产出是:一条 60 秒视频,从文案到成片,40 分钟

原来一天一更都勉强,现在一天三条不是问题。


工具清单(全免费)

| 环节 | 工具 | 用途 |

|------|------|------|

| 文案提取 | TranscriptGenerate | 提取全网视频文案 |

| 文案写作 | Codex CLI / ChatGPT | AI 写初稿 |

| 配音 | edge-tts(微软) | 免费文字转语音 |

| 素材库 | 本地文件夹(ffmpeg 预处理) | 电影/视频素材分类存储 |

| 剪辑合成 | ffmpeg | 拼接 + 混音 + 导出 |


写在最后。

半年了,我的公众号流量还是不高。但短视频这条线,确实跑通了。

如果你也在做 AI 工具方向的内容,或者想做短视频但不知道从哪入手,不妨试试这套流程。

工具都是现成的。

迈出第一步,比什么都重要。

(文章配图来源于网络及工具截图,仅用于功能演示说明。)