ARTICLE · 1042829
普通人用 AI 做视频,别从剪辑软件开始
很多人做视频失败,不是因为没审美,也不是因为不够努力,而是流程一开始就错了。
脚本要写、配音要学、剪辑要学、字幕要对齐、画面还要找素材。每一件事单拿出来都不难,但四件事压在一起,普通人很容易从“入门”直接走到“放弃”。
现在这件事有了新的解法:你可以把 Codex 当成视频制作助理。
它不是简单帮你写一段文案,而是可以按照你的要求,处理口播稿、配音、时间轴、字幕、分镜,最后检查成片。
你要做的不是学会所有软件,而是学会当导演:把目标说清楚,把结果验收好。
这篇文章,我把普通人跑通第一条 AI 视频的流程讲清楚。

1、先别打开剪辑软件
普通人做视频,最常见的问题是上来就问:“我用剪映还是 PR?”
这个问题可以往后放。
因为一条视频能不能成立,首先不是取决于剪辑软件,而是取决于三件事:
给谁看?
讲什么?
看完以后观众能带走什么?也就是利他性。
你可以先把这段提示词交给 Codex:
我要做一条 60 秒竖版视频,主题是【填写主题】。观众是【填写人群】,他们没做过视频,也不懂技术。开头先告诉他们这条视频最后能得到什么。中间只讲三个步骤,每句话都要能直接念出来。结尾给一个今天就能做的动作。现在只输出完整口播稿,暂时不要做分镜和视频。这一步很关键:先让 AI 只做一件事。
很多新手一开始就让 AI“直接帮我生成视频”,结果拿到的东西看起来什么都有,实际上什么都不准。先把口播稿定下来,后面的声音、字幕、画面才有骨架。

2、口播稿不是文章缩写
如果你已经有一篇公众号文章,想把它改成视频,不要让 AI 逐段缩写。
文章是给人看的,口播是给人听的。
文章里可以有长句、小标题、括号和补充说明,但口播必须一口气说得出来。尤其是开头三秒,不能慢慢铺垫,要直接把结果或者痛点摆出来。
你可以这样写提示词:
请读取这篇文章,把它改成一条 90 秒口播稿。
保留核心判断和最有用的案例,不要逐段缩写全文。开头先说观众能得到什么。中间只保留三步方法。链接、脚注和排版符号不要读出来。最后把需要我核对的事实单独列出来。
先只生成口播稿。“把需要核对的事实单独列出来”这一句很重要。
AI 做视频最怕的不是画面丑,而是内容看起来很顺,里面混进了没核实的数据、来源不清的案例,或者把别人的说法写成了确定事实。
文章可以交给 AI 改,判断必须留在我自己手里。

3、声音定稿以后,再决定时间轴
第二条容易踩的坑,是边做画面边改文案。看起来灵活,其实后面会全部返工。
因为声音只要改一句,字幕时间、镜头长度、图片出现的时间点都会跟着变。
更稳的顺序是:主题、口播稿、声音、时间轴、分镜、成片
第一次做视频,不一定要急着复刻自己的声音。先用普通文字转语音跑一版,听十几秒,确认语速、停顿和咬字,再生成全文。声音文件定稿以后,它就是整条视频的时间尺。
你可以让 Codex 这样处理(提示词):
请以 final.wav 为准建立时间轴。用口播稿核对字幕文字,用音频转写结果取得每句话的真实开始和结束时间。输出字幕文件和时间轴文件。如果口播稿和实际声音不一致,请列出来,不要自行猜测。不要按字数平均分配字幕时间。
同样十个字,有的半秒就说完,有的中间停顿两次。字幕、关键词和画面都应该跟着真实声音走,不然观众会觉得视频哪里都怪,但又说不清为什么。

4、 分镜不是设计,是回答问题
很多人一听“分镜”就觉得专业。其实第一条视频的分镜很简单:口播切成几段,每段只回答一个问题。
观众听到这句话时,画面上最需要看到什么?
如果讲的是步骤,就出现步骤卡。
如果讲的是对比,就出现前后对比。
如果讲的是一篇文章,就把文章里的截图、图表、重点句放大。
如果讲的是一个具体案例,就出现案例里的关键信息。
你可以这样交给 Codex:
请根据口播稿、时间轴和素材文件夹制作分镜表。每个镜头写清楚:对应口播、开始时间、结束时间、主要画面、需要的素材、字幕位置。已有图片必须优先使用。缺少素材的地方先标记,不要用无关图片填满。第一条视频不要追求华丽。
先让观众看懂。画面不需要每秒都在动,但必须在关键句子出现时,给观众一个能抓住的东西。

5、 先看前 15 秒,再做全片
视频项目生成以后,不要急着渲染完整成片。
先看前 15 秒。
前 15 秒能暴露大部分问题:开头是不是太慢,字幕是不是太小,画面有没有解释口播,字体有没有被裁掉,声音是不是不舒服。
修改时也不要只说“高级一点”“再好看一点”。
这种反馈很难执行。
你要说具体位置和具体对象:
第 6 秒的标题太小。这张截图至少停留 3 秒。字幕挡住了人物。第一个镜头进入太慢。第 12 秒的关键词改成“省时间”。AI 最需要的是明确指令。你越能说清楚哪里不对、希望变成什么样,它越容易改到位。

6、真正的完成标准,是成片能看
看到预览页面,不代表视频完成了。
真正的完成标准是:生成最终视频文件,并且你从头到尾看一遍。
最后至少检查五个地方:
声音有没有截断?
字幕有没有错位?
图片有没有被裁掉?
重点信息有没有被字幕挡住?
事实和数字有没有出错?
这一步不能交给 AI 完全判断。
AI 可以帮你检查文件、转写、对比时间轴,但“这条视频我想不想发”“这个表达像不像我”“这个例子适不适合我的观众”,仍然要你自己决定。

7、从一条视频,变成一套内容系统
如果你只想做一条视频,上面的流程已经够用了。
但如果想长期做账号,就要再往前走一步:把流程固化。
比如你可以固定做一类内容:
每周拆一个 AI 工具。
每次解决一个办公问题。
每期把一篇长文章改成短视频。
每周解读一个行业信号。
连续做几期以后,让 Codex 把文件结构、字幕样式、片头、分镜模板保留下来。第二期开始,你只需要换主题和素材,后面的流程可以继续复用。
这时候 AI 的价值才真正变大。
它不只是“帮你做过一条视频”,而是陪你持续生产一类内容。
普通人用 AI 做视频,最正确的姿势不是把所有事都丢给它,而是你负责选题、判断和风格,AI 负责把重复流程跑完。
说白了,做视频这件事,以前难在技术门槛。
现在难在你能不能把一件事讲清楚。
如果你能把目标讲清楚,AI 就能帮你把剩下的路铺出来。