上周我干了一件事:用4个AI工具,从零做了一条30秒的短片。
不是那种“敲一行字就出片”的演示视频,而是正经走了一遍完整流程——写脚本、做角色设计、生成画面、配音、配乐、剪辑、加字幕,最后导出成片。花了差不多一个下午,但跑通之后,我发现AI视频制作已经不再是“抽卡游戏”了。
这条短片叫《AI短剧时代,一个人就是一支团队》。咱就是说,这个标题听着有点鸡汤,但做完之后我是真信了。
第一步:
写脚本,但不是你想象的那种写法
工具:ChatGPT / Claude
很多人写脚本的方式是“写一篇文章,然后让AI生成视频”。但现在的AI视频工具有一个硬性限制:每个镜头最长只能生成10-15秒,超过这个长度,画面崩坏率会急剧上升。
所以脚本必须按镜头来写。一个场景只描述一个动作、一个机位、一个情绪。我让Claude生成了一条30秒短片的脚本,结构是这样的:

每个镜头不超过6秒,刚好卡在AI视频工具的安全区内。读一遍旁白,大约2.4字/秒,6秒刚好能放15个字左右——这个细节我跑了三遍才意识到。
第二步:
做角色设计,一致性是最大的坑
工具:即梦AI / Midjourney
AI视频最让人崩溃的问题是什么?角色变脸。第一幕还是同一个女主,第三幕直接换了个演员。
我这次学乖了,先建立了一个“角色身份锚点”。在即梦AI里生成了一张标准角色图:25岁中国女性,黑色齐肩直发,白色衬衫,淡妆,正面半身,柔和自然光。生成时记下了种子值,后续所有镜头都用同一张参考图+同一个种子值。

然后我用同样的角色图,在即梦里生成了一个3×3的故事板网格,把每个镜头的场景、人物动作、画面氛围一次生成出来。这一步比想象中快——大概15分钟,9个分镜就全有了。
再把每个分镜单独提取出来,用AI放大到4K清晰度。这一步别省,后面做视频生成时,参考图越清晰,出片质量越高。
第三步:
生成视频片段,最耗时的环节
工具:可灵 3.0 / Seedance 2.0
我用了图片转视频的模式,这是目前最可控、质量最高的路径。把分镜图上传到可灵3.0,写清楚这个镜头里的动作、情绪和镜头运动。
比如第一个镜头我写的提示词是:“无人机缓慢下降,俯瞰城市天际线,晨光从地平线扩散,金色光芒洒在建筑群上,云层缓慢移动,电影感,24帧每秒”。
生成一个5秒的镜头,大概需要3-5次尝试才能得到满意的结果。5个镜头我一共跑了大概20次生成,用了将近1小时。
这里有个省钱技巧:先用可灵的免费版跑草稿,确认构图和动作没问题后,再用Seedance 2.0的高质量模式跑最终版。可灵每天66积分,大概能跑6条免费视频,够用了。
第四步:
配音和配乐,声音是视频的灵魂
工具:ElevenLabs / 剪映AI配音
画面生成完了,但没声音的视频就像没加盐的菜。我用剪映的AI配音功能,选了“热门”区的女声音色,把脚本台词导进去,调整语速到1.0倍速,听起来最自然。

背景音乐从剪映的免费音乐库里找了一段“轻柔钢琴+环境氛围音”,长度刚好30秒。音量调到20%左右,不能压过人声。
第五步:
剪辑和导出,把碎片拼成完整的作品
工具:剪映专业版
这一步反而是最轻松的。把5个视频片段拖进时间线,按顺序排好,每个片段之间加0.3秒的叠化过渡。
关键技巧:前3秒必须有钩子。我在开头加了一个“随着AI技术爆发式发展”的字幕,搭配城市天际线升起的画面,节奏感立刻拉满。
自动字幕功能一键生成,调整字体和位置。导出时选择1080p 9:16,适合抖音和视频号。
成本和时间总账

从脚本到成片,2小时,零成本。放在一年前,这简直是天方夜谭。2026年的AI视频工具,已经从“随机抽卡”进化到了“精准导演”的阶段。
当然,它还有很多问题。角色一致性还不够完美,手指细节偶尔翻车,物理碰撞逻辑偶尔掉线。但说实话,对于一个2小时零成本的个人项目来说,这个完成度已经让我有点意外了。
你在用什么工具做AI视频?有没有什么特别想试但一直没动手的创意?现在这个时间点,工具基本成熟、成本几乎为零、平台还在扶持AI内容——跑一轮试试,跑出来了来评论区聊聊效果。

夜雨聆风