乐于分享
好东西不私藏

AI视频制作解析:香蕉猫VS迪迦奥特曼

AI视频制作解析:香蕉猫VS迪迦奥特曼
先上视频:
这是目前做的时间最长的AI视频,属于剧情类的,不同于特效类视频的短平快,剧情类视频需要有详细的细节描述,并且让故事按照自己预想的情节发展,从时长和内容控制两方面来讲,难度都有所提升。
主要用到的视频模型是可灵Omni3.0和Veo2.0(即梦seedance对迪迦的形象一直审核不同过),由于是第一次制作这类视频还不太熟悉,前前后后用了可灵AI1.5k左右的灵感值,算是偏多的了,主要是同一片段重复生成了很多次才满意,过程中也总结了不少经验,会在后文章分享。
图片模型依旧是Nano Banana 2 Pro,目前依然是我觉得最强的图片生成模型。

核心思路:

  • 定主题:明确视频核心故事。
  • 写脚本:让AI围绕主题写一个60s的详细脚本。
  • 做角色:让AI生成角色的三视图,保证人物统一。
  • 做场景:让AI根据剧情生成合适的场景。
  • 分镜头:让AI写用于生成分镜头的提示词,用提示词来生成分镜头。
  • 做视频:根据生成的分镜头,用视频模型生成动画。
  • 后期剪辑:在剪辑软件中调节视频节奏,加入特效、音效、背景音乐、字幕等内容,形成完整视频。
下面来看详细步骤。

1.明确视频主题

考虑到人物对打类视频角色数量少、对场景环境的控制要求也更低,作为第一次尝试剧情类 AI 视频,我就先选了这类相对好上手的题材。角色方面,我选了自己很喜欢的香蕉猫和迪迦奥特曼,组合起来反差感很强,题材也足够新奇,更容易吸引眼球。所以最终视频主题就确定为香蕉猫大战迪迦奥特曼。

2.生成详细视频脚本

在正式撰写脚本之前,我先让 AI 只输出一段纯文字版的故事情节叙述,不附带任何镜头、画面或多余内容,避免干扰核心剧情的确定,以下是 AI 给出的情节描述
【由于最后一段奥特曼石化和红灯闪烁的场景一直没有生成让我满意的视频(生成的抽象结果会在后面展示),所以暂时放弃了这个情节。一直追求细节不知道要什么时候才能完成,本着先完成再完美的原则,就先生成了目前的视频,当然,后续的视频中我会不断的打磨技术,持续性追求完美。】
故事情节确定了,接下来就可以生成详细的视频脚本了。下面是我给AI的提示词,以及AI的答复:
提示词:根据这个故事情节,帮我生成详细的60s视频脚本,excel形式,表头包含镜头序号、时长、画面描述、画面风格、景别、运镜方式、首帧画面描述、尾帧画面描述、首帧文生图提示词、尾帧文生图提示词、图生视频提示词、首帧文生图提示词(中英文)、尾帧文生图提示词(中英文)、图生视频提示词(中英文)。

3.角色与场景制作

网上找了一张香蕉猫和迪迦奥特曼的图片,用banana生成了两个角色的三视图。
让AI根据剧情帮我生成了一个场景。

4.分镜头制作

用AI生成的脚本内容表格中的提示词,发给AI帮我生成了每个片段的分镜头画面

5.视频制作

大部分片段我都采用了首尾帧生成视频的方式,最大程度保证了画面的流畅衔接;只有在需要切换镜头、不用延续上一段连贯性时,才会改用普通图片参考生成,在提示词里插入首帧画面,并明确标注以该图作为视频起始帧。用这个两个方法就生成了视频所需的全部内容了。
不过实际制作中,一次就成功的情况少之又少,很多镜头都需要反复调整。我会根据生成失败的视频,一点点优化提示词,再重新渲染,就这样循环往复,直到调出相对满意的画面为止。这次视频的成本和灵感值,也基本都消耗在了这个反复试错、迭代优化的环节。从下面可灵的生成历史里就能直观看到,满屏都是重复生成的记录。
【痛的教训:1.由于刚开始做视频,有追求完美的心态,我最开始都是用的最高画质生成视频,花费了不少积分。后来发现,对于比较简单的视频内容,成功率比较高,就直接用最高画质生成;对于动作较多,比较复杂的视频内容,就先用最低画质生成来节省积分,等生成满意的画面后再用相同提示词来生成最高画质的版本。或者可以全都用最低画质,等视频做完后再用AI工具或剪辑软件来优化画质。2.现在有很多完全免费的视频生成模型,虽然质量没有保障,但是可以用来做提示词实验,看生成的动作效果怎么样,等试出比较满意的提出词后,在到用付费模型来生成。】

6.后期剪辑

首先把生成的视频片段进行前后拼接,有些片段由于用的不同的模型,虽然用了首尾帧功能,但前后衔接的时候还是会有卡顿的情况,就需要在前后衔接的地方加上一些转场特效来掩盖卡顿。
【痛的教训:不同模型生成的片段可能无法完美拼接,在写提示词的时候一定要强调画面比例,强调保持风格一致。】
再给视频加音乐,由于AI生成的每个片段都有各自对应的音效,拼接到一块就会有些不协调,可以用剪映中的生成音效功能,给视频统一增加音效。但这次AI生成的片段进行拼接后整体效果还可以,所就没有再次生成音效了。对于人物发声,以及特点的bgm,就需要自己在对应的地方手动添加,最终让视频整体音效保持和谐。

抽象视频回顾:
最后一个是想用倒放的思路,结果也是十分的抽象。

在真正动手做AI视频之前,我以为只要输入提示词就能得到想要的结果。上手后才发现,它远没有想象中简单。大量的反复试错、漫长的生成等待、不断消耗的时间与成本,都是这条路上无法跳过的必经环节。
AI从来不是能直接产出完美作品的魔法,也不是可以替代创作者的工具,而是一个需要人主导、通过持续迭代来实现想法的协作者。很多人只看到别人成品的惊艳,却看不到背后几十上百次的失败生成和反复调整。
所有的试错都不是无用功。它们在帮你一点点摸清AI的边界和逻辑,建立对工具的真正掌控力。当你不再指望AI一步到位,而是学会拆解需求、精准引导的时候,才算是真正入了门,往后自然会越来越得心应手。
【我会持续更新我的AI经验和教训,欢迎大家随时来讨论交流~
宝子们的点赞和关注就是我更新的最大动力~】