ARTICLE · 1083740
AI视频教育:第一集(1.前言;2.AI图片生成;3.AI视频生成;4.AI生成脚本;5.保持视频一致性;6.视频生成全流程.)
从零到一的全流程指南
一、前言
AI视频创作正在经历从“玩具”到“工具”的关键转折。2026年上半年,图片与视频生成模型密集迭代,Nano Banana Pro、Seedance 2.0、Veo 3.1等模型在画质、一致性和生成效率上均有显著突破。与此同时,剪映Hub、OpenCreator等一站式工作台的出现,让“一个人做出一部短片”从设想变为日常操作。
然而,工具越丰富,学习路径反而越容易迷失。本指南按照“图片→视频→脚本→一致性→全流程”的逻辑链条,系统梳理AI视频教育的核心知识模块,帮助读者建立可复用的创作能力。
核心认知:AI视频创作的本质不是“让AI替你拍片”,而是用AI把导演的构思快速视觉化。提示词编写能力、分镜规划能力和一致性控制能力,是决定作品质量的三项核心技能。
二、AI图片生成
2.1 工具选择
当前主流的AI图片生成工具可分为三类:
Qwen-Image-2.1是一个值得关注的选项:它将文生图、图片编辑、透明图生成和2K输出整合在同一套权重中,RTX 3090即可运行,支持一次参考最多10张图片。对于预算有限但需要高质量输出的创作者,这是一个实用选择。
2.2 提示词编写方法
图片生成提示词的核心结构可以概括为:
主体 → 细节 → 环境/背景 → 风格 → 画质/光影 → 构图/镜头
具体技巧:
第一,先写“不要”,再写“要”。 AI有一套“默认精修包”,如果不明确禁止,它会自动添加柔光、完美肤质、过度锐化等效果。在提示词开头加入否定约束(如“不要棚拍感”“不要过度磨皮”),能有效抑制AI的“自作主张”。
第二,用具体画面动作替代抽象形容词。 与其写“一个悲伤的女孩”,不如写“女孩低头看着手机屏幕,嘴角微微下垂,手指停在发送键上方没有按下”。具体的动作描述能引导模型生成更精准的画面。
第三,锁定场景边界。 明确写出“画面中只有两个人”“背景中没有其他人”,防止AI在空白区域填充不必要的内容。
2.3 从单图到角色设定图
在视频制作中,单张图片远远不够。需要制作角色设定图——一张包含角色正面、四分之三侧面、侧面和背面多角度视图的网格图像,配合中性表情和标准姿势。这张设定图是后续所有镜头生成的“身份锚点”,是保持角色一致性的基础素材。
三、AI视频生成
3.1 主流模型对比
2026年视频生成模型的能力分化日益明显,选择模型时应根据具体场景匹配:
Kling 3.0在角色一致性和多镜头支持上表现最为突出,适合需要同一角色出现在多个场景的项目;Sora 2在因果逻辑和叙事连贯性上领先,适合故事型内容;Veo 3.1的运镜控制能力最强,适合产品演示和电影感画面。
3.2 提示词的核心公式
视频生成提示词与图片提示词的本质区别在于时间维度。Seedance 2.0的提示词指南提出了一个实用的进阶公式:
精准主体 + 动作细节 + 场景环境 + 光影色调 + 镜头运镜 + 视觉风格 + 画质 + 约束条件
这个公式的逻辑是:先告诉模型“谁在做什么”,再交代“在哪、什么氛围”,然后明确“怎么拍”,最后用风格和约束把结果收紧。以Seedance 2.0为例,模型内部会将提示词拆分为“空间层”(画面里有什么)和“时间层”(事情如何随时间变化),因此提示词中的动作描述需要明确时间顺序和动作节点。
3.3 三种生成路径
文生视频:直接从文本描述生成视频,适合快速概念验证和创意探索。可控性最低,但速度最快。
图生视频:以一张图片作为首帧或风格参考,生成动态画面。这是目前最实用的路径——先用图片生成工具确定画面质量,再让视频模型“让画面动起来”。控制力主要取决于参考图本身的角度、光线和清晰度是否与目标镜头匹配。
视频生视频:以参考视频迁移运镜风格、节奏和动作,适合需要复刻特定镜头语言的项目。注意它迁移的是运动倾向和风格,不绑定角色身份。
四、AI生成脚本
4.1 脚本生成的基本流程
AI短剧团队的实际工作流揭示了一条清晰的路径:将想法和大致框架发给AI生成剧本大纲 → 大纲确认后进行AI扩写得到完整剧本 → 用AI拆解剧本,提取角色、场景、物品等提示词 → 生成关键道具图。
4.2 提示词模板
面向短视频脚本生成,一个经过验证的提示词结构是:
“类型词 + 角色/时长/结构三要素指令” ,生成后再进行“删虚词、分动作、加镜头标记”的优化。
对于短剧类内容,可以采用更结构化的方式:
“我有一个短剧创意:[创意描述]。请帮我扩展成一个20集、每集5分钟的短剧大纲。要求:每集结尾留悬念;主角有明确的目标和阻碍;配角有自己的故事线。”
4.3 工具生态
剪映Hub提供了一站式的脚本到成片能力:用户可以在无限画布上从一句话出发,生成分镜脚本,然后直接调用即梦、小云雀等平台生成素材,再进入多轨道编辑器完成剪辑。爱奇艺的“纳逗Pro”则面向专业影视场景,支持从剧本生成、分镜设计到成片输出的完整链条,已接入即梦、可灵、Vidu、海螺等主流模型。
对于需要更高控制力的创作者,开源工具如Slate提供了从剧本、分镜到素材生成的本地化工作台,基于storyboard.json驱动整个流程。
五、保持视频一致性
一致性是AI视频制作中最具挑战性的问题。需要先区分两种场景:单条片内的风格统一(难度较低,参考图或参考视频即可解决)和跨集/跨镜头的角色与调性一致(需要系统性方法)。
5.1 三种保持机制
机制一:参考图(首帧/风格图)
门槛最低、最常用的方式。给一张图作为首帧或风格参考,让模型照着色调和构图走。Runway的首帧条件、可灵的图生视频与角色参考、即梦的主体迁移都支持此类输入。短板是:画面动起来后可能漂移,单张图难以支撑跨角度、跨景别的角色一致性。
机制二:参考视频(迁移镜头风格与节奏)
给一段样片做视频到视频或运动迁移,模型会模仿其运镜方式和整体调性。适合延续系列的镜头感。注意:它迁移的是运动和风格倾向,不绑定角色身份,参考和目标差距大时容易“串味”。
机制三:风格模型/LoRA(训练专属权重)
用一组风格图或角色图训练LoRA,将画风和角色“焊”进模型权重中。跨集一致性最强,但需要显卡资源和调试能力,且写实视频角色的LoRA成熟度目前仍不如图像领域。
5.2 实操技巧
锚点主图法:首先生成一张定义角色或产品标准外观的主图,作为后续每次生成的@image引用。锚点图是唯一的真实来源,面部几何、色彩方案、服装和比例都从中派生。在每条提示词中重新引用锚点图,可以有效防止跨镜头的身份漂移。
提示词锚定法:在所有镜头的提示词中保持相同的风格描述,例如“电影级,35mm胶片拍摄,蓝绿和橙色调色”。同时保持光照描述一致,这是跨镜头视觉连续性的关键。
参考强度控制:将参考强度设在70%–80%可获得自然且仍允许适当场景变化的效果。如果连续生成多次后出现漂移,使用原始参考图而非已生成帧来重新锚定效果更佳。
减少变量:如果角色的面部或服装在镜头之间发生偏移,减少每次生成中变更的变量数量。保持镜头角度、光线和姿势尽量接近锚点图,添加约束关键词如“same character as reference, consistent clothing, stable face features”。
六、视频生成全流程
将以上模块整合,一条完整的AI视频制作流程可归纳为六个步骤:
步骤一:剧本与分镜
将创意框架输入AI(如ChatGPT、DeepSeek),生成剧本大纲并扩写为完整剧本。随后进行剧本拆解,提取角色、场景、道具清单,生成每个镜头的分镜描述和提示词。剪映Hub等工具可在此环节实现“一句话到分镜脚本”的快速转化。
步骤二:建立资产库
为每个角色生成角色设定图(多角度网格图),为每个场景生成空镜参考图,为关键道具生成标准图。这一步决定了后续所有镜头的视觉基础。角色设定图越完整(多角度、中性表情、标准姿势),后续一致性越有保障。
步骤三:分镜图生成
使用AI图片生成工具,基于角色设定图和分镜描述,逐镜生成分镜图。可以采用“九宫格法”:一次生成3×3的分镜网格,包含每个场景的第一帧,再逐个提取和放大到高清。
步骤四:图生视频
将分镜图上传到视频生成工具(如Kling、Seedance、可灵),在提示词中写清该镜头的人物动作、情绪、台词和运镜方式。每个镜头生成后立即与参考图对比,检查一致性偏差。
步骤五:音频与配音
使用AI配音工具生成角色对白,使用AI音乐生成工具(如Suno)制作背景音乐。注意配音音色需要与角色设定匹配,并在多集之间保持一致。
步骤六:剪辑与输出
将所有镜头片段导入剪辑工具(剪映专业版等),按分镜顺序排列,加入转场、字幕、音效和调色。剪映的AI创作助手“小映”可以辅助完成素材整理、口播删减和字幕纠错等重复性工作。最终导出成品,检查全片的一致性表现。
效率参考:据AI短剧团队的实际经验,真人短剧制作通常需要数月,而AI短剧一般只需4–5天,一名剪辑师与一名素材师合作即可完成。
学习路径建议:初学者可以先从“图片生成→图生视频”的单镜头制作入手,掌握提示词编写和一致性控制的基本感觉;然后扩展到3–5个镜头的短片,练习分镜规划和跨镜头一致性;最后再挑战系列化内容,引入LoRA训练或流程模板化方法。每一步的复杂度增加都是可控的,关键是先跑通最小可行流程,再逐步叠加能力。