夜雨聆风学习资料网

ARTICLE · 1083740

AI视频教育:第一集(1.前言;2.AI图片生成;3.AI视频生成;4.AI生成脚本;5.保持视频一致性;6.视频生成全流程.)

AI视频教育:第一集(1.前言;2.AI图片生成;3.AI视频生成;4.AI生成脚本;5.保持视频一致性;6.视频生成全流程.)

从零到一的全流程指南  

一、前言

AI视频创作正在经历从“玩具”到“工具”的关键转折。2026年上半年,图片与视频生成模型密集迭代,Nano Banana Pro、Seedance 2.0、Veo 3.1等模型在画质、一致性和生成效率上均有显著突破。与此同时,剪映Hub、OpenCreator等一站式工作台的出现,让“一个人做出一部短片”从设想变为日常操作。

然而,工具越丰富,学习路径反而越容易迷失。本指南按照“图片→视频→脚本→一致性→全流程”的逻辑链条,系统梳理AI视频教育的核心知识模块,帮助读者建立可复用的创作能力。

核心认知:AI视频创作的本质不是“让AI替你拍片”,而是用AI把导演的构思快速视觉化。提示词编写能力、分镜规划能力和一致性控制能力,是决定作品质量的三项核心技能。

二、AI图片生成

2.1 工具选择

当前主流的AI图片生成工具可分为三类:

类型
代表工具
适用场景
通用文生图
Qwen-Image-2.1、Hy Image3.5、Midjourney
概念图、角色设计、场景概念
专业影视向
Nano Banana Pro、Seedream
分镜图、角色设定图、商业素材
开源本地部署
GLM-Image、FLUX
数据隐私要求高、需要微调

Qwen-Image-2.1是一个值得关注的选项:它将文生图、图片编辑、透明图生成和2K输出整合在同一套权重中,RTX 3090即可运行,支持一次参考最多10张图片。对于预算有限但需要高质量输出的创作者,这是一个实用选择。

2.2 提示词编写方法

图片生成提示词的核心结构可以概括为:

主体 → 细节 → 环境/背景 → 风格 → 画质/光影 → 构图/镜头

具体技巧:

第一,先写“不要”,再写“要”。 AI有一套“默认精修包”,如果不明确禁止,它会自动添加柔光、完美肤质、过度锐化等效果。在提示词开头加入否定约束(如“不要棚拍感”“不要过度磨皮”),能有效抑制AI的“自作主张”。

第二,用具体画面动作替代抽象形容词。 与其写“一个悲伤的女孩”,不如写“女孩低头看着手机屏幕,嘴角微微下垂,手指停在发送键上方没有按下”。具体的动作描述能引导模型生成更精准的画面。

第三,锁定场景边界。 明确写出“画面中只有两个人”“背景中没有其他人”,防止AI在空白区域填充不必要的内容。

2.3 从单图到角色设定图

在视频制作中,单张图片远远不够。需要制作角色设定图——一张包含角色正面、四分之三侧面、侧面和背面多角度视图的网格图像,配合中性表情和标准姿势。这张设定图是后续所有镜头生成的“身份锚点”,是保持角色一致性的基础素材。

三、AI视频生成

3.1 主流模型对比

2026年视频生成模型的能力分化日益明显,选择模型时应根据具体场景匹配:

模型
最长时长
分辨率
角色一致性
最佳场景
Kling 3.0
15s
4K/60fps
优秀(3+角色)
社交内容、广告、IP
Sora 2
60s
1080p
中等
叙事长片、故事讲述
Veo 3.1
8s
4K
良好
电影感B-roll、产品展示
Runway Gen-4.5
10s
4K
优秀(Act-Two)
专业影视、动作迁移
Pika 2.5
5s
1080p
较低
病毒式传播、社交快剪

Kling 3.0在角色一致性和多镜头支持上表现最为突出,适合需要同一角色出现在多个场景的项目;Sora 2在因果逻辑和叙事连贯性上领先,适合故事型内容;Veo 3.1的运镜控制能力最强,适合产品演示和电影感画面。

3.2 提示词的核心公式

视频生成提示词与图片提示词的本质区别在于时间维度。Seedance 2.0的提示词指南提出了一个实用的进阶公式:

精准主体 + 动作细节 + 场景环境 + 光影色调 + 镜头运镜 + 视觉风格 + 画质 + 约束条件

这个公式的逻辑是:先告诉模型“谁在做什么”,再交代“在哪、什么氛围”,然后明确“怎么拍”,最后用风格和约束把结果收紧。以Seedance 2.0为例,模型内部会将提示词拆分为“空间层”(画面里有什么)和“时间层”(事情如何随时间变化),因此提示词中的动作描述需要明确时间顺序和动作节点。

3.3 三种生成路径

文生视频:直接从文本描述生成视频,适合快速概念验证和创意探索。可控性最低,但速度最快。

图生视频:以一张图片作为首帧或风格参考,生成动态画面。这是目前最实用的路径——先用图片生成工具确定画面质量,再让视频模型“让画面动起来”。控制力主要取决于参考图本身的角度、光线和清晰度是否与目标镜头匹配。

视频生视频:以参考视频迁移运镜风格、节奏和动作,适合需要复刻特定镜头语言的项目。注意它迁移的是运动倾向和风格,不绑定角色身份。

四、AI生成脚本

4.1 脚本生成的基本流程

AI短剧团队的实际工作流揭示了一条清晰的路径:将想法和大致框架发给AI生成剧本大纲 → 大纲确认后进行AI扩写得到完整剧本 → 用AI拆解剧本,提取角色、场景、物品等提示词 → 生成关键道具图。

4.2 提示词模板

面向短视频脚本生成,一个经过验证的提示词结构是:

“类型词 + 角色/时长/结构三要素指令” ,生成后再进行“删虚词、分动作、加镜头标记”的优化。

对于短剧类内容,可以采用更结构化的方式:

“我有一个短剧创意:[创意描述]。请帮我扩展成一个20集、每集5分钟的短剧大纲。要求:每集结尾留悬念;主角有明确的目标和阻碍;配角有自己的故事线。”

4.3 工具生态

剪映Hub提供了一站式的脚本到成片能力:用户可以在无限画布上从一句话出发,生成分镜脚本,然后直接调用即梦、小云雀等平台生成素材,再进入多轨道编辑器完成剪辑。爱奇艺的“纳逗Pro”则面向专业影视场景,支持从剧本生成、分镜设计到成片输出的完整链条,已接入即梦、可灵、Vidu、海螺等主流模型。

对于需要更高控制力的创作者,开源工具如Slate提供了从剧本、分镜到素材生成的本地化工作台,基于storyboard.json驱动整个流程。

五、保持视频一致性

一致性是AI视频制作中最具挑战性的问题。需要先区分两种场景:单条片内的风格统一(难度较低,参考图或参考视频即可解决)和跨集/跨镜头的角色与调性一致(需要系统性方法)。

5.1 三种保持机制

机制一:参考图(首帧/风格图)

门槛最低、最常用的方式。给一张图作为首帧或风格参考,让模型照着色调和构图走。Runway的首帧条件、可灵的图生视频与角色参考、即梦的主体迁移都支持此类输入。短板是:画面动起来后可能漂移,单张图难以支撑跨角度、跨景别的角色一致性。

机制二:参考视频(迁移镜头风格与节奏)

给一段样片做视频到视频或运动迁移,模型会模仿其运镜方式和整体调性。适合延续系列的镜头感。注意:它迁移的是运动和风格倾向,不绑定角色身份,参考和目标差距大时容易“串味”。

机制三:风格模型/LoRA(训练专属权重)

用一组风格图或角色图训练LoRA,将画风和角色“焊”进模型权重中。跨集一致性最强,但需要显卡资源和调试能力,且写实视频角色的LoRA成熟度目前仍不如图像领域。

5.2 实操技巧

锚点主图法:首先生成一张定义角色或产品标准外观的主图,作为后续每次生成的@image引用。锚点图是唯一的真实来源,面部几何、色彩方案、服装和比例都从中派生。在每条提示词中重新引用锚点图,可以有效防止跨镜头的身份漂移。

提示词锚定法:在所有镜头的提示词中保持相同的风格描述,例如“电影级,35mm胶片拍摄,蓝绿和橙色调色”。同时保持光照描述一致,这是跨镜头视觉连续性的关键。

参考强度控制:将参考强度设在70%–80%可获得自然且仍允许适当场景变化的效果。如果连续生成多次后出现漂移,使用原始参考图而非已生成帧来重新锚定效果更佳。

减少变量:如果角色的面部或服装在镜头之间发生偏移,减少每次生成中变更的变量数量。保持镜头角度、光线和姿势尽量接近锚点图,添加约束关键词如“same character as reference, consistent clothing, stable face features”。

六、视频生成全流程

将以上模块整合,一条完整的AI视频制作流程可归纳为六个步骤:

步骤一:剧本与分镜

将创意框架输入AI(如ChatGPT、DeepSeek),生成剧本大纲并扩写为完整剧本。随后进行剧本拆解,提取角色、场景、道具清单,生成每个镜头的分镜描述和提示词。剪映Hub等工具可在此环节实现“一句话到分镜脚本”的快速转化。

步骤二:建立资产库

为每个角色生成角色设定图(多角度网格图),为每个场景生成空镜参考图,为关键道具生成标准图。这一步决定了后续所有镜头的视觉基础。角色设定图越完整(多角度、中性表情、标准姿势),后续一致性越有保障。

步骤三:分镜图生成

使用AI图片生成工具,基于角色设定图和分镜描述,逐镜生成分镜图。可以采用“九宫格法”:一次生成3×3的分镜网格,包含每个场景的第一帧,再逐个提取和放大到高清。

步骤四:图生视频

将分镜图上传到视频生成工具(如Kling、Seedance、可灵),在提示词中写清该镜头的人物动作、情绪、台词和运镜方式。每个镜头生成后立即与参考图对比,检查一致性偏差。

步骤五:音频与配音

使用AI配音工具生成角色对白,使用AI音乐生成工具(如Suno)制作背景音乐。注意配音音色需要与角色设定匹配,并在多集之间保持一致。

步骤六:剪辑与输出

将所有镜头片段导入剪辑工具(剪映专业版等),按分镜顺序排列,加入转场、字幕、音效和调色。剪映的AI创作助手“小映”可以辅助完成素材整理、口播删减和字幕纠错等重复性工作。最终导出成品,检查全片的一致性表现。

效率参考:据AI短剧团队的实际经验,真人短剧制作通常需要数月,而AI短剧一般只需4–5天,一名剪辑师与一名素材师合作即可完成。

学习路径建议:初学者可以先从“图片生成→图生视频”的单镜头制作入手,掌握提示词编写和一致性控制的基本感觉;然后扩展到3–5个镜头的短片,练习分镜规划和跨镜头一致性;最后再挑战系列化内容,引入LoRA训练或流程模板化方法。每一步的复杂度增加都是可控的,关键是先跑通最小可行流程,再逐步叠加能力。

今天就和大家分享这么多,谢谢大家的观看,请关注、收藏、转评赞,下期再见。
上期链接:
1.【跟我学剪映】第1集:下载与安装视频剪辑软件
2.【跟我学剪映】第2集:视频剪辑的设置(分辨率、帧率)
3.【跟我学剪映】第3集:视频剪辑的设置(片头、片尾)
4.【跟我学剪映】第4集:去除“剪同款”水印
5.【跟我学剪映】第5集:视频剪辑的管理(剪辑草稿)
6.【跟我学剪映】第6集:用剪映进行素材处理(添加、分割、复制、删除、替换)
7.【跟我学剪映】第7集:用剪映进行画面调整(镜像、旋转、裁剪、色调、背景、定格、动画、画中画)
8.【跟我学剪映】第8集:用剪映进行转场设置
9.【跟我学剪映】第9集:用剪映进行蒙版操作
10.【跟我学剪映】第10集:用剪映进行文字添加(添加文字、识别字幕、识别歌词、添加贴纸)
11.【跟我学剪映】第11集:用剪映进行音频处理(添加音乐/音效/录音、音频操作、音频调整)
12.【跟我学剪映】第12集:用剪映进行特效制作(特效操作、特效调整)
13.【跟我学剪映】第13集:手机版配音及音频处理(添加音乐、Siri声音、生成字幕、配音、曲线变速、踩点变速、灯光卡点、插入音乐)
14.【跟我学剪映】第14集:关键帧用法(具体操作、渐变颜色、定格转场、滚动转场、抽帧卡点、表情包、追踪运镜、视频音量、不透明度)
15.【跟我学剪映】第15集:关键帧用法(滚动字幕、三连帧、表情字幕跳动、文字遮挡、神奇转场、文字卡点、运镜、照片变视频、镂空文字)
16.【跟我学剪映】第16集:将视频放在一张图片上
17.【跟我学剪映】第17集:如何制作国庆动画祝福语
18.【跟我学剪映】第18集:详解画中画(了解、分身合体、黑白反转片头)
19.【跟我学剪映】第19集:详解画中画(淡进淡出的无缝转场、视频结尾头像效果)
20.【跟我学剪映】第20集:详解画中画(制作主体穿越文字效果、制作局部马赛克)
21.【跟我学剪映】第21集:详解画中画(彩色光束蒙版、叠化转场)
22.【跟我学剪映】第22集:详解画中画(替换云彩背景、火焰绽放效果)
23.【跟我学剪映】第23集:详解画中画(漫画效果、朋友圈动态九宫格)
24.【跟我学剪映】第24集:文字变成声音(配音)
25.【跟我学剪映】第25集:声音变成文字(音视频文字提取)
26.【跟我学剪映】第26集:万能拉镜(剪映新功能)
27.【跟我学剪映】第27集:用关键帧和蒙版将两段画面融合在一起
28.【跟我学剪映】第28集:去除画面中字幕和动态水印
29.【跟我学剪映】第29集:剪映操作界面工具栏功能释义和用法
30.【跟我学剪映】第30集:美颜和美体
31.【跟我学剪映】第31集:一键成片
32.【跟我学剪映】第32集:超清画质
33.【跟我学剪映】第33集:清理电脑和手机内存
34.【跟我学剪映】第34集:文章文字自动做成视频(图文成片)
35.【跟我学剪映】第35集:竖频变成横屏、朗读变声、三分屏卡点、自定义曲线控制播放速度
36.1【跟我学剪映】第36-1集:一组爆款剪映视频
36.2【跟我学剪映】第36-2集:一组爆款剪映视频
36.3.【跟我学剪映】第36-3集:一组爆款剪映视频
37.【跟我学剪映】第37集:去除视频多余的人或物体的5种方法(遮盖法、背景法、色度抠图法、定格法、涂鸦法)
38.【跟我学剪映】第38集:彻底清理抖音和微信占用手机的内存
39.【跟我学剪映】第39集:太神奇了!微信#键功能竟然如此强大
40.【跟我学剪映】第40集:今日头条、西瓜视频、抖音三个平台的关系及区别
41.【跟我学剪映】第41集:剪映零基础入门(操作界面和基本功能键详解)
42.【跟我学剪映】第42集:剪映零基础入门(获取免费海量视频图片素材三个渠道——今日头条、剪映APP、西瓜视频)
43.【跟我学剪映】第43集:剪映零基础入门(多段视频完美拼接)
44.【跟我学剪映】第44集:剪映零基础入门:图片转换动态视频的5种方法(抖音玩法、关键帧运镜、动画作用、添加转场、特效作用)
45.【跟我学剪映】第45集:国产AI智能工具(写文案、做视频、翻译、生活无所不能,可比肩ChatGPT) 免费!好用!功能超级强!
46.【跟我学剪映】第46集:如何调节视频高清画质(清晰度)
47.【跟我学剪映】第47集:把一段文字做成视频
48.【跟我学剪映】第48集:用2张照片制作旱地拔葱震撼感视频
49.【跟我学剪映】第49集:剪映常用音效分享
50.【跟我学剪映】第50集:微信隐藏的13个超级实用功能(高清视频图片发送、图片文字提取、查看微信过期图片、转发语音、注册小号)
51.【跟我学剪映】第51集:剪映成片、触手可及、千变万化:用好手机相册隐藏的3个功能
52.【跟我学剪映】第52集:六种卡点视频的操作方法(动画卡点、转场卡点、手势卡点、蒙版卡点、变速卡点、抽帧卡点)
53.【跟我学剪映】第53集:四分屏卡点效果制作
54.【跟我学剪映】第54集:高级感钢琴百叶窗卡点视频
55.【跟我学剪映】第55集:制作炫酷快切卡点
56.【跟我学剪映】第56集:用蒙版结合关键帧制作高级感旅拍卡点效果
57.【跟我学剪映】第57集:用蒙版和关键帧制作高级感开场效果
58.【跟我学剪映】第58集:一组爆款作品欣赏
59.【跟我学剪映】第59集:超级震撼 旅拍大片片头制作案例
60.【跟我学剪映】第60集:关键帧6种使用方法
61.【跟我学剪映】第61集:关键帧使用方法(让贴纸动起来、电影感片尾字幕、控制特效强度)
62.【跟我学剪映】第62集:素材库素材 8种避免侵权的二次加工方法(拉伸视频、镜像、调色、变速、抽帧、加特效、加贴纸、加画中画)
63.【跟我学剪映】第63集:给人物换背景的5种方法
64.【跟我学剪映】第64集:励志名人名言书单模板制作方法
65.【跟我学剪映】第65集:混合模式的六种高级用法
66.【跟我学剪映】第66集:育儿书单的制作方法
67.【跟我学剪映】第67集:剪映和国际版capcut版本的区别
68.【跟我学剪映】第68集:如何把三张照片合在一张上
69.【跟我学剪映】第69集:如何让一张照片开口讲话对口型唱歌
70.【跟我学剪映】第70集:把别人的素材变成自己原创视频的制作方法
71.【跟我学剪映】第71集:片头和片尾的制作方法
72.【跟我学剪映】第72集:制作照片对口型的视频
73.【跟我学剪映】第73集:用DeepSeek+剪映制作原创爆款视频
74.【跟我学剪映】第74集:如何让视频画面秒变通透
75.【跟我学剪映】第75集:如何让文字(歌词)整排向上滚动
76.【跟我学剪映】第76集:歌词字幕滚动制作(层级+蒙版+关键帧)
77.【跟我学剪映】第77集:微信也能做视频、手机微信立马把照片变视频,只需5步,超级简单!
78.【跟我学剪映】第77集:进入实操,这是手机拍摄的横屏剪辑的,配上王峰《春天里》,把劳动者的伟大、崇高表现的淋漓尽致!
(未完待续)

相关学习资料