夜雨聆风学习资料网

ARTICLE · 1117069

AI 生成视频:常用方法与核心技巧手册——九大核心方法

AI 生成视频:常用方法与核心技巧手册——九大核心方法

AI 生成视频:常用方法与核心技巧手册

本手册讲的是怎么用,不重复讲用哪个。工具选型见配套报告。


一、先建立一个正确的心智模型

绝大多数人第一次用 AI 生成视频,会把它当成「许愿池」——写一句话,期待出来一条成片。这是失败率最高的用法。

正确的理解是:AI 视频生成不是"写文案",而是"当导演"。 模型是一个执行力很强但没有判断力的摄影师,你给的信息越接近分镜脚本,它交回来的东西越接近你要的。

三条必须建立的心智模型:

① 单次生成 = 一个镜头,不是一条片子。除了通义万相(原生 30 秒)、Pika(最长 30 秒多镜头)这类特例,主流产品单次生成多为 5–10 秒。做长视频的正解是分段生成 + 剪辑拼接,而不是找一个"能一次生成 3 分钟"的工具。

② 可控性来自「输入端的约束」,不是「提示词的形容词」。想让角色不换脸,靠的是参考图,不是写"同一个女孩,短发,穿红裙子";想让镜头按你想法运动,靠的是首尾帧或运动控制,不是写"镜头缓缓推进"。

③ 成本由「迭代次数」主导,不由「单价」主导。一条满意成片平均要迭代 3 次。先出低价草稿、满意后再用高清重跑同一条,是整套流程里最省钱的一条规则。


二、九种常用生成方法

2.1 方法全景

#
方法
输入
可控性
最适合做什么
主要局限
1
文生视频
(T2V)
文字提示词
低
概念探索、氛围镜头、空镜
具体主体不可控,试错成本高
2
图生视频
(I2V)
一张图 + 文字
中
电商、插画动起来、分镜落地
首帧被锁死,运动幅度受限
3
首尾帧控制
(F2F)
首帧图 + 尾帧图
高
精确转场、镜头衔接、循环片段
需要先准备好两张图
4
参考生视频
(R2V)
多张参考图(角色/物体/风格)
高
系列内容、角色一致性
参考图质量决定上限
5
视频生视频
(V2V)
视频 + 编辑指令
中高
风格迁移、改画幅、补/删元素
部分产品需较高档位
6
运动控制
参考视频 + 角色图
高
舞蹈、动作复刻、表演迁移
需要一段参考动作视频
7
音频驱动
音频 + 人像图
高
口播、数字人、MV 对口型
需要外部音频,表情幅度有限
8
延长 / 多镜头
已有片段 + 提示词
中
长叙事、30 秒成片
越长越容易累积漂移
9
Agent 工作流
一句话需求
低(但端到端)
批量生产、自动化流水线
精细控制要让位给效率

2.2 四种最常用的组合打法

打法 A|探索期:T2V 快速试方向用最低成本档(480p / Draft)连出 10–20 条 5 秒片段,只为确认"这个画面感觉对不对"。不要在这一步追求画质。

打法 B|落地期:I2V 或 R2V 锁定主体方向确认后,先做一张满意的静帧(用即梦/万相的图像能力,或 Midjourney 之类),再图生视频。一张好图能省掉一半的提示词。

打法 C|叙事期:F2F 串镜头每个镜头的尾帧,就是下一个镜头的首帧。这样两段拼起来不会有跳变。

打法 D|量产期:R2V + 主体库 + 批量把角色做成参考资产,之后所有镜头都挂同一组参考图,用批量/Agent 功能出片。这是做系列内容(漫剧、连载、品牌 Campaign)的标准姿势。


三、八条核心技巧

技巧 1|提示词按「七要素」写,不要写散文

这是投入产出比最高的一条。把提示词当成一个结构化表单来填:

要素
写什么
示例
主体
谁 / 什么,带外观细节
一名穿米色针织衫的年轻女性
动作
一个明确的、中低速的动作
双手捧着白瓷杯缓缓举起轻啜
环境
地点 + 氛围物
靠窗的位置,窗外是雨中的梧桐
镜头
景别 + 机位 + 焦段 + 运镜
中近景,平视,50mm,轻微推镜
光线
光源方向 + 质感
午后斜阳透过百叶窗,侧脸条纹光影
风格
参考影片 / 摄影师 / 画风
是枝裕和式日常感,暖调胶片
技术
画质与质感关键词
柯达 Portra 400,细腻颗粒,浅景深

对比示例:

  • 差的写法:「一个女孩在咖啡馆喝咖啡,很文艺」
  • 好的写法:「一名穿米色针织衫的年轻女性坐在靠窗位置,双手捧着白瓷杯缓缓举起轻啜一口,眼神望向窗外;窗外是雨中的梧桐街道。中近景,平视机位,50mm 焦段,轻微推镜,浅景深虚化背景。午后斜阳透过百叶窗在侧脸投下条纹光影。是枝裕和式日常感,暖调胶片质感,柯达 Portra 400,细腻颗粒。」

要点:七要素不必每次都写全,但**「动作 + 镜头」两项不能省**——这两项决定了画面"有没有在动"和"观众站在哪看"。

技巧 2|镜头语言要显式写出来

模型对镜头术语的理解远好于对文学描述的理解。直接抄这个词汇表:

维度
可用词
景别
大特写 / 特写 / 中近景 / 中景 / 全景 / 远景
机位
平视 / 俯拍(高机位)/ 仰拍(低机位)/ 过肩镜头 / 主观视角 POV
焦段
24mm 广角(空间纵深)/ 35mm(纪实)/ 50mm(自然)/ 85–100mm(压缩背景、强虚化)/ 微距
运镜
推镜 / 拉镜 / 摇镜 / 移镜 / 环绕 / 跟拍 / 升降 / 手持晃动
构图
中心构图 / 三分法 / 前景遮挡 / 框式构图 / 对称

一句话记法:写清楚「谁在看、从哪看、怎么动」。

技巧 3|一致性靠「锚定 + 复用」,不靠运气

角色换脸是 AI 视频最大的痛点,靠形容词是解决不了的。三个手段按优先级:

  1. 参考图锚定
    (最有效):用产品的多主体参考能力挂 1–12 张参考图。Vidu 的多主体参考、海螺的 Omni Reference(最多 12 张)、可灵/即梦的主体保持都属于这一类。
  2. 主体库复用
    :把角色存成资产(Vidu 有主体库,旗舰版 300 个/月),跨镜头、跨项目复用同一组参考。这是从"技巧"升级为"流程"的关键一步。
  3. 风格锚定词:
    同一个项目里反复用同一组风格词(如「水墨风、留白构图、宣纸质感」),配合开源模型的自定义 LoRA 效果更稳。

补充手段:首尾帧也能锁一致性——把同一角色的两个姿势分别作为首帧和尾帧。

技巧 4|长视频 = 分段生成 + 拼接,别指望一次到位

标准流水线:

写分镜 → 逐段生成(5–10s)→ 首尾帧衔接 → 剪辑拼接 → 统一调色 → 配音/配乐

关键细节:相邻两段的「上一段尾帧」和「下一段首帧」要能接上,否则拼接处会有明显跳变。做法是先把 A 段的尾帧导出,直接作为 B 段的首帧输入。

另一个技巧是多生成几条再挑:同一个镜头出 3–4 条,选动势和构图最好的那条,比反复调提示词更高效。

技巧 5|先便宜后贵:两段式迭代(最省钱的一条)

用低分辨率草稿档反复试提示词,满意之后再用同一条提示词跑高清。

成本差距非常悬殊。以 Luma Ray3.2 官方价目为例(5 秒视频):

档位
消耗
相对倍数
Draft
20 credits
1×
540p
50 credits
2.5×
720p
100 credits
5×
1080p
400 credits
20×

用 Draft 试 20 次的成本,只等于用 1080p 试 1 次。 同理,海螺的 Hailuo 2.3-Fast、可灵的低清档、Runway 的 Gen-4 Turbo 都是为这一步设计的。

有创作者的做法是「分阶段渲染」:先用低成本规格做草稿,只对最终选中的结果放大,总价其实一样,但钱都花在满意的结果上。

技巧 6|避开模型的「能力盲区」

这些是当前所有模型都容易翻车的地方,绕开比硬刚划算:

盲区
表现
绕开方式
大幅快速运动
肢体扭曲、多出手指
改成中低速动作;或拆成多个短镜头
手部特写
手指数量异常
让手部出画、被遮挡,或用景深虚化
多人交叉互动
人脸/肢体融合
改成单人;多人时拉开空间距离
画面内文字
乱码、错字
用后期加字幕,
别让模型生成文字
长段对白口型
后半段口型对不上
拆成短句分段生成;或改用数字人工具
物理交互
倒水、开合、碰撞穿模
选物理能力强的模型(Veo 系列官方明确以物理与真实感为强项)
精确数值/品牌元素
变形、错位
用后期合成贴图

技巧 7|音频走哪条路,按「要不要精确」来选

路线
做法
优势
代价
原生音频
模型直接输出带音轨的视频(可灵 4.0、Veo 3.1、Hailuo H3、Seedance 2.0)
省事,音画天然同步,氛围音效自然
说话内容不可控,改一句要重跑整段
后期配音 + 唇形同步
外部 TTS(ElevenLabs 等)+ 唇形模型(Sync Lipsync)
内容完全可控,支持多语言
多一道工序,需要工具链

判断标准:要「说话内容精确」→ 后期;要「氛围音效」→ 原生。

口播、产品讲解、多语言本地化 → 后期路线。 氛围短片、空镜、情绪镜头 → 原生音频。

技巧 8|成本 = 分辨率 × 时长 × 迭代次数,而迭代次数是最大变量

三个变量里,前两个是明码标价的,第三个最容易被忽略:

  • 时长
    :10 秒 = 5 秒的 2 倍
  • 分辨率
    :480p → 1080p ≈ 3.3 倍
  • 迭代次数
    :平均 3 倍(有人实测需要 5–6 条才能出一条满意的)

推论:

  • 缩短单段时长比降低分辨率更划算
    (2 倍 vs 3.3 倍)。
  • 订阅积分普遍按月清零
    (可灵、海螺、Vidu 都是),买超出自己月消耗的档位等于白扔。只有单独购买的积分能跨月(可灵 2 年、Vidu 2 年、Pika 可结转)。
  • 先跑 10–15 次真实生成,记录自己每条成品的实际迭代次数,再倒推该买哪一档。

四、六个可直接复制的示例

示例 1|电商产品广告(图生视频)

做法:先做一张产品静帧 → 图生视频 → 三段拼接

【第一段 · 产品亮相】一只哑光黑色的无线耳机充电盒静置在深灰色石材台面上,盒盖缓缓打开,露出内部耳机的金属触点。镜头:中近景,平视,100mm 微距焦段,缓慢推镜,浅景深。光线:左上方单侧柔光箱,右侧留出阴影,台面有细腻反光。风格:高端 3C 产品广告,冷调,极简。技术:8K 商业摄影质感,金属与磨砂材质的真实反射。【第二段 · 使用场景】一名年轻男性在通勤地铁上取出耳机戴入耳中,闭眼轻靠车窗。镜头:中景,过肩视角,35mm,轻微手持晃动。光线:车厢顶部冷白荧光灯,窗外掠过的隧道灯光。风格:都市纪实,低饱和,轻微颗粒。【第三段 · 卖点特写】耳机特写,机身表面缓慢浮现金色的降噪波纹动画。镜头:特写,环绕运镜 90 度。风格:科技感,深色背景,金色高光。

要点:三段用同一个色调基底(冷调 + 金属),拼接后才像一支完整的广告片。

示例 2|电影感叙事镜头(文生视频)

一位面容消瘦的中年男人坐在狭窄的审讯室里,身体略微前倾,双肩自然下垂但略显紧绷,头部微向右转,目光锐利地凝视画面左侧画外。镜头:中近景(Medium Close-up),完全平视(Eye-level),85mm 长焦带来的空间压缩感,背景被彻底虚化成柔和光斑,焦点锐利锁定双眼。光线:右侧自然窗光作单侧主光,在面部阴影侧形成经典的伦勃朗三角高光,左脸处于阴影中,眼球有清晰的眼神光。环境:50 年代风格的听证会办公室,百叶窗形成垂直线条,背景左后方远处坐着一位模糊的深色着装女性。风格:低饱和柯达 Vision3 胶片色调,整体偏冷,肤色苍白真实,环境色为沉闷的办公绿与暗木棕,黑色西装与白衬衫形成高对比。氛围:令人窒息的压抑感、存在主义的危机感、严肃的心理惊悚。技术:IMAX 70mm 胶片质感,可见皮肤毛孔与面部汗毛细节,羊毛西装的粗粝纤维纹理,轻微自然胶片颗粒。

要点:这条提示词几乎把「七要素」写满了。注意光线部分写得极具体——布光是电影感最大的来源,而模型对布光术语的理解非常好。

示例 3|动漫角色一致性(多主体参考)

做法:不用长提示词,改为挂参考图 + 短提示词

【参考图】3 张:角色正面 / 侧面 / 全身(同一角色,同一画风)【提示词】[角色A] 站在雨夜的霓虹街道上,缓缓回头看向镜头,雨水顺着发梢滴落,表情从平静转为惊讶。[角色B] 撑伞站在她身后三米处,伞面微微倾斜。镜头:中景,平视,环绕运镜 30 度。风格:日式动画电影质感,赛璐璐上色,霓虹光在湿地面上的反射。画幅:16:9

要点:参考图 > 文字描述。当你有参考图时,提示词里就不要再详细描述长相了——那反而会干扰参考图的锚定效果。提示词只写动作、镜头、环境、风格。

示例 4|口播 / 数字人(音频驱动)

做法:先录好/生成音频 → 用音频驱动人像

【输入】一段 15 秒的中文配音音频(44.1kHz)+ 一张正面人像图【参数】- 唇形同步强度:高- 头部微动幅度:中(避免机械感)- 视线:自然漂移,偶尔直视镜头- 背景:静态虚化的办公室【提示词(部分产品需要)】人物自然说话,表情放松,偶尔有轻微点头与眨眼,肩部随呼吸有细微起伏,镜头固定不动。

要点:拆短句。超过 20 秒的连续口播,后半段口型容易漂。做法是把音频切成 10–15 秒的段落,分别驱动后拼接,剪辑点上用转场或画面切换遮盖。

示例 5|国风场景(用中文提示词)

做法:用中文写具体意象,不要翻译成英文

青瓦白墙的江南小巷,细雨中一把油纸伞缓缓撑开,行人踩着湿漉漉的石板路向巷子深处走远,屋檐水珠成串滴落。镜头:全景转中景,平视,24mm 广角,缓慢跟拍。光线:阴天漫射光,低对比,空气中有可见的雨丝与水汽。风格:水墨留白构图,宣纸质感,低饱和青灰色调。氛围:静谧、悠远、略带惆怅。

要点:通义万相、即梦、可灵这类国产模型对中文语境的本土文化符号(青瓦白墙、油纸伞、宣纸、水墨留白)识别明显更准。在国产模型上写中文,比写翻译腔英文效果好。

示例 6|长视频分段拼接(首尾帧衔接)

【第 1 段】首帧 = 主角站在门口(静帧 A)          提示词:推门而入,镜头缓慢向前推进          → 导出尾帧,存为「静帧 B」【第 2 段】首帧 = 静帧 B(上一段的尾帧)          提示词:继续向前走,环顾四周,镜头轻微左摇          → 导出尾帧,存为「静帧 C」【第 3 段】首帧 = 静帧 C          提示词:停下脚步,抬头望向天花板,镜头缓慢上摇          → 导出尾帧

要点:这样生成的片段,段与段的衔接处几乎是无缝的。这是把 5 秒片段串成 30 秒叙事的标准做法。


五、常见失败排查表

症状
常见原因
修法
画面几乎不动,像一张会呼吸的图
提示词没写动作;或首帧约束太强
补上明确动作词;降低"保持原图"类参数;换用运动幅度更大的模型
动作过猛、肢体扭曲
描述的动作幅度超出模型能力
改成中低速动作;缩短时长;拆成多个短镜头
角色每个镜头都不一样
纯文字描述长相,没有参考图
改用参考图 / 主体库;或固定首尾帧
手指数量异常
手部特写是当前模型的通病
让手部出画、被遮挡,或用浅景深虚化
画面里的文字是乱码
模型对文字渲染能力弱
后期加字幕;画面内不放文字
风格不统一,拼接后像不同片子
每段提示词的风格词不一致
建一个固定的「风格锚定词组」,每段都带上
拼起来有跳变
相邻两段画面接不上
用上一段的尾帧作下一段的首帧
出片质量不稳定,时好时坏
没有做两段式迭代
先用 Draft 档试 10–20 次锁定提示词,再用高清跑
口型后半段对不上
音频太长
切成 10–15 秒段落分别生成
积分不够用
买错档位 / 在高清档试错
改两段式迭代;核对积分是否按月清零

六、一句话速查卡

  • 提示词:
    主体 + 动作 + 环境 + 镜头 + 光线 + 风格 + 技术(动作和镜头不能省)
  • 镜头:
    谁在看、从哪看、怎么动
  • 一致性:
    参考图 > 主体库 > 风格锚定词;文字描述最弱
  • 长视频:
    分段生成 + 尾帧接首帧 + 剪辑拼接
  • 省钱:
    Draft 试错 → 高清定稿(差价可达 20 倍)
  • 避坑:
    快速大动作、手部特写、画面内文字、多人交叉、长段对白
  • 音频:
    内容要精确走后期,氛围音效走原生
  • 成本:
    分辨率 × 时长 × 迭代次数,迭代次数最容易失控

相关学习资料