ARTICLE · 1117069
AI 生成视频:常用方法与核心技巧手册——九大核心方法
AI 生成视频:常用方法与核心技巧手册
本手册讲的是怎么用,不重复讲用哪个。工具选型见配套报告。
一、先建立一个正确的心智模型
绝大多数人第一次用 AI 生成视频,会把它当成「许愿池」——写一句话,期待出来一条成片。这是失败率最高的用法。
正确的理解是:AI 视频生成不是"写文案",而是"当导演"。 模型是一个执行力很强但没有判断力的摄影师,你给的信息越接近分镜脚本,它交回来的东西越接近你要的。
三条必须建立的心智模型:
① 单次生成 = 一个镜头,不是一条片子。除了通义万相(原生 30 秒)、Pika(最长 30 秒多镜头)这类特例,主流产品单次生成多为 5–10 秒。做长视频的正解是分段生成 + 剪辑拼接,而不是找一个"能一次生成 3 分钟"的工具。
② 可控性来自「输入端的约束」,不是「提示词的形容词」。想让角色不换脸,靠的是参考图,不是写"同一个女孩,短发,穿红裙子";想让镜头按你想法运动,靠的是首尾帧或运动控制,不是写"镜头缓缓推进"。
③ 成本由「迭代次数」主导,不由「单价」主导。一条满意成片平均要迭代 3 次。先出低价草稿、满意后再用高清重跑同一条,是整套流程里最省钱的一条规则。
二、九种常用生成方法
2.1 方法全景
| 文生视频 | |||||
| 图生视频 | |||||
| 首尾帧控制 | |||||
| 参考生视频 | |||||
| 视频生视频 | |||||
| 运动控制 | |||||
| 音频驱动 | |||||
| 延长 / 多镜头 | |||||
| Agent 工作流 |
2.2 四种最常用的组合打法
打法 A|探索期:T2V 快速试方向用最低成本档(480p / Draft)连出 10–20 条 5 秒片段,只为确认"这个画面感觉对不对"。不要在这一步追求画质。
打法 B|落地期:I2V 或 R2V 锁定主体方向确认后,先做一张满意的静帧(用即梦/万相的图像能力,或 Midjourney 之类),再图生视频。一张好图能省掉一半的提示词。
打法 C|叙事期:F2F 串镜头每个镜头的尾帧,就是下一个镜头的首帧。这样两段拼起来不会有跳变。
打法 D|量产期:R2V + 主体库 + 批量把角色做成参考资产,之后所有镜头都挂同一组参考图,用批量/Agent 功能出片。这是做系列内容(漫剧、连载、品牌 Campaign)的标准姿势。
三、八条核心技巧
技巧 1|提示词按「七要素」写,不要写散文
这是投入产出比最高的一条。把提示词当成一个结构化表单来填:
| 主体 | ||
| 动作 | ||
| 环境 | ||
| 镜头 | ||
| 光线 | ||
| 风格 | ||
| 技术 |
对比示例:
差的写法:「一个女孩在咖啡馆喝咖啡,很文艺」 好的写法:「一名穿米色针织衫的年轻女性坐在靠窗位置,双手捧着白瓷杯缓缓举起轻啜一口,眼神望向窗外;窗外是雨中的梧桐街道。中近景,平视机位,50mm 焦段,轻微推镜,浅景深虚化背景。午后斜阳透过百叶窗在侧脸投下条纹光影。是枝裕和式日常感,暖调胶片质感,柯达 Portra 400,细腻颗粒。」
要点:七要素不必每次都写全,但**「动作 + 镜头」两项不能省**——这两项决定了画面"有没有在动"和"观众站在哪看"。
技巧 2|镜头语言要显式写出来
模型对镜头术语的理解远好于对文学描述的理解。直接抄这个词汇表:
| 景别 | |
| 机位 | |
| 焦段 | |
| 运镜 | |
| 构图 |
一句话记法:写清楚「谁在看、从哪看、怎么动」。
技巧 3|一致性靠「锚定 + 复用」,不靠运气
角色换脸是 AI 视频最大的痛点,靠形容词是解决不了的。三个手段按优先级:
- 参考图锚定
(最有效):用产品的多主体参考能力挂 1–12 张参考图。Vidu 的多主体参考、海螺的 Omni Reference(最多 12 张)、可灵/即梦的主体保持都属于这一类。 - 主体库复用
:把角色存成资产(Vidu 有主体库,旗舰版 300 个/月),跨镜头、跨项目复用同一组参考。这是从"技巧"升级为"流程"的关键一步。 - 风格锚定词:
同一个项目里反复用同一组风格词(如「水墨风、留白构图、宣纸质感」),配合开源模型的自定义 LoRA 效果更稳。
补充手段:首尾帧也能锁一致性——把同一角色的两个姿势分别作为首帧和尾帧。
技巧 4|长视频 = 分段生成 + 拼接,别指望一次到位
标准流水线:
写分镜 → 逐段生成(5–10s)→ 首尾帧衔接 → 剪辑拼接 → 统一调色 → 配音/配乐关键细节:相邻两段的「上一段尾帧」和「下一段首帧」要能接上,否则拼接处会有明显跳变。做法是先把 A 段的尾帧导出,直接作为 B 段的首帧输入。
另一个技巧是多生成几条再挑:同一个镜头出 3–4 条,选动势和构图最好的那条,比反复调提示词更高效。
技巧 5|先便宜后贵:两段式迭代(最省钱的一条)
用低分辨率草稿档反复试提示词,满意之后再用同一条提示词跑高清。
成本差距非常悬殊。以 Luma Ray3.2 官方价目为例(5 秒视频):
| 20× |
用 Draft 试 20 次的成本,只等于用 1080p 试 1 次。 同理,海螺的 Hailuo 2.3-Fast、可灵的低清档、Runway 的 Gen-4 Turbo 都是为这一步设计的。
有创作者的做法是「分阶段渲染」:先用低成本规格做草稿,只对最终选中的结果放大,总价其实一样,但钱都花在满意的结果上。
技巧 6|避开模型的「能力盲区」
这些是当前所有模型都容易翻车的地方,绕开比硬刚划算:
| 用后期加字幕, | ||
技巧 7|音频走哪条路,按「要不要精确」来选
| 原生音频 | |||
| 后期配音 + 唇形同步 |
判断标准:要「说话内容精确」→ 后期;要「氛围音效」→ 原生。
口播、产品讲解、多语言本地化 → 后期路线。 氛围短片、空镜、情绪镜头 → 原生音频。
技巧 8|成本 = 分辨率 × 时长 × 迭代次数,而迭代次数是最大变量
三个变量里,前两个是明码标价的,第三个最容易被忽略:
- 时长
:10 秒 = 5 秒的 2 倍 - 分辨率
:480p → 1080p ≈ 3.3 倍 - 迭代次数
:平均 3 倍(有人实测需要 5–6 条才能出一条满意的)
推论:
- 缩短单段时长比降低分辨率更划算
(2 倍 vs 3.3 倍)。 - 订阅积分普遍按月清零
(可灵、海螺、Vidu 都是),买超出自己月消耗的档位等于白扔。只有单独购买的积分能跨月(可灵 2 年、Vidu 2 年、Pika 可结转)。 先跑 10–15 次真实生成,记录自己每条成品的实际迭代次数,再倒推该买哪一档。
四、六个可直接复制的示例
示例 1|电商产品广告(图生视频)
做法:先做一张产品静帧 → 图生视频 → 三段拼接
【第一段 · 产品亮相】一只哑光黑色的无线耳机充电盒静置在深灰色石材台面上,盒盖缓缓打开,露出内部耳机的金属触点。镜头:中近景,平视,100mm 微距焦段,缓慢推镜,浅景深。光线:左上方单侧柔光箱,右侧留出阴影,台面有细腻反光。风格:高端 3C 产品广告,冷调,极简。技术:8K 商业摄影质感,金属与磨砂材质的真实反射。【第二段 · 使用场景】一名年轻男性在通勤地铁上取出耳机戴入耳中,闭眼轻靠车窗。镜头:中景,过肩视角,35mm,轻微手持晃动。光线:车厢顶部冷白荧光灯,窗外掠过的隧道灯光。风格:都市纪实,低饱和,轻微颗粒。【第三段 · 卖点特写】耳机特写,机身表面缓慢浮现金色的降噪波纹动画。镜头:特写,环绕运镜 90 度。风格:科技感,深色背景,金色高光。要点:三段用同一个色调基底(冷调 + 金属),拼接后才像一支完整的广告片。
示例 2|电影感叙事镜头(文生视频)
一位面容消瘦的中年男人坐在狭窄的审讯室里,身体略微前倾,双肩自然下垂但略显紧绷,头部微向右转,目光锐利地凝视画面左侧画外。镜头:中近景(Medium Close-up),完全平视(Eye-level),85mm 长焦带来的空间压缩感,背景被彻底虚化成柔和光斑,焦点锐利锁定双眼。光线:右侧自然窗光作单侧主光,在面部阴影侧形成经典的伦勃朗三角高光,左脸处于阴影中,眼球有清晰的眼神光。环境:50 年代风格的听证会办公室,百叶窗形成垂直线条,背景左后方远处坐着一位模糊的深色着装女性。风格:低饱和柯达 Vision3 胶片色调,整体偏冷,肤色苍白真实,环境色为沉闷的办公绿与暗木棕,黑色西装与白衬衫形成高对比。氛围:令人窒息的压抑感、存在主义的危机感、严肃的心理惊悚。技术:IMAX 70mm 胶片质感,可见皮肤毛孔与面部汗毛细节,羊毛西装的粗粝纤维纹理,轻微自然胶片颗粒。要点:这条提示词几乎把「七要素」写满了。注意光线部分写得极具体——布光是电影感最大的来源,而模型对布光术语的理解非常好。
示例 3|动漫角色一致性(多主体参考)
做法:不用长提示词,改为挂参考图 + 短提示词
【参考图】3 张:角色正面 / 侧面 / 全身(同一角色,同一画风)【提示词】[角色A] 站在雨夜的霓虹街道上,缓缓回头看向镜头,雨水顺着发梢滴落,表情从平静转为惊讶。[角色B] 撑伞站在她身后三米处,伞面微微倾斜。镜头:中景,平视,环绕运镜 30 度。风格:日式动画电影质感,赛璐璐上色,霓虹光在湿地面上的反射。画幅:16:9要点:参考图 > 文字描述。当你有参考图时,提示词里就不要再详细描述长相了——那反而会干扰参考图的锚定效果。提示词只写动作、镜头、环境、风格。
示例 4|口播 / 数字人(音频驱动)
做法:先录好/生成音频 → 用音频驱动人像
【输入】一段 15 秒的中文配音音频(44.1kHz)+ 一张正面人像图【参数】- 唇形同步强度:高- 头部微动幅度:中(避免机械感)- 视线:自然漂移,偶尔直视镜头- 背景:静态虚化的办公室【提示词(部分产品需要)】人物自然说话,表情放松,偶尔有轻微点头与眨眼,肩部随呼吸有细微起伏,镜头固定不动。要点:拆短句。超过 20 秒的连续口播,后半段口型容易漂。做法是把音频切成 10–15 秒的段落,分别驱动后拼接,剪辑点上用转场或画面切换遮盖。
示例 5|国风场景(用中文提示词)
做法:用中文写具体意象,不要翻译成英文
青瓦白墙的江南小巷,细雨中一把油纸伞缓缓撑开,行人踩着湿漉漉的石板路向巷子深处走远,屋檐水珠成串滴落。镜头:全景转中景,平视,24mm 广角,缓慢跟拍。光线:阴天漫射光,低对比,空气中有可见的雨丝与水汽。风格:水墨留白构图,宣纸质感,低饱和青灰色调。氛围:静谧、悠远、略带惆怅。要点:通义万相、即梦、可灵这类国产模型对中文语境的本土文化符号(青瓦白墙、油纸伞、宣纸、水墨留白)识别明显更准。在国产模型上写中文,比写翻译腔英文效果好。
示例 6|长视频分段拼接(首尾帧衔接)
【第 1 段】首帧 = 主角站在门口(静帧 A) 提示词:推门而入,镜头缓慢向前推进 → 导出尾帧,存为「静帧 B」【第 2 段】首帧 = 静帧 B(上一段的尾帧) 提示词:继续向前走,环顾四周,镜头轻微左摇 → 导出尾帧,存为「静帧 C」【第 3 段】首帧 = 静帧 C 提示词:停下脚步,抬头望向天花板,镜头缓慢上摇 → 导出尾帧要点:这样生成的片段,段与段的衔接处几乎是无缝的。这是把 5 秒片段串成 30 秒叙事的标准做法。
五、常见失败排查表
六、一句话速查卡
- 提示词:
主体 + 动作 + 环境 + 镜头 + 光线 + 风格 + 技术(动作和镜头不能省) - 镜头:
谁在看、从哪看、怎么动 - 一致性:
参考图 > 主体库 > 风格锚定词;文字描述最弱 - 长视频:
分段生成 + 尾帧接首帧 + 剪辑拼接 - 省钱:
Draft 试错 → 高清定稿(差价可达 20 倍) - 避坑:
快速大动作、手部特写、画面内文字、多人交叉、长段对白 - 音频:
内容要精确走后期,氛围音效走原生 - 成本:
分辨率 × 时长 × 迭代次数,迭代次数最容易失控