乐于分享
好东西不私藏

AIGC短剧分镜工业化标准全流程(含软件/APP选型,实测投产版)

AIGC短剧分镜工业化标准全流程(含软件/APP选型,实测投产版)

点击蓝字

关注我们

原创|沧溟微履 · Jn-Rise

阅读本文约消耗:520 token

      我实测跑过可灵Omni3.0、Seedance、即梦、ComfyUI。95%AI短剧返工、变脸、限流,根源不是提示词不行,是没有标准化生产链路。

不要幻想AI一键输出完整成片,把AI当成参数不稳定的开源软件来用。

0 全链路工具总表(网页 / PC软件 / 手机APP)

剧本&分镜脚本拆解(文本)

1. 豆包网页版:输出结构化分镜表格,输出角色主体固定描述,免费,手机网页可操作

2. Claude:长剧本批量拆镜,适合多集连载

      不依赖AI自动分镜,AI只输出表格框架,镜头叙事逻辑必须人工校正。

静态关键帧、角色定妆照生成

1. LiblibAI网页:SDXL在线运行,IP‑Adapter插件做角色锁脸,采样步数28,CFG7.5,9:16 1024×1792,国内直连,手机浏览器能用

2. ComfyUI(PC本地):本地部署SDXL,IP‑Adapter权重0.7‑0.78,批量批量生关键帧;权重>0.82姿态僵死,<0.65参考失效。适合工作室批量生产

3. 即梦AI网页/APP:Seedance底层,中文提示词友好,生成角色定妆、场景概念图,新手友好

图生视频(核心,禁止文生视频直出成片)

1. 可灵AI网页/APP(Kling3.0):国内写实短剧首选,图生视频模式。参数:参考强度0.7‑0.8,运动幅度0.3‑0.45,关闭场景扩展。适合机房、都市写实题材,人物肢体容错高

2. 即梦AI网页/APP:Seedance模型,角色参考锁定,支持数字人对口型,适合连载短剧,手机APP可以直接上传定妆参考图生成片段

3. Pika2.5网页:海外,表情细腻,适合特写情绪镜头,长镜头稳定性一般

配音TTS

1. 剪映PC/手机APP内置TTS:零成本,国内商用版权安全;单句台词严格≤15字,防止气口错乱、语气飘

2. VITS本地部署:可控音色、语速、停顿气口,适合工作室,需要PC算力

3. 魔音工坊网页/APP:付费,情绪音色更多,批量导出音频文件

后期剪辑、质检、导出、上架

剪映专业版PC + 手机APP,必用。多音轨管理、自动字幕、片段拼接、调色、音量统一;全部AI片段导入,手动音画对齐,不依赖AI自动对齐。成片输出9:16 1080P,直接分发抖音、视频号、快手。

一、前置资产闭环,没完成不要碰分镜(第一道质量闸门)

这一步决定跨镜头角色漂移率。

每个角色产出3张定妆参考图:正面、45°半身、站姿,统一9:16画幅。

硬性要求:无手持道具、无多余手势动作,纯色干净背景,杜绝AI记忆多余杂物。

每个角色写一段固定主体描述文本,全片所有镜头一字不改,放在提示词最开头。

固定场景概念图,机房、办公室等环境,全剧复用同一套参考图。

实测数据:无定妆锚定,CFG7‑12区间,角色漂移率92%。

IP‑Adapter权重固定0.7‑0.78,角色一致性稳定到85%以上。

坑:虚拟AI捏脸做短剧,平台肖像风控随机拦截。条件允许优先真人数字人,使用本人实拍定妆照做参考,限流风险大幅降低。

二、剧本机器化拆解,拒绝文学长文本直接投喂

AI不懂叙事逻辑,只识别单镜单动作。

工业标准分镜必填字段:镜号|时间码|场景|出镜人物|限定道具|景别|运镜|画面精准描述|台词|单镜时长|音效BGM|转场方式|风控备注。

硬性拆解规则:

1. 单个镜头只承载一个动作、一句台词。

2. 禁止复合动作:边走边操作平板、转头同时打字,极易肢体崩坏,必须拆成多镜。

3. 竖屏短剧单镜安全时长2‑4秒;60秒成片控制12‑18个镜头。

4. 台词单句≤15个字,超长对白拆分,规避TTS气口错乱。

通用镜序:全景定场景→中景定动作→近景对话→特写情绪→细节补镜→收尾定格。

三、静态关键帧生图,工业化的底座

生产链路固定:剧本分镜 → 静态关键帧生图 → 图生视频。

Diffusion模型没有跨帧记忆,静态关键帧才可以锁死五官、服装、光影。

SDXL通用参数:采样步数28,CFG系数7.5,分辨率1024×1792(9:16),IP‑Adapter参考权重0.75。

正向Prompt固定结构:

【固定角色主体描述】+无任何手持道具+景别运镜+场景光影+ARRI电影质感,无文字水印。

强制负面Prompt:

禁止变脸、禁止更换服饰、禁止新增道具、禁止手部畸形、肢体扭曲、禁止字幕水印、禁止幼化美颜、禁止场景错乱。

每一张关键帧生成后做初检:人脸、服饰、道具三项校验,不合格直接重跑。

四、图生视频标准化调参,降低抖动、人脸偏移

全部镜头使用图生视频,禁用文生视频,首帧上传已经校验完成的关键帧。

可灵Omni参数

参考强度0.7‑0.8,运动幅度0.3‑0.45,关闭场景扩展,动态抖动调到最低档位。

安全动作白名单(AI出错概率低):

15°以内微转头、眨眼、微蹙眉、镜头缓慢推拉、机身横移,人物静态站立。

高危动作黑名单,不要交给AI生成:

快速转身、大幅度挥臂、奔跑、旋转、双人同步大幅度动作。高危动作拆镜,后期剪辑拼接。

多人镜头铁律:优先正反打单人近景。双人同框镜头占比≤20%,极易出现换脸、服装互换bug。

即梦(Seedance)参数

上传角色参考图,参考权重0.72‑0.78,运动幅度不要拉满,适合数字人对口型对话镜头。

五、单镜头三级质检,不通过不流入剪辑

每生成一条视频片段,立刻执行三项校验,不合格直接重跑,不要等全部做完返工。

1.人脸质检:五官、骨相、年龄和定妆参考图保持统一。

2.服饰质检:颜色、版型、内搭无改动,不凭空多出口袋、护甲。

3.道具质检:画面没有凭空出现平板、笔,腋下无夹物残留。

前面镜头全部正常,某一镜角色漂移,后续片段会继承错误特征,整集素材直接报废,算力全部浪费。

六、音频链路,解决音画脱节

配音输出之后,禁止AI自动对齐时间轴。

所有台词、音效、BGM全部手动对轨。

分层音频规范:底层环境音,中层BGM,顶层人声。人声音量高于背景15%,短视频收音清晰。

实操:剪映APP/PC导入TTS音频,按照分镜时间码,把每一句台词贴到对应镜头。

七、后期剪辑与平台风控规避

软件:剪映PC/手机APP。

1.按照镜号顺序拼接全部AI视频片段。

2.添加字幕,后期叠加,原始生成画面做到零文字。

3.转场只用淡入淡出,少用花哨特效。

4.统一调色,统一亮度对比度,消除不同镜头画面割裂。

5.导出1080P 9:16,直接发布。

风控要点:

1.优先真人基底数字人,AI虚拟脸存在随机拦截风险。

2.原始画面零水印、零文字,字幕后期叠加。

3.非关键剧情尽量45°侧拍,减少正脸怼镜头。

4.规避畸形五官、过度美颜二次元偏移。

八、AI能力硬边界,不要抱有幻想

1.不存在一套万能提示词,漂移是Diffusion底层缺陷,只能管控,无法彻底根除。

2.一键分镜工具只能翻译文本,不懂镜头叙事,必须人工二次校正。

3.批量翻车,绝大多数是前置资产不规范,镜头拆解不合格。

4.AI只负责执行,稳定产出靠人工设置校验闸门。

完整投产流水线总架构

角色定妆资产固化 → 剧本机器化拆镜 → 标准化关键帧生图 → 参数化图生视频 → 单镜头三级质检 → 手动音画对轨 → 剪映分层剪辑输出 → 风控合规上架。

能稳定批量出片的团队,拼的不是生成模型,是这套标准化流程。

      流水线本质,就是把风险拆成一道一道人工闸门,不要把全部希望丢给AI。

作者:Vast Microsteps Studio | Jn-Rise

专注影视CG技术解构与效率工具研究

Thanks so much for reading this piece, and huge props to everyone following Vast Microsteps Studio