AI漫剧从0到1:拆小说、定角色、生场景,全流程Prompt都在这里
刷到那些画面惊艳的AI漫剧时,你心里大概飘过同一个问题:这到底是怎么做出来的?
过去一部动画短剧,背后是一整条生产线:编剧、美术、导演、分镜、剪辑,一个都不能少。现在这套流程被AI压缩成了一条一个人就能跑通的链路,业内喜欢叫它"文-资-视-剪"。
今天我就把这条链路完整拆给你看,五个环节,每个环节都配上能直接用的提示词。老规矩,先收藏再读。

一、文:故事从"拆"开始
内容行业有个残酷的事实:爆款是可以被拆出规律的。
别急着动笔。先挑3-5本和你想做题材一致的小说,交给AI,让它从四个维度做一次"解剖":
• 开头怎么钩人:前三章靠什么留住读者; • 高潮怎么顶情绪:情绪峰值出现在什么位置、用什么方式引爆; • 反转怎么设计:转折点埋在哪里,凭什么让人意外; • 爽点怎么排布:读者是靠着什么"爽感"一路追下去的。
对应的提示词可以这样写:
请帮我拆解这几本小说的内容逻辑,分别从开头钩子、情绪高点、转折设计、爽点密度四个维度分析,并总结它们共同的创作规律
拆完你会发现,所谓爆款,拼的从来不是文笔,而是这套骨架踩得准。
接下来别急着写正文。先把故事的章节大纲列出来,10章也好、20集也好,大纲确认了再往下走。方向对了,后面每一步都是加分项。给每个主角定一张'视觉身份证'

二、资:让角色和场景先"立住"
故事有了骨架,接下来要把文字翻译成画面。这一步的关键词是:编号管理。
把剧本里所有要出镜的东西列成一张资产清单:角色、场景、道具,分别编号——角色C01、C02,场景S01、S02,道具P01、P02。有了编号,后面生成视频时引用参考图才不乱。
角色资产:先立绘,再三视图
给每个主角定一张"视觉身份证":年龄、体型、发型、服装、标志性配色。然后分两步出图:
• 第一步,出单人全身立绘,9:16竖版、纯白背景,先确认这个角色"长对没有"; • 第二步,角色形象确认了,再补三视图,16:9横版,正面、侧面、背面各一个角度。
三视图不是随便摆三个姿势,而是一张"制作级参考图",最好包含:完整造型三视角、面部特写、毛发和服装的配色板、配饰等局部细节、用黄金比例参考物做身高对照。一句话:让任何一个人拿到这张图,都能还原出这个角色。
场景资产:一个地方,三张图
重要场景至少要出三张:正打、反打、侧面全景。正反打按角色可能的站位和对话方向设计,方便后期分镜直接对机位;侧面全景用来交代完整的空间关系。场景里不要出现人物,也不要出现文字,保持干净,方便后续合成。

道具资产:单独展示
关键道具单独出图,纯白背景,突出材质、年代感和使用痕迹。如果这个道具和剧情线索有关,在提示词里点明它的重要性。
一个实用小技巧:每个角色用不同的配色方案,同框时一眼就能区分;同一角色多张图之间,提示词里写死画风和特征,否则AI会给你画出"两张脸"。
三、视:把故事翻译成镜头语言
资产齐了,开始分镜。这一步是把"小说的文字"翻译成"能拍的镜头"。
专业做法是建一张分镜脚本表,每一行一个镜头:分镜号、景别、运镜、画面内容、台词、预估时长、分镜出图提示词。
写分镜时有几条铁律:
• 一镜控制在3-5秒,一集十几秒,节奏要快; • 景别要有变化,远景、中景、近景、特写轮着来,别一镜到底全是中景; • 运镜写具体:推、拉、摇、移、跟、环绕、升降,而不是"镜头缓缓移动"这种废话; • 台词标注声音来源:画面里说话写"角色名说",心里想的写"内心独白",人不在画面里写"画外音"; • 心理活动不能直接拍,要翻译成动作、表情、道具细节; • 对话场景用正反打,情绪转折处用空镜接画外音,电影感一下就出来了。
这段提示词可以直接用:
你是一位资深电影剪辑师和AI视频分镜设计师。请根据我提供的剧本,拆解成适合AI视频制作的分镜表格,包含分镜号、景别、运镜、画面内容、台词、预估时长、分镜出图提示词。心理描写请翻译成可拍摄的动作和表情。
四、生:用Seedance 2.0把分镜变成画面
分镜表拿到手,进入生成环节。以Seedance 2.0这类视频模型为例,有几种"入戏方式":
• 文字生视频(T2V):直接拿文字提示词生成; • 图片生视频(I2V):上传角色图、场景图做参考,让画面"动起来"——漫剧最常用的方式; • 视频参考生视频(V2V/R2V):拿上一段视频当参考,续写或衔接动作。
这里有个特别重要的原则:每张参考图只负责一件事。这张图管角色长相,那张图管场景,另一张图管首帧或尾帧。不要让一张参考图既管人物又管动作,否则它会两头都管不好。
生成单集分镜时,可以按时间轴来写提示词,把15秒分成几段:
0-3秒:建立场景,镜头推进,交代环境氛围3-6秒:主角入场,中景,完成第一个动作6-9秒:冲突推进,镜头环绕,情绪上升9-12秒:高潮爆发,特写,视觉冲击最强12-15秒:收尾留余韵,空镜,落版
再强调一遍:运镜、光线、情绪都要落到具体描述上,少用"唯美""震撼"这种空词。写清楚"谁、在做什么、镜头怎么走",画面才有信息密度。
声音也一样。对话、口型、音效、环境声、配乐,这些现在都能生成,但别一股脑全丢给模型。分镜阶段就标清楚每段声音的来源,效果会稳定很多。
五、剪:连贯,靠尾帧和抽帧
最后聊一个最容易被忽略、却最决定成品质感的问题:连贯性。
• 尾帧要记下来:每段视频的最后一帧是什么画面、什么光线、什么构图,写清楚。下一集要接它。 • 抽帧接力:上一段的结尾截一帧,作为下一段的首帧参考图,画面就"接得上"了。 • 残次镜头先出图:遇到复杂的极限镜头,与其硬跑视频,不如先用出图工具把分镜图做出来,再图生视频,成功率更高。
把"上一集尾帧"变成"下一集首帧",这一条习惯,能让你的漫剧从"一堆碎片"变成"一部连续的作品"。

写在最后
把整条链路压成一句话:
故事靠拆,资产靠编号,分镜靠表格,生成靠参考,连贯靠尾帧。
你不需要会写小说,不需要会画画,也不需要懂剪辑。你需要的,是把一条大流程拆成可以执行的小步骤,然后一遍一遍地跑通它。
下一期,我们挑一部热门AI漫剧,用今天这套框架拆它的镜头语言,看看爆款到底赢在哪。想看的在评论区扣个"1",关注皮咻喵AI知识库,我们下期见。
夜雨聆风