这两天我又被问到一个问题:现在做 AI 漫剧,到底该用哪个文生视频模型?
我先泼一小盆冷水。
如果你一上来就问“Veo 、 Kling 、 Seedance 谁最强”,大概率会走偏。 AI 漫剧不是发一条 8 秒炫技视频。它是连续更新、角色不能崩、镜头不能乱、成本不能炸、故事还得能让人追下去。
这玩意儿很残酷。
短视频平台不管你用了多先进的模型。观众只看三件事:角色顺不顺眼,剧情有没有钩子,下一集想不想点。

先定一个笨但能跑的 AI 漫剧方案
我建议别一开始就做“电影级 AI 短片”。
先做 20 集竖屏漫剧测试盘。每集 45-75 秒,单集 8-12 个镜头,主角不超过 3 个,场景不超过 5 个。题材优先选强钩子的:逆袭、悬疑、都市异能、古风复仇、赛博爽文。
听起来土。
但土办法最容易验证。你要先知道观众会不会追,而不是先把自己埋进模型参数里。
完整流程我会这样拆:
真正的关键不是某一个模型。
关键是你要把“角色设定、镜头脚本、关键帧、生成参数、失败镜头处理”做成固定流程。否则你今天生成一个帅哥,明天他换脸,后天身高变了,大后天衣服自己长出一堆奇怪花纹。
不对,比“奇怪”更烦。
那种崩坏会让观众瞬间出戏,像刚喝一口热汤被人塞了冰块。很恶心。
观众不会原谅这个。
他们会滑走。很干脆。
文生视频模型排名按漫剧口径来排
我不按“谁的视频最像电影预告片”排。
AI 漫剧要看五个指标:角色一致性、镜头可控性、中文/东亚审美、音画能力、批量成本。官方页面里, Google DeepMind 把 Veo 3.1 定位成带原生音频的视频模型,强调物理真实、提示词遵循和音效/对白; ByteDance Seed 的 Seedance 2.0 写得更猛,支持文本、图像、音频、视频输入,做多模态参考和剪辑控制; Luma Ray3.2 则把多关键帧、最高 16 个 keyframes 、 1080p 和生产管线写得很清楚。
所以我给一个“做 AI 漫剧”的实用榜。
Sora 我不放进主力榜。
不是因为它不强,而是因为 OpenAI 官方帮助页已经把 Sora 放在 discontinuation 信息里: App 已停止, API 也进入关闭时间线。做商业项目最怕这种事。你刚把流程搭好,地板没了。
这太扯了。
刚才这句我说得有点狠,但意思不改。商业项目最怕的不是工具输给别人,是工具突然把门关上。
工具强是一回事,能不能稳定用一年,是另一回事。

真要开工我会用三套组合
如果你是一个人或两三个人的小团队,别贪大。
第一套:低成本验证盘。
角色图用 Seedream 或 Midjourney ,视频用 Hailuo/Vidu/Kling 标准档,配音用剪映或 ElevenLabs ,剪辑用剪映。目标不是做精致,是在 7 天内发出 20 条素材,测题材、封面、前三秒。
这套最适合“我还不知道观众吃不吃这个题材”的阶段。
第二套:稳定更新盘。
角色主视觉固定下来后,用 Kling 或 Seedance 做主力镜头。每集只做 2-3 个复杂动作镜头,其余用轻运动、推拉镜头、表情特写、漫画格转场撑节奏。不要每个镜头都让模型跳舞、奔跑、打架。
AI 视频最贵的不是生成。
是返工。
尤其是那种“差一点能用”的返工,最折磨人。删了心疼,修又修不好,像半夜卡在 99% 的进度条,荒唐。
第三套:精品宣传盘。
关键镜头用 Veo 3.1 或 Runway Gen-4 , Luma Ray3.2 用来做多关键帧、重构环境、改服装、改镜头。适合发预告片、账号置顶、投放素材。
说白了,别把旗舰模型拿来生成所有镜头。那不是专业,那是烧钱。

分镜要写到模型能听懂不是写给人感动
AI 漫剧的脚本不能只写:
“男主愤怒地看着反派。”
这句给人看可以,给视频模型看就很悬。它可能生成男主大喊,可能生成反派大喊,也可能两个人突然拥抱。别笑,真会。
分镜要写成这样:
这里有三个小技巧。
第一,每个镜头只做一件事。别写“她奔跑、摔倒、爬起、转身、哭、拔刀”。模型不是剧组场务,别把它当牲口使。
第二,动作词要克制。漫剧很多时候靠剪辑制造情绪,不靠单镜头表演完一整段戏。能用“眼神变化”就别用“激烈打斗”,能用“车窗升起”就别用“十辆车追逐”。
第三,关键角色用参考图锁住。 Veo 、 Seedance 、 Kling 、 Runway 、 Luma 都在往参考控制走,但你不能只靠文字描述“黑发冷酷男主”。这四个字太糊弄了。至少准备正脸、侧脸、半身、全身、服装板。
不然角色会像被风吹散。
最小团队怎么排工期
我会把 20 集测试盘压成 14 天。
这个排期听着像压榨。
但测试盘就该这么干。你不是在拍《哪吒》,你是在验证“这个钩子能不能活”。如果第 3 集完播率瘦得可怜,后面做得再精致也没意义。
我会盯四个数据:前三秒留存、单集完播、评论关键词、下一集点击。别一上来就纠结“皮肤质感是不是电影级”。那是后面的事。
现在的事,是别死在第一周。
给一个能直接抄的提示词模板
角色设定这样写:
角色:19岁女主,黑色短发,浅米色校服外套,眼神倔,情绪克制。 固定特征:左眼下方一颗小痣,银色发夹,白色帆布鞋。 画风:日系漫画改编剧,柔和光影,干净线条,浅暖色调。 禁止变化:不要换发型,不要换服装主色,不要增加夸张配饰。 单镜头这样写:
竖屏9:16,5秒。 便利店门口,雨夜,女主站在玻璃门前,校服被雨水打湿。 镜头从中景缓慢推进到近景,她低头握紧手机,没有哭。 情绪:压抑、委屈、忍住不爆发。 画风:漫画感真人化,浅暖灯光,珊瑚橙和薄荷绿点缀。 保持角色外貌一致,不要出现文字、logo、水印。 负面提示词也要写:
不要多手指,不要换脸,不要年龄变化,不要衣服图案乱变, 不要出现字幕,不要出现乱码文字,不要突然切换场景。 嗯,就这些。
你会发现, AI 漫剧的核心不是“我能不能写出神级提示词”,而是“我能不能把每个镜头限制得足够清楚”。限制越清楚,返工越少。
嗯,我甚至想把这句话贴在显示器上。不然很容易被新模型发布会骗走,东试一下,西试一下,素材散了一地。

我会怎么选第一批模型
如果今天我真要开一个账号,我会这样选:
主力视频: Kling + Seedance 。
精品镜头: Veo 3.1 。
后期改镜头: Luma Ray3.2 。
低成本补镜头: Hailuo 或 Vidu 。
开源技术储备: LTX-2 。
这个组合不性感,但稳。它的逻辑是:日更靠稳定,爆款靠前三秒,精品靠少数关键镜头,不靠每一秒都旗舰。
也许三个月后榜单会变。 AI 视频这行更新太快,今天第一,明天就被新模型按在地上摩擦。可制作方法不会变太快。
你要搭的不是一个模型崇拜系统。
你要搭一条能连续产出的流水线。
先做 20 集。
别先做梦。
夜雨聆风