ARTICLE · 1116985
AI短剧全流程开源工具链:从剧本到成片一条龙
AI短剧全流程开源工具链:从剧本到成片一条龙
AI 短剧大概是 2026 年离钱最近的 AI 场景:有平台一口气接入了 34 款大模型做 AI 制剧,"一人 + 一台电脑 = 一个剧组"已经不是段子。更关键的是,这条流水线的每一环,都有能打的开源项目。
这篇把五个项目按制作流水线串起来:让角色演起来、让直播跑起来、让产量提上来,最后给一张选型速查表。全部自带实测数据,建议收藏。
一部 AI 短剧的生产链是:剧本(LLM 生成/拆解)→ 角色表演(参考图+音频驱动人物说话做动作)→ 实时交互(直播、客服这类"活人感"场景)→ 成片合成(配音、字幕、BGM、剪辑)。开源方案在每一环都成熟了,缺的只是把它们串起来的你。
EchoMimicV2(蚂蚁集团,4.7k 星,Apache-2.0,CVPR 2025):一张参考图 + 一段音频,生成半身说话带手势的视频,中英文都支持。最实用的是加速推理——A100 上 120 帧从约 7 分钟压到约 50 秒,快 9 倍,有 ComfyUI 集成,工作流玩家可以直接挂进现有管线。V3 已经放出,迭代很勤。
Hallo3(复旦,1.4k 星,MIT):单张肖像 + 音频 → 动态说话视频,基于 CogVideoX-5B 微调,还公开了 70+ 小时训练数据。官方演示是让蒙娜丽莎开口说话——对短剧来说,历史人物、二次元立绘、AI 生成的人设图都能直接"请"来演戏。界面长这样:
拍好的短剧是离线产物,但直播带货、AI 客服、大屏互动要的是实时。这一环的标杆是 LiveTalking(9.7k 星,Apache-2.0):实时流式数字人引擎,文字或语音驱动,可选接 LLM 做智能对话,WebRTC/RTMP/虚拟摄像头三种输出。
它对穷人最友好的地方是硬件弹性:wav2lip 方案 RTX 3060 就能跑 60fps,MuseTalk 方案 4090 到 72fps。还支持语音克隆、可打断说话、待机动作编排、多并发。虚拟主播 24 小时挂着,就是它的典型用法。
口播类短视频的"印钞机"是 MoneyPrinterTurbo(127.8k 星,MIT,今天还在 GitHub 趋势榜):给一个话题关键词,自动完成脚本生成(12+ 家 LLM 可选)→ 素材匹配(免费图库或 AI 文生视频)→ 配音(Edge TTS 免费,ElevenLabs 等 8 种可选)→ 字幕 → BGM → FFmpeg 合成,还能自动发布到 TikTok/YouTube Shorts。CPU 就能跑,四种用法从 WebUI 到 CLI 批量(一次 100 个任务)都有。
另外补一个常被忽略的:Duix-Avatar(15.6k 星)做完全离线的外形+声音克隆,适合给短剧角色批量配音出画面——细节多,我们单独开了一篇,这里不展开。
最后送个彩蛋:国内首部真人主演 AI 剧《行镖》把全套制作资产开源了——分镜提示词、幕后资产库、二创源文件。想看怎么把这条流水线用到真实剧组里的,我们另一篇专门拆它。
你的短剧流水线缺哪一环?留言区对个暗号,说不定能找到搭子。
觉得有用的话,点个「赞」和「在看」再走吧 ↓
转载请联系授权 · 欢迎留言交流