乐于分享
好东西不私藏

AI短剧的"变脸"诅咒,被这个开源工具破了:Jellyfish从剧本到成片一站式搞定

AI短剧的"变脸"诅咒,被这个开源工具破了:Jellyfish从剧本到成片一站式搞定
做AI短剧最让人崩溃的事是什么?不是画面不够精美,不是动作不够流畅,而是——同一个角色,第一秒是锥子脸御姐,第三秒变成了圆脸甜妹,第五秒连眼睛颜色都换了。这种"变脸"问题,才是AI短剧从玩具走向产品的最大拦路虎。

PART 01

AI短剧创作工作台
Jellyfish就是来解决这个问题的。最近在GitHub上发现这个开源项目,来自一个叫Forget-C的团队,定位是"一站式AI竖屏短剧工业化生产工具"。看了一圈下来,它想做的事很有意思:把AI短剧生产从玄学变成流水线。

PART 02

AI短剧的"变脸"诅咒
先说说为什么这个问题难解决。
AI绘图本质上是"根据提示词重新想象",而不是"复制粘贴"。每次生成一张图,AI都在做一次独立的创作决策。所以同一个角色,不同提示词、不同批次、不同情绪描述,出来的五官细节大概率会有差异。这个差异在单张图上看不出来,但放进短剧里就是灾难。
常见的问题包括但不限于:发型细节今天卷明天直、眼睛形状忽大忽小、服装褶皱忽有忽无、面部轮廓忽圆忽尖。最要命的是场景,一扇门在镜头A是红木雕花,在镜头B可能变成现代玻璃推拉门。这种穿帮放在普通视频里都要被吐槽,放在竖屏短剧这种强叙事内容里,直接毁掉沉浸感。

角色一致性对比图
行业里不是没有尝试解决这个问题。固定提示词是最笨的办法,大概能维持70-80%的一致性;图生图参考能提到85-90%,但每张图都要手动喂进去;种子固定法配合一些参数调整能到80-85%,但适用范围有限;IP-Adapter这类工具能做到90-95%,但配置起来有一定门槛;最狠的是LoRA训练,理论上能达到95-98%的一致性,但需要专门训练模型,成本和周期都上去了。
这些方案各有各的问题:要么一致性还是不够看,要么操作成本太高,要么换了底模就失效。端到端直接生成一致性只能到30-50%,模块化组装的话能到85%左右。这距离工业化生产还有不小距离。而且这里有个很现实的矛盾——一致性越强的方案,表情和动作的灵活度往往越差。身份保持强度拉满,角色就变面瘫;放松一点,脸又变了。这个平衡点,目前没有完美解。
南洋理工大学之前发过一篇叫OneSentenceOneDrama的论文,专门研究AI短剧的叙事一致性问题。论文指出了三个核心痛点:叙事节奏弱、空间一致性不足、质量控制不成熟。这基本概括了目前行业的现状——技术上能跑通,但离好看还差得远。

PART 03

Jellyfish登场
Forget-C团队推出的Jellyfish,就是冲着这个痛点来的。
项目地址在GitHub上: https://github.com/Forget-C/Jellyfish ,开源协议是Apache-2.0,感兴趣的可以直接去看源码。
它的核心定位很明确:一站式AI竖屏短剧工业化生产工具。翻译成人话就是,把之前零散的AI工具——Midjourney、Runway、Kling、Luma等等——整合进一个可视化可控的工作台,让一个人就能完成从剧本到成片的全部流程。
Jellyfish的完整流水线是这样的:剧本输入 → 智能分镜 → 资产一致性管理 → AI视频生成 → 后期剪辑。这条链路打通了,AI短剧才能真正从"能看"进化到"好看"。之前大多数人做AI短剧的流程是什么?Midjourney出图,手动喂给Runway/Kling生成视频,再用剪映剪辑——三个工具之间全靠手动搬运,资产不复用,一致性纯看运气。Jellyfish想做的就是把这条松散的链路拧成一条可控的流水线。

PART 04

七大核心功能
Jellyfish的功能架构分成了七个模块,说几个我比较关注的。
剧本智能分镜
剧本智能分镜是入口。用户输入一段文学剧本或者小说,系统会自动提取分镜信息,生成景别、角度、运镜、对白的结构化分镜表。这个功能如果做得好,能省掉不少手动拆解的时间。传统做法里,一个编剧要把一集剧本拆成10-15个分镜,每个分镜要手写景别描述、镜头运动、情绪标签、对白备注,一部30集的短剧光分镜表就得搞几天。AI分镜不是替代编剧的创造力,而是把重复性劳动压缩掉,让人专注在剧情节奏和叙事逻辑上。

剧本创作工作台界面
极致一致性控制
极致一致性控制是核心卖点。Jellyfish用了三层机制来保证一致性:全局种子(Global Seed)作为基准、统一风格强制继承、角色/场景/道具资产复用体系。简单理解就是,系统会尽量让不同镜头里的元素使用同一套底层参数,而不是每次生成都重新"想象"。这里值得多说一句的是"全局种子"的设计——它不像传统的种子固定法那样只能锁定单张图,而是作为整个项目的风格锚点,所有分镜的生成都继承这个种子的视觉基因,再配合角色资产的参考图注入,确保"同一张脸、同一套衣服、同一个场景"在任意镜头里都是可复现的。配合资产复用,角色五官、服装、场景在不同镜头间的稳定性会有明显提升。
可视化分镜编辑器
可视化分镜编辑器是操作界面。采用三栏式布局,左边是剧本大纲,中间是分镜预览,右边是属性面板。用户可以精细调整每个分镜的参数——景别、情绪、时长、氛围,甚至首尾关键帧的独立提示词都能单独写。不用跟命令行打交道,所见即所得。
资产全生命周期管理
资产全生命周期管理解决的是素材混乱问题。系统内置了双层资产库:项目库针对当前项目私有,全局库跨项目复用。角色、场景、道具、服装、提示词模板都可以集中管理。这个设计思路比较务实,避免了每次做新项目都要重新造轮子。
高级生成控制
高级生成控制给了用户更多操作空间。参考图可以跨分镜引用,保持同一角色在多个镜头里的形象一致;ControlNet能控制角色的动作走向——骨骼绑定控制姿态、深度图控制空间关系;智能对口型(Lip Sync)能让声音和嘴型对上,这点在中文短剧里尤其关键,因为中文的儿化音、轻声字、快速对白都会让口型跳跃不连贯;多模型调度可以根据需求切换不同的视频生成模型。这部分功能跟市面上其他AI视频工具的能力对齐,但关键是把它们统一到一个工作流里,不用在五个工具之间反复切换。

视频生成节点工作流

多场景角色一致性效果
后期剪辑与导出
后期剪辑与导出是收尾环节。内置时间线编辑器,支持多轨视频和音频拖拽剪辑,配乐音效库一键调用,最后导出成片。不用再把生成好的片段导出到剪映或者Pr里处理。
Agent工作流
Agent工作流 是面向高级用户的玩法。类似Dify那种可视化节点编排器,可以定制自动化Agent,把重复性的工作流封装成模板。这个功能适合有开发能力的团队,做出自己的定制化流程。

PART 05

实操案例:制作古风重生微短剧
说几个具体的使用场景,帮大家建立更直观的印象。
假设要做一部古风重生题材的微短剧,第一步是创建项目,全局风格设为"中式宫廷暗黑"。这个风格会作为底色贯穿整个项目。
然后进入资产准备阶段。先用AI生成一个"冷艳女主"角色,挑选一张正脸图注册为主角资产。同一套提示词再生成几组不同角度和表情的图,一起归入这个角色资产包。场景方面,"冷宫""金銮殿""御花园"分别生成几套背景图,注册为场景资产。这些资产在后续分镜里会被反复调用。
剧本输入环节,把故事大纲喂进去:"第一幕:冷宫中,女主饮下毒酒,含恨而终。第二幕:女主惊醒,发现自己重生回入宫前..."系统会自动拆解分镜,生成"女主倒地特写""毒酒杯掉落近景""窗外闪电空镜"等一序列镜头描述。每个分镜会自动关联可用的角色资产和场景资产,用户可以在属性面板里微调提示词,强调关键细节比如"女主眼角一滴泪""毒酒杯裂纹特写"。
全部调整完成后,批量生成视频片段,在时间线上剪辑拼接,添加配乐和转场,导出60秒成片。
整个流程听起来不复杂,但关键在于资产复用和一致性控制带来的效率提升。传统做法是每个镜头单独生成,出来的角色可能每帧都不一样;Jellyfish的做法是复用同一套资产,视觉一致性有保证的前提下,批量产出成为可能。
对比一下成本:传统制作一部30集短剧,租赁影棚、雇佣演员、服装道具,保守估计要十几万到几十万。用AI短剧方案,模块化组装的单集成本大约520-720元,4-6小时能完成一集。关键差异不在单次成本,而在可复制性——传统方案每集都要重新来,AI方案做好一套资产,后续集数只需微调。

PART 06

部署方式
对于想自己部署的同学,Jellyfish的环境要求如下:
后端依赖Python 3.10以上,通过pip安装后运行 `python main.py` 启动。Node.js用LTS版本,前端通过pnpm安装依赖后 `pnpm run dev` 即可跑起来。模型调用方面,系统支持在Web后台配置API Key,兼容OpenAI、Anthropic、通义千问、混元等多个服务商 。
pip install -r requirements.txtpython main.pypnpm installpnpm run dev
如果是技术背景不强或者懒得折腾的用户,可以等官方推出云端版本或者基于Jellyfish做的托管服务。开源项目的通常路径是,先跑通本地版,再出托管版,最后可能还有企业定制版。

PART 07

我的判断
Jellyfish这个项目让我比较感兴趣的有几点。
首先,AI短剧赛道在2026年已经进入新阶段——从"能不能做"转向"做得好不好"。技术积累到今天,跑通一个AI短剧的流程不难,难的是品质稳定、产能跟上。Jellyfish瞄准的一致性问题,恰恰是这个阶段的核心矛盾。谁解决了一致性,谁就能让AI短剧从UGC走向PGC。
其次,它的开源策略值得关注。降低门槛、建立生态,这是很多工具类项目的常规打法,但放在AI短剧这个赛道上,效果如何还有待观察。商业化的短剧SaaS走的是另一条路——提供更完善的服务和支持,收取订阅费或者分成。两条路最后谁赢还不一定,但开源至少给了不想被平台绑定的用户一个选择。

AI短剧创作平台界面
当然也有隐忧。一致性方案的天花板,最终取决于底层模型的能力。Jellyfish做的是工具层的事,能优化工作流、提升效率,但如果底层模型本身的一致性上限只有85%,工具再怎么打磨也很难突破。这一点务必要认清——Jellyfish解决的是"把现有模型能力用足"的问题,而不是"让模型变得更强"的问题。
南洋理工的OneSentenceOneDrama走的是另一个技术路线——分层Agent框架配合3D场景锚定。它的核心思路是用3D场景建模来锚定首帧构图和空间关系,再通过审阅模块自动检查连贯性,发现问题就重写提示词。这个方案在叙事质量和跨镜头一致性上确实表现更好,但API成本约25-27美元/分钟,离普通创作者的承受范围还有距离。学术味更重,离实用还有一段路。
还有一个值得关注的趋势:商业化短剧制作公司已经在入场了。像集之互动这类公司,专门做AI短剧出海,搞了自己的"无垠大模型"来控制角色一致性,为每个核心角色建立九宫格参考图、核心表情包、发型服饰设定等数字资产模板 。这种企业级方案的成本和门槛不是个人创作者能承受的,但它代表了AI短剧制作走向专业化的方向。
短期来看,Jellyfish这种工具化的方案更实用,落地快、门槛低;长期来看,两种路线可能会走向融合——底层模型能力提升,加上工作流工具优化,才能真正解决一致性问题。AI短剧工业化,现在才刚起步。谁先跑通这条链路,谁就能吃到第一波红利。

角色形象复刻对比
#AI短剧 #Jellyfish #开源工具 #AI视频 #AIGC

相关学习资料