Z-Image和Qwen-Image-2512是目前生图主力。前者构图稳、速度快,后者中文语义理解更准——你写"一只橘猫蹲在窗台边",它出来的细节基本都在点上。Qwen-Image-Edit-2511解决了图片编辑最头疼的问题:人物一致性。换背景、调表情、改姿态,脸不乱变。这在一年前做不到。
视频生成上,阿里通义实验室的Wan2.2是社区应用最广的,图生视频和文生视频都支持,画风适应性强。字节跳动基于它二次开发的Bernini-R,在空间感知上做了增强——画面里物体之间的关系保持得更好。LTX2.3的优势是速度:生成快、显存占用低,测试阶段反复调参的首选,试错成本大幅降低。
长视频是另一回事。单片段通常几秒到十几秒,做完整短片要靠拼接。SCAIL-2基于Wan2.1,通过多张参考图保持角色一致性——一段长视频的不同片段,指定不同的参考图,它帮你维持角色外观统一。虽然还不能100%完美,但已经让连续镜头有了可操作性。
音频方面,ACE-Step1.5可以直接从歌词生成歌曲,调性、节拍、语种都可指定。Qwen3-TTS做配音,MelBandRoFormer做音源分离。这几个配合起来,从作曲到配音一条链跑通,个人创作者不需要进录音棚。
现在用ComfyUI把这些串起来,电商出图-影视短剧-漫剧-数字人-视频改编,每个方向都有可落地的完整管线。
回到开头的问题:能不能干活?看你怎么定义。如果指望一键出成片——还不行。但如果把AI当生产管线的一个环节,配合传统工具出成品——已经可以了,而且效率提升明显。
后续会在公众号菜单栏整理具体工作流。视频教程在抖音和B站,同名搜索「晨序AI工坊」关注。
— 晨序AI工坊
夜雨聆风