乐于分享
好东西不私藏

开源 AI 视频编辑工具!Qwen‑Video‑Edit 靠提示词改视频,FlexAM 精细控制物体与镜头......

开源 AI 视频编辑工具!Qwen‑Video‑Edit 靠提示词改视频,FlexAM 精细控制物体与镜头......

今天,我给大家介绍两款开源的 AI 视频编辑项目:Qwen‑Video‑Edit 和 FlexAM。Qwen‑Video‑Edit 直接复用现成的图像编辑模型来做视频修改,无需专门预训练视频 Transformer。

FlexAM 则采用外观‑运动解耦的思路,借助 3D 点云控制信号,实现对物体运动和相机轨迹的精细调控。两个项目都公开,从事 AIGC 开发的朋友可以下载到本地测试。

Qwen‑Video‑Edit:复用图像编辑模型,完成指令驱动的视频修改

市面上大多数视频编辑方案,都要用大量视频数据完整训练视频专用网络。Qwen‑Video‑Edit换了一个思路:直接改造Qwen‑Image‑Edit图像模型,让它处理视频VAE的隐空间数据。

整套编辑靠文本提示词驱动。既可以做全局风格转换,把实拍片段转成皮克斯、水墨、像素、赛博朋克等画风;也支持局部修改,更换人物服饰配饰,抹除雾气、飞鸟、光斑这类画面元素,或是向场景中添加无人机、光晕、香炉等物体。

已关注
关注
重播 分享

处理长视频时,工具会把素材切为45帧的片段,每段可以独立设置编辑指令。同一条视频里,前半段做风格化、后半段修改物体,这种混合编辑是可行的。人像视频也能正常处理,会保留原始宽高比,不会强行拉伸人物。

它也存在些局限。遇到高速运动、动作幅度剧烈的镜头,输出画质会下滑,细节容易模糊。更适合人物动作平缓的素材,打斗、快速运镜的内容不要期待过高......

技术实现

原始视频送入 Wan2.1 VAE,压缩得到视频隐特征。把每一段隐帧,视作一张超大虚拟图片上的分块瓦片。原本服务于图片分块的图像DiT,就可以直接读取视频数据。

实现跨模态打通,只新增一对轻量级投影层,连接图像模型与视频VAE的隐空间,图像主干网络改动很少。训练基于公开数据集 Ditto‑1M,也就是源视频、编辑指令、编辑结果组成的三元样本;训练方式可选LoRA微调或是全参数微调,对比完整训练视频大模型,算力开销更低。

编辑结束后,会调用 Wan2.2 执行少量降噪步骤,用来减轻帧间闪烁。这一步属于后处理增强,不会完整重生成整条视频......

适用场景

  • 算法研发人员可以拿来快速搭建视频编辑原型,或是用来做横向对比实验。

  • 短视频创作者更适合用在动作平缓的素材上,完成风格转换和简单局部修改。

  • 学生也可以参考这套代码,理解图像模型迁移到视频任务的实现思路......

比较合适的案例:风景短片转手绘绘本、访谈视频更换人物衣着、清除画面中多余的小物件......

FlexAM:外观运动解耦,借助3D点云实现细粒度视频控制

FlexAM 的设计思路和 Qwen‑Video‑Edit 差异很大。它不完全依靠文本提示直接修改画面,而是将视频拆成外观、运动两套独立部分,依靠3D点云控制信号,完成可控的视频生成与编辑。

这套框架主要覆盖三类任务。第一类是外观编辑:完整保留原有运动轨迹,只更改画面视觉样貌,实现运动迁移、前景或背景局部替换。

第二类相机控制:既可以在图生视频阶段指定相机轨迹,也能给现成视频重新渲染运镜。注意该功能依赖前置3D点跟踪算法,跟踪质量直接决定成片好坏。

第三类空间物体编辑:在三维层面平移、旋转物体,改动物体空间位置,尽量维持合理的遮挡关系。

已关注
关注
重播 分享

这项目也有短板。整套效果高度依赖前置3D点跟踪,如果画面遮挡多、物体运动过快,跟踪出错,最终编辑结果就会崩坏。源运动与目标外观差异过大时,物体容易发生形变。训练数据集覆盖的光照样本有限,偶尔会出现生成画面光照和原视频不匹配......

技术实现

外观条件采用掩码视频,不再只依赖首帧图片。需要改动的区域填充灰色,搭配二值掩码划定编辑范围,I2V、V2V、局部编辑全部复用同一套输入逻辑。

运动条件是整个框架的核心,研究人员构造了多属性运动控制信号。引入多频编码,区分画面内近距离不同物体的各自运动;增加深度感知编码,缓解2D投影带来的深度歧义,保证遮挡逻辑符合现实物理逻辑。

训练阶段对点云做不同程度随机下采样,让模型同时学习稠密、稀疏控制点。推理的时候,可以按需在控制精度与泛化能力之间做权衡。框架能够对接现成预训练视频扩散模型,复用原有VAE,依靠轻量Adapter完成特征融合,不必从零搭建完整视频大模型。

做物体编辑时,系统会调用分割、深度估计工具,直接在三维点云上完成变换,再投影回二维,生成对应的控制信号。

适用场景

  • 视频算法、动效研发人员,可以研究这套外观‑运动解耦的技术范式。

适合这些需求:做视频运动迁移,保留原片动作,替换人物形象;生成指定运镜的图片转视频,或是为旧素材重新设计镜头运动;调整画面物体位置,平移旋转对象,同时尽量守住时序一致性......

项目链接:

https://yunpeng1998.github.io/Qwen-Video-Edit-Page/

https://flexam-project.github.io/

如果对您有点帮助💡
记得点赞👍、收藏⭐、在看👀、分享📤

推荐阅读:
1、AtomicDance:北大全新开源,一段音乐就能生成流畅 3D 人物舞蹈动画......
2、Wan-Dancer:一首歌 + 一张图,就能生成一分钟+ 舞蹈视频,阿里开源......
3、LiveEdit :清华 等联合打造,实时 AI 视频剪辑从业者必备工具。
4、重磅发布!清华、智谱 SCAIL-2 开源,多人动画、角色替换一站式搞定。
5、字节跳动 开源新作:Bernini,AI视频生成与编辑统一框架 。
6、OmniNFT:北大 等推出开源AI项目,一句话生成同步音视频......

🏷️点这关注我,记得标星⭐不迷路!

给点打赏🤑我想去喝西北风 😭