
🐉 龙哥读论文知识星球来了!公众号每日8篇拆解不够看?星球无上限更AI领域论文、资讯、招聘、招博、开源代码,一站式干货,每日2分钟刷完即赚!👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~

龙哥推荐理由:
想让AI生成的视频画面按照你的想法“运镜”?通常这需要大把的标注数据和昂贵的新模块来训练。但今天这篇来自上海AI实验室的论文,提供了一个反常识的解决方案:直接把相机轨迹“伪装”成预训练模型早就看惯了的历史帧,喂给它就行了!仅需一个目标视频用来微调,就能让模型精准跟随任何相机轨迹,效果还堪比那些用海量数据训练出来的方法。方法简单到令人发指,但效果又出奇地好,极具实用价值和创新思维。
原论文信息如下:
论文标题:
Warp-as-History: Generalizable Camera-Controlled Video Generation from One Training Video
发表日期:
2026年05月
发表单位:
上海交通大学,上海人工智能实验室(上海AI实验室),上海创新研究院
原文链接:
https://arxiv.org/pdf/2605.15182v1.pdf
开源代码链接:
https://github.com/yyfz/Warp-as-History
项目链接:
https://yyfz.github.io/warp-as-history/
想象一下,你只需要给AI看一段马路飙车的视频,然后它就能按照你设定的任何相机轨迹,生成一段全新的、视角完全符合你要求的驾驶画面。是不是有点像科幻电影里的情节?以前要做到这点,那可是个大工程。主流的做法要么是给模型训练一个“新大脑”——额外的相机控制模块,这就像给车加装一个复杂的自动驾驶系统,需要成千上万小时的驾驶视频来“训练”。要么是让模型在“考试”时临时抱佛脚,通过复杂的优化算法自己琢磨怎么动,速度慢,效果还不稳。上海AI实验室这篇论文的思路,可以说是另辟蹊径,脑洞大开。它发现,目前先进的视频生成模型(比如Helios)天生就有一个“历史帧”处理接口,负责根据前面几帧的画面推测后面的内容。于是,研究者们就想:既然这个接口这么擅长“看”连续的画面,那我们为什么不直接把相机轨迹造成的“画面扭曲”当做“历史”喂给它呢?这就好比,别人都在费力教一个只会听音乐的人跳舞,而这篇论文的作者,直接把音乐节拍翻译成了他熟悉的语言(比如,用荧光棒在他眼前晃动),他自然就跟着嗨起来了。你的视频生成器会“读”相机轨迹吗?
讲真,当龙哥第一次看到这个研究的时候,就被它的思路惊艳到了。在AI生成视频这个赛道上,想让生成的视频按照你的想法运镜,这几乎是个刚需。想象一下,你做游戏关卡设计、电影预演或者虚拟场景探索的时候,是不是特别希望有个工具能像摄影师一样,指哪打哪?之前的主流做法,比如CameraCtrl、Voyager、ViewCrafter这些方法,大都需要搞一个专门的相机控制模块,然后用海量的、有相机标注的视频数据去训练。这就好比你想教会一个人跳舞,但这个人完全不懂节拍,你非得给他做个专门的耳机,再花很多年让他学会跟着节拍器动。成本巨大,效率还不一定高。而上海AI实验室的这篇Warp-as-History,它的骚操作在于:它没造什么新工具,而是把目标相机轨迹导致的画面扭曲(Warp)直接整理成了一份“假历史”,喂给了模型天生就有的“历史帧”处理接口。它等于直接把舞蹈节奏翻译成了那个人天生就听得懂的“重低音”,刚放出来,身体就跟着抖起来了。这意味着什么?意味着我们不再需要海量的标注数据来从头训练一个新技能,而是去唤醒模型在预训练阶段可能已经“沉睡”的某个能力。这个思路一旦打开,整个游戏规则都可能被改写。一个巧妙的“欺骗”:将相机轨迹伪装成历史帧
那么,这个“欺骗”到底是怎么实现的呢?我们得先理解一下,这些视频生成模型内部到底是怎么工作的。本方法建立在Helios这种先进的视频生成模型之上。这类模型有一个非常重要的内置组件:历史条件接口(History Conditioning Interface)。简单解释一下,这个接口的职责就是处理并“理解”已经生成出来的老画面(历史帧),然后根据这些老画面去预测和生成接下来的新画面。Warp-as-History的“魔法”就在于,它把控制相机运动的意图,强行翻译成了这个历史接口能读懂的“语言”。具体来说,它干了三件事:给定第一帧画面和目标相机轨迹,我们需要知道相机移动后画面看起来应该是什么样的。作者使用一个现成的场景重建模型(来自Wang等人,2025年的工作)将第一帧画面粗略重建为3D场景,然后根据目标相机轨迹进行投影,得到一段“相机扭曲(Camera-Induced Warp)”的视频。这段视频不完美,有空洞、有变形,但它精确地反映了相机运动带来的视觉变化。这是非常关键的一步。模型在处理视频时,会给每一帧画面打上“时间标签”,即旋转位置编码(Rotary Position Embedding, RoPE),告诉模型这是第几秒的画面。如果我们简单地把扭曲视频当成历史输入,模型会认为这些是已经发生过的旧画面。但Warp-as-History做了一个精妙的目标帧位置对齐(Target-frame Positional Alignment):它将扭曲视频中第j帧的位置编码,分配给了模型当前正在去噪的第j个目标帧。这样一来,模型会把扭曲画面的内容理解为“当前帧”应该长什么样,而不是来自“过去”的参考。由于扭曲视频是通过投影生成的,画面在很多地方会出现空洞(新视角下新暴露出来的区域)或者拉伸、变形等不可靠的区域。如果把这些“坏信息”直接喂给模型,模型可能会产生错误的猜测。因此,本方法加入了一个可见性选择(Visible-token Selection)机制:它生成一个遮罩,只把那些有可靠信息来源的扭曲像素作为“历史证据”输入给模型,而把那些空洞和不可靠的区域直接丢弃。这样,模型就只从可靠的地方获取相机运动提示,而对于新暴露的区域,则完全依靠自身的想象力进行补全。
图3:Warp-as-History条件化过程示意图,展示了如何将相机轨迹打包成伪历史并输入模型。也就是说,模型的输入变成了两部分:一部分是真实的过去历史帧,另一部分就是这份精心伪装的、带有位置对齐和可见性筛选的“相机扭曲伪历史”。整个过程中,模型本身的网络结构、权重参数,没有任何改变。它就像是一个被我们巧妙利用的工具,完全不知道自己正在被引导着运镜。可以看一下下面的公式,展示了伪历史条件的具体构建:
这个公式表示,在给定相机轨迹C下,构建的相机扭曲伪历史条件(~H^C_t),是通过模型的原生历史构造操作(H),先处理扭曲视频W_C,再经过一个由可见性遮罩M_C决定的可见性选择操作S,最终得到的结果。
这个公式表明,模型生成第t到t+K帧(^X_{t:t+K})的概率,是在给定普通历史条件H_t、相机扭曲伪历史条件~H^C_t以及文本提示p的条件下得到的。零样本能力:预训练模型中的“沉睡”相机控制先驱
最让龙哥感到兴奋的,是论文中揭示的一个现象:零样本(Zero-shot)相机控制能力。什么概念?就是完全不用训练,把上述的“伪历史”接口直接怼进一个什么微调都没做过的、冻结权重的Helios模型里。结果你猜怎么着?它竟然真的开始按照相机轨迹运动了!这简直就像一个从来没学过跳舞的人,你突然给他放了一段节奏感极强的音乐,他就跟着律动了起来。这说明,视频生成模型在海量数据预训练的过程中,已经“无师自通”地学会了一些关于相机运动和视觉几何的知识。只是这些知识处于“沉睡”状态,需要一个合适的“钥匙”来唤醒。而这个“伪装”后的历史条件,就是那把金钥匙。
图6:零样本消融实验,展示了不同设计(朴素伪历史、目标帧位置对齐、可见性选择)对最终输出的影响,清晰论证了每一步的必要性。从图6的消融实验可以很清楚地看到,如果只输入扭曲画面但不做位置对齐(NoAlign),模型根本看不懂,产生的结果与扭曲画面差异巨大;如果做了位置对齐但不做可见性选择(NoVisDrop),模型虽然能跟随运动,但由于接收了太多不可靠的扭曲信息,生成质量很差。只有在完整的Warp-as-History配置下,模型才能既完美跟随目标轨迹,又生成高质量的补全画面。单视频“激活”:LoRA微调让控制更稳定通用
虽然零样本能力已经足够惊艳,但它还不够完美。就好像一个初学跳舞的人,虽然能跟上节拍了,但动作偶尔会僵硬,某些转身会摔倒。为了让它跳得更稳、更好看,论文作者引入了一个非常轻量级的“训练”——LoRA(Low-Rank Adaptation,低秩适应)微调。作者解释说,零样本的模型有时候会过于“信任”扭曲画面,比如把动态的前景物体(如行人、车辆)也僵硬地复制到新视角。为了纠正这些,LoRA微调就像是一堂大师课,教导模型如何更好地平衡“从扭曲画面学到的提示”和“自己原有的生成先验”之间的关系。最离谱的是,为了让这堂“大师课”生效,仅仅需要一段单独的、带有相机标注的5秒视频来作为训练数据!
对,你没看错,就只训练一段视频。作者在实验中,通常是拿DAVIS数据集里一段“汽车绕环岛行驶(car-roundabout)”的视频,进行1000次迭代训练,在单张A800 GPU上大概用时1小时。就这么点训练,训练好的LoRA权重,就可以直接用在其他完全不同的视频上,实现稳定的轨迹控制,而无需针对每个新视频再做任何调整。这充分说明,LoRA微调的作用不是从头学习相机控制,而是“放大”和“稳定”了模型已经具备的、但尚不完善的的零样本能力。极低资源下的“降维打击”:效果媲美海量数据训练的方法
吹得那么神,实战效果到底怎么样?龙哥带你们看看数据。论文在三个公开基准上进行了测试:WorldScore(世界生成基准)、RealEstate10K(RE10K,真实室内外场景)和DAVIS(动态视频)。CameraCtrl [He et al., 2024]:经典的相机控制方法,需要大量相机标注数据进行训练。
Gen3C [Ren et al., 2025]:基于几何条件的方法,训练数据大约用了9万个视频。
Voyager [Huang et al., 2025a]:可探索的3D场景生成方法,训练数据大约7.8万个视频。
ViewCrafter [Yu et al., 2024]:基于扭曲和渲染的方法,训练数据大约8.5万个视频。
而我们的Warp-as-History(单次训练)只用了1个视频,4个剪辑片段。这是在用微不足道的零头,去挑战别人的几十万大军!
表1:在WorldScore基准测试中,本方法(单次训练)在相机控制分数上从26.42(纯文本基线)飙升到62.00,提升了134.7%,超越了CogVideoX-I2V,并紧逼Voyager等。更重要的是,在主观质量上也远超零样本情况和纯文本基线,证明微调不仅增强了控制力,还优化了画面质量。
表3:在DAVIS和RE10K上的相机跟随精度评估(PSNR/SSIM/LPIPS等),本方法在仅有1个视频训练量的情况下,与使用数万视频训练的方法处于同一水平,尤其在DAVIS上的R-Err(旋转误差)和T-Err(平移误差)都低于ViewCrafter。表4:在视觉质量、时间一致性(如FID, FVD, DOVER)上,本方法在多种指标上(如DAVIS上的Subject, Backgr.一致性)都取得了最优或次优的结果。在属于不同领域的RE10K上(源域是DAVIS),本方法依然在DOVER, Subject, Backgr., Imaging等多个指标上拔得头筹。这出奇好的泛化能力,完美诠释了什么叫做“降维打击”。下面这张定性比较图,可以更直观地看到本方法的优势。在大多数场景下,Warp-as-History生成的内容更清晰,前景物体的动态也更自然,没有像其他方法那样出现明显的扭曲和伪影。
图4:在多种真实世界视频上的定性对比结果。可以看到,本方法(Ours)在保持画面清晰度和避免前景物体变形上表现突出。总结与展望:历史通路的无限潜力
看完这篇论文,龙哥的第一个感觉不是“新”,而是“妙”。它没有发明任何复杂的新模块,而是用极其简洁优雅的思路,解决了一个长期存在的难题。它的核心思想“重用而非重造”,在目前动辄需要海量数据和巨大算力的AI领域,无疑是一股清流。不过,龙哥也发现了一些有待挖掘的地方。例如,现在的方法还是需要额外一步的3D场景重建来生成扭曲画面,这本身就是一个有挑战的研究课题,而且重建的质量会直接影响最终结果。另外,对于动态前景非常复杂的、或者是需要大幅度运动(比如180度转身)的场景,扭曲画面的空洞会非常大,模型的想象压力也会剧增,效果可能就会打折扣。未来,沿着这个思路,我们或许可以探索如何让模型对相机运动的敏感性更强,甚至尝试完全摒弃3D重建这一步,让模型直接从单张图和模糊的描述中“脑补”出新视角。作者在论文中也提到,他们发现使用不同来源的单张训练视频微调,结果会有较大差异,这说明唤醒模型“沉睡”能力的方式可能还不唯一,留有很多探索空间。无论如何,Warp-as-History向我们展示了,有时候解决问题的最佳方案,可能就藏在我们已经拥有的东西里,只需要我们换个角度去使用它。龙迷三问
问:这篇论文解决了什么问题?与之前的方法有什么本质不同?答:它解决了如何用极低成本(1段视频微调)实现对生成视频精确相机控制的问题。与之前方法(如CameraCtrl, Gen3C)的本质不同在于,之前的方法都是新加一个模块来“学习”怎么使用相机信息,而Warp-as-History是通过“伪装”的方式,让模型既有的“历史帧处理”接口直接“读取”相机信息,从而激活了模型预训练时就已经具备的、但未被利用的隐性几何理解能力。
问:文中提到的“旋转位置编码(RoPE)”是什么?为什么对齐它很重要?答:可以简单地把它理解为模型给每一帧画面贴上的“时间标签”。比如,第0帧是“现在”,第1帧是“0.1秒后”。当模型处理普通历史帧时,第j帧的画面就是第j个时间标签。但本方法把从第一帧投影得到的第j个“扭曲帧”当成伪历史输入。如果不做对齐,模型会认为伪历史中的第j帧是“过去”的。而Warp-as-History做了目标帧位置对齐,把这些扭曲帧的RoPE标签,替换成当前去噪目标帧的标签,这样模型就会认为:“哦,这个扭曲画面说的就是现在这个时间点应该有的画面”,从而指导它的去噪过程。
问:文中LoRA微调的作用是什么?为什么只需要一个视频就能生效?答:LoRA微调的作用是“行为稳定化”。零样本的Warp-as-History已经能跟随相机了,但效果不够稳定,比如可能会过于僵硬地复制扭曲画面(把动态物体也挪位置)。LoRA微调就是在极小规模的训练中,教会模型一个微妙的平衡:什么时候该相信扭曲画面带来的运动提示,什么时候该忽略那些不可靠的扭曲区域,更多地依赖自己的生成先验去创造新内容。之所以一个视频就够,是因为模型本来就已经有了相机跟随的“底子”,LoRA只是把这个“底子”从忽隐忽现的状态变得稳定可靠起来。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~龙哥点评
论文创新性分数:★★★★★满分5星。思路极其新颖,跳出了“相机控制=新模块+新训练”的框架,开创性地通过“历史接口伪装”来激活模型既有的隐性能力,这种“四两拨千斤”的视角本身就是最大的创新。
实验合理度:★★★★☆4星。实验设计非常严谨,包含了零样本、单视频微调、多视频微调、不同来源视频微调等多种情境的对比,消融实验完整。扣一星是因为,对比方法训练数据与本文差异太大,虽然是为了突出对比,但严格来说不是完美公平的“公平对比”。
学术研究价值:★★★★★5星。价值极高。它揭示了一个普遍现象:预训练大模型内部可能已经蕴含了丰富的“认知”或“知识”,只是我们没有找到合适的刺激方式。这种“能力暴露”而非“能力赋予”的研究范式,对未来所有依赖预训练模型的下游任务研究都有重要启发。
稳定性:★★★☆☆3星。零样本情况下不稳定,LoRA微调后稳定性显著提升。但效果依然依赖于初始3D重建的质量,对于运动幅度过大、前景物体动态复杂的场景,其稳定性和保真度可能会下降。
适应性以及泛化能力:★★★★☆4星。方法对领域外(从DAVIS微调后在RE10K上测试)和未见过的场景都表现出了不错的泛化能力,这是其最大优点之一。但论文也提到,选择不同的单视频作为微调源,会显著影响最终效果的偏好,还没找到一个可以“通杀”的最佳源视频,因此适应性并非完美。
硬件需求及成本:★★★★★5星。成本极低。零样本模式无需额外训练。LoRA微调仅需1小时单卡A800,推理时增加的开销可以忽略不计(小于1秒),是绝对的“低成本解决方案”。
复现难度:★★★★★5星。论文方法描述清晰,提供了算法流程图和关键步骤说明。代码和项目主页也已开源,并提供了模型细节和推理例子,复现应该非常容易。
产品化成熟度:★★★☆☆3星。目前还处在Demo和研究阶段。虽然原理简单,但实际产品落地还需要解决几个问题:对动态前景处理不够稳定,需要依赖外部场景重建模块,以及确保在各种极端用户输入下(如非常复杂的轨迹)的鲁棒性。
可能的问题:论文的实验结论非常有说服力,但算法本身有一个“先天性”的短板:它强依赖于第一帧场景重建的质量来生成扭曲画面。如果输入的视频第一帧背景非常复杂或者信息不够(比如物体遮挡严重),重建出来的3D场景就很拉胯,那扭曲画面就会有大量错误,后续的伪历史条件也就成了“毒药”,模型再聪明也没用。另外该局限性作者也有所提及。此外,该方法在动态前景物体保持原本运动方面还有提升空间。
[1] Yifan Wang, Tong He. Warp-as-History: Generalizable Camera-Controlled Video Generation from One Training Video. arXiv:2605.15182v1, 2025.[2] Hao He, Yinghao Xu, Yuwei Guo, et al. CameraCtrl: Enabling camera control for text-to-video generation. arXiv:2404.02101, 2024.[3] Xun Huang, et al. Voyager: Long-range and world-consistent video diffusion for explorable 3d scene generation. ACM Trans. Graph., 44(6):1–15, 2025.[4] Zhaoxin Ren, et al. Gen3C: Geometry-conditioned multi-view video generation. 2025.[5] Wangbo Yu, et al. ViewCrafter: Consistent novel view synthesis from video diffusion priors. 2024.[6] Edward J Hu, et al. Lora: Low-rank adaptation of large language models. ICLR, 2022.[7] Yuan et al. Helios: Real-time long-video generation model with native history conditioning. 2026.*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击左下角的"阅读原文",查看更多原论文细节哦!
欢迎加入龙哥读论文粉丝群,
扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。
一定要备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+清华+龙哥),根据格式备注,可更快被通过且邀请进群。
『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群