从 Seedance 2.5到 Autodesk,3D 场景、摄影机与生成模型正在重新汇合,AI 视频竞争正从“生成画面”转向“导演镜头”
一、一个反常的现象
2026年8月5日上映的国产动画电影《牛来》,最近因为画面被网友形容为“像早期3D 动画练习作业”,意外引发大量玩梗和二创。
把这个现象和今天的 AI 视频放在一起,会产生一种强烈的错位感。AI 已经能在几分钟内生成写实人物、电影感光影、巨型场景甚至复杂特效,几张参考图加几句提示,就能让部分短镜头呈现接近成片的质感。“人人都能生成电影感镜头”,似乎不再是口号。
但真正操作过的人都知道,画面逼真并不等于镜头可控。
人物何时入场、机位如何移动、镜头怎样交错与收束、遮挡与揭示何时发生——这些决定镜头是否成立的细节,很难靠一句 Prompt 精确控制。即使把运镜方向、人物走位和画面构图写得很详细,生成结果仍可能偏离预设:人物中途消失,机位突然偏转,镜头速度前稳后飘。
AI 视频创作者常把这种不可控的状态称为——“抽卡”。
二、updream 的“预演台”:把控制权还给创作者
就在8月17日,AI 视频创作平台 updream 上线了一个叫“预演台”的新功能。
做法很直接:上传一张场景参考图,系统自动生成3D 白模场景,创作者在场景里拖拽设置摄像机运动轨迹和人物走位,录完白模视频后一键回到画布送进模型。
爱范儿的测试覆盖了机甲格纳库、宇宙中心、地铁站多人走位、雨夜打斗、武侠对决等不同复杂度场景。新智元则选择了三个影史经典镜头做实测:致敬《好家伙》的科帕卡巴纳跟随长镜头、致敬《盗火线》的咖啡馆多机位正反打、致敬《老男孩》的走廊横移长镜头。
结果对比很直观。
《好家伙》的跟随长镜头:白模版基本保持了人物跟随距离和匀速推进,但第一次生成仍出现人物融合与鬼影,第二次才获得相对可用的结果。纯提示词版连续生成三次,都在人物推门时发生突然加速和机位偏移。
《盗火线》的多机位正反打:预演台通过三个机位和四段切换控制构图与切镜时间,整体比纯Prompt版更接近预设,但第三次切镜仍延迟约0.5秒。
《老男孩》的走廊横移长镜头:白模能够明确传递走廊纵深、人物站位和水平横移路线,这是纯Prompt很难精确表达的空间关系。不过,白模版最后3秒仍出现轻微偏转。
需要说明的是,这些测试属于小样本产品体验,并非严格的模型基准:报道没有公布统一的随机种子、完整生成参数和大规模重复实验,因此更适合用来展示典型问题,而不能据此量化预演台的整体成功率。

更准确地说,updream 预演台像是 AI 视频工作流中的轻量级 Previs 工具——承担镜头预演和空间调度,但还不能替代完整的 Blender 制作流程。
三、从 Seedance 2.5到 Autodesk,AI 视频工具开始集体“回到3D”
updream 预演台上线的同期,从主流视频模型到专业影视工具,多条独立的产品与学术路线正在指向同一个方向。
Seedance 2.5:白模渲染成为一种结构化参考条件
7月31日,字节跳动正式发布 Seedance 2.5。除了单次30秒生成、多轮扩展、多模态参考和时间戳编辑等能力,它还强化了“白模参考”(clay render)。创作者可以先用无材质3D 模型确定场景结构、角色姿态、运动路径和摄影机角度,再把白模渲染结果作为参考交给模型生成最终视频。
这意味着白模渲染不再只是外部预演结果,也开始成为视频模型支持的一种结构化参考条件。 不过,字节跳动也承认,复杂运动的物理合理性和多主体互动稳定性仍有改进空间。
Autodesk Flow Studio:3D Editor + Canvas
8月4日,Autodesk 在 Flow Studio 中推出3D Editor + Canvas。这是 Flow Studio 的一次重大扩展,目标是解决 AI 视频创作中最棘手的问题之一:精确控制。
它的逻辑非常直接:创作者不再通过提示词或参考图像在2D 界面中指导角色、动画和摄影机运动,而是直接在3D 环境中工作,AI 负责最终的渲染。在3D Editor 中,创作者可以调度场景、指导表演、控制节奏和摄影机运动;然后在 Canvas(一个基于节点的2D 工作流)中,调用图像和视频模型完成生成、细化和最终画面。
Autodesk 在发布文中写道:“我们生活在3D 中,也在3D 中导演,但大多数生成式 AI 视频工具仍然要求创作者在2D 世界里操作。”这套工作流延续了 Autodesk 通过 Maya、3ds Max 和 Arnold 等工具长期积累的3D 影视制作思路。更值得注意的是,这一方向已经进入 Autodesk 这样的专业影视工具厂商产品线。
Reallusion AI Studio:3D 作为“控制层”
5月25日,Reallusion 发布了 AI Studio。Reallusion 将这套产品的定位概括为:3D 技能在 AI 时代不是负担,而可能成为创作者控制 AI 输出的优势。
AI Studio 将创作者的3D 场景——空间布局、摄影机设置、角色动画——直接翻译为 AI 输入。创作者先在3D 中搭建场景、构图,然后直接传给 AI 生成最终图像或视频。平台整合了 Flux、Nano Banana、GPT Image 2等图像模型,以及 Wan、LTX、Scail、Veo 3、Kling AI、Seedance 2.0等视频模型。Reallusion 官方演示显示,摇臂、轨道移动、多轴环绕以及多机位切换等信息,可以从3D 视口传递给视频模型。不过,这些效果目前主要来自厂商演示,尚缺少公开的独立基准和大样本验证。
万兴剧厂“3D 导演台”:分层架构
6月18日,万兴剧厂推出3D 导演台,将 AI 视频生成流程重构为“空间建模—元素调度—镜头设置—生成”的分层架构。创作者通过类似“摆积木”的方式,在3D 空间内自由搭建场景、调度演员与机位,并对人物姿势进行精细调节。
学术研究:PrevizWhiz、DepthDirector 与 OmniDirector
2026年4月,CHI 2026会议收录了 Autodesk Research 的 PrevizWhiz,一个将粗粒度3D 场景和2D 视频片段结合、引导生成式视频预可视化的系统。它的目标是让电影制片人获得更快的迭代速度,同时不丢失他们所需的空间和导演控制力。
2026年1月提交 arXiv 的 DepthDirector,通过深度信息作为摄像机控制引导,在保持内容一致性的前提下精确改变摄像机轨迹。
2026年6月,快手相关研究团队发布 OmniDirector 论文并开放代码。它将摄影机参数渲染成“camera grid”运动视频,并使用百万级 camera grid-video 样本训练。在论文自建评估集上,其平移精度 T-Pre 相对第二名 CamCloneMaster 提高39.3%。不过,作者也承认,现有架构在显著延长视频时仍难以保持长期记忆和时间一致性。
从 Seedance 2.5、PrevizWhiz、Reallusion AI Studio 和万兴剧厂3D 导演台,到 OmniDirector、Autodesk Flow Studio 和 updream 预演台,研究模型与创作产品正在逐步汇聚到同一个方向:把3D 空间、人物调度和摄影机重新接到生成模型前端。
四、还有一条平行路线:不做白模,直接实时控制
3D 白模并不是解决可控性的唯一方法。
4月10日,Adobe Research 预览了实验系统 MotionStream。与现有工具“输入提示→等待数十秒→生成”的模式不同,MotionStream 让创作者在视频生成过程中实时交互:用鼠标拖动物体改变运动轨迹、调整摄影机位置、指定哪些对象运动、哪些保持静止。修改结果实时呈现。
背后的模型还能捕捉物理和自然运动——比如拖动大象时,它的腿和耳朵会自然摆动。这提供了一个重要提醒:AI 视频正在从纯 Prompt 生成转向显式控制,但显式控制未必都采用3D 白模。 它还可能表现为摄影机参数、轨迹曲线、深度图、参考视频或实时交互。

五、为什么是现在?
这个趋势的出现,背后有一个行业性的结构变化。
当高质量短镜头不再稀缺时,竞争正在从“能不能生成”转向“能不能让创作者精确控制”。
正如 Autodesk 在发布3D Editor + Canvas 时所说:生成式 AI 工具让创建角色、环境和视觉资产变得越来越快,但下一个挑战是如何把这些元素组织成连贯的、可导演的、可控制的镜头。Autodesk 在发布文中还提到,今年戛纳有关 AI 电影制作的讨论集中在创作者身份、创作意图和控制力——而这些正是传统3D 工作流恰好能提供的。
过去两年,文生视频模型在画质、时长、一致性上取得了飞跃式进步。但“画面好看”只是第一步。当高质量短镜头不再稀缺,创作者真正需要的不是“更逼真”,而是“更可控”。
传统的影视工业早就有一套成熟的预演(Previsualization)流程——先用粗模把镜头、走位、节奏定下来,再进入正式拍摄。AI 视频现在做的事情,本质上是把这道工序重新接回到生成模型的前端。
万兴剧厂的3D 导演台、Reallusion 的 AI Studio、Autodesk 的3D Editor + Canvas、updream 的预演台——尽管实现路径和门槛各不相同,但都在做同一件事:让创作者先导演,再让 AI 去生成。
六、局限与边界
当然,这套路线还远未成熟。
白模控制目前仍停留在“粗粒度”层面。它能规划人物动线、机位和空间关系,但无法处理精细的动作细节。精细建模仍需创作者自行导入。对于完全没有3D 空间编辑经验的新手,仍有一定的学习和适应门槛。
更重要的是,白模只是减少“抽卡”,并没有消灭“抽卡”。实测中白模版仍会出现人物融合、鬼影和镜头偏转。updream 的《好家伙》镜头第一次生成时出现了服务员融合和鬼影;《老男孩》白模版在最后3秒仍出现轻微偏转。它降低了试错成本,但并非一次就能生成完美结果。
七、从“生成”到“导演”
不过,如果把视野拉长一点,这个方向的意义可能不止于“让 AI 视频更好用”。
PrevizWhiz 的定位是“让早期电影预可视化更快、更广泛可及”。Autodesk 将自己的方向概括为 “From generation to direction”——从生成转向导演。
这些工具的终极目标是一致的:把 AI 视频从“抽卡碰运气”,推进为一种更可设计、可迭代、可复用的创作流程,并为真正的工业化生产打下基础。
AI 视频越来越逼真,但创作工具反而把3D 白模接了回来——这不是倒退,恰恰是行业走向成熟的标志。
参考资料
6 Adobe Research:MotionStream Demonstrates Real-Time Control in AI Video Creation https://research.adobe.com/news/motionstream-control-in-ai-video-creation/?utm_source=chatgpt.com
夜雨聆风