前两天我干了一件特别离谱的事。因为不是codex 出手机版了吗,我又刚好在耍手机。。 (一键部署搭建教程在文尾,便于大家直接把它发给codex和claude)
偶然看到一张电影截图,一个暖色调的公寓场景,木地板,圆形餐桌,阳台透进来的光,挺有氛围感的。
然后我鬼使神差地打开了手机上的 Codex,对它说了一句话。
「帮我链接电脑,开始渲染这幅图。」
五分钟之后,我的电脑上多了一个完整的 3D 场景。
那一刻我很兴奋,因为我知道ai视频的工作流也许会带来巨大变革,因为以前遇到的同一场景内的不同景别,镜头,也许可以通过使用世界模型建模来解决场景一致性了,而不是一味的更换prompt去抽卡浪费时间。
。。。
我知道你可能觉得我在吹牛。
所以让我把整个过程一步一步给你看。
第一步,一张普通的照片。
就是这张。一个电影画面里的公寓场景。女孩拖着蓝色行李箱走进来,暖色灯光,木地板,阳台落地窗后面是洗衣机和生活杂物。


输入的原图,一张电影画面截图,就是一张普通的 2D 照片
就这么一张普通的图。没有深度信息,没有 3D 数据,什么都没有。
第二步,手机遥控,Codex 开始跑。
我在手机上打开 Codex,这是 OpenAI 三天前刚上线的功能,把手机变成了 AI 编程助手的遥控器。你的手机控制你的电脑,电脑上的 AI 帮你干活。
我跟它说「制作 3D 场景演示视频」,然后它就开始自己跑了。

model.glb、model.obj、model.blend,三种格式全给你了。还有预览图和转盘视频。
下面它还很诚实地列了限制,单张图不能真正知道物体背面和被遮挡的区域,背面是 AI 推断的。然后给了建议,先做一个干净的 MVP。
这套东西背后跑的是一个叫 image-blaster 的开源工具,旧金山一个开发者做的。它底层串了三个 AI 服务,腾讯混元 3D 负责把物体变成 3D 模型,World Labs 的 Marble 负责生成整个场景空间,ElevenLabs 负责生成环境音效。
想自己跑的话,GitHub 开源地址:https://github.com/slashml/image-blaster ,clone 下来装好依赖,填上 API Key,一行命令跑全流程。
第三步,看看它到底生成了什么。
先看带材质贴图的 3D 重建。

image-blaster 生成的 3D 重建场景,左侧面板显示自动识别的资产,场景可以自由转动视角
同一个场景,但你已经可以在里面转视角了。左边面板里列着它自动识别出来的物体,蓝色行李箱、圆形餐桌,每个都是独立的 3D 资产,可以单独导出。
切到线框模式看看底下的真实结构。

线框模式,密密麻麻的三角面网格,能看到每个物体的三维几何轮廓
整个场景的空间结构都被重建出来了。桌子的腿、行李箱的棱角、窗框的厚度,全都有。这不是假的深度图糊弄人,是实打实的三维几何体。
再看它单独提取出来的物体。

自动提取的单体 3D 模型,蓝色行李箱和圆形餐桌,可直接导入任何 3D 软件
蓝色行李箱,轮子、拉杆、箱体,全都有。圆形餐桌,桌面桌腿比例基本对。这些是 .obj 文件,可以直接导进 Blender、Unity、Unreal,随便你用。场景编辑器里你还能实时调参数。

场景编辑器,可以调节太阳光强度、环境光、阴影浓度、世界缩放等参数,还能开关碰撞体
太阳光强度 0.8,环境光 1.5 用的 HDRI,阴影浓度 0.35,地面高度 1.503。这些参数都可以实时拖拽调整,场景会即时响应。
你注意看下面这张图。

AI 生成的 360 度全景图,原图里看不到的大门、沙发、书架、落地灯全被补出来了原图只拍了一个角度。
大门、沙发、书架、落地灯、地毯、茶几,这些在原图里根本看不到的东西,AI 自己推断出来了。而且风格一致,比例合理,灯光连贯。
但别把这套跟 VR 看房的 720 全景搞混。全景贴图本质是 2D 球面图,只能原地转头看。这套生成的是真正的 3D 资产——.glb、.obj 文件,每个物体独立可编辑,能进 Blender 自由移动、布光、导出控制信号。你拿到的不是一张好看的全景图,而是一个可控的 AI 视频片场。
这对 AI 视频制作意味着什么?
好,到这里你可能会说,挺酷的,但跟我有什么关系?
关系太大了。如果你做过 AI 视频,你一定被一个问题折磨过。
场景一致性。
为什么?因为这些视频模型每一帧都是「从头想象」的。它没有一个固定的三维空间在脑子里,每次生成都是即兴发挥。
但如果你手里有一个真正的 3D 场景呢?
这就是这套工作流真正值钱的地方——可控性。
你拍一张照片,用 image-blaster 生成完整的 3D 空间。这个空间不是一张贴图,而是一个真正的三维底座。房间布局是固定的,摄影机路径是你画的,光源方向是你定的,物体位置是你摆的。
空间可控性,解决了。
环境可控性,也解决了。
最后要导进 Blender 微调,但注意一定要让它把每个物体都单独建模好再进去,world lab 的世界模型还不能直接导入blender。

4 月底 Anthropic 一口气放了 9 个创意工具连接器,其中就有 Blender。Claude 通过连接器直接操控 Blender 的脚本接口,你说人话,它翻译成代码执行。
所以你也可以让claude 去帮你操作blender 进行详细的灯光控制和微操。这是我的灯光实验控制,还挺好玩的。

原始场景,自然光氛围,雾气弥漫的工业码头

同一场景,切换到红色警戒灯光,末日废土感

同一场景,霓虹蓝紫灯光,赛博朋克夜景

线框与贴图混合视图,展示 3D 几何结构如何承载视觉表面,导入 Blender 后可精细调整
你在 Blender 里可以做的事情就太多了。修模型拓扑、加细节、换材质、重新布光、设相机动画路径、渲染不同角度的参考帧。
。。。
我有时候觉得,2026 年可能是一个很特殊的年份。
手机变成了 AI 的遥控器。专业软件变成了 AI 的执行器。世界模型让 AI 理解了三维空间。工具之间的壁垒正在被打通。
那些最早学会跟 Agent 协作的人,那些把 AI 当队友的人,会最先跑出来。
夜雨聆风