乐于分享
好东西不私藏

AI 生成的视频开始能“玩”了:你一操作,后面的世界接着生成

AI 生成的视频开始能“玩”了:你一操作,后面的世界接着生成

向前走,画面会继续生成前方的道路和空间。

转动视角,刚才看不到的区域随之出现。

按下动作键,角色可以近战、远程射击或滑翔。再注册一个文字事件,天色可以变暗,场景也可以下起雪。

这些画面不是依次播放事先做好的分支片段。系统收到动作和事件后,再继续生成下一段画面。

过去的 AI 视频生成完就固定了。这里,方向键、动作键和文字事件都进入了生成过程。

Robbyant Team 发布的 LingBot-World 2.0 就在做这件事。它是一个交互式世界模型:从一张起始图片出发,模型根据文字描述、当前画面和新的控制输入,继续生成后续视频帧。

官方演示涉及移动、视角控制、攻击、射箭、施法、射击和文字驱动事件。项目页和 GitHub 上都有短视频,同时提供 Reactor 网页和 LingGuang 移动端体验入口。

已关注
关注
重播 分享

论文于 2026 年 7 月 8 日提交,项目于 7 月 9 日宣布公开技术报告、推理代码和模型。

动作要在生成过程中继续生效

一般的 AI 视频工具收到图片和提示词后,可以把一段短视频整体生成出来。生成结束,内容也就固定了。

交互式系统在运行过程中还要接收新的动作,同时处理三件事:响应要足够快,按键和画面不能明显脱节;新画面要接得上旧画面,走几步之后房间、人物和物体不能突然换一套;生成还要持续往后走,不能到固定秒数就停。

当前公开代码采用因果推理和 KV Cache,按小段连续处理视频帧。每一段新画面都要参考前面的视觉内容和刚收到的控制输入。

官方完整系统做到了什么

项目方称 LingBot-World 2.0 实现了 unbounded interaction horizon,系统可以持续接收动作并往后生成。论文还展示了一次超过一小时的连续生成,包含 20 个不同场景,并把它作为长时稳定性的定性测试。这是项目方自己的测试结果,不是 AIMPC 的独立实测。

速度方面,项目方称完整实时系统可以支撑 720p、60fps。交互也不只限于移动镜头,还包括攻击、射箭、施法、射击,以及下雪、昼夜变化和加入新对象等文字事件。

已关注
关注
重播 分享

论文里的 Director-Pilot 机制也比“两个 Agent 分工”更具体:Director 是视觉语言模型,负责读取当前场景并提出事件变化;Pilot 是视频生成模型,负责把这些变化生成成连续画面。论文还展示了多人进入同一世界的交互界面。

看起来像游戏,还不是游戏引擎

成熟游戏引擎有明确的地图、资产、碰撞检测、角色状态和规则系统。LingBot-World 2.0 主要通过生成后续画面来表现动作结果,并没有因此获得一套稳定、可编辑的游戏状态。

论文自己的限制部分写得很具体。模型可以长时间保持画面连贯,却没有真正的长期记忆:一个区域离开上下文窗口后,再回去时往往会被重新生成,而不是从记忆里还原。

长时间运行后,角色外观和整体风格也可能慢慢变化。

它对物理规律的理解同样来自像素,没有显式的几何和碰撞机制。人物与物体偶尔可能互相穿过,而不是像真实世界那样发生碰撞。

因此,连续生成一小时和拥有一个可以反复回访、规则稳定的世界,并不是同一件事。

当前公开的是 14B 快速版

目前已经公开的是 14B causal-fast 模型权重、推理代码和技术报告,Hugging Face 与 ModelScope 都有下载入口。

官方 Quick Start 基于 Wan2.2,需要 PyTorch 2.4 以上和 FlashAttention。当前示例给出的是 480P、多 GPU 推理,命令通过 torchrun --nproc_per_node=8启动 8 个进程。

前面提到的 720p、60fps 属于完整实时系统,不是当前开源 Quick Start 在一般电脑上的运行效果。

论文摘要还写到一个 1.3B 轻量版可以单卡部署,但截至核验时,项目的 TODO 列表仍把 1.3B 模型标为未公开。项目也明确写明不计划开放部署代码。

代码和模型采用 CC BY-NC-SA 4.0,只允许非商业使用。

我们现在能用到什么

如果你不想安装 14B 模型,可以先通过 Reactor 网页或 LingGuang 移动端体验实时版本。README文档里也同时提醒,这两个入口是方便体验的第三方版本,与项目方完整配置下的能力可能不同。

我们可以借它来观察动作、角色行为和环境事件怎样进入同一段生成过程,但它目前不适合替代正式的剪辑、建模和游戏开发流程。

开发人员也可以下载 14B 模型和推理代码,研究动作控制、连续生成和缓存机制。官方示例按多 GPU 配置给出,实际门槛并不低,还要遵守非商业许可。

它和机器人有什么关系

机器人执行动作前,也需要判断动作之后环境可能怎样变化。世界模型研究的正是“当前状态加动作,预测后续状态”这类能力。

但 LingBot-World 2.0 当前展示的重点是交互式视觉世界,不直接输出机器人控制指令,也不能据此当成可靠的机器人训练环境。

Robbyant 同期还公开了 LingBot-VLA 2.0。官方资料写明,它的预训练数据约 60,000 小时,其中 50,000 小时机器人轨迹覆盖 20 种机器人配置,另有 10,000 小时第一视角人类视频。直接面向真实机器人应用的是这条 VLA 线。

判断这种系统,可以问一个很具体的问题:离开一个房间再回来,它记住的是同一个地方,还是重新生成了一个相似的地方?

能一直往前生成,和能记住你走过的世界,还不是一回事。

资料链接:

LingBot-World 2.0 项目: https://github.com/Robbyant/lingbot-world-v2

项目页: https://technology.robbyant.com/lingbot-world-v2

论文: https://arxiv.org/abs/2607.07534

Hugging Face 模型: https://huggingface.co/robbyant/lingbot-world-v2-14b-causal-fast

ModelScope 模型: https://modelscope.cn/models/Robbyant/lingbot-world-v2-14b-causal-fast

Reactor 在线体验: https://www.reactor.inc/lingbot-world-v2

LingGuang 移动端入口: https://www.lingguang.com/support

LingBot-VLA 2.0: https://github.com/Robbyant/lingbot-vla-v2

LingBot-VLA 2.0 论文: https://arxiv.org/abs/2607.06403