夜雨聆风学习资料网

ARTICLE · 992616

以后还需要打开 App 吗?Runway Solaris 想让 AI 实时生成整个界面

以后还需要打开 App 吗?Runway Solaris 想让 AI 实时生成整个界面
现在的网页和 App,基本都遵循同一套逻辑:设计师画出界面,工程师把它翻译成代码,用户再按照开发者预先设计好的按钮、菜单和流程进行操作。
Runway 最近公布了一个大胆的方向:如果界面不再由固定代码提前写死,而是由 AI 根据用户的动作实时生成,会发生什么?
这个名为 Solaris 的系统,被 Runway 称为 Interface World Model,也就是“界面世界模型”。它不是只生成一张网页截图,也不是把设计稿转换成 HTML,而是尝试让整个视觉界面在用户点击、拖拽和输入时持续变化。
简单说,过去的软件是“先写好,再使用”;Solaris 想探索的是“边使用,边生成”。

什么是“界面世界模型”

理解 Solaris,先要区分三种东西:图片、代码界面和界面世界模型。
一张图片可以很好地呈现视觉效果,但它不能真正响应点击;一套代码界面可以响应点击,却需要开发者提前写好每一种行为;而界面世界模型试图直接学习“画面、用户动作和下一步变化”之间的关系。
可以把它看成一个会动的数字场景:
用户点击、拖动或输入          ↓模型理解这次动作和当前场景          ↓生成下一帧画面与对应变化          ↓用户继续操作,场景持续演化
传统 App 更像一张有固定路线的地铁图,用户只能沿着设计好的站点前进;Solaris 更像一个可以随时改造的房间,用户说“把桌子移开一点”或“把沙发换成蓝色”,界面会直接在当前场景中做出反应。

它和普通 AI 生成网页有什么不同

今天的 AI 已经可以根据一句话生成网页代码,也可以根据截图还原一个网站。
但这中间有一道“翻译”:AI 先理解视觉设计,再把设计转换成 HTML、CSS、JavaScript 或其他中间表示。最终用户看到的,是代码对原始视觉意图的一次近似重建。
Solaris 的思路是绕过这一步,让模型直接生成界面画面,并同时理解用户行为。
这带来三个明显变化:

1. 界面首先是视觉场景

在传统软件里,视觉效果和功能逻辑通常是两套系统。Solaris 试图让一张视觉场景本身就成为可交互的应用。
比如,虚拟服装店不必只是商品卡片和按钮,用户可以直接从货架上拿起衣服,拖到自己的照片上试穿,再重新布置展示空间。
关注
重播 分享

2. 界面是持续“活着”的

传统网页通常等用户做出操作后才更新。生成式界面则可以持续变化:光线会移动,物体会产生反馈,场景会随着用户的动作逐步演化。
关注
重播 分享

3. 交互不必完全预先写死

开发者通常需要提前定义“点击这里会发生什么”。而在 Solaris 的设想里,用户可以直接与场景里的对象互动,模型根据上下文决定这个对象如何响应。
这意味着,同一个画面可能因为用户的不同表达,产生过去没有被开发者预先设计过的行为。

Solaris 是怎样工作的

根据 Runway 的介绍,Solaris 建立在其 Gen-4.5 视频生成模型之上,并结合了此前的 GWM-1 世界模型研究。
关注
重播 分享
它主要做了三件事。

1.让模型理解交互

点击、拖动等用户动作会被当作下一帧画面的条件输入。模型不需要看到未来的操作,只根据已经发生的动作和当前场景推测接下来应该发生什么。
例如,用户拖动一个物体,模型需要同时考虑物体的位置、大小、材质和周围环境,而不是简单地把一个图片元素从左边搬到右边。

2.把生成速度提升到实时

普通视频扩散模型往往需要经过多轮去噪,生成一个视频片段可能需要几秒甚至更久,这很难支持用户连续点击。
Runway 描述的优化路径包括:让模型逐帧自回归生成、减少去噪步骤,以及让快速模型使用自己的输出继续训练,以保持长时间交互时的画面质量。

3.让语言模型负责“想”,视觉模型负责“呈现”

Solaris 并不是单独完成所有事情。一个语言模型负责理解用户意图,判断当前场景应该如何变化,并生成引导提示;界面世界模型负责把这个变化渲染成下一帧画面。
可以把两者理解成导演和摄影师:语言模型决定下一场戏演什么,Solaris 负责把它即时拍出来。

它可能带来哪些新体验

Runway 认为,界面世界模型可能改变几类产品。

1.个性化的购物空间

未来的商店不一定给每个人展示同一个固定页面。用户可以通过自然动作改变商品排列、颜色和空间布局,产品展示会围绕自己的意图实时调整。

2.更适合自己的互动教程

传统教程让所有人观看同一套步骤;生成式教程可以根据用户当前的操作,实时展示下一步。如果用户操作偏离流程,系统也可以在当前上下文里进行引导,而不是简单提示“请返回上一步”。

3.可操作的科学演示

例如生成一个燃烧实验,用户更换材料、调整条件,就能看到场景随操作变化。它不再只是播放一段固定动画,而是让用户在视觉环境中进行探索。

4.不再以 App 作为唯一入口

如果操作系统能够根据任务临时生成合适的界面,那么用户未必需要先找到对应的 App。想订酒店、比较商品或整理资料时,系统可以围绕当前目标生成一个临时工作空间。
这是一个很大的设想,但它也意味着软件的基本单位可能从“预先制作好的应用”转向“按需生成的交互环境”。

Runway 的测试结果说明了什么

Runway 在介绍中做了两类评估。
第一类是视觉重建测试:让多模态模型根据截图重建网页、海报和自然场景,再比较重建结果与原始画面的相似度。Runway 的结论是,随着画面复杂度增加,传统“截图—语言描述—代码重建”的方式会损失更多细节。
第二类是交互对比测试:让 Solaris 和一个代码生成方案从同一张图片开始,接受相同的互动请求,再由 250 名参与者对 30 组案例进行比较。
按照 Runway 公布的数据,参与者在“是否遵循指令”这一项上更偏好 Solaris,比例为 61% 对 24%;在“行为是否自然”这一项上,Solaris 的偏好比例为 71% 对 21%。
这些结果说明,在该测试集和测试方法下,参与者更喜欢 Solaris 生成的交互效果。但它们并不等于 Solaris 已经可以替代所有真实网页,也不代表任何复杂任务都应该使用生成式界面。

它现在还解决不了什么

Solaris 的概念很有想象力,但 Runway 自己也承认仍有几项关键难题。

1.文字仍然是硬问题

生成式视频擅长动态视觉,却经常难以稳定生成清晰、准确、不会变形的文字。但真实软件大量依赖文字:商品名称、价格、按钮、表格和法律条款都不能随意出错。
因此,一个现实的混合方案可能是:图像和视频模型负责连续的视觉交互,文字密集页面仍使用传统渲染或在可接受的等待时间内单独生成。

2.“看起来正确”不等于事实正确

如果一个商业界面把错误的产品参数、价格或库存生成得非常逼真,问题会比普通页面报错更严重。
Solaris 目前需要依靠起始画面、参考图片和外部资料来约束生成结果。如何在交互过程中持续接入经过验证的商品数据、文档和品牌信息,仍是重要研究方向。

3.长时间运行的一致性

生成几帧画面并不难,难的是让一个场景在长时间操作后仍然保持人物、物体、文字、布局和逻辑的一致。
如果一张桌子被拖动几次后逐渐变形,或者商品在连续操作中改变了身份,用户很快就会失去信任。

4.可访问性和系统集成

真正的软件需要支持屏幕阅读器、键盘操作、辅助功能 API、支付系统和数据接口。视觉上灵活的生成界面,如何与这些成熟的软件基础设施兼容,目前还没有简单答案。

最现实的判断:它更像新的交互层,而不是马上替代网页

Solaris 目前仍是 Runway 正在探索的早期系统,官方介绍中提供的是早期访问申请,而不是面向所有人的成熟产品。
短期内,传统代码界面仍然有几个不可替代的优势:可预测、易测试、成本相对可控、文字稳定、无障碍支持成熟,也更容易进行权限和安全审计。
生成式界面的优势,则在于视觉表达、个性化和开放式互动。它尤其适合那些本来就像“空间”或“演示”的场景,例如虚拟展厅、教育模拟、创意工具、互动广告和游戏化体验。
比较合理的未来形态,可能不是所有页面都由模型逐帧生成,而是让传统代码与生成式界面协同:关键数据、支付、账号和核心业务逻辑由可靠代码负责,视觉呈现和探索式交互由世界模型动态生成。

未来的软件,可能不再只是“写出来”的

Runway Solaris 提出的真正问题,并不是“AI 能不能生成一个更漂亮的网页”,而是:软件是否一定要先被完整写好,用户才能开始使用?
如果界面可以根据用户的意图实时生成,那么未来的操作系统、网站和应用,可能会越来越像可交互的数字环境,而不是一组固定页面。
但这条路要真正走向大众,还需要解决速度、稳定性、文字准确性、事实可信度、成本和无障碍等问题。
Solaris 更像一次重要的方向展示:AI 正在从生成内容,走向生成我们与软件互动的方式。

相关学习资料

返回首页浏览学习资料