乐于分享
好东西不私藏

“物理AI和机器人已经进入了类似GPT的时代”—— Physical Intelligence 首席科学家分享最新进展

“物理AI和机器人已经进入了类似GPT的时代”—— Physical Intelligence 首席科学家分享最新进展

Physical Intelligence 联合创始人兼首席科学家,Chelsea Finn在YC上公开分享了机器人最新的业界最新进展。

Chelsea Finn认为,对于机器人和物理智能来说。

如果类比大语言模型的演进历程,“我们已经非常明确地进入了一个类似于 GPT和DALL-E 的时代,这非常令人兴奋,而且我认为我们只用了短短几年就跨越到了这里。”

全文精华如下。


各位,今天我将为大家讲解物理智能(Physical Intelligence)的前沿进展。
两年前,我创办了一家名叫物理智能(Physical Intelligence)的公司。
我们真正关心的问题是:究竟如何让打造一台通用机器人,都能在现实世界中完成任意任务。

去年,机器人已经可以完成折叠、卸载衣物、叠衣服这类复杂度很高的任务。

今天,机器人又解锁了许多新能力。

不过今天我不想只放各种酷炫的机器人演示视频。

我真正想探讨的,是如何打造通用机器人并让机器人真正在现实世界中稳定完成任务。

这件事分为两大方向:

第一,研发通用基础模型;

第二,把这些模型部署到真实世界,让它们切实给人类带来帮助。

在开始正式的介绍之前,回顾人工智能过去的落地历史会对理解我们的技术阶段有所启发。

2005年前后,机器学习最早一批真正落地商用的案例,是商品推荐、广告排序这类业务。

2015年前后,深度学习开始被用于同样类型的业务场景。

2022年,ChatGPT发布。人类第一次见到一款通用模型,被海量普通用户在现实场景大规模使用。

不过,过去所有已经落地、并且实现盈利的机器学习应用,几乎都是一个模式:最终决策权掌握在人类手里,AI只给出建议

也就是说,即便AI系统出错,问题也不大,人能够识别错误、自主做出后续判断。

但物理人工智能、机器人领域不一样。

运行在物理世界当中的智能体,它做出的决策会直接改变物理环境。想要真正发挥巨大价值,机器人需要做到稳定、自主、可靠。

这要求我们开发的物理AI系统犯的错误要比目前已部署的机器学习系统少得多

不过有一个振奋人心的案例可以证明这条路走得通:一年前,Waymo自动驾驶每周完成的自动驾驶出行订单突破25万次。

这证明,基于机器学习的系统完全可以稳定可靠、自主地在物理世界运行,这为行业带来了积极的氛围。

那要如何实现呢?

机器学习的第一步永远是收集数据集、训练模型,然后评估模型有多好。

不幸的是,这很少能在第一次就可靠地奏效。

实际上,更好的做法是对你开发的模型进行迭代:

尝试收集更多数据,或者提高数据集中标签的质量、让标签更详细、收集更多边缘案例的数据,调整数据集的平衡等等。

更理想的方案,是让AI自己在场景中迭代 —— 

AI自动去寻找需要更多数据的地方、需要更多监督的地方。

如果我们能做到这一点,那么这可能就是从物理AI系统中获得99%以上极高可靠性的方法。

在大语言模型中,我们有PPO和GRPO这样的算法,可以实现非常复杂的推理。

但是这些语言模型的强化学习算法中存在一些巨大的低效之处。

第一个低效之处是,它们在死胡同轨迹上浪费了大量时间。

如果只是消耗算力,这可能还可以接受。但在物理世界中,这代价就太大了。

一个应对方案是:人类提前介入、远程操控机器人,教会它如何从错误状态恢复过来。

第二个方案是针对PPO和GRPO这类算法进行改进。

这类算法会对单个提示进行很多次尝试,本质上是在试图评估这些不同回答中哪个是好回答、哪个是坏回答。

即使对单个提示,它们也会进行大约10次或50次 rollout。

但与其为单个提示收集大量尝试,我们可以将此尝试成本摊销到不同提示之间,学习一个更通用的价值估计——什么是好的、什么是坏的——然后用它来通过自主经验改进。

具体来说,我们可以在大量机器人经验视频上训练一个通用价值函数。

这个价值函数可以学到,比如如果它在试图折叠衣服时意外地把衣服展开了,那是不好的,是在做负面进展——用红色表示。

或者如果它在取得正向进展,它也能识别出来。

同一个价值函数还可以估计一个完全不同场景中什么是好什么是坏——比如从冰箱中取物品。

这种通用的价值模型基本上是在预测到成功的剩余时间,可以显著减少改进经验所需的尝试次数。

通过这两项对强化学习系统的改进,我们基本上有了一套通用的改进算法:

  1. 在多样化数据集上训练基础大模型;
  2. 让模型在现实世界自主执行任务,必要时人工介入,避免无效轨迹;
  3. 训练通用价值函数,判断动作好坏;
  4. 使用价值函数,迭代优化模型。

当前,我们实际上只运行了几次该算法的迭代改进,随着更多迭代,我们应该能看到更大的改进和更高的可靠性。

除了智力的通用性之外,如果你想做一个涉及多个不同步骤的长时任务,记忆至关重要。

我们当前的解决方法是:开发了一个具有多时间尺度记忆的系统。

第一层是短期视频记忆,大约有10秒的视频记忆,但计算效率比朴素传入高得多。

第二层是更长期的记忆——对于跨越数分钟或数小时的记忆,我们不一定需要关于过去历史的精确视频。

通过这种多时间尺度的记忆,我们能够让机器人执行长达10到15分钟完全自主的任务。

机器人迎来GPT时代

回看通用AI发展时间线,Physical Intelligence已经迈入了时间线右侧,机器人领域的GPT和DALL·E时代,这非常令人兴奋。

我们的模型已经开始落地真实商业场景。上方两段视频来自两家YC孵化创业公司Ultra和Weave。

现在有两家公司基于PI模型分别进行了后训练,各自落地了衣物折叠、仓库打包业务。

我们的模型还适合各种不同形态的机器人硬件:常见双臂人形机器人、无人机、四旋翼飞行器、手术机器人、拖拉机等等。

物理智能技术不再只停留在实验室演示,已经开始真实落地,产生实际价值。

未来几年,会有越来越多搭载这套技术的机器人部署到现实世界。