Physical Intelligence 联合创始人兼首席科学家,Chelsea Finn在YC上公开分享了机器人最新的业界最新进展。
Chelsea Finn认为,对于机器人和物理智能来说。
如果类比大语言模型的演进历程,“我们已经非常明确地进入了一个类似于 GPT和DALL-E 的时代,这非常令人兴奋,而且我认为我们只用了短短几年就跨越到了这里。”
全文精华如下。
去年,机器人已经可以完成折叠、卸载衣物、叠衣服这类复杂度很高的任务。
今天,机器人又解锁了许多新能力。
不过今天我不想只放各种酷炫的机器人演示视频。
我真正想探讨的,是如何打造通用机器人并让机器人真正在现实世界中稳定完成任务。
这件事分为两大方向:
第一,研发通用基础模型;
第二,把这些模型部署到真实世界,让它们切实给人类带来帮助。
在开始正式的介绍之前,回顾人工智能过去的落地历史会对理解我们的技术阶段有所启发。
2005年前后,机器学习最早一批真正落地商用的案例,是商品推荐、广告排序这类业务。
2015年前后,深度学习开始被用于同样类型的业务场景。
2022年,ChatGPT发布。人类第一次见到一款通用模型,被海量普通用户在现实场景大规模使用。
不过,过去所有已经落地、并且实现盈利的机器学习应用,几乎都是一个模式:最终决策权掌握在人类手里,AI只给出建议。
也就是说,即便AI系统出错,问题也不大,人能够识别错误、自主做出后续判断。
但物理人工智能、机器人领域不一样。
运行在物理世界当中的智能体,它做出的决策会直接改变物理环境。想要真正发挥巨大价值,机器人需要做到稳定、自主、可靠。
这要求我们开发的物理AI系统犯的错误要比目前已部署的机器学习系统少得多
不过有一个振奋人心的案例可以证明这条路走得通:一年前,Waymo自动驾驶每周完成的自动驾驶出行订单突破25万次。
这证明,基于机器学习的系统完全可以稳定可靠、自主地在物理世界运行,这为行业带来了积极的氛围。
那要如何实现呢?
机器学习的第一步永远是收集数据集、训练模型,然后评估模型有多好。
不幸的是,这很少能在第一次就可靠地奏效。
实际上,更好的做法是对你开发的模型进行迭代:
尝试收集更多数据,或者提高数据集中标签的质量、让标签更详细、收集更多边缘案例的数据,调整数据集的平衡等等。
更理想的方案,是让AI自己在场景中迭代 ——
AI自动去寻找需要更多数据的地方、需要更多监督的地方。
如果我们能做到这一点,那么这可能就是从物理AI系统中获得99%以上极高可靠性的方法。
在大语言模型中,我们有PPO和GRPO这样的算法,可以实现非常复杂的推理。
但是这些语言模型的强化学习算法中存在一些巨大的低效之处。
第一个低效之处是,它们在死胡同轨迹上浪费了大量时间。
如果只是消耗算力,这可能还可以接受。但在物理世界中,这代价就太大了。
一个应对方案是:人类提前介入、远程操控机器人,教会它如何从错误状态恢复过来。
第二个方案是针对PPO和GRPO这类算法进行改进。
这类算法会对单个提示进行很多次尝试,本质上是在试图评估这些不同回答中哪个是好回答、哪个是坏回答。
即使对单个提示,它们也会进行大约10次或50次 rollout。
但与其为单个提示收集大量尝试,我们可以将此尝试成本摊销到不同提示之间,学习一个更通用的价值估计——什么是好的、什么是坏的——然后用它来通过自主经验改进。
具体来说,我们可以在大量机器人经验视频上训练一个通用价值函数。
这个价值函数可以学到,比如如果它在试图折叠衣服时意外地把衣服展开了,那是不好的,是在做负面进展——用红色表示。
或者如果它在取得正向进展,它也能识别出来。
同一个价值函数还可以估计一个完全不同场景中什么是好什么是坏——比如从冰箱中取物品。
这种通用的价值模型基本上是在预测到成功的剩余时间,可以显著减少改进经验所需的尝试次数。
通过这两项对强化学习系统的改进,我们基本上有了一套通用的改进算法:
在多样化数据集上训练基础大模型; 让模型在现实世界自主执行任务,必要时人工介入,避免无效轨迹; 训练通用价值函数,判断动作好坏; 使用价值函数,迭代优化模型。
当前,我们实际上只运行了几次该算法的迭代改进,随着更多迭代,我们应该能看到更大的改进和更高的可靠性。
除了智力的通用性之外,如果你想做一个涉及多个不同步骤的长时任务,记忆至关重要。
我们当前的解决方法是:开发了一个具有多时间尺度记忆的系统。
第一层是短期视频记忆,大约有10秒的视频记忆,但计算效率比朴素传入高得多。
第二层是更长期的记忆——对于跨越数分钟或数小时的记忆,我们不一定需要关于过去历史的精确视频。
通过这种多时间尺度的记忆,我们能够让机器人执行长达10到15分钟完全自主的任务。
机器人迎来GPT时代
回看通用AI发展时间线,Physical Intelligence已经迈入了时间线右侧,机器人领域的GPT和DALL·E时代,这非常令人兴奋。

我们的模型已经开始落地真实商业场景。上方两段视频来自两家YC孵化创业公司Ultra和Weave。
现在有两家公司基于PI模型分别进行了后训练,各自落地了衣物折叠、仓库打包业务。
我们的模型还适合各种不同形态的机器人硬件:常见双臂人形机器人、无人机、四旋翼飞行器、手术机器人、拖拉机等等。
物理智能技术不再只停留在实验室演示,已经开始真实落地,产生实际价值。
未来几年,会有越来越多搭载这套技术的机器人部署到现实世界。
夜雨聆风