乐于分享
好东西不私藏

AI规划终于可以跳过过程直达终点了

AI规划终于可以跳过过程直达终点了

自回归这玩意儿,真是把太多领域都拖慢了。

大语言模型一个字一个字往外蹦,慢。世界模型做视觉规划,给定当前画面和一个动作,预测执行后的下一个画面,再基于新画面预测再下一步,也慢。要预测连续五个动作之后的状态,就得把这个预测下一步的流程重复五遍。

这不仅仅是慢的问题。每一步预测都带点小偏差,五步叠下来,误差滚成一团,预测画面可能跟真实情况差出十万八千里。

西安交大放出来的Fast-LeWM,换了个思路。它不一步步推演了,把一整串动作打包扔进模型,直接输出最终状态。规划速度一下快了4倍。

把一串动作当一句话翻译

传统LeWM的做法,相当于逐字翻译。当前状态是,加一个动作预测下一个状态是,再加一个动作预测再下一个状态是。串行跑三遍。

Fast-LeWM的做法是整句翻译。把三个字对应的动作前缀一起编码,一步输出整句话的意思。

具体怎么做的。模型不再以单个动作为基本单位,而以动作前缀为单位。一个包含五个动作的序列,它的所有前缀——只做第一个动作会到哪,做前两个会到哪,做前三个会到哪——全部并行编码和预测。

到了规划的时候,预测器只需要用编码序列里最后一个前缀token,就能一步输出执行完整串动作之后到达的最终状态。中间那些过渡状态,一个都不用算。

又快又准这件事,背后有道理

速度提升4倍好理解。把串行改并行,肯定快。

但更值得说的是论文里那张开环潜损失曲线。Fast-LeWM不但起步损失更低,而且随着预测视野拉长,损失的增长速度明显比传统方法慢。

原因出在误差传递链上。传统自回归推演,每一步预测误差都会传给下一步。视野越长,误差叠得越离谱。Fast-LeWM直接学习从起点执行某段动作后到终点的映射,跳过了中间误差传递的链条,反而更准。

训练方式也起了关键作用。传统方法是让模型学单步状态转移,Fast-LeWM用前缀级监督,逼着模型学做了前k个动作后状态会变成什么样。这种多视野、多粒度的学习,让模型对状态演化的理解更结构化,不是死记硬背单步映射。

具身智能团队可能会盯上这个方向

Fast-LeWM的论文已在arXiv公开,代码等论文接收后会放出。

对做机器人视觉规划和自动驾驶决策的团队来说,这个方向价值很直接。具身智能场景里,机器人执行一个任务通常需要连续十几个动作,实时规划的要求下每一步推演延迟都算在总反应时间里。把串行推演改成并行前缀预测,减少的是整个规划链路的系统性延迟。

自动驾驶的长尾场景规划也类似。复杂路口需要快速评估直行、左转、右转、紧急制动多条候选轨迹,每条都是一串连续动作。候选越多、视野越长,传统自回归推演越慢。并行前缀预测如果迁移过来,规划模块的响应速度会有质变。

更值得琢磨的是论文里那个发现:直接学习不同长度的前缀效果,可能比学单步转移再组合更有效。这件事如果具有普适性,影响的就不只是世界模型。天气预测、交通流推演、金融时间序列,任何需要预测序列演化结果的场景,都可能被这个思路重新审视。

有些惯性思维,早该被打破了

我们做序列预测的时候,默认路径一直是先算第一步,再算第二步。这个惯性太强了,强到很少有人停下来想,能不能跳过中间直接算最后一步。

Fast-LeWM提醒了一件事:如果训练的时候就让模型同时学习不同粒度的预测,做一步会到哪、做三步会到哪、做五步会到哪,那推理的时候它完全可以跳过中间步骤,直接从起点看到终点。

道理简单得让人拍大腿。但把动作前缀并行预测真正做进世界模型,还证明又快又准的,这是第一个。

相关资源:

  • 📄 arXivhttps://arxiv.org/abs/2606.26217
  • 🧬 Githttps://github.com/Yuntian-Gao/Fast-LeWorldModel(代码待论文接收后发布,建议点      Watch 关注更新)