自回归这玩意儿,真是把太多领域都拖慢了。
大语言模型一个字一个字往外蹦,慢。世界模型做视觉规划,给定当前画面和一个动作,预测执行后的下一个画面,再基于新画面预测再下一步,也慢。要预测连续五个动作之后的状态,就得把这个“预测下一步”的流程重复五遍。
这不仅仅是慢的问题。每一步预测都带点小偏差,五步叠下来,误差滚成一团,预测画面可能跟真实情况差出十万八千里。
西安交大放出来的Fast-LeWM,换了个思路。它不一步步推演了,把一整串动作打包扔进模型,直接输出最终状态。规划速度一下快了4倍。
把一串动作当一句话翻译
传统LeWM的做法,相当于逐字翻译。当前状态是“我”,加一个动作预测下一个状态是“爱”,再加一个动作预测再下一个状态是“你”。串行跑三遍。
Fast-LeWM的做法是整句翻译。把“我→爱→你”三个字对应的动作前缀一起编码,一步输出整句话的意思。
具体怎么做的。模型不再以单个动作为基本单位,而以“动作前缀”为单位。一个包含五个动作的序列,它的所有前缀——只做第一个动作会到哪,做前两个会到哪,做前三个会到哪——全部并行编码和预测。
到了规划的时候,预测器只需要用编码序列里最后一个前缀token,就能一步输出执行完整串动作之后到达的最终状态。中间那些过渡状态,一个都不用算。
又快又准这件事,背后有道理
速度提升4倍好理解。把串行改并行,肯定快。
但更值得说的是论文里那张开环潜损失曲线。Fast-LeWM不但起步损失更低,而且随着预测视野拉长,损失的增长速度明显比传统方法慢。
原因出在误差传递链上。传统自回归推演,每一步预测误差都会传给下一步。视野越长,误差叠得越离谱。Fast-LeWM直接学习“从起点执行某段动作后到终点”的映射,跳过了中间误差传递的链条,反而更准。
训练方式也起了关键作用。传统方法是让模型学单步状态转移,Fast-LeWM用前缀级监督,逼着模型学“做了前k个动作后状态会变成什么样”。这种多视野、多粒度的学习,让模型对状态演化的理解更结构化,不是死记硬背单步映射。
具身智能团队可能会盯上这个方向
Fast-LeWM的论文已在arXiv公开,代码等论文接收后会放出。
对做机器人视觉规划和自动驾驶决策的团队来说,这个方向价值很直接。具身智能场景里,机器人执行一个任务通常需要连续十几个动作,实时规划的要求下每一步推演延迟都算在总反应时间里。把串行推演改成并行前缀预测,减少的是整个规划链路的系统性延迟。
自动驾驶的长尾场景规划也类似。复杂路口需要快速评估直行、左转、右转、紧急制动多条候选轨迹,每条都是一串连续动作。候选越多、视野越长,传统自回归推演越慢。并行前缀预测如果迁移过来,规划模块的响应速度会有质变。
更值得琢磨的是论文里那个发现:直接学习不同长度的前缀效果,可能比学单步转移再组合更有效。这件事如果具有普适性,影响的就不只是世界模型。天气预测、交通流推演、金融时间序列,任何需要预测序列演化结果的场景,都可能被这个思路重新审视。
有些惯性思维,早该被打破了
我们做序列预测的时候,默认路径一直是“先算第一步,再算第二步”。这个惯性太强了,强到很少有人停下来想,能不能跳过中间直接算最后一步。
Fast-LeWM提醒了一件事:如果训练的时候就让模型同时学习不同粒度的预测,做一步会到哪、做三步会到哪、做五步会到哪,那推理的时候它完全可以跳过中间步骤,直接从起点看到终点。
道理简单得让人拍大腿。但把“动作前缀并行预测”真正做进世界模型,还证明又快又准的,这是第一个。
相关资源:
- 📄 arXiv:https://arxiv.org/abs/2606.26217
- 🧬 Git:https://github.com/Yuntian-Gao/Fast-LeWorldModel(代码待论文接收后发布,建议点 Watch 关注更新)
夜雨聆风