ARTICLE · 1100055
AI顶会NeurIPS收录联想车计算与清华AIR联合研究:挖掘VLM与纯视觉模型互补能力,赋能端到端自动驾驶

NeurIPS(Conference on Neural Information Processing Systems)是全球人工智能与机器学习领域顶级学术会议,与ICML、ICL一同被视作AI三大顶会,汇聚全球学术界与产业界顶尖研究力量,聚焦深度学习、具身智能、大模型等前沿方向。会议录用成果代表领域内前沿创新水平,是衡量 AI 基础研究能力的重要标杆。

端到端自动驾驶引入视觉语言动作模型(VLA)后,借助语言增强的视觉骨干网络显著提升复杂场景理解能力。但行业内一直缺少系统性研究,厘清 VLM 和传统纯视觉编码器在经过策略学习之后,表征与驾驶行为上的差异,以及如何利用这类差异优化自动驾驶精度与算力开销之间的平衡。
针对该问题,研究团队基于统一的VLM隐变量+扩散策略框架,对比了InternVL3、Qwen3VL等多系列、不同规模VLM模型,以及ResNet、ViT、EVA-CLIP等纯视觉编码器。研究围绕三大核心问题展开:两类模型表征空间的相似度;二者残留差异是否会带来驾驶行为上的区别;如何利用差异改善自动驾驶性能与算力成本的权衡。

从分析到机制的流水线概述
实验研究得出关键结论:经过策略学习后,VLM策略与纯视觉策略存在大量共享表征子空间,但各自保留无法互相迁移的独有残差子空间。借助Shared-Unique SAE工具验证,这些残差特征会直接影响驾驶行为表现:纯视觉编码器在几何特征主导的常规路况下表现更优;而VLM擅长处理长尾、语义复杂、人车交互密集的交通场景。两类模型还呈现截然不同的驾驶风格,纯视觉模型整体决策更为保守,VLM则倾向于更主动的驾驶策略。
基于上述表征互补特性,团队探索双分支融合方案,在NAVSIM数据集上取得93.58 PDMS的理论上限。研究提出两套可落地的端到端自动驾驶双系统架构:HybridDriveVLA并行运行VLM分支与ViT纯视觉分支,通过学习得到的轨迹打分器完成决策选择,PDMS指标达到92.10,相比VLM基线提升1.30;DualDriveVLA快慢双系统方案仅在15%的复杂场景下调用VLM,最终PDMS达到91.00(较基线提升 0.20),推理延迟相比原生VLM基线实现约1.9倍加速。项目后续将开源相关代码,供行业研究复用。

当前端到端自动驾驶VLA模型在落地过程中持续面临算力成本高、推理时延大的现实瓶颈。这项研究从模型表征底层出发,揭示VLM与纯视觉模型的能力互补规律,提出的双系统架构为端到端自动驾驶实现性能与算力的协同优化提供全新思路。该研究思路同样具备泛化性,可迁移至机器人、具身智能等需要实时决策与复杂语义推理的智能系统研发。
联想车计算持续聚焦高阶自动驾驶大模型产业化落地,围绕算力约束、实时推理、模型部署等产业痛点开展产学研联合创新。依托AD1、AH1系列车载域控制器硬件平台,联想车计算持续探索大模型在高阶辅助驾驶、Robotaxi 场景的工程化落地。本次 NeurIPS 论文录用,是联想车计算与清华大学产学研协同创新的重要阶段性成果,进一步夯实联想在端到端自动驾驶领域的基础研究能力。
未来双方将继续围绕自动驾驶大模型表征学习、多模型协同决策等方向深耕,持续打通前沿理论研究到车载工程落地的链路,推动物理智能在汽车场景的规模化应用,助力下一代智能驾驶系统安全高效演进。
资源链接
论文:https://arxiv.org/abs/2602.10719


往期推荐: