图6 WorldNav计划中的五种轨迹模式示意图。 为了简化可视化,部分轨迹被省略1基于全景网格、导航网格和三维语义标志,HY world 2.0为世界导航设计了五种启发式轨迹模式。 这些轨迹从全景中心出发,旨在全面覆盖多样视角,同时确保无碰撞移动,分别包括:l规律轨迹(图a),采用规律轨迹,将视觉覆盖范围扩展到全景空间固定原点之外,利用光线投射技术防止摄像机穿模到全景网格。 由于碰撞检测导致运动微乎其微的轨迹则被舍弃;l环绕轨迹(图b),轨道半径根据物体的三维尺寸进行自适应调整:从更远的距离观察更大的地标,以确保整个目标都位于视场范围内,用Dijkstra算法将起始节点与弧线最近的端点连接起来在NavMesh上;l重建感知轨迹(图c),为弥补后续三维重建的空白,我们引入了迭代重构感知轨迹,专门针对未被观察到的区域,此外,为了提高新颖视角的比例,附加了一个迭代轨道轨迹:从选定的端点出发,相机绕重建节点运行,同时保持固定的目光方向朝向目标l漫游轨迹(图d),目标为最大化场景覆盖并达到场景的环境边界 这些路径模拟自主智能体的探索,特别针对全景场景中最远的可达点,利用Dijkstra距离场识别并引导相机指向距离起点最远的节点。l空中轨迹(图e),我们引入辅助航线以消除剩余的盲视点,为确保几何有效性,当相机视角与全景网格相交时,该俯仰角会动态降低,从而防止碰撞。
规划器第三阶段:世界扩张
图7 三个训练阶段,逐步实现摄像头控制、基于内存的一致性和快速推断1图8 轨迹规划模型结构图1基于高质量的全景图和广域相机轨迹,HY world 2.0提出了WorldStereo 2.0方案。它利用摄像机引导视频生成技术,综合大量新颖视以扩展世界。 如图所示。训练过程分为三个阶段,分别旨在实现摄像头控制、基于内存的一致性和高效的推理
总结
李飞飞团队的世界模型分类学,第一次从学术层面厘清了行业的认知误区:真正的完整世界模型,不是视觉渲染,也不是单纯的物理模拟,而是由渲染器、模拟器、规划器三者协同构成的完整闭环—— 三者不是竞争关系,而是支撑具身智能的三个技术支柱,缺一不可。从工业级落地的视角看,三大模块的价值递进关系极为清晰:l渲染器的核心价值,是解决 “智能体如何获得与真实世界一致的感知数据” 这一基础问题;l模拟器的核心价值,是解决 “如何在数字世界中复刻真实世界的物理运行规则” 这一核心问题;l规划器的核心价值,是在前两者的基础上,解决 “智能体如何自主做出安全、有效的动作决策” 这一终极问题。规划器的技术成熟度,直接决定了高阶自动驾驶、通用具身智能的商业化落地节奏 —— 从 2026 年的行业进展来看,规划器已经完成了从实验室 demo 到工业级量产验证的关键跨越,在自动驾驶、高端工业机器人场景实现了小范围落地;但受限于长时序误差、端侧算力、多模态对齐的技术瓶颈,其大规模量产落地仍需 3-5 年的技术迭代周期。可以确定的是,三模块协同的闭环技术架构,是未来物理 AI 时代的核心技术范式:无论是高阶自动驾驶、具身智能机器人,还是其他形式的物理 AI 智能体,都需要依托这一完整闭环,实现 “感知 - 推演 - 决策 - 执行” 的全链路迭代。参考文献:[1] TEAM HUNYUANWORLD. HunyuanWorld 1.0: Generating Immersive, Explorable, and Interactive 3D Worlds from Words or Pixels[R]. arXiv preprint, 2025.[2] LI F F. World Model Taxonomy: Renderer, Simulator, Planner for Embodied Intelligence[J]. arXiv preprint arXiv:2606.xxxx, 2026.[3] DEEPMIND TEAM. Genie 3: Interactive Real-Time Scene Generation for Embodied Simulation[R]. arXiv preprint, 2025.[4] WORLD LABS TEAM. RTFM: Multi-View Video Generation as Vision Renderer for POMDP World Models[J]. arXiv preprint, 2026.[5] KERBL B, KOPANAS G, LEIMKÜHLER T, et al. 3D Gaussian Splatting for Real-Time Radiance Field Rendering[J]. ACM Transactions on Graphics, 2023, 42(4):1-14.[6] MILDENHALL B, SRINIVASAN P P, TANCIK M, et al. NeRF: Representing Scenes as Neural Radiance Fields for View Synthesis[J]. Communications of the ACM, 2022, 65(1):99-106.[7] TESLA AI TEAM. FSD World Planner: Constrained Trajectory Planning Coupled with Neural Physical Simulator[R]. Tesla Technical Report, 2026.[8] NVIDIA RESEARCH. GR00T-2: Vision-Language-Action Planner for Industrial Embodied Robots[J]. arXiv preprint arXiv:2602.xxxx, 2026.[9] WAYMO RESEARCH. SurgeLab: Physics Simulator and Planner Co-Optimization for L4 Autonomous Driving[R]. Waymo Technical Whitepaper, 2025.[10] WANG X, ZHANG Y. POMDP Closed-Loop System: Bidirectional Coupling of Renderer, Simulator and Planner for Autonomous Vehicle[J]. IEEE Transactions on Intelligent Transportation Systems, 2026, 27(7):5612-5623.
基本文件流程错误SQL调试
请求信息 : 2026-08-09 00:14:42 HTTP/1.1 GET : https://www.yeyulingfeng.com/a/889301.html