乐于分享
好东西不私藏

高德ABot:当一个导航App开始"造人",具身智能的全栈突围

高德ABot:当一个导航App开始"造人",具身智能的全栈突围

2026年4月,一只叫"途途"的四足机器狗在北京亦庄机器人半程马拉松上,协助一位视障人士完成了复杂避障和人群穿行。它没有预设路线,没有人工遥控,全程自主感知、自主决策、自主行走。三个月后,它背后的"大脑"一口气拿出五款全新模型,在17项国际权威基准测试中拿下全球第一。做这件事的公司,是高德——那个每天被上亿人用来导航的App。


一、一件反直觉的事

在很多人印象中,高德是一家地图公司——做导航、做打车、做生活服务。但在2026年,高德一口气拿出了ABot全栈具身技术体系,从世界模型到导航基座到操作基座到Agent系统到运控系统,五层全部自研。

这很反直觉。一个做导航的,为什么突然冲进了机器人赛道?

答案藏在"导航"这两个字的另一层含义里。

导航的本质是什么?空间智能。知道自己在哪,知道要去哪,知道怎么走——这三件事,人类司机需要,自动驾驶需要,机器人同样需要。高德过去十几年积累的空间数据——近10亿月活用户产生的海量时空轨迹、覆盖全球190多个国家和地区的3D地图、来自卫星/街景车/众包探针的实时路况——这些不是"地图",而是机器人理解物理世界所需要的先天记忆

当其他机器人公司还在从零构建空间理解能力时,高德已经把这些能力内化成了ABot体系的底层基建。这不是跨界,这是把藏在导航里的通用能力,正式释放给了机器人。


二、ABot是什么:一具三层飞轮,五款模型

2.1 三个层:一个自我进化的闭环

ABot体系的核心设计是三层飞轮架构——它不是一个单点技术的堆叠,而是一个深度咬合、互为引擎的持续进化系统。

数据层:ABot-World

这是ABot体系的底层仿真基座,相当于一个"可编程的物理世界模拟器"。

ABot-World采用14B参数的DiT架构,以观测与动作为输入,在潜空间直接生成符合时空动力学的未来状态序列。它做了三件学术界还没做好的事:

物理合规性:首创Diffusion-DPO物理偏好对齐框架——让VLM生成物理规则清单并独立判别,驱动模型主动抑制违反物理规律的行为。拉格朗日动力学与3DGS重建的融合,使得每一帧画面都成为包含质量、摩擦、接触力等属性的可微分物理快照。
动作可控性:训练+数据双引擎并行架构,累计生产万级3D真实场景、百万级推理数据与千万级训练轨迹,覆盖99%的典型生活场景。
零样本泛化:通过跨形态动作映射,统一支持多种机械形态的精确控制。

在PBench、EZSbench、WorldArena等主流评测中,ABot-World是唯一在物理合规性、动作可控性、零样本泛化三大维度同时达到SOTA的模型。

模型层:ABot-N + ABot-M

这是ABot体系的"运动双核"。

ABot-N是导航基座模型,负责"去哪里"。它是全球首个实现五大核心导航任务"大一统"的VLA基座模型——点位导航、目标导航、指令跟随、兴趣点导航、人物跟随,全用一个模型搞定。在VLN-CE、HM3D-OVON、EVT-Bench等7大权威基准上全面刷新SOTA。

ABot-M是操作基座模型,负责"做什么"。它提出了全球首个动作流形学习——将学习目标由去噪重构转为流形投影,显著提升动作生成的稳定性与解码效率。感知端采用语义流与动作流双流并行架构,提升精细操作的执行精度。在LIBERO、RoboCasa等4项权威基准中全面超越π0.5、UniVLA等强基线。

应用层:ABot-Claw

ABot-Claw是连接大脑与身体的执行中枢。它的角色不只是"把模型能力跑起来",而是解决一个更本质的问题:如何让机器人在真实世界中记住、思考、纠错、协作。

2.2 五款模型:一套完整的"生理系统"

2026年7月22日的升级中,高德将ABot拆解为一套对应机器人"生理系统"的五款模型:

模型
对应部位
核心能力
关键数据
ABot-N1
双脚
通用导航基座——快慢双系统架构
室外导航成功率92.9%,五大任务领先
ABot-M0.5
双手
通用操作基座——双流并行+梦境自愈
RoboCasa复杂任务领先SOTA 20.4%
ABot-ER
大脑
具身推理——感知到行动全流程判断
Embodied Arena 2D-EQA登顶
ABot-AgentOS
中枢
规划/调用/执行解耦——适配异构机器人
跨任务多模态终身记忆
ABot-C0
运动神经
四足机器人统一行为基座
决策传导至动作

这五款模型不是五个独立项目,而是同一个体系的不同层次——数据从底层World向上流动到模型层,模型层的能力通过Claw执行到真实世界,真实世界的经验再回流到World和记忆库,驱动下一轮进化。


三、藏在细节里的技术突破

3.1 快慢双系统:让机器人既"看得清"又"走得稳"

ABot-N1的导航架构借鉴了人类的认知两系统理论。

慢系统负责长程逻辑推理——从当前位置到目的地,规划出宏观路径。快系统负责实时控制——具体到正在走的路,出现障碍物怎么绕、出现偏差怎么调整。

当导航出现偏差时,模型不是硬拉回到预设路线,而是基于慢系统的正确推理将导航权限回退至视觉判断。机器人用自己的眼睛看路,而不是死板地跟着地图走。

这解决了机器人领域一个根深蒂固的问题:导航地图是为人类设计的,路线标在机动车道上,人类司机凭常识知道走人行道安全,但机器人没有这个常识。快慢双系统的设计,让机器人既有地图提供的"先验知识",又有视觉感知提供的"实时判断"。

同时,ABot-N1首创了像素级思维链——能结合视觉画面与语言逻辑完整展现推理过程。机器人为什么选择这条路、为什么避开了那个区域、为什么在路口犹豫了一下——每一步决策都可追溯、可沉淀。这不仅是技术提升,也为机器人的安全审计和失败回溯提供了基础能力。

3.2 梦境自愈:让机器人在"含噪画面"中学会坚持

长程操作任务有一个致命问题:误差累积。

前面99步都走对了,但第100步偏差了1厘米,后面全崩。这是当前机器人操作模型最常见的失败模式。

ABot-M0.5的解法很有洞察力——它不做对每一步的完美控制,而是教会机器人在感知不完美的情况下继续保持操作

"梦境自愈"训练方式的核心是:模型基于自身预测的"含噪视觉画面"继续生成动作。如果动作执行中出现了视觉偏差(比如摄像头有点偏移、光照条件变了、目标物体被部分遮挡),模型不崩溃,而是基于它对任务的理解和对当前"含噪画面"的预测,继续输出合理的动作序列。

这就像一个人在黑暗中摸索开关——视线不好没关系,你知道开关的大概位置,手伸过去摸就是了。

更关键的是,这些"自愈"过程中产生的数据——成功和失败的都有——通过ABot体系高效回流,成为下一轮训练的素材。越跑越强,越难越强。在RoboCasa-365测试中,ABot-M0.5在复杂任务上领先前代SOTA 20.4%。

3.3 Map as Memory:终结"一机一图"的困局

这是ABot体系最有野心的创新。

传统机器人行业有一个几乎无解的工程困境,业内称之为**"一机一图"**。每台机器人部署到新环境,必须从零开始——独立建图、独立冷启动、独立训练。A机器人在办公室学会了怎么找会议室,换了新机器人到同一间办公室,一切从头再来。经验无法沉淀,知识无法复用。

ABot-Claw的"Map as Memory"破掉了这个局。

它在全局空间坐标系上构建了一套四层视觉空间记忆架构:

层级
定义
作用
BlockLayer
区域层
定义室内房间和室外街区
Road Layer
路网层
刻画物理连通性——交叉口、门洞、通道
Function Layer
功能层
标注语义节点——休息区、厨房、电梯厅
Object/POI Layer
对象层
定位实体——特定商铺、物品位置

四层结构让机器人既能在宏观层面理解"回家→进客厅→到沙发"这样的长程任务,又能在微观层面精确知道"沙发前的地毯上放着一只遥控器"。

更重要的是,这个记忆可共享。A机器人发现"三楼会议室门口有饮水机",B机器人到同一栋楼执行任务,直接就知道渴了去哪喝水。知识不再绑定在单一设备上,而是沉淀在共享的世界记忆中,可继承、可累积、可进化。

高德每天处理的海量导航数据——来自卫星、街景车、众包探针——也会实时注入这套记忆系统。机器人不仅能记住"静态的世界",还能感知"变化的世界":临时道路封闭、新开的店铺、调整后的室内布局。

3.4 闭环反思:像人一样"试一下,不行就换"

传统机器人执行任务是线性的:接收指令→执行动作→汇报结果。中间出了岔子,要么卡死,要么报错,等人工干预。

ABot-Claw首创的闭环反思与自我纠错机制,给机器人装了一套"元认知"系统。

每个子任务完成后,Self-Reflector模块会对执行结果进行评估。成功就继续下一步,失败就生成结构化的失败诊断反馈,触发规划器重新规划。

举个真实场景:用户说"我渴了",机器人理解意图后规划去最近的零食货架找饮料。到了货架发现没货——传统机器人可能就此傻眼,宣告任务失败。

但ABot-Claw支持下的途途会怎么做?Self-Reflector确认"零食货架无可乐库存"后,生成反馈:"目标位置无目标物体,建议尝试自动售货机。"规划器接收反馈,重新规划路径,机器人转向自动售货机,最终锁定一瓶可乐,任务圆满完成。

这种"尝试→判断→调整"的循环,是处理真实世界长尾分布的关键。真实世界永远充满意外,模型训练得再好也覆盖不了所有边缘场景。但有了反思能力,机器人可以在遇到意外时自我修正,而不是每次意外都变成一次失败。

3.5 社会导航:让机器人"会做人"

机器人要在人类社会中活动,不能只顾着完成任务。电梯里人多要知道让一让,人行道上有老人要知道绕道走,进了咖啡店不能横冲直撞吓到顾客。

ABot引入强化学习技术,通过多智能体相对评估,让机器人自主学习电梯避让、行人礼让等社会规范。SocialNav社会化导航基座模型以6/6/5几乎满分的成绩入选CVPR 2026 Oral,断层式领先全行业。

这个细节可能比很多技术突破更重要——具身智能从实验室走向真实社会,最大的障碍不是"不会做",而是"不会做人"


四、从"一机一图"到"群体智能":高德的终极棋局

如果把视野从技术细节拉远,高德的策略正在浮现。

4.1 终结定制化部署

过去,每一类机器人应用场景都需要定制化开发。家庭服务机器人一套系统,物流配送一套系统,城市巡检又是一套系统。开发成本高、迭代周期长、经验无法复用。

ABot的策略是**"通用大脑+专用躯体"**。大脑是通用的——ABot-ER负责推理、ABot-AgentOS负责任务调度、Map as Memory负责世界记忆。躯体是专用的——四足机器人在户外跑,人形机器人在工厂干,轮式机器人在商场导购。

大脑和躯体解耦,各自演进。大脑升级了一次,所有形态的机器人都跟着受益。躯体的经验通过共享记忆回流,所有机器人都能学到。这就是体系相对于单机的核心优势——它不是一台机器人在进步,而是整个群体在进步

4.2 自进化飞轮:每天在真实世界中变强

ABot体系内部形成了一个闭环飞轮:

ABot-World生成训练数据 → ABot-N/M获得导航和操作能力 → ABot-Claw驱动机器人在真实世界执行任务 → 真实执行数据(成功+失败)回流到World和记忆库 → 指导下一轮数据生成和模型训练 → 能力螺旋上升

这个飞轮每天都在真实世界中自动运转。不依赖单点技术突破,而是依靠飞轮的"转速"。

高德的优势在于,它有这个飞轮的先天燃料——近10亿月活用户产生的海量时空数据、日均数亿次的导航请求。这些数据本身就在不断更新对物理世界的认知,而机器人只是把这些认知从"给人看"延伸到了"给机器用"。

4.3 开源:做具身智能时代的水电煤

2026年3月31日,高德宣布全量开源ABot-M0——涵盖数据、算法与模型三方面。目前规模最大的通用机器人数据集UniACT(600万+真实操作轨迹、9500+小时数据、覆盖20多种机器人形态)对外开放。动作流形学习算法、双流感知架构等核心技术一并开源。

开源的好处在机器人领域比在软件领域更显著。当越多机器人运行在同一套体系之上,共享的世界记忆就越丰富,每一台新机器人都能从群体智慧中受益。就像AWS之于云计算、Android之于移动互联网——高德想要做的是具身智能时代的底层基础设施


五、对未来的意味

5.1 对机器人行业

ABot体系从根本上改变了机器人的部署模式。过去,机器人厂商卖的是"硬件+定制软件",每部署到新环境都是定制项目。ABot带来的模式是:硬件厂商可以专注于本体设计,智能能力由ABot体系按需提供。

这意味着机器人行业的商业模式可能发生根本性变化——从"卖机器人"转向"卖智能能力"。机器人的价值不再是它硬件有多强,而是它接入的智能体系有多强。

5.2 对AI行业

ABot是"空间智能可以货币化"的验证。高德十几年积累的地图数据,在LLM时代一度被认为价值有限——地图数据是静态的、结构化的,而大模型需要的是开放的、泛化的知识。但具身智能时代,空间数据重新变得珍贵——因为机器人要理解物理世界,而地图数据是物理世界最精确、最结构化的描述。

谁拥有空间数据,谁就拥有具身智能的先天优势。这不仅适用于高德,也适用于百度地图、腾讯地图等所有积累了大量空间数据的公司。

5.3 最直接的影响

途途不是一个概念产品。它在2026年4月的亦庄半马上已经完成了真实世界的实地演示——协助视障人士完成复杂避障、人群穿行。这不是实验室里的演示,而是在真实的城市环境中、面对真实的街道和行人、完成真实的任务。

高德内部对途途的定位很明确:不是做一个技术demo,而是验证"开放环境全自主"这件事是否可行。

当机器狗能在城市街道上导盲,它就能做末端配送、园区巡检、商场导购。当这些能力被封装到ABot体系里,任何形态的机器人只要接入都能获得。"帮我去隔壁买杯咖啡"这件事,正在从一个段子变成真实可交付的功能。


六、核心判断

ABot体系发布的真正意义,不是高德做出了五款好模型,而是它第一次让"机器人群体智能"变得可操作。

"一机一图"的困局不是一个技术问题,而是一个范式问题——过去所有人都在做"更好的单机",没人做"连接所有机器的体系"。ABot的出现,意味着机器人行业正在发生一次范式切换:从"单体能力展示"转向"体系智能竞争"。

这个切换有三个层次的意味:

第一层(对行业):机器人不再是一台台孤立的设备,而是共享世界记忆、统一调度的智能网络节点。部署成本从"每次从头开始"变成"一次部署,终身受益"。
第二层(对厂商):竞争从"谁的硬件更强"转向"谁的体系更完整"。单点技术优势会被体系优势抹平,谁能率先跑通"数据-模型-执行"的飞轮,谁就能建立结构性壁垒。
第三层(对我们所有人):机器人走出实验室的速度,不取决于模型的评测分数,而取决于它能不能在真实世界中持续学习和自我纠错。ABot的自进化飞轮——越跑越强,越用越聪明——如果真能规模化运转,那"机器人走进千家万户"这件事的时间表,可能比所有人预期的都要快。

参考资料:光明网《高德ABot全栈升级》、时代在线《高德ABot让机器人手脚并用》、新智元《ABot-Claw具身智能Harness》、头条《从导航到具身智能全栈体系》、新浪科技《高德发布五款ABot模型》、凤凰网《高德发布全球首个AGI全栈具身技术体系》等。