乐于分享
好东西不私藏

机器人的“安卓时刻”要来了?

机器人的“安卓时刻”要来了?
深度分析
阿里亲自下场了:Qwen-Robot三件套,具身智能的底层逻辑正在重写
今天上午,阿里巴巴发布了首个完整的具身智能大模型系列。这不是一次普通的产品发布——它和华为、英伟达的路线之争,将定义未来三年的行业底层架构。
Qwen-Robot 系列 · 三大模型
阿里巴巴 | 千问大模型 | 具身智能 | VLA | 世界模型
QWEN-ROBOT SERIES
三模型同日发布:手 · 脚 · 脑
🤖
Manip操作模型
80维统一动作表征 | 38,000h+开源数据训练 | RoboChallenge 排名第一
🧭
Nav移动模型
5大任务族统一 | 宇树Go2实机验证 | 自主寻物导航
🧠
World世界模型
860万条视频+2亿帧 | 双流MMDiT架构 | 4大基准全第一
阿里 AI 未来研究院 · 通义实验室  |  2026年6月16日发布
核心判断
阿里今天发布的不是某款机器人产品,而是具身智能的"操作系统"——一套覆盖操作、移动和世界理解的基础模型体系。它和华为 Cloud Robo 的工具链路线、英伟达 GR00T 的硬件绑定路线,形成了三条截然不同的竞争路径。对行业来说,这意味着底层架构的选边站已经开始
本文要点
 三件套完整拆解:Manip(手)、Nav(脚)、World(脑)各自解决了什么行业痛点
 180维统一动作表征+全开源数据训练——这套技术路线为什么值得关注
 阿里 vs 华为 vs 英伟达:三条路径的具身智能"操作系统"之争,对整机企业意味着什么
 几个需要冷静思考的问题:开源边界、真机验证、商业闭环
一、三件套拆解:一个上午,三种能力

6月16日上午,阿里巴巴正式发布千问具身智能大模型 Qwen-Robot 系列。三款模型同日推出,覆盖了从操作到移动到世界理解的全链路——这在行业里是第一次。

团队由阿里合伙人、AI未来研究院首席科学家周靖人参与,通义实验室资深专家吴晨飞(北邮博士)领衔。去年10月,通义千问大语言模型负责人林俊旸曾在社交媒体上官宣组建机器人与具身智能团队——八个月后,成果落地。

三款模型分别解决三个不同层级的问题:

1. Qwen-RobotManip:给所有机器人一套通用"肢体语言"

VLA(视觉-语言-动作)模型本身不是新东西,但 RobotManip 的做法和行业主流有本质差异。

传统 VLA 的痛点是什么?换个机器人型号、换个场景,模型性能就大幅下降。因为不同机器人的关节数量、自由度、控制协议完全不同,一套模型只能适配一个硬件。

RobotManip 的思路是把这个问题拆成两个维度来解:

动作统一:用一套80维的统一动作表征,为不同硬件定义通用的"肢体语言"。不教机器人模仿某个具体轨迹,而是让它理解"推"、"拉"、"旋转"这类基础物理动作逻辑。搭载不同硬件时,只需要几轮反馈就能自动适配。

空间统一:不依赖绝对坐标计算,直接基于摄像头画面中的相对位置来规划动作。这意味着换一个工作台、换一个环境,模型不需要重新标定。

最有意思的一组数据:RobotManip 在超过38,000小时的语料上完成了预训练——全程仅使用开源数据。行业常规做法是大量采集私有真机数据(成本极高),但 RobotManip 用纯开源数据就在 RoboChallenge Table30 v1(30项真实任务、4个机器人平台)中拿下两个版本包揽前两名

这对"数据壁垒"论是个有分量的回应。如果开源数据就能做到这个水平,那依赖私有数据建立的护城河,可能没那么宽。

2. Qwen-RobotNav:让机器人"边走边想"

基于 Qwen-VL 构建的视觉语言导航模型,核心创新在于将五大任务族(语言指令导航、目标搜索、自动驾驶等)统一到同一框架——不需要人工按场景切换模型。

记忆策略是另一个亮点。此前的 VLN 模型普遍面临"记少了迷路、记多了混乱"的困境。RobotNav 引入的任务自适应观察机制,能根据当前任务灵活调整记忆策略——找钥匙时关注小物体,找房间时关注空间结构。

实测已在宇树 Go2 四足机器人上跑通。一个典型案例:对搭载该模型的 Go2 说"帮我找找不知道放哪的行李箱",机器人可以自主巡逻的同时进行视觉推理,最终完成任务。

3. Qwen-RobotWorld:"物理世界的第一性原理"

这是三件套里技术含量最高、也最值得业内人士关注的一个。

World Model(世界模型)的核心能力是:给定当前视觉状态和动作,预测未来的视觉轨迹。说出来简单,做出来极难。

RobotWorld 的做法是用自然语言作为全域统一接口——不再依赖不同机器人的底层控制指令,而是让模型理解"把杯子往左边推5厘米"这样的自然语言指令,然后自主规划动作轨迹。

860万条
视频文本对
2亿+帧
训练数据总量
30%/70%
通用数据/具身数据配比
4项第一
四大评测基准全面领先

技术架构上,采用双流 MMDiT 扩散 Transformer + Qwen2.5-VL 动作编码器,支持最高 48,360 个视频 Token 的长时序生成。数据集覆盖20+机器人形态、500+动作语言标注、1300+技能种类。

训练分两阶段:第一阶段基于互联网通用图片和视频构建世界先验(物体形态、光照、基础物理),第二阶段分四步渐进注入70%具身专业数据——从单视角机器人操作到多视角拼接,再到长时序任务和流体/柔性物体交互。

在四大主流基准上的成绩:EWMBench 运动保真度较第二名提升33%,WorldModelBench 物理合规性(牛顿定律、质量守恒、流体、重力)全部满分。

四 大 基 准 成 绩 一 览
EWMBench
运动保真度
4.60
较第二名 +33%
DreamGen
视频生成
4.95
全面第一
PBench
物理行为
0.804
开源第一
WorldModel
物理推理
8.99
物理合规性满分
数据来源:阿里通义实验室  |  2026年6月16日发布

二、技术路线的底层逻辑:为什么这次发布值得认真看

不是所有的"大模型+机器人"都值得写文章。Qwen-Robot 让人认真对待的原因,有三层:

第一层:首套完整体系。在此之前,行业里要么只有VLA(英伟达GR00T、谷歌RT-2),要么只有世界模型(谷歌Genie),要么只有导航模型。但把这三者同时做出来、且都以自然语言为统一接口的,阿里是第一个。这个架构设计的野心是——不是做一个单项冠军,而是做一个能跑通的闭环。

第二层:开源数据达到SOTA。RobotManip 全程仅用开源数据就在 RoboChallenge 中拿到第一名,这在行业内是有信号意义的。如果这条路径可以持续迭代,意味着具身智能的数据门槛可能比目前行业认为的要低。对于那些砸重金自采数据的企业来说,这是个需要重新算账的信号。

第三层:"通用底座"的叙事。阿里没有发布自己的机器人硬件,而是定位为"通用底座"——让不同形态的机器人使用同一套大脑。这个定位意味着它和所有整机企业是合作关系,而非竞争关系。智元、宇树、优必选等原则上都可以接入。相比之下,英伟达GR00T天然绑定自家芯片生态,华为Cloud Robo深度关联鸿蒙。


三、三条路的"操作系统"之争

放在更大的行业格局里看,Qwen-Robot 的发布意味着国内具身智能底层架构进入了"三足"阶段:

阿里 Qwen-Robot:基础模型开源路线
逻辑:做一个通用的基础模型底座,开源或部分开源,让机器人公司各自接入。像Android之于手机——我做大脑,你来做身体。优势:对整机企业没有排他性约束,接入成本低,生态扩展快短板:开源边界尚未明确(三大模型的开源协议今天暂未公布),端侧部署效率待验证
华为 Cloud Robo:开发平台+工具链路线
逻辑:提供全流程开发平台——数据合成、标注、模型训练、仿真测试一站式服务。做"具身智能的云计算",收工具链的钱。优势:和华为云及鸿蒙生态深度绑定,对已有华为体系的客户迁移成本低短板:更像生产力工具而非"大脑",还缺一个像Qwen-Robot这样完整的模型系列
英伟达 GR00T + Cosmos 3:硬件绑定路线
逻辑:开源VLA参考模型+物理世界模拟平台,但天然跑在NVIDIA芯片上。做"物理AI时代的CUDA"。优势:芯片+模型+仿真一体化,计算密度最高短板:深度绑定NVIDIA生态,在中美科技博弈背景下,国内企业的选择空间受限

对整机企业来说,这个局面的影响是实际的:选择接入哪一套底座,不只是技术选型问题,更是供应链自主性的考量。用GR00T意味着依赖英伟达芯片供应,用Cloud Robo意味着深度绑定华为云和鸿蒙,用Qwen-Robot目前看起来最"自由"——但要看开源协议出来之后的具体约束。


四、几个需要冷静思考的问题

在行业普遍叫好的同时,有几个维度值得独立判断:

开源边界尚未明确
RobotWorld 论文已发,"稍晚公布开源信息",但截至下午发稿时,三款模型的具体开源协议尚未正式公开。是全开源、部分开源、还是只开源论文不开源模型——差别很大。对机器人企业来说,接入一个"不透明"的基础模型是有风险的。
真机验证规模有限
目前公开的真机验证只有宇树 Go2 一台机器狗上的寻物导航任务,以及 RoboChallenge 评测(实验室环境)。Manip 和 World 模型在真实工厂产线、复杂光照、多机器人协同等场景下的表现,还需要更多数据点。
商业闭环:谁来买单?
阿里做基础模型的开源路线,如果没法直接从模型上收钱,那就需要从云服务、算力、或者其他地方变现。这和华为 Cloud Robo 的"开发者平台收费"逻辑完全不同。在具身智能这个还在商业化早期阶段的领域,哪条路更快跑通,目前没有答案。

第一,行业底层架构正在成型。一个月前华为发布 Cloud Robo,三周前英伟达发布 GR00T+Cosmos 3,今天阿里发布 Qwen-Robot。具身智能的"基础设施竞赛"在2026年Q2突然加速,本质上是大家都看到了:谁做出"机器人时代的安卓",谁就拿到了下一张生态入场券。

第二,"全开源数据训练到SOTA"是个重要的信号。如果这条路可持续,它会在很大程度上降低行业的进入门槛——不需要几千万的真机数据采集预算就能训出有竞争力的模型。这对大公司是挑战(护城河变浅),对创业公司是利好(追赶成本降低)。

第三,关键是未来6个月。Qwen-Robot 今天发布的三件套是一个完整的技术架构,但技术架构不等于商业生态。接下来要看:开源协议到底怎么定、有几家机器人企业真正接入、真机验证能覆盖多少场景。以及——华为 Cloud Robo 会如何回应?英伟达会在国内机器人企业身上抢到什么份额?这个局的动态比静态更有看头。

今天阿里发布的不是机器人,是机器人怎么想的。
Qwen-Robot 三件套的出现,标志着具身智能从"硬件主导"进入了"模型+硬件"双轮驱动的阶段。底层架构的选边站已经开始,对每一家机器人企业来说,选择接入哪个底座,将直接影响未来三年的技术路线和商业路径。
机器人产业的"安卓时刻"可能比多数人预想的来得更快。
数据来源:量子位、智能纪元AGI、IT之家、新浪财经本文仅供参考,不构成投资建议关注「具身智能落地观察员」,每周获取行业深度分析