6月16日上午,阿里巴巴正式发布千问具身智能大模型 Qwen-Robot 系列。三款模型同日推出,覆盖了从操作到移动到世界理解的全链路——这在行业里是第一次。
团队由阿里合伙人、AI未来研究院首席科学家周靖人参与,通义实验室资深专家吴晨飞(北邮博士)领衔。去年10月,通义千问大语言模型负责人林俊旸曾在社交媒体上官宣组建机器人与具身智能团队——八个月后,成果落地。
三款模型分别解决三个不同层级的问题:
VLA(视觉-语言-动作)模型本身不是新东西,但 RobotManip 的做法和行业主流有本质差异。
传统 VLA 的痛点是什么?换个机器人型号、换个场景,模型性能就大幅下降。因为不同机器人的关节数量、自由度、控制协议完全不同,一套模型只能适配一个硬件。
RobotManip 的思路是把这个问题拆成两个维度来解:
动作统一:用一套80维的统一动作表征,为不同硬件定义通用的"肢体语言"。不教机器人模仿某个具体轨迹,而是让它理解"推"、"拉"、"旋转"这类基础物理动作逻辑。搭载不同硬件时,只需要几轮反馈就能自动适配。
空间统一:不依赖绝对坐标计算,直接基于摄像头画面中的相对位置来规划动作。这意味着换一个工作台、换一个环境,模型不需要重新标定。
最有意思的一组数据:RobotManip 在超过38,000小时的语料上完成了预训练——全程仅使用开源数据。行业常规做法是大量采集私有真机数据(成本极高),但 RobotManip 用纯开源数据就在 RoboChallenge Table30 v1(30项真实任务、4个机器人平台)中拿下两个版本包揽前两名。
这对"数据壁垒"论是个有分量的回应。如果开源数据就能做到这个水平,那依赖私有数据建立的护城河,可能没那么宽。
基于 Qwen-VL 构建的视觉语言导航模型,核心创新在于将五大任务族(语言指令导航、目标搜索、自动驾驶等)统一到同一框架——不需要人工按场景切换模型。
记忆策略是另一个亮点。此前的 VLN 模型普遍面临"记少了迷路、记多了混乱"的困境。RobotNav 引入的任务自适应观察机制,能根据当前任务灵活调整记忆策略——找钥匙时关注小物体,找房间时关注空间结构。
实测已在宇树 Go2 四足机器人上跑通。一个典型案例:对搭载该模型的 Go2 说"帮我找找不知道放哪的行李箱",机器人可以自主巡逻的同时进行视觉推理,最终完成任务。
这是三件套里技术含量最高、也最值得业内人士关注的一个。
World Model(世界模型)的核心能力是:给定当前视觉状态和动作,预测未来的视觉轨迹。说出来简单,做出来极难。
RobotWorld 的做法是用自然语言作为全域统一接口——不再依赖不同机器人的底层控制指令,而是让模型理解"把杯子往左边推5厘米"这样的自然语言指令,然后自主规划动作轨迹。
技术架构上,采用双流 MMDiT 扩散 Transformer + Qwen2.5-VL 动作编码器,支持最高 48,360 个视频 Token 的长时序生成。数据集覆盖20+机器人形态、500+动作语言标注、1300+技能种类。
训练分两阶段:第一阶段基于互联网通用图片和视频构建世界先验(物体形态、光照、基础物理),第二阶段分四步渐进注入70%具身专业数据——从单视角机器人操作到多视角拼接,再到长时序任务和流体/柔性物体交互。
在四大主流基准上的成绩:EWMBench 运动保真度较第二名提升33%,WorldModelBench 物理合规性(牛顿定律、质量守恒、流体、重力)全部满分。
不是所有的"大模型+机器人"都值得写文章。Qwen-Robot 让人认真对待的原因,有三层:
第一层:首套完整体系。在此之前,行业里要么只有VLA(英伟达GR00T、谷歌RT-2),要么只有世界模型(谷歌Genie),要么只有导航模型。但把这三者同时做出来、且都以自然语言为统一接口的,阿里是第一个。这个架构设计的野心是——不是做一个单项冠军,而是做一个能跑通的闭环。
第二层:开源数据达到SOTA。RobotManip 全程仅用开源数据就在 RoboChallenge 中拿到第一名,这在行业内是有信号意义的。如果这条路径可以持续迭代,意味着具身智能的数据门槛可能比目前行业认为的要低。对于那些砸重金自采数据的企业来说,这是个需要重新算账的信号。
第三层:"通用底座"的叙事。阿里没有发布自己的机器人硬件,而是定位为"通用底座"——让不同形态的机器人使用同一套大脑。这个定位意味着它和所有整机企业是合作关系,而非竞争关系。智元、宇树、优必选等原则上都可以接入。相比之下,英伟达GR00T天然绑定自家芯片生态,华为Cloud Robo深度关联鸿蒙。
放在更大的行业格局里看,Qwen-Robot 的发布意味着国内具身智能底层架构进入了"三足"阶段:
对整机企业来说,这个局面的影响是实际的:选择接入哪一套底座,不只是技术选型问题,更是供应链自主性的考量。用GR00T意味着依赖英伟达芯片供应,用Cloud Robo意味着深度绑定华为云和鸿蒙,用Qwen-Robot目前看起来最"自由"——但要看开源协议出来之后的具体约束。
在行业普遍叫好的同时,有几个维度值得独立判断:
第一,行业底层架构正在成型。一个月前华为发布 Cloud Robo,三周前英伟达发布 GR00T+Cosmos 3,今天阿里发布 Qwen-Robot。具身智能的"基础设施竞赛"在2026年Q2突然加速,本质上是大家都看到了:谁做出"机器人时代的安卓",谁就拿到了下一张生态入场券。
第二,"全开源数据训练到SOTA"是个重要的信号。如果这条路可持续,它会在很大程度上降低行业的进入门槛——不需要几千万的真机数据采集预算就能训出有竞争力的模型。这对大公司是挑战(护城河变浅),对创业公司是利好(追赶成本降低)。
第三,关键是未来6个月。Qwen-Robot 今天发布的三件套是一个完整的技术架构,但技术架构不等于商业生态。接下来要看:开源协议到底怎么定、有几家机器人企业真正接入、真机验证能覆盖多少场景。以及——华为 Cloud Robo 会如何回应?英伟达会在国内机器人企业身上抢到什么份额?这个局的动态比静态更有看头。
夜雨聆风