AI跨出屏幕谷歌让机器人从头动到脚

2026年7月31日,三件事同时发生。
谷歌DeepMind发布Gemini Robotics 2,第一次让AI从头到脚控制一整台人形机器人。OpenAI宣布GPT 5.6最高降价80%,数字AI正在变成白菜价。英伟达黄仁勋半个月前刚在日本喊出"物理AI时代已经到来"。
三件事看似各不相干,但拼在一起,指向同一个事实:AI正在跨出屏幕,走进物理世界。
而这一次,谷歌走在了最前面。
一、从头到脚的控制

7月31日,Google DeepMind发布Gemini Robotics 2。这个名字听起来像是一次常规升级,但实际变化是质变级的。
上一代Gemini Robotics只能控制机器人的上半身——手臂、夹爪、头部的运动。新一代做到了一件事:从脚趾到指尖的全身协调控制。
这意味着什么?意味着机器人不再需要"走过去→停下来→再伸手"这种割裂的分步操作。它可以在行走的同时下蹲、在蹲伏的同时伸手、在伸手的同时放置物体——一个指令,一条链路,全身联动。
在DeepMind发布的演示视频中,Apptronik公司的Apollo 2人形机器人收到一条自然语言指令:"把浇水壶放到底层架子的绿色箱子里。"
然后Apollo 2做了这些事:观察房间布局,规划路径,迈步穿越房间,自主绕开地面障碍物,弯腰捡起浇水壶,蹲低身体以通过架子的高度限制,把壶放进指定位置,完成。
整个过程中,行走、平衡、蹲伏、伸手、放置——这些动作没有分段,没有"导航模式"切换到"操作模式"的手动交接。一个模型,一次决策链,全程流畅执行。
谷歌DeepMind机器人部门副总裁Carolina Parada在发布会上说了一句话:"我们的目标是将AI带入物理世界,并构建一个可供每台机器人使用的智能层。"
这句话的野心比产品本身更大。她说的不是"控制Apollo"——她说的是"每台机器人"。
二、不是单兵作战是三件套
Gemini Robotics 2不是一个模型,是三个。
第一个是Gemini Robotics 2(VLA)——视觉-语言-动作模型,核心引擎。它负责把摄像头看到的画面和人类说的指令,直接翻译成电机控制信号。这是"大脑→肌肉"的直连通道。
第二个是Gemini Robotics ER 2——具身推理引擎。它不直接动机器人,而是做高层规划:把复杂任务拆成多步骤、追踪执行进度、在需要时调用Google搜索等外部工具。它还能协调多台机器人同时作业,避免碰撞和重复劳动。据DeepMind的数据,ER 2在关键事件识别上达到91.3%的准确率,速度比上一代ER 1.6快了四倍。
第三个是Gemini Robotics On-Device 2——端侧模型。它跑在机器人本地的芯片上,不联网就能工作。更关键的是,它能让新机器人在几小时内适配新模型,只需要不到200个演示样本。
三个模型各司其职:ER 2做战略规划,VLA做战术执行,On-Device 2做本地备份和快速适配。这套架构让人联想到Android——一个操作系统,适配无数硬件。
DeepMind CEO Demis Hassabis此前就表达过这个愿景:做机器人的Android操作系统。谷歌不做机器人本体,做的是让所有机器人都能跑的那层"智能系统"。
目前,已经有四家硬件厂商在测试这套系统:Apptronik的Apollo 2、波士顿动力的Atlas和Spot、Agile Robots、以及Franka的F3 Duo平台。
三、十年沉浮谷歌的机器人情结

谷歌做机器人不是新鲜事。新鲜的是,它又回来了。
2013年前后,谷歌一口气收购了Boston Dynamics、Schaft、Redwood Robotics等七八家机器人公司,野心是做机器人的安卓生态。但好景不长,此后数年,这些资产被逐一出售或解散。Boston Dynamics卖给了软银,后来又被现代汽车接手。2023年,谷歌关闭了内部机器人部门Everyday Robots。
十年投入,折戟沉沙。
但2025年,谷歌推出初代Gemini Robotics,重新点燃了这条路线。当时它还只能做桌面级别的物体操控。到了2026年7月的Gemini Robotics 2,突然就能控制全身了。
一年时间,从桌面到全身。这个速度超出行业预期。
谷歌的竞争对手也没有闲着。OpenAI正在探索融合视觉、语言与动作的通用机器人基础模型。英伟达则为开发者提供训练AI机器人的全套软件工具。但谷歌有一个独特优势:它在机器人AI研究领域的学术积累,比任何一家公司都深。
Wired杂志在报道中写道:"虽然Anthropic和OpenAI在聊天机器人和AI编程工具上领先,但谷歌在机器人研究领域拥有更强的记录。"
不过,谷歌自己也坦承了差距。DeepMind机器人部门总监Kanishka Rao在发布会上直言:"真正意义上的灵活性,仍是一个遥远的目标。"
数据也支持这个判断。Gemini Robotics 2在桌面拾取任务上的成功率是68.4%,从货架拾取是76.3%,精确插拔任务达到89.6%。
这些数字对于一个实验室产品来说已经不错,但如果要进工厂、进家庭,还有很大距离。人类做这些事,成功率接近100%。
机器人动作仍然缓慢且刻意。原因在于,它必须停下来思考人类凭直觉就能做出的判断。
四、灵巧手与安全红线
Gemini Robotics 2另一个突破在"手"上。
上一代主要适配两指平行夹爪——就是那种看起来像大钳子的工业夹具。新一代已经能操控五指高自由度灵巧手。
在演示中,机器人用Sharpa公司的22自由度触觉灵巧手完成了几项精细操作:拧灯泡、系垃圾袋、封保鲜袋、打结。
这些任务对人类来说不费脑子,但对机器人来说极难。因为它们需要指尖级别的力反馈控制和微操精度——不是"抓住"而是"拧转",不是"夹起"而是"穿插"。
值得注意的是,Sharpa的22-DoF灵巧手同时出现在了英伟达的Isaac GR00T参考设计中。同一款硬件,同时被谷歌和英伟达选中。这说明两家公司在物理AI领域的路线虽不同,但对硬件能力的判断高度一致。
安全方面,DeepMind发布了ASIMOV-Agentic基准测试,用于评估多个AI系统协作控制机器人时的安全性。它的工作方式是:检测一条指令是否会导致有害或不确定的结果。同时,ER 2增加了人体接近感知功能——检测到人离得太近时,机器人会自动平稳停止。
Carolina Parada专门提到了安全问题。她说,把前沿AI模型装进机器人,让它在工作场所或家庭中走动并操作物体,"安全问题更加紧迫,因为你在把它们放进很多其他场景中。"
她还说了一句值得玩味的话:"这里有很多不确定性会暴露出来,所以你需要能更深入地理解安全问题。"
这句话的背景是,最近OpenAI一个未发布的AI智能体黑进了多个系统,引发了巨大争议。数字世界的AI失控已经让人不安,物理世界的AI如果失控,后果完全不同。
一个能思考的机器人,和一个能聊天的AI,出事时的量级不是一个级别。
五、英伟达的物理AI版图

如果说谷歌在软件层攻城拔寨,英伟达则在基础设施层布下重兵。
7月15日,黄仁勋现身东京秋叶原——英伟达梦开始的地方。三十年前,英伟达在世嘉《VR战士》的3D技术上押注失败,濒临倒闭,是世嘉500万美元的救命钱让它活了下来。
三十年后,黄仁勋回到这里,不是为了怀旧,而是为了物理AI。
7月16日,英伟达宣布与日本22家企业合作,共建物理AI生态。阵容豪华:发那科、安川电机、川崎重工——日本工业机器人三巨头悉数在列,加上富士通、NEC、软银、丰田。
黄仁勋的原话是:"下一波AI浪潮——物理AI已经到来。日本顶尖的工业机器人技术与物理AI融合,将推动制造业跨入下一个世纪,成为下一次产业革命的起点。"
这套合作的底层是英伟达的完整技术栈:Cosmos世界模型、Omniverse仿真平台、Isaac机器人开发框架、Newton物理引擎、Jetson边缘芯片。
日本方面则以国家级力量响应。由索尼、软银、NEC、本田牵头成立的Noetra公司(日本"物理AI模型国家队"),宣布将在2027年4月启动AI计算平台建设,配备27500块英伟达Rubin GPU,2028年6月投入运营。
这座数据中心的规划功耗达140兆瓦,堆叠13750块Vera CPU和27500块Rubin GPU,通过Spectrum-X以太网高速互连。这是一座为训练物理AI模型而建的国家级工厂。
日本的选择有其深层逻辑。日本在AI算法和大模型迭代上相对滞后,但在汽车制造、工业机器人、半导体材料、精密加工方面拥有无可替代的**"产业现场经验"**。英伟达的算力和模型,加上日本的制造know-how,这正是黄仁勋眼中的致胜组合。
六、数字AI白菜价物理AI新边疆
7月31日同一天,OpenAI宣布GPT 5.6系列全面降价。
最便宜的Luna模型价格暴跌80%,每百万输入代币仅0.20美元。Terra下调20%,代码自动批准模式成本降十倍。降价的核心原因不是慷慨——是竞争压力。DeepSeek、Kimi、Gemini的价格在挤压OpenAI的企业客户。
OpenAI还用AI给自己省了钱:Sol模型自主重写了底层生产内核,使端到端运行成本降低20%,token生成效率提高15%。AI优化AI的基础设施,然后降价。
这条新闻和谷歌的机器人发布放在同一天看,意味深长。
数字AI正在迅速商品化。价格战已经开打,利润空间在被压缩。而物理AI——让AI理解并作用于物理世界——还是一片几乎空白的处女地。
谷歌、英伟达、OpenAI三家在同一天的动作,勾勒出AI产业的分水岭:
OpenAI降价,是在数字AI的存量市场中抢份额。谷歌发布全身机器人控制模型,是在物理AI的增量市场中抢先手。英伟达绑定日本制造产业链,是在物理AI的基础设施层卡位。
三家公司的共同判断是:数字AI的天花板正在逼近,物理AI的天花板还没看见。
欧盟也在同一天前后宣布投入114亿美元建设7座AI超级工厂,每座配备至少10万块AI芯片。这个规模已经不是"追赶GPT"的级别——是奔着物理AI训练去的。
写在最后:物理AGI还有多远
Carolina Parada把Gemini Robotics 2称为通向"物理AGI"的又一个里程碑。物理AGI——就是让机器人做到人类能做到的任何事。
这个目标还有多远?
看看数据:桌面拾取成功率68.4%,精确插拔89.6%。机器人动作缓慢,需要停下来思考。它不能像人一样自然地躲避突然出现的障碍,不能在陌生环境中自如操作。
但方向已经确定了。从控制上半身到控制全身,只用了一年。从桌面操作到穿越房间完成多步骤任务,也是一年。
谷歌做了一件事——它证明了AI可以像控制聊天机器人一样控制机器人的全身。这不是PPT,是跑通的Demo。
黄仁勋说物理AI时代已经到来。谷歌用Gemini Robotics 2给出了佐证。日本的22家企业在排队入场。欧盟的114亿美元在路上了。
唯一还没准备好的,可能是我们自己。
当AI跨出屏幕、走进物理世界的那一刻,安全、伦理、就业、监管——所有在数字世界被推迟的问题,都将在物理世界加速到来。
夜雨聆风