ARTICLE · 1035595
物理AI曾只在云端,如今进现实动手
物理AI曾只在云端,如今进现实动手
说清AI怎么从屏幕走进现实
01物理 AI,就是会摸现实的 AI
先说人话。过去说的 AI 干信息活:读文字、认图片、写稿对答,全程在数字世界,碰不到一草一木。物理 AI 是英伟达反复讲的——能感知、能推理、还能在现实里动手的 AI:长在机器人、装在汽车、跑在产线,看得到车间、动得了零件【据英伟达 Cosmos 官方页,链接见文末】。 打个比方:过去的 AI 像读了万卷书却没下过地的书生;物理 AI 是既读书、又肯碰实物那个。它靠摄像头、雷达、力觉传感器去看和摸,靠世界模型猜接下来发生什么,再变成动作。英伟达在 SIGGRAPH 2026 说得直白:物理 AI 靠世界模型感知、推理、预测真实环境【据英伟达官方博客,链接见文末】。
02这周多的那一点:开始落地
数据摆在这儿。九月十日那条最扎眼:Skild AI 的 S1 模型,看段演示视频,机器人就能干从没练过、约十分钟的多步活。对照很说明问题——新多步任务上,S1 每步成功率约百分之六十六,一套类似系统只有百分之九,差了七倍多【据英伟达官方博客,链接见文末】。 更贴日子:种盆栽测试里,从录演示到机器人自己动手只用了十一分钟;英伟达估计,一段短视频顶得上人工手把手教约三百八十次。换一个活,过去靠工程师重编几天程序,现在拍段视频就够【据英伟达官方博客,链接见文末】。 九月十六日补另一块:教机器人认识世界本是苦活,人工整仿真环境往往耗几周。英伟达演示用智能体自动贴标签、做校验,削薄了这道坎【据 NVIDIA Developer,链接见文末】。
03物理 AI 不是什么都会
先把话说稳。单段视频学会干活,演示里很惊艳,但英伟达自己把话说在前面:机器人正接近一个拐点,不是已经到了。真实产线对稳定安全的苛求,远不是一段视频能覆盖——长时可靠、遇意外怎么处理,都得在仿真和真机反复验证【据英伟达官方博客,链接见文末】。 还有一层:物理 AI 不是一台机器包打天下。英伟达的打法是仿真、模型、边缘芯片、传感器分开做再拼起来;扫地机、机械臂、Robotaxi 各管各的场景。别把 AI 进现实听成啥活都能接。
04普通人现在能沾哪点光
头一件,把物理 AI 记下来。往后买机器人、智能车、带摄像头设备,大半看它懂不懂眼前、顺手干活。 第二件,想让家里省事,别等通用机器人。扫地、洗地、擦窗这类活,专用家电已更稳;需看现场再动手的,先挑带视觉识别的成熟款。 第三件,小店作坊常换产品换工序,多留意示教成本——教机器换活像拍段视频那么简单那天,就近了。
技术忙了这么多年,替人在屏幕里答题、写稿、画图;物理 AI 这一脚,想让它从屏幕里走出来,去碰真实的桌子、零件和路。进度是真的,门槛也是真的。今天你能做的,是把它看不看得懂眼前,当成挑智能设备的尺子。等机器人真能稳稳接住现实里的活,值得高兴的不是机器多神,而是你又少站那半小时。 这篇已收进合集《前沿》,要用时翻出来就行。
封面:汽车工厂里的机器人(Pexels, ID 19319639);内文:工程师在现场查看机器人设备(Pexels, ID 36692505)、自动化产线上的机械臂(Pexels, ID 34194567)。均为 Pexels 免版权图(Pexels License)。
参考来源:①英伟达官方博客《Skild AI Taps NVIDIA Physical AI…》(2026-09-10,https://blogs.nvidia.com/blog/skild-ai-s1-physical-ai/):Skild AI 的 S1 机器人基础模型靠一段视频演示学会没见过的多步任务,最长约 10 分钟;新多步任务单步成功率约 66%(对照系统约 9%);一段短视频约合 380 次人工示教(人工录需 50–100 小时);与英伟达、富士康用于双臂机械臂装配(拧 16 颗螺丝)【据英伟达官方博客,2026-09-18 核】;②NVIDIA Developer(2026-09-16,https://developer.nvidia.com/blog/how-to-use-ai-agents-to-prepare-3d-scenes-for-simulation ):AI 智能体自动为三维场景贴语义标签、加物理属性、做仿真校验【据 NVIDIA Developer,2026-09-18 核】;③英伟达 Cosmos 官方页(https://www.nvidia.com/en-us/ai/cosmos/ ):物理 AI 定义与世界基础模型定位【据英伟达官方,2026-09-18 核】;④英伟达 SIGGRAPH 2026 官方博客(2026-07-20,https://blogs.nvidia.com/blog/siggraph-news-2026/ ):Cosmos 3 Edge 为 40 亿参数端侧世界模型【据英伟达官方博客,2026-09-18 核】;⑤Jetson Thor 产品页(https://www.nvidia.com/en-eu/autonomous-machines/embedded-systems/jetson-thor/ ):2070 FP4 TFLOPS、128GB 内存,约 AGX Orin 的 7.5 倍性能、3.5 倍能效【据英伟达官方,2026-09-18 核】。登记:厂家官方一手(英伟达官网/博客/开发者平台/产品页),按前沿类权威平台特例采用;官媒 0 家(如实登记);全篇无价格数字与价格锚点;缺口:英伟达未公布 S1 训练与部署明细,「物理 AI」最早提出无单一可核出处,按 SSOT 不编造词源。
本文为人工主导、AI辅助整理,素材取自权威公开渠道、来源可溯源;不涉及需专项资质的敏感内容,仅供参考,不构成决策建议,风险自担。