乐于分享
好东西不私藏

【硅基经济】物理AI:感知是机器人需要补足的重要短板

【硅基经济】物理AI:感知是机器人需要补足的重要短板

硅基经济浪潮是渗透所有维度的范式革命,将重构人类文明底层代码。未来已来,硅基经济不是选择,而是必然,将是席卷人类社会每个角落的基础性范式革命,从能源获取、到生命密码,从价值交换、到文化生产,从基础设施、到劳动力结构,一切都将以硅为基,在全新的规则体系下运转,影响深度与广度将超越以往任何技术革命。

硅基经济专题物理AI

免费版4,378字,预计阅读9分钟

完整版13,296字

硅基经济,更前瞻,更硬核,支持专题/单篇付费解锁

一、从数字世界AI,到物理世界AI,机器人要真正实现大规模商业化,感知能力跃升是关键台阶。

数字世界AI,主要面向文本、代码、图像、音频、视频等数字化信息;物理世界AI,需要在真实世界中理解环境,在物理约束下完成感知、移动、抓取、避障、交互、执行等连续行为。

与大语言模型LLM不同,机器人面对的是更复杂、更动态、容错率更低的物理世界,要进入真实商业场景,不能长期依赖遥控、预设路线或人工干预,必须自主识别环境、理解任务状态、感知人与物的变化,做出实时决策。

机器人要从技术演示,走向规模化商业应用,首先要补足对真实环境的稳定感知与理解能力,感知能力跃升,成为机器人商业化落地必须跨过的关键台阶。

AI发展,依赖算力、算法、数据三大基石,物理世界AI突破同样需要算力、算法、数据共同进步。

算力层面,训练芯片、边缘推理芯片、机器人计算平台等持续演进,为物理世界AI训练与部署提供基础支撑,短期看不是最核心约束。

物理世界AI,真正更底层挑战,集中在算法与数据方面。

算法层面,物理世界AI当前尚未形成类似Transformer之于数字世界AI的绝对主流范式。视觉语言动作模型VLA、世界模型World Model、世界动作模型WAM、具身大模型、机器人基础模型等路线快速发展,行业持续探索最适合智能机器人的模型架构与训练方法。

数据层面,物理世界数据尚未像互联网语料一样大规模数字化,可用于机器人训练的高质量数据稀缺。机器人真正需要的数据,不是普通互联网数字内容,是在真实世界行动中产生的交互轨迹,包括感知、动作、反馈、修正等过程。

未来无论哪条路线胜出,感知层都是连接物理本体与算法大脑的关键入口。感知能力越弱,机器人越依赖预设程序与受控场景;感知能力越强,机器人越能适应开放环境,在真实场景中完成更多复杂任务,积累更多可用于训练的数据,实现更快进化。

大语言模型LLMAI在数字世界里学会理解语言、生成内容,下一步,物理世界AI是让机器真正理解真实世界。

机器人面对的不是整齐排列的Token,是会移动的人、会变化的光线、会滑落的杯子、会变形的衣物,与不断变化的开放环境。

机器人要进入工厂、商场、医院、家庭,竞争重点不只是本体是否灵活、控制是否稳定,更是能否持续感知环境、理解任务、判断变化,据此采取行动。它必须先看见,才能理解;先理解,才能行动;先行动并反馈,才能形成数据飞轮。

未来物理世界AI突破,可能不是某个单点技术胜利,将是感知、数据、模型、部署闭环的系统进化。谁能更稳定地把复杂物理世界,转化为模型可理解、可预测、可行动的信息,谁就更接近物理世界AI的真正拐点。

二、感知层是连接物理本体与算法大脑的关键信息入口,是机器人从被动执行、走向自主作业的基础。

与数字AI不同,机器人面对的是更复杂、更动态、容错率更低的物理世界。机器人智能的跃迁,不能只依赖算法大脑本身,必须依赖高质量、稳定、实时的感知输入。

感知层是否足够强,决定机器人能否把物理世界,转化为可被模型理解与用于决策的信息,决定具身智能能否真正从实验演示、走向规模化商业落地。

感知可拆成感、知两个环节,感是看到,知是理解。

感是通过摄像头、激光雷达、各类传感器等,把物理世界转化为机器可处理的数据,从物理世界到数据是感。

知是通过视觉模型、空间建图、多传感器融合等,把数据转化为对环境、空间、物体、任务状态的理解,从数据到理解是知。

机器人在算力、算法、本体持续进步背景下,感知成为机器人商业化需要补足的重要短板。物理世界AI越接近商业化,机器人越需要从能执行动作,走向能理解空间。感知不仅是传感器问题,也是现实数据入口、空间智能基础、物理世界AI落地前提。

机器人感知,不是单一感知,是多模态感知,类似人类理解世界,不依赖单一感官,智能形成建立在多种感知能力协同的多模态感知基础上。

视觉是人类最重要感知入口,空间理解高度依赖视觉信息。据估算,人类大脑处理的外界信息中,约80%来自视觉,约15%来自听觉,二者合计约95%,说明视觉与听觉在人类感知中主导地位,尤其是视觉,人类依靠视觉建立大量空间判断,日常行动几乎都与视觉相关。

机器人多模态感知中,视觉感知是最重要入口。对机器人,视觉是形成空间智能的核心入口,决定机器人能否看见物体、理解场景、建立空间关系,进一步判断能否接近、能否抓取、如何避障等。

未来机器人感知竞争,不会停留在装几个传感器,会转向以视觉为核心、多传感器协同的数据融合能力。

三、物理世界AI挑战之一,模型范式尚未收敛。

数字世界AI能力爆发的核心技术拐点,是2017Transformer架构的提出。

数字世界中AI能力的爆发,不只是ChatGPT的出现,ChatGPT更像是大模型能力被公众广泛感知的标志性产品,更深层的技术拐点,是2017Transformer架构的提出。

Transformer提供一套高度可扩展、相对统一、能充分利用大规模数据与算力的基础架构,使模型能力可随参数规模、训练数据、算力的提升持续增强。

GPU算力快速提升、互联网海量文本数据的积累,与分布式训练、模型对齐、推理优化等工程体系的成熟,共同推动大模型能力的集中爆发。

物理世界AI当前面临的另一核心问题,行业尚未形成类似Transformer之于数字世界AI的绝对主流范式。

具身智能领域目前主流探索,集中在视觉语言动作VLA模型、世界模型、世界动作模型WAM(把预测性世界建模与动作生成统一起来World Action Models)、具身强化学习等路线,当前模型路线尚未收敛。

VLA是当前具身智能领域最受关注的基础架构之一,通过动作Token化,统一视觉、语言、动作语义空间。

世界模型被视为物理世界AI走向更高阶智能的重要基础设施。世界模型本质是物理世界的模拟器,让AI能在脑中进行虚拟试错。

世界模型核心思想是,让智能体在内部学习、模拟物理世界的动态规律,能想象不同动作可能导致的未来状态,对需要长期规划、因果推理、跨场景泛化的复杂任务至关重要,能显著降低机器人在真实世界中试错成本与风险。

世界动作模型WAM,是继VLA之后,具身智能的下一个核心前沿。VLA,实现从视觉语言到动作的端到端直接映射,语义理解强、工程化成熟,缺乏物理动态预测能力。

世界动作模型WAM,是前两者深度融合统一,同时具备物理预见与行动执行能力、跨实体泛化潜力巨大,当前存在算力需求高、技术架构未收敛、工程落地难度大等挑战。

VLA、世界模型、世界动作模型WAM,从分立路线走向融合,车企与机器人厂商,都在把未来状态预测/物理推演,嵌入动作生成闭环。

真正的智能,既需要理解语言与语义的抽象能力,也需要感知物理与预测未来的直觉能力。各家路线命名不同,有的仍叫VLA,有的直接叫WAM或世界行为模型,底层方向逐渐收敛,把VLA的语义理解、任务泛化、动作生成能力,与世界模型的物理预测、未来推演、仿真训练、因果规划能力融合起来。

四、物理世界AI挑战之二,高质量数据稀缺。

机器人真正需要的数据,不是普通互联网数字内容,物理世界数据是物理世界AI关键瓶颈。

物理世界AI训练,依赖机器人在真实世界行动产生的交互轨迹,包括感知、动作、反馈、修正等过程。

与数字世界数据相比,物理世界数据极度复杂、数据量极大、非结构化,物体关系、环境变化、动作结果间关联更模糊,很多信息难以通过语言描述,造成物理世界数据采集成本高,高质量数据稀缺。

未来物理世界AI要迎来GPT时刻,不只是算力更强,出现类似数字世界AITransformer架构的提出,更在于行业能否持续获得足够丰富、足够真实、足够有用的物理世界数据。

数字世界数据,具备天然供给基础,互联网长期沉淀大量可用于大模型训练的数字内容。互联网上,文本、代码、图像、音频、视频资料规模庞大,获取成本相对较低,尤其是移动互联网普及,带来数字信息持续指数级增长。

人类语言与文字,具备较强结构性,容易转化为Token序列,适合大模型进行统计学习、语义建模、推理训练,推动大语言模型LLM快速进化。

物理世界数据,不具备同等条件,机器人行动轨迹,不会自然沉淀在互联网上。机器人训练,需要在真实环境中,与物理世界交互时产生数据,不仅是视觉画面,还包括力觉、触觉、关节位置、电机控制量、动作结果、失败反馈、时间戳同步等信息,过去没有系统记录,不会天然沉淀为数字信息,造成物理世界数据巨大缺口,是具身智能难以快速复制大语言模型LLM突破路径的重要原因。

Token语料,到物理轨迹数据,物理世界AI训练复杂度明显上升。

大语言模型LLM主要学习语言规律与知识关联,物理世界AI需要学习物理世界行动规律,不仅要理解世界,还要在行动中承受真实后果。

物理世界包含空间、材质、力、接触、环境变化、任务状态等多重变量,同一任务在不同场景下,可有大量变化,机器人要学会稳定完成任务,需要见过海量场景、经历海量操作、积累海量经验,所需训练数据规模与复杂度,相比大语言模型LLM呈指数级增长。

机器人训练数据,主要分为真实机器人遥操作数据(人通过控制设备操作机器人,在真实场景中完成动作,记录数据)、仿真合成数据、动作捕捉数据、互联网视频与第一视角人类视频四类,在质量、成本、规模、用途上差异明显,难以简单相互替代,需根据任务类型、机器人本体、应用场景等,进行组合使用。

宇树在招股书、问询函回复中强调,机器人想要实现大规模商业化应用,最关键的是大脑层面的具身大模型能力与灵巧手的精细耐用程度两方面难题。

2026316日,英伟达GTC 2026大会上,宇树创始人王兴兴表示,具身智能领域尚未迎来ChatGPT时刻,行业仍需攻克泛化能力瓶颈,预计还需2~3年时间。

五、李想提出具身智能的上、下半场的判断。

2018~2033年,上半场,核心是自动驾驶。

2018~2023年:L2级辅助驾驶普及期,车辆在特定场景辅助操作,核心技术特征是CNN 2D神经网络、规则算法模型、MCU控制器,算力100 TOPS以内。

2023~2028年:L3级有条件自动驾驶落地期,车辆在更多场景接管任务,核心技术特征是2D ViT感知模型、预训练模型模仿学习、端到端控制,算力约2,000 TOPS

2028~2033年:L4级高度自动驾驶成型期,实现全场景无人出行,核心技术特征是3D ViT感知模型、面向物理世界的稳定预训练模型,算力要求接近1TOPS

李想认为,只要模型规模压到4B~7B,配合2,000TOPS左右算力,2027~2028年能实现L32028~2029年能实现L4L4实现后,汽车就真正成为机器人。

2030年开启,下半场,核心是通用人形机器人。

2030~2035年:人形机器人具备类似6岁儿童的泛化能力,初步落地家庭与商用场景。

2035~2040年:人形机器人达到12岁认知水平,服务功能全面成熟。

2040~AGI实现前后:人形机器人具备18岁成人认知水平,逼近AGI

李想判断,人形机器人将于2030年进入市场初期,类似2015年时期的电动汽车,商业化第一个重要突破口是上料环节,无论工业、商业、家庭场景,搬运上料不需要微米级精度、单一工种、用量大。

李想认为,自动驾驶与机器人间的技术连接非常清晰,共享芯片、大模型、感知、控制等底层技术,上半场直接决定下半场的入场资格,这是机器人公司大量从自动驾驶公司挖人的根本原因。

李想预测,未来汽车与通用人形机器人,各自都会是5万亿美元市场,两者用户重合度高达90%

李想指出,具身智能目前最大困境,是缺少稳定的物理世界预训练模型,需要类似GPT-3.5那样基于大规模无监督预训练,基于强化学习对齐人类意图,成为通用基座。

六合年度报告全库会员,欢迎扫描识别下方图中二维码或点击文末“阅读原文”购买
深圳硬件创新之都专题,欢迎扫描识别下方图中二维码或点击文末阅读原文购买
硅基经济专题,欢迎扫描识别下方图中二维码或点击文末“阅读原文”购买
智能时代专题,欢迎扫描识别下方图中二维码或点击文末“阅读原文”购买
智能时代专题第二季,欢迎扫描识别下方图中二维码或点击文末“阅读原文”购买

智能时代专题第一季,欢迎扫描识别下方图中二维码或点击文末“阅读原文”购买

六合商业叙事付费专题报告,欢迎扫描识别下方图中二维码或点击文末“阅读原文”购买
元宇宙专题,欢迎扫描识别下方图中二维码或点击文末“阅读原文”购买
头号玩家第二季,欢迎扫描识别下方图中二维码或点击文末“阅读原文”购买
头号玩家第一季,欢迎扫描识别下方图中二维码或点击文末“阅读原文”购买
智能电动汽车专题,欢迎扫描识别下方图中二维码或点击文末“阅读原文”购买
相关研报:
【长期主义】第365期环球说:首尔行,好奇心之旅,地缘视角下的City Walk
【长期主义】第337期环球说:富国岛行,与AI硬核对话的升维体验
国家经济、投资的范式变化:从碳基经济到硅基经济,AI寒武纪大爆发时刻

【智能时代】现象级游戏《黑神话:悟空》的思考,游戏二元属性,文化与科技

【智能时代】自动驾驶:汽车iPhone时刻,中国三大流派演化形成中

诸神之战:美国科技巨头,从春秋五霸进入战国七雄|GBAT 2023 大湾区智能时代产业峰会

人类未来文明三部曲之二:智能时代专题预售开启,奇点临近,未来已来

九宇资本赵宇杰:智能时代思考,认知思维,存在原生、降维、升维三波认知红利

九宇资本赵宇杰:智能时代思考,以史为鉴,科技浪潮,从互联网到AI

九宇资本赵宇杰:智能时代思考,宇宙视角,从碳基生物,到硅基智能体

人类未来文明三部曲之一:元宇宙专题预售开启,59期45万字

九宇资本赵宇杰:1.5万字头号玩家年度思考集,科技创新,无尽前沿

九宇资本赵宇杰:1.5万字智能电动汽车年度思考集,软件定义,重塑一切

【重磅】前沿周报:拥抱科技,洞见未来,70期合集打包送上

【重磅】六合年度报告全库会员正式上线,5年多研究成果系统性交付

【智能电动汽车专题预售】百年汽车产业加速变革,智能电动汽车时代大幕开启

【头号玩家第一季预售】:科技巨头探索未来,头号玩家梯队式崛起

【头号玩家第二季预售】:科技创新带来范式转换,拓展无尽新边疆

【首份付费报告+年度会员】直播电商14万字深度报告:万亿级GMV风口下,巨头混战与合纵连横

【重磅】科技体育系列报告合集上线,“科技+体育”深度融合,全方位变革体育运动

【重磅】365家明星公司,近600篇报告,六合君4年多研究成果全景呈现

九宇资本赵宇杰:CES见闻录,开个脑洞,超级科技巨头将接管一切

【万字长文】九宇资本赵宇杰:5G开启新周期,进入在线世界的大航海时代|GBAT 2019 大湾区5G峰会

九宇资本赵宇杰:抓住电子烟这一巨大的趋势红利,抓住产业变革中的变与不变

【IPO观察】第一季:中芯国际、寒武纪、思摩尔、泡泡玛特、安克创新等11家深度研报合集

【IPO观察】第二季:理想、小鹏、贝壳、蚂蚁、Snowflake、Palantir等12家公司深度研报合集

【IPO观察】第三季:Coinbase、Roblox、快手、雾芯科技等12家公司深度研报合集

【重磅】年度观察2019系列合集:历时3个多月,超20万字近500页,复盘过去,展望未来,洞悉变与不变

【珍藏版】六合宝典:300家明星公司全景扫描,历时3年,210万字超5,000页,重磅推荐

九宇资本赵宇杰:对智能电动汽车产业的碎片化思考

九宇资本赵宇杰:九宫格分析法,语数外教育培训领域的道与术

【2023回乡见闻录】90、00后小伙伴们万字记录,生活回归正轨,春节年味更浓

【2022回乡见闻录】20位90、00后2万字,4国13地,全方位展现国内外疫情防疫、春节氛围、发展现状差异

【2021回乡见闻录】22位90后2万字,就地过年与返乡过年碰撞,展现真实、立体、变革的中国

【2020回乡见闻录】20位90后2万字,特殊的春节,时代的集体记忆

【重磅】22位“90后”2万字回乡见闻录,讲述他们眼中的中国县城、乡镇、农村

六合君3周岁生日,TOP 60篇经典研报重磅推荐

下午茶,互联网世界的三国杀

5G助推AR开启新产业周期,AR眼镜开启专用AR终端时代

新商业基础设施持续丰富完善,赋能新品牌、新模式、新产品崛起,打造新型多元生活方式

【重磅】中国新经济龙头,赴港赴美上市报告合辑20篇

知识服务+付费+音频,开启内容生产新的产业级机遇,知识经济10年千亿级市场规模可期

从APP Store畅销榜4年更替,看内容付费崛起

新三板破万思考:新三板日交易量10年100倍?

九宇资本赵宇杰:科技改变消费,让生活更美好|2017 GNEC 新经济新消费峰会

九宇资本赵宇杰:创业时代的时间法则,开发用户平行时间|2016 GNEC 新经济新智能峰会

九宇资本赵宇杰:互联网引领新经济,内容创业连接新生态|2016 GNEC 新经济新营销峰会

请务必阅读免责声明与风险提示