欢迎大家关注“凯哥讲故事系列”公众号

本文配有完整 PPT 如需要
加凯哥微信,将文章转发朋友圈截图发给笔者,即发 PPT 完整版
凯哥讲 AI · The Intelligent Edge

时隔近两年,李飞飞再次做客 a16z。表面上,这是一场关于 World Labs 收购 SceniX、进军机器人基础设施的访谈;往深处看,它其实发出了一张很重要的产业转向通知:AI 的下一条缩放曲线,未必来自更多现实数据,而可能来自更多可生成、可控制、可验证的世界。
很多人看完访谈,记住的是“空间智能”“世界模型”“机器人仿真”几个热词。凯哥的判断是,如果只记住这些词,基本等于没看。真正值得关注的,是李飞飞把过去几年机器人行业中彼此分离的五个问题——数据、仿真、评估、模型和商业化——第一次放进了一条完整的产业链里。
这条链路可以浓缩成一句话:把真实世界变成可计算的数字世界,让机器人先在里面看见、试错、失败、比较、反事实推演,再把获得的能力带回真实世界;真实执行产生的新数据,又反过来让数字世界变得更可信。它不是传统意义上的“做一个数字孪生”,也不是“拿视频生成模型造点训练素材”,而是一套面向机器人学习的世界基础设施。

过去的 AI,擅长从世界留下的痕迹中学习;下一代 AI,要学会在尚未发生的世界里训练自己。——凯哥讲 AI
01李飞飞真正押注的,不是机器人,而是“世界”
为什么一家以空间智能为使命的前沿模型公司,要在此时收购一家机器人仿真公司?答案并不是 World Labs 想造一台人形机器人。恰恰相反,李飞飞和李昀烛反复强调:他们不押注某一种硬件形态,也不绑定某一个算法模型。他们要做的是所有机器人都需要、却没有任何一家机器人公司愿意独自完整建设的公共层——可规模化生成、重建、训练和评估的数字世界。
这是一个典型的基础设施判断。淘金热里最稳定的生意,不一定是猜中哪位淘金者最后挖到金子,而是提供铲子、道路和地图。机器人行业今天最热闹的是本体、VLA、灵巧手和端到端策略,但真正卡住规模化落地的,往往是更加“脏、重、慢”的工作:如何重建客户现场,如何覆盖长尾状态,如何低成本采集动作数据,如何在不砸坏设备、不伤到人的情况下评估新 checkpoint,如何证明仿真里的 2% 提升到了现场仍然成立。
World Labs 的 Marble 擅长从稀疏输入生成几何一致的三维世界;SceniX 擅长把真实场景转成可运行物理、可部署机器人、可做训练评估的数字环境。一个解决“世界怎么快速生成”,一个解决“这个世界怎么成为机器人的训练场”。两者的结合,不是简单并购,而是把生成式世界模型与工程仿真栈接成闭环。

过去:模型中心围绕参数规模、架构和 benchmark 竞争。
现在:系统中心模型、数据、评估、仿真与硬件共同决定结果。
未来:世界中心谁拥有可扩展的世界,谁就拥有持续生成经验的能力。
所以,标题里最值得琢磨的不是“人也不全靠现实数据学习”,而是它所隐含的学习观变化。过去十年,AI 的成功很大程度上建立在一个朴素假设上:只要现实世界留下的数据足够多,模型就能从中统计出规律。但机器人面对的是开放物理世界,很多关键情况罕见、危险、昂贵,甚至从未发生。只靠采集,永远追不上状态空间的爆炸。
02从“现实主义”到“生成式经验主义”
有人会质疑:仿真终究是假的,机器人最终要在真的世界里干活,为什么不老老实实多采真实数据?这个问题听起来务实,实则把“真实”与“有效”混为一谈。
人类学习从来不只依靠已经发生的现实数据。棋手会在脑中推演没有下过的变化,工程师会在图纸上分析桥梁尚未遭遇的极端载荷,足球教练会在白板上推演对手可能采用的阵型,孩子会通过假装游戏理解角色与因果。我们不仅从事实中学习,也从假设、类比、想象和反事实中学习。
反事实学习的核心不是“幻想”,而是提出一个可检验的问题:如果光线更暗、摩擦力更小、货箱偏移三厘米、夹爪慢半拍、突然有人进入工作区,策略会怎样?现实世界很难系统制造这些情况,数字世界却可以一次改变一个变量,也可以组合改变多个变量,并记录完整真值。
凯哥把这种路线称为“生成式经验主义”:经验不再全部等待现实发生后再收集,而是由一个受物理、几何和业务约束的世界系统主动生成;生成的经验通过评估与真实回传不断校准。它既不同于纯规则仿真,也不同于无约束的视频生成。

真实世界场景与约束
→
可计算世界重建、生成、随机化
→
机器人经验训练、评估、反事实
真实反馈持续校准世界,数字世界持续扩展经验。
这里必须划清边界:合成数据不是“便宜的假数据”。低质量合成数据会放大模型偏见,制造看似海量、实则高度同质的垃圾经验。真正有价值的数字训练场,至少要满足四个条件:与真实场景在任务关键变量上对齐;能够暴露底层状态和因果关系;能够系统控制分布和长尾;仿真表现与真实表现存在可度量的相关性。
因此,仿真不需要像电影一样每一根灰尘都逼真,却必须在任务本质上真实。扫地机器人不需要知道地毯花纹的艺术史,却必须理解摩擦、障碍、轮胎打滑与传感器遮挡;装配机器人不需要复刻整个工厂的每一盏灯,却必须准确描述孔位、公差、力反馈和零件接触。
凯哥判断:未来行业不会争论“真实数据还是合成数据”,而会争论什么该真实、什么可生成、什么必须受物理约束,以及如何建立 Sim-to-Real 的证据链。
03机器人真正稀缺的不是数据,而是“可学习的经验”
语言模型为什么能迅速出现缩放效应?因为互联网已经替它完成了海量数据生产:人类写过的文章、代码、问答和讨论,本质上是文明留下的符号轨迹。机器人没有这样一座现成的“物理互联网”。一次抓取不仅需要视频,还需要机器人状态、动作、力矩、深度、接触、失败原因和任务目标。更麻烦的是,同一个动作对不同本体、夹爪、载荷和现场条件未必可复用。
所以,机器人缺的并非狭义的“数据文件”,而是覆盖任务空间、带有动作与结果、能够被训练和评估系统消费的经验单元。真实遥操作可以生产经验,但成本高、速度慢、覆盖窄;互联网视频覆盖广,却通常缺少精确动作与物理状态;纯仿真可控,却可能存在现实鸿沟。产业答案不会是三选一,而是把三者装进同一个数据飞轮。
这也是为什么“数据飞轮”不能只被理解为数据越积越多。真正的飞轮必须让每一次现场失败都改变下一轮训练分布:系统发现某类透明包装抓取失败,就在数字世界里围绕材质、反光、角度与夹持力生成一批针对性场景;新策略通过仿真回归测试后,再灰度部署;现场表现又验证仿真相关性。数据的价值不在数量,而在是否推动策略边界外扩。
用 Lean AI 的语言说,这是一条“问题—假设—实验—评估—学习”的闭环。仿真的意义不是替代现场,而是压缩闭环周期;世界模型的意义不是制造漂亮视频,而是降低实验成本;合成数据的意义不是填满存储,而是提高单位真实数据所能撬动的学习增量。
04评估,才是这场访谈中最容易被忽视的金矿
大多数媒体会把焦点放在训练数据上,但李昀烛反复强调了另一个更重要的问题:评估。机器人行业今天最大的瓶颈之一,是不知道一个新模型究竟有没有真正变好。
在大语言模型领域,一个 checkpoint 可以在数小时内跑完大量自动评测;在机器人领域,若每次 2% 的提升都要把机器人部署进仓库、餐厅或实验室,重复数百次真实任务,迭代周期可能以周甚至月计算。测试还会占用场地、人员和设备,失败可能损坏货物,极端情况下还涉及人身安全。
数字环境的价值,是把评估从“偶尔做一次现场验收”变成“每次模型更新都能运行的持续测试”。它可以保存标准场景、难例场景、极端场景和历史事故场景;可以对两个 checkpoint 做同分布对照;可以把成功率拆解到光照、物体、姿态、摩擦力等维度;还可以在真实机器人执行前设置安全门槛。
但这也提出了更高要求:仿真评估本身必须被评估。企业不能只看模拟成功率,而要长期维护一张 Sim-to-Real 相关性地图:哪些任务上仿真排名能够预测现实排名,误差多大,何时失效,模型升级或硬件变化后是否需要重新校准。

没有评估闭环的世界模型,只是一个昂贵的内容生成器;能够影响上线决策的世界模型,才是生产基础设施。——凯哥讲 AI
这意味着机器人时代的 Evals 不再只是一个数据集,而是一套“世界组合”:环境、任务、初始状态、干扰因素、物理参数、成功标准与安全边界的结构化定义。谁掌握了行业的评估世界,谁就可能掌握行业事实上的交付标准。
05为什么三维不是情怀,而是行动的语法
视频模型可以生成看起来合理的下一帧,为什么还要坚持几何一致的三维世界?因为对观看者而言,“看起来像”可能足够;对机器人而言,“可以作用”才是底线。
机器人不是一个坐在屏幕前欣赏视频的人。它要决定夹爪从哪里进入、手臂是否碰撞、物体受力后向哪里移动、遮挡之后目标是否仍然存在。同一个物体换个视角不能凭空变形,推一下不能突然消失,接触关系不能随帧漂移。这些不是视觉美学问题,而是行动的语法。
三维、时间、物理与动作条件共同构成世界模型的四根支柱。三维提供空间关系,时间提供状态连续性,物理提供因果约束,动作条件提供“如果我这样做会发生什么”的接口。缺少任何一根,模型都很难成为可靠的机器人学习环境。
当然,这并不意味着传统物理引擎将战胜学习模型。更可能的未来是混合世界:确定性强、可建模的部分由几何与物理提供骨架;复杂材质、接触、形变与人类行为由学习模型补足;生成模型负责快速构建多样场景;真实数据负责持续校准。世界模型不是单一大模型,而是一套可组合的系统。
06“模型总会换代,基础设施不会”——这句话值十亿美元
李昀烛说,具体用哪个模型其实不重要,因为模型总会换代,但基础设施不会。这句话看似谦虚,实则暴露了 World Labs 与 SceniX 的商业野心。
模型层竞争异常激烈,今天领先的 VLA、动作模型或视频模型,明天可能被新架构替代。如果一家企业把全部资产押在某个模型 API 上,获得的只是短期能力租赁。相反,现场重建管线、任务定义、评估世界、难例库、硬件适配、仿真到现实的校准记录,以及客户长期积累的运行轨迹,具有更强的粘性和复利。
这套基础设施一旦进入研发与交付流程,就会成为机器人行业的 CI/CD:模型可以插拔,本体可以替换,但每次更新都要在这里训练、回归测试、验证和发布。它的价值不只在卖算力或软件许可证,而在掌握机器人从实验室走向现场的“质量通道”。
因此,World Labs 的最佳定位不是另一家人形机器人公司,也未必是一家单纯的基础模型公司,而可能是 Physical AI 时代的“世界云”:客户上传或扫描现场,系统生成可执行环境,接入不同机器人与模型,并提供训练、评估、合成数据和部署反馈闭环。

模型资产可替换,折旧快,容易被新一代能力追平。
世界资产包含场景、任务、约束、难例与验证证据。
运营资产来自持续执行轨迹,最贴近客户真实价值。
07机器人商业化,不会从“万能”开始
访谈中另一个非常清醒的判断,是机器人落地将从结构化环境走向半结构化环境,最后才进入家庭等非结构化环境。今天资本市场热衷展示“像人一样”的通用机器人,但商业价值通常来自“把一个具体任务稳定做完”。
工厂是结构化环境,流程、工位和对象高度可控,传统自动化已深耕数十年;仓库、酒店、餐厅、实验室和电子装配属于半结构化环境,主要任务可定义,但会出现人、杂物、光照和对象变化;家庭则是高度非结构化环境,每户布局不同、物品不同、规则不同,还要求极高安全性和低成本。
人形身体是对非结构化人类世界的一种通用适配,但通用不等于经济。一个任务若能由轮式底盘、单臂或专用末端执行器更便宜地完成,企业不会为“像人”支付溢价。未来几年真正可持续的机器人公司,很可能不是演示最惊艳的公司,而是能够把任务边界定义清楚、把异常状态覆盖充分、把单位任务成本降到商业阈值以下的公司。
World Labs 选择保持本体中立,正是为了不押注某一种“身体”。这也提醒企业客户:采购机器人不能只看本体参数和 demo,要同时检查任务定义、数据闭环、评估体系、异常恢复、现场改造和持续运营能力。机器人不是一台买回来就结束的设备,而是一个持续学习的生产系统。
08人形机器人热潮里,最危险的是“未经校准的乐观”
李飞飞说,当下 AI 最难做到的,是保持恰如其分且经过校准的乐观。这句话非常适合送给今天的具身智能行业。
悲观者容易低估技术曲线:多模态模型、三维重建、生成式世界、VLA 和硬件供应链正在同时进步,许多五年前看似遥远的问题正在快速收敛。乐观者则容易忽略系统工程:机器人成功率从 90% 到 99% 不是提高九个百分点,而是失败率降低十倍;从 99% 到 99.9% 又是一个数量级。真实商业要求的不只是“多数时候能做”,而是失败可预期、可恢复、可追责。
此外,智能并不自动等于经济性。机器人的资本成本、维护、能耗、场地改造、远程接管、安全认证和数据运营都要计入单位任务成本。人脑约几十瓦功耗即可完成极强感知与控制,而现有 AI 系统加上机器人硬件远没有达到同等能效。
所以,正确的乐观不是预测“两年后机器人进入每个家庭”,而是选择几个高价值、半结构化、可度量的任务,用数字世界把训练和评估周期压缩一个数量级,再用灯塔客户证明单位经济性。李飞飞给出的两年目标也很克制:在少数重要垂直用例中,获得经验证的客户和自动化成果。这种克制,反而比宏大的 AGI 口号更值得重视。
09这场并购将重画 Physical AI 产业地图
过去,机器人产业常被分成硬件本体、核心零部件、控制系统、仿真软件和应用集成。生成式 AI 进入之后,中间会长出一个新的厚层:世界基础设施层。它向下连接传感器、CAD、物理引擎和机器人本体,向上连接世界模型、VLA、策略学习、评估与现场运营。
这个新层的竞争不会只有 World Labs。芯片与仿真平台公司拥有算力和物理引擎优势,机器人基础模型公司掌握策略与数据,云厂商拥有基础设施和企业客户,工业软件公司掌握 CAD/PLM/MES 数据,机器人本体公司拥有真实执行轨迹。真正的胜负手,是谁能把这些分散资产连接成低摩擦的 real-to-sim-to-real 闭环。
未来两三年可能出现五类重要产品:一是从视频、图像、扫描和 CAD 自动生成机器人可用环境;二是面向行业任务的场景与难例市场;三是机器人模型的云端评估与认证;四是跨本体的数据与策略迁移工具;五是把现场失败自动转化为仿真测试和训练任务的闭环平台。
同时,新壁垒也会形成。单纯拥有漂亮的生成效果不是壁垒;单纯拥有大量遥操作小时也未必是壁垒。真正难复制的是“世界—任务—动作—结果—现实验证”的完整映射,以及在特定行业不断积累的失败分类学。
10对中国机器人产业意味着什么?
中国拥有全球最完整的制造业场景、供应链和机器人硬件能力,这是发展 Physical AI 的天然优势。但优势不会自动转化为智能。若每家企业各自采数据、各自搭仿真、各自定义评估,不仅重复建设,而且难以形成缩放效应。
下一阶段需要建设的,不只是更多机器人训练基地,而是面向重点行业的“高质量世界数据集”:它不仅包含图像和视频,还应包含空间几何、对象语义、材料属性、任务规范、动作轨迹、力与接触、异常状态、安全约束和现实评估结果。数据集的最小单元要从“样本”升级为“可重放场景”。
对于电子装配、物流仓储、汽车制造、矿山、港口、能源巡检、医疗辅助等行业,可以优先选择高价值且半结构化的任务,建立行业级 benchmark 与数字训练场。公共平台的职责不是替企业训练同一个模型,而是提供共性的场景标准、评估工具、数据治理和可信流通机制。
这也将重塑“高质量数据集”的定义。过去评价数据集常看规模、完整性、准确性和标注质量;机器人时代还必须看任务覆盖、状态分布、物理一致性、动作可执行性、仿真现实相关性和对策略性能的增益。一个 10TB 的精准难例世界,可能比 1PB 的重复视频更值钱。
11企业现在应该怎么做:不是先买机器人,而是先定义世界
如果你是一家制造、物流或服务企业,这场访谈最重要的行动建议,不是立刻采购一批人形机器人,也不是先建一个宏大的“具身智能平台”。第一步应该是选择任务,并把任务世界定义清楚。
第一,选出经济上值得自动化的任务。
看频率、人工成本、危险性、招工难度、质量波动和停机影响。不要从“机器人能做什么”出发,而要从“哪个业务问题值得为可靠性付费”出发。
第二,建立任务的状态空间。
列出对象、位置、光照、材质、公差、人员干扰、设备状态和异常类型。把“正常流程”之外的边界条件系统化。机器人项目通常不是死在主流程,而是死在那些没人写进需求的例外。
第三,建立现实基线与评估协议。
当前人工成功率、节拍、成本和安全指标是多少?机器人达到什么阈值才算可上线?测试多少次才有统计意义?没有基线,所谓“智能提升”就只剩演示。
第四,构建最小可用数字世界。
先覆盖最关键的场景变量,不追求一开始就打造电影级数字孪生。用少量真实数据校准,利用随机化扩展长尾,再把仿真测试与现场灰度连接起来。
第五,建立失败回灌机制。
每次失败要能被分类、重放并转化为新测试。无法重放的失败,只是事故;能够进入下一轮评估的失败,才是组织资产。
Lean-FDE 的角色:FDE 不只是把模型接进业务,而要成为现实世界与数字世界之间的翻译者:把业务目标转成任务,把现场例外转成状态空间,把失败转成数据,把模型指标转成经营结果。
12读懂空间智能的十个产业拐点
一,空间智能不是计算机视觉的升级版。它的目标不是识别世界,而是生成、理解、推理并作用于世界。
二,世界模型的价值不在视频有多逼真。关键是几何、时间、物理与动作是否一致。
三,机器人缩放定律的燃料是经验,而不是文件数量。动作、结果、任务和状态必须共同存在。
四,仿真不是现实数据的对立面。它负责扩展、控制和反事实;现实负责锚定、校准和验证。
五,评估可能比训练更先形成稳定商业价值。因为所有模型和机器人都需要可信的上线门槛。
六,最强壁垒可能在基础设施而非模型。模型会换代,世界资产与验证证据会复利。
七,机器人会先在半结构化环境中规模化。商业化来自边界清晰,不来自形态通用。
八,Physical AI 是系统工程。硬件、模型、数据、摩擦系数、安全和运营缺一不可。
九,高质量数据集将升级为高质量世界集。数据从静态样本变成可执行、可扰动、可重放的场景。
十,企业的起点不是买机器人,而是定义任务世界。谁能把现场知识结构化,谁才能把 AI 能力转化为生产力。

语言模型把人类留下的知识变成了可调用的智能;世界模型要把人类尚未经历的可能性,变成机器可训练的经验。 ——凯哥讲 AI
结语:AI 的下一站,是从“知道”走向“做到”
大模型让机器学会了说,空间智能要让机器学会在世界中存在。两者之间的差距,不只是增加一个动作输出头,而是从符号概率跨越到物理因果,从一次回答跨越到持续行动,从“生成得像”跨越到“执行得对”。
李飞飞与 SceniX 的这次联手,真正值得行业记住的,不是又一家明星公司进入机器人赛道,而是机器人产业的基础逻辑正在改变:现实不再是唯一训练场,仿真不再只是研发辅助工具,世界本身开始成为一种可以被生成、计算、验证和运营的基础设施。
当数字世界足够可信,机器人就可以在里面经历一百万次现实中不敢发生、来不及发生、没有条件发生的事情。然后,它带着这些“未曾发生的经验”回到现实。
人类文明的进步,从来不只靠亲自撞过每一堵墙。我们靠故事、模型、实验、推演和想象,把别人的经历和没有发生的可能变成自己的判断。现在,机器也要开始获得这种能力了。
这才是“人也不全靠现实数据学习”背后最激动人心的部分:我们不是在教机器人模仿过去,而是在为它们建造可以练习未来的世界。

《精益场景咨询白皮书》
以场景牵引战略、数据与AI,形成可运行、可核验、可复制、可运营的场景生产体系。
Lean Scenario Innovation Method · 2026
凯哥讲 AI|智胜系列
策略决定边界,洞察穿透表象,行动创造价值。

书籍简介

Springer Nature 出版社已经签约出版此书的全球版
敬请期待
“精益数据方法,是基于20年中国信息化,数字化市场的深度实践,超过100家大型头部企业的数字化转型规划,实施的落地总结沉淀出的,以数据要素为核心,以价值场景为抓手的中国特色的数字化转型方法论和体系化实践工具。
2023年已经出版了原创著作《精益数据方法论-数据驱动的数字化转型》,并且已经在多个全球头部行业领军企业落地。
精益数据方法,将精益思想深度融合到企业数字化转型领域,以创造价值,消除浪费为目标,打造高质量发展的数字化企业,助力企业在新的数字化时代获得高响应力,建立数据驱动的企业。”
如何找场景? 如何让场景落地?
如何让企业建立起持续生产高质量场景的组织能力?
场景创新咨询落地 | 数据智能咨询落地
精益数据训练营/解决方案架构师特训营
从数据到价值:精益数据工作坊
数字化咨询教练陪跑服务:
数字化转型规划 | 顶层设计 |企业创新与运营
IT战略规划 | IT服务管理体系 | 数据治理
往期推荐内容
智胜|Agent Discovery:AI 时代的价值互联网
智胜|从“智能体应用”到“智能互联网”:中国智能体政策的底层逻辑与产业范式跃迁
富贵研究所 | 我们花了 7 天,才把 AI 编程的起点搭起来
富贵研究所 | CEO 都开始写代码了,你的老黄牛思维还没醒悟?
凯哥 | AI 时代:TOGAF 没过时,但它已经不再够用了
富贵研究所 | AI 时代,答案越来越便宜,真正值钱的只剩一种能力










夜雨聆风