ARTICLE · 1124804
长期方向调研笔记:AI 时代的十年选择(2)
01Day 2 概览:物理智能
开幕定调:数字 IT 产业约 6 万亿美元(全球 GDP 5%),制造业 18 万亿(15%),再加农业/能源/采矿/建筑共 36 万亿(全球三分之一);美国 6800 万体力劳动者 vs 5000 万白领。工业界缺的是"高度智能的概率性系统"。
01
Periodic Labs:AI 科学家与自主实验室
(Liam Fettis,前 OpenAI 后训练负责人、ChatGPT 团队核心、MIT 物理博士)
使命:构建"能理解和有效生成物质的系统";训练数据不是论文和教科书,而是记录科学研究如何完成的完整脉络。
物理世界 RL 与数字 RL 本质不同:智能体不能弹性扩展、rollout 以天计、奖励信号模糊。
用自研 harness 把 Opus 5 在 XRD 物相鉴定上提升 23 个点;将 Kimi K2-6 从 3% 成功率做到超越 GPT-6 Astra。
全程只用 1300 块 H200,对比 GPT-6 Astra 据报 10 万块 GB300(约 250 倍有效算力差距)——赢在自有实验数据闭环,不在算力。
工程杠杆:训练吞吐 4 倍(Megatron)、推理 2.5 倍(SGLang)、沙箱 3 倍。
满配实验室几周可完成原需四个月的合成量。
金句:"只要物理定律允许,我们就能把它造出来。""归根结底,计算是物理的。Transformer 中每一次加法与乘法的背后,都只是对原子的精密工程。"
02
NVIDIA Cosmos:世界基础模型
(Ming-Yu Liu,Cosmos 实验室负责人)
类比:热力学→内燃机→专用车辆(摩托车/跑车/卡车/公交)。深度学习是热力学,模型是发动机,不同应用仍需专用设计——"没有免费午餐"。
多智能体工厂愿景:订单 Agent→跨厂库存 Agent→工厂 Agent→人形机器人 Agent→运输 Agent→装配 Agent→质检 Agent 协同。"主要假设:未来是多智能体。"
Cosmos 三大用途:合成数据(罕见场景)、仿真环境(用算力替代实体车队验证策略)、策略骨干。
Cosmos 3 双塔架构(自回归 VLM + 扩散 Transformer),首个把 action 作为一等公民的基座模型。
明确边界:"我们不是为内容创作/做电影而建的"——世界模型的最大买家是机器人/AV 开发者,不是内容消费者。
200+ 家物理公司在生产管线使用;问答:硬件进步很快,数据和算力仍是瓶颈。
03
World Engine 圆桌(Waymo 主持)
ROI 排序:"结构化环境+非结构化任务"最先盈利——制造与物流。
人形机器人进家庭预测从 2.5 年到 2045 年,分歧巨大;中国硬件成本大降是变量。
Li Jing 反共识:智能任务会比重复性任务更早被解决(GPT-6 已可零样本解决大多数机器人任务);主张"部署模型只做 System 1、推理全部卸载给云端"的双层架构。
"Sora 用了零 3D 数据。它纯粹是视频生成,最终自己学会了所有 3D。"(Li Jing)
Oliver Cameron(Odyssey):世界模型才几百亿参数、LLM 已数万亿——去年投入世界模型的资金约等于 2022 年的 LLM,规模曲线会被重写。"如果你想要在虚拟和物理世界运作的真正超级智能,需要世界模型和语言模型的结合。Omni models for the win."
仿真之辩:Li Jing 反对仿真训练(人工场景盖不住长尾);Waymo 坚持仿真是安全验证关键杠杆;共识:先评估后训练,"世界模型会大幅拉近 sim2real 差距"。
数据一年剧变:"说数据在拖物理 AI 后腿已经不对了。数据就在那里,需要去买。"(Oliver Cameron)
04
Nebius 炉边:算力生态
Yandex 分拆、900 工程师起步;3/4 收入来自湾区 100 英里内;愿景"下一个 AWS",1000 亿美元收入路径。
GPU 供需:pipeline 每块 GPU 有 4 个客户排队、75% 时间在拒绝客户;预测者 15 个月来全错。
定价演进:GPU 小时→token→按结果付费(按完成通话/记录/交易计费)。
推理是最快增长业务、快速走向 10 亿美元规模、将超过训练。
结论:"我们将销售一个智能平台,而不仅仅是销售推理——推理只是获取智能的 API。"
05
Generalist AI:机器人 Scaling Law
(Pete Florence,PaLM-E/RT-2 作者)
Gen 0(2025.11)把 scaling law 引入机器人,27 万小时数据(当时高一个数量级);发现 1B 模型"骨化"、7B 起持续改进的阈值现象。
Gen 1:单任务 1 小时数据微调至 99%+ 成功率、速度 3 倍、出现即兴智能。
Gen 1.5:3-12 秒数据 in-context one-shot;零样本工具即兴(香蕉当刷子、簸箕铲积木)。
跨本体:除手以外对任意机械臂零样本泛化。
RL 观:test-time training 就是微调的重新包装;预训练越强,越不需要从零摸索的 RL。
06
Dyna Robotics:人类→机器人迁移
Dyna1 首个 99%+ 可靠 VLA(24 小时叠数千餐巾零失败)。
Dyna2 用 100 万+小时第一人称人类视频预训练,首次确立"人类→机器人迁移 scaling law"——训练人类数据可预测地提升机器人性能,且完全不需机器人参与采集。
反直觉发现:五指灵巧手达到 80% 成功率所需数据反而比平行夹爪少——因为更接近预训练(人类)分布。"设计机器人应尽可能贴近预训练数据分布,哪怕硬件更难。"
部署哲学:"部署是机器人领域终极的、唯一重要的 eval。"
商业:鼎泰丰美国 10+ 门店、Best Western,客户主动要求多站点扩张。
07
Laminar:流程制造的化学智能
(Annie Liu)
论点:流程工业 = 50% 制造业、万亿美元级、无人关注的"化学智能"空白。
驱动:利润压缩、SKU 爆炸(一客户 10 年从 4 种产品到 300 种)、97% 产能是棕地老旧环境。
核心洞察:"整个制造业世界运行在硬编码上"——PLC/SCADA 全静态,操作员取样每批才一个数据点。
打法:自研专利在线传感器("为制造业发明 LiDAR 和摄像头")+分子基础模型+闭环自主。
结果:六大洲数百工厂;全球十大食品饮料商中 7 家在用;可口可乐每条线省 7 万美元/年。
08
Reality Gap 圆桌:机器人落地的血泪
血泪案例:静电随温湿度变化导致放弃任务;机器人被要求 10 倍于人类的质量标准。
Josh 的 hot take:"台上没有人在真正使用预训练,大家都在做任务特定模型。"
"真正的苦涩教训是只有部署才能规模化。"(Walden Adrian)解法是自动驾驶式的"共享自主"(AI+远程人)。
98-99% 成功率才商业可行——护机员每天帮几次就毁掉商业逻辑。
遥操作经济学:H100 3-4 美元/小时 vs 菲律宾遥操作员 12-15 美元/小时——人机混合劳动力的定价已被量化。
5 年价值分配之辩:Adrian"0/90/10"(模型层 0%!)、Nikhil"15/70/15"、Josh"没人知道所以全做"。
"智能已不是瓶颈,是单位经济学。"(Tutor Intelligence)
09
AI for Bio 座谈
Hetu(Zera CEO,David Baker 首位 AI 科学家)
Zera:完全整合的 AI 药企,3 年,主打管线为肿瘤。
核心资产:X-Atlas——世界最大疾病扰动数据集(自建湿实验生成),构建症状→病因的因果模型。
"现代制药已擅长造分子,难的是该让药去做什么"(靶点发现)。
"没有任何东西是真正不可成药的"——20-30 年经验同事两年前说不可能的事已做到。
瓶颈方法论:"把最慢的一步变快,你只会发现下一个最慢的步骤。"
FDA 出乎意料地灵活,释放了所有正确信号。
监管洞见:"模型本身无法监管——几块 GPU 就能训个不错的模型。要监管就监管 DNA 合成,那是生物界的台积电。"
Eric Nguyen(Radical Numerics CEO,Evo/Evo2 创造者)
开创"生成式基因组学":训练语言模型读取、编写、生成 DNA 序列。
关键数据:网上公开的 DNA 比整个互联网的文本还多,而这些模型的表达能力基本相当于线性回归——巨大差距在模型。
缺好下游评测;关键在"上下文"(同一 DNA 在脑细胞/肝细胞/疾病态下不同);下一代模型将融合几十种模态成单一表示。
非药应用:稀土提取蛋白(亲和力数值当奖励做 RL)、生物防御("深度伪造病毒"检测)。
护城河之辩:"当模型把旧瓶颈商品化后,速度和执行成为捕获价值的关键——制药 10-15 年没人重视速度。"
10
Jerry Tworek 炉边(前 OpenAI 研究VP、O1 推理负责人)
轨迹:波兰数学系→5 年量化交易→AlexNet/RL 启发进 OpenAI→机械手解魔方→"对代码做 RL"(代码有语义、奖励易构造)→领导 coding/agent/RL 大部分工作。
创业动机:①用 Agent 做研究——在 OpenAI 碰组织障碍,"大船难转向";②"还有别的方法训练大规模神经网络,可能更好"——研究者的直觉(OpenAI/Anthropic 现有配方"在印钞",但改变成功配方很难)。
持续学习定义:模型在测试时从现实数据/用户交互中学习;"据我所知,世界上没有人知道怎么做持续学习"。
"取代 Transformer 的第一步,是深深地欣赏它。……但时候到了。其他瓶颈基本都解决了,现在的瓶颈就在这里。"
Backprop 是持续学习的根本瓶颈:梯度下降数据效率低+灾难性遗忘,"没人真正知道怎么解决"。
人类在环:"当今模型对齐/理解都不够,不能无人监督";目标是"一个人跑 10-100 个实验",同时监督 Agent 是否在乱来。
企业智能平台愿景:"用你的数据训练出的模型,对你来说更好。LLM 知道每个球员、英国所有国王女王、波兰每个小村庄,但对我和我昨天干了什么知之甚少。如果反转过来呢?"
基准悖论:"现在的大模型能解决所有基准,但问题是:那又怎样?为什么能解千禧年难题的模型在我日常工作面前失败?"
11
Day 2 收尾 VC 圆桌
Ajay Agarwal(Bain,2004 年起投机器人):"价值在系统层——跨层整合"(Kiva 连货架都自己做);"不可能提前知道那一百万个问题,除非你把机器人放到现场。"(Kiva 教训:Staples 首周全挂——1% 坡度/油污/灰尘/条码/网络)
Connor Lovely(Capital G):"自主性本身不是产品,是服务。"三问框架:能力是否达到/超人类?需求是否真实拐点?采用摩擦多大?
Rob Toews(Radical):"每一层都有巨大赢家,别问押哪层;若必须选,最大奖赏在模型层(寡头格局)。对创业者而言现在是机器人创业的最好时机。""原子世界比比特世界复杂太多。机器人有非常参差不齐的前沿,要仔细挑客户。"
PMF 唯一真定义:"机器人部署在生产环境、产生生产收入,而非试点——改这个定义就是自欺欺人。"
"现在像 Harvey 获投的时刻——一堆明显的超大市场与 AI 有清晰 PMF。制造业、建筑、物流就在这里。"(Connor)
制造业 18 万亿美元 > 任何数字产业;AI 原生服务公司(Corgi 保险/Crosby 法律)模式在物理世界会非常大。