夜雨聆风学习资料网

ARTICLE · 1124804

长期方向调研笔记:AI 时代的十年选择(2)

长期方向调研笔记:AI 时代的十年选择(2)

01Day 2 概览:物理智能

开幕定调:数字 IT 产业约 6 万亿美元(全球 GDP 5%),制造业 18 万亿(15%),再加农业/能源/采矿/建筑共 36 万亿(全球三分之一);美国 6800 万体力劳动者 vs 5000 万白领。工业界缺的是"高度智能的概率性系统"。

01

Periodic Labs:AI 科学家与自主实验室

(Liam Fettis,前 OpenAI 后训练负责人、ChatGPT 团队核心、MIT 物理博士)

▪

使命:构建"能理解和有效生成物质的系统";训练数据不是论文和教科书,而是记录科学研究如何完成的完整脉络。

▪

物理世界 RL 与数字 RL 本质不同:智能体不能弹性扩展、rollout 以天计、奖励信号模糊。

▪

用自研 harness 把 Opus 5 在 XRD 物相鉴定上提升 23 个点;将 Kimi K2-6 从 3% 成功率做到超越 GPT-6 Astra。

▪

全程只用 1300 块 H200,对比 GPT-6 Astra 据报 10 万块 GB300(约 250 倍有效算力差距)——赢在自有实验数据闭环,不在算力。

▪

工程杠杆:训练吞吐 4 倍(Megatron)、推理 2.5 倍(SGLang)、沙箱 3 倍。

▪

满配实验室几周可完成原需四个月的合成量。

▪

金句:"只要物理定律允许,我们就能把它造出来。""归根结底,计算是物理的。Transformer 中每一次加法与乘法的背后,都只是对原子的精密工程。"

02

NVIDIA Cosmos:世界基础模型

(Ming-Yu Liu,Cosmos 实验室负责人)

▪

类比:热力学→内燃机→专用车辆(摩托车/跑车/卡车/公交)。深度学习是热力学,模型是发动机,不同应用仍需专用设计——"没有免费午餐"。

▪

多智能体工厂愿景:订单 Agent→跨厂库存 Agent→工厂 Agent→人形机器人 Agent→运输 Agent→装配 Agent→质检 Agent 协同。"主要假设:未来是多智能体。"

▪

Cosmos 三大用途:合成数据(罕见场景)、仿真环境(用算力替代实体车队验证策略)、策略骨干。

▪

Cosmos 3 双塔架构(自回归 VLM + 扩散 Transformer),首个把 action 作为一等公民的基座模型。

▪

明确边界:"我们不是为内容创作/做电影而建的"——世界模型的最大买家是机器人/AV 开发者,不是内容消费者。

▪

200+ 家物理公司在生产管线使用;问答:硬件进步很快,数据和算力仍是瓶颈。

03

World Engine 圆桌(Waymo 主持)

▪

ROI 排序:"结构化环境+非结构化任务"最先盈利——制造与物流。

▪

人形机器人进家庭预测从 2.5 年到 2045 年,分歧巨大;中国硬件成本大降是变量。

▪

Li Jing 反共识:智能任务会比重复性任务更早被解决(GPT-6 已可零样本解决大多数机器人任务);主张"部署模型只做 System 1、推理全部卸载给云端"的双层架构。

▪

"Sora 用了零 3D 数据。它纯粹是视频生成,最终自己学会了所有 3D。"(Li Jing)

▪

Oliver Cameron(Odyssey):世界模型才几百亿参数、LLM 已数万亿——去年投入世界模型的资金约等于 2022 年的 LLM,规模曲线会被重写。"如果你想要在虚拟和物理世界运作的真正超级智能,需要世界模型和语言模型的结合。Omni models for the win."

▪

仿真之辩:Li Jing 反对仿真训练(人工场景盖不住长尾);Waymo 坚持仿真是安全验证关键杠杆;共识:先评估后训练,"世界模型会大幅拉近 sim2real 差距"。

▪

数据一年剧变:"说数据在拖物理 AI 后腿已经不对了。数据就在那里,需要去买。"(Oliver Cameron)

04

Nebius 炉边:算力生态

▪

Yandex 分拆、900 工程师起步;3/4 收入来自湾区 100 英里内;愿景"下一个 AWS",1000 亿美元收入路径。

▪

GPU 供需:pipeline 每块 GPU 有 4 个客户排队、75% 时间在拒绝客户;预测者 15 个月来全错。

▪

定价演进:GPU 小时→token→按结果付费(按完成通话/记录/交易计费)。

▪

推理是最快增长业务、快速走向 10 亿美元规模、将超过训练。

▪

结论:"我们将销售一个智能平台,而不仅仅是销售推理——推理只是获取智能的 API。"

05

Generalist AI:机器人 Scaling Law

(Pete Florence,PaLM-E/RT-2 作者)

▪

Gen 0(2025.11)把 scaling law 引入机器人,27 万小时数据(当时高一个数量级);发现 1B 模型"骨化"、7B 起持续改进的阈值现象。

▪

Gen 1:单任务 1 小时数据微调至 99%+ 成功率、速度 3 倍、出现即兴智能。

▪

Gen 1.5:3-12 秒数据 in-context one-shot;零样本工具即兴(香蕉当刷子、簸箕铲积木)。

▪

跨本体:除手以外对任意机械臂零样本泛化。

▪

RL 观:test-time training 就是微调的重新包装;预训练越强,越不需要从零摸索的 RL。

06

Dyna Robotics:人类→机器人迁移

▪

Dyna1 首个 99%+ 可靠 VLA(24 小时叠数千餐巾零失败)。

▪

Dyna2 用 100 万+小时第一人称人类视频预训练,首次确立"人类→机器人迁移 scaling law"——训练人类数据可预测地提升机器人性能,且完全不需机器人参与采集。

▪

反直觉发现:五指灵巧手达到 80% 成功率所需数据反而比平行夹爪少——因为更接近预训练(人类)分布。"设计机器人应尽可能贴近预训练数据分布,哪怕硬件更难。"

▪

部署哲学:"部署是机器人领域终极的、唯一重要的 eval。"

▪

商业:鼎泰丰美国 10+ 门店、Best Western,客户主动要求多站点扩张。

07

Laminar:流程制造的化学智能

(Annie Liu)

▪

论点:流程工业 = 50% 制造业、万亿美元级、无人关注的"化学智能"空白。

▪

驱动:利润压缩、SKU 爆炸(一客户 10 年从 4 种产品到 300 种)、97% 产能是棕地老旧环境。

▪

核心洞察:"整个制造业世界运行在硬编码上"——PLC/SCADA 全静态,操作员取样每批才一个数据点。

▪

打法:自研专利在线传感器("为制造业发明 LiDAR 和摄像头")+分子基础模型+闭环自主。

▪

结果:六大洲数百工厂;全球十大食品饮料商中 7 家在用;可口可乐每条线省 7 万美元/年。

08

Reality Gap 圆桌:机器人落地的血泪

▪

血泪案例:静电随温湿度变化导致放弃任务;机器人被要求 10 倍于人类的质量标准。

▪

Josh 的 hot take:"台上没有人在真正使用预训练,大家都在做任务特定模型。"

▪

"真正的苦涩教训是只有部署才能规模化。"(Walden Adrian)解法是自动驾驶式的"共享自主"(AI+远程人)。

▪

98-99% 成功率才商业可行——护机员每天帮几次就毁掉商业逻辑。

▪

遥操作经济学:H100 3-4 美元/小时 vs 菲律宾遥操作员 12-15 美元/小时——人机混合劳动力的定价已被量化。

▪

5 年价值分配之辩:Adrian"0/90/10"(模型层 0%!)、Nikhil"15/70/15"、Josh"没人知道所以全做"。

▪

"智能已不是瓶颈,是单位经济学。"(Tutor Intelligence)

09

AI for Bio 座谈

Hetu(Zera CEO,David Baker 首位 AI 科学家)

▪

Zera:完全整合的 AI 药企,3 年,主打管线为肿瘤。

▪

核心资产:X-Atlas——世界最大疾病扰动数据集(自建湿实验生成),构建症状→病因的因果模型。

▪

"现代制药已擅长造分子,难的是该让药去做什么"(靶点发现)。

▪

"没有任何东西是真正不可成药的"——20-30 年经验同事两年前说不可能的事已做到。

▪

瓶颈方法论:"把最慢的一步变快,你只会发现下一个最慢的步骤。"

▪

FDA 出乎意料地灵活,释放了所有正确信号。

▪

监管洞见:"模型本身无法监管——几块 GPU 就能训个不错的模型。要监管就监管 DNA 合成,那是生物界的台积电。"

Eric Nguyen(Radical Numerics CEO,Evo/Evo2 创造者)

▪

开创"生成式基因组学":训练语言模型读取、编写、生成 DNA 序列。

▪

关键数据:网上公开的 DNA 比整个互联网的文本还多,而这些模型的表达能力基本相当于线性回归——巨大差距在模型。

▪

缺好下游评测;关键在"上下文"(同一 DNA 在脑细胞/肝细胞/疾病态下不同);下一代模型将融合几十种模态成单一表示。

▪

非药应用:稀土提取蛋白(亲和力数值当奖励做 RL)、生物防御("深度伪造病毒"检测)。

▪

护城河之辩:"当模型把旧瓶颈商品化后,速度和执行成为捕获价值的关键——制药 10-15 年没人重视速度。"

10

Jerry Tworek 炉边(前 OpenAI 研究VP、O1 推理负责人)

▪

轨迹:波兰数学系→5 年量化交易→AlexNet/RL 启发进 OpenAI→机械手解魔方→"对代码做 RL"(代码有语义、奖励易构造)→领导 coding/agent/RL 大部分工作。

▪

创业动机:①用 Agent 做研究——在 OpenAI 碰组织障碍,"大船难转向";②"还有别的方法训练大规模神经网络,可能更好"——研究者的直觉(OpenAI/Anthropic 现有配方"在印钞",但改变成功配方很难)。

▪

持续学习定义:模型在测试时从现实数据/用户交互中学习;"据我所知,世界上没有人知道怎么做持续学习"。

▪

"取代 Transformer 的第一步,是深深地欣赏它。……但时候到了。其他瓶颈基本都解决了,现在的瓶颈就在这里。"

▪

Backprop 是持续学习的根本瓶颈:梯度下降数据效率低+灾难性遗忘,"没人真正知道怎么解决"。

▪

人类在环:"当今模型对齐/理解都不够,不能无人监督";目标是"一个人跑 10-100 个实验",同时监督 Agent 是否在乱来。

▪

企业智能平台愿景:"用你的数据训练出的模型,对你来说更好。LLM 知道每个球员、英国所有国王女王、波兰每个小村庄,但对我和我昨天干了什么知之甚少。如果反转过来呢?"

▪

基准悖论:"现在的大模型能解决所有基准,但问题是:那又怎样?为什么能解千禧年难题的模型在我日常工作面前失败?"

11

Day 2 收尾 VC 圆桌

▪

Ajay Agarwal(Bain,2004 年起投机器人):"价值在系统层——跨层整合"(Kiva 连货架都自己做);"不可能提前知道那一百万个问题,除非你把机器人放到现场。"(Kiva 教训:Staples 首周全挂——1% 坡度/油污/灰尘/条码/网络)

▪

Connor Lovely(Capital G):"自主性本身不是产品,是服务。"三问框架:能力是否达到/超人类?需求是否真实拐点?采用摩擦多大?

▪

Rob Toews(Radical):"每一层都有巨大赢家,别问押哪层;若必须选,最大奖赏在模型层(寡头格局)。对创业者而言现在是机器人创业的最好时机。""原子世界比比特世界复杂太多。机器人有非常参差不齐的前沿,要仔细挑客户。"

▪

PMF 唯一真定义:"机器人部署在生产环境、产生生产收入,而非试点——改这个定义就是自欺欺人。"

▪

"现在像 Harvey 获投的时刻——一堆明显的超大市场与 AI 有清晰 PMF。制造业、建筑、物流就在这里。"(Connor)

▪

制造业 18 万亿美元 > 任何数字产业;AI 原生服务公司(Corgi 保险/Crosby 法律)模式在物理世界会非常大。

相关学习资料