
EMBEDDED AI · 2026.07 · 行业观察
从一篇论文、一次融资、一场专访里,我看到具身智能正在收敛的三条技术主线
架构共识 · 数据基建 · 长程任务—— 从"各自摸索",走向"技术共识"
这周,具身智能领域几乎同时冒出了几件表面上互不相关的事:一篇学术论文推翻了一个"直觉正确"的做法,一家成立不到一年的公司融了三轮钱,一位芯片公司的技术负责人在专访里反复强调"数据",一个联合实验室发布的新模型专门去啃"长程任务"这块硬骨头。
单看每一件事,都只是行业里一条普通的新闻。但把它们放在一起读完,会发现这些独立事件其实在同一个方向上互相印证——具身智能这一波,正在从"各自摸索"走向"技术共识"。
· · ·
主线 01 / THE FIRST THREAD
架构共识:从"一个模型端到端出动作",转向"分层解耦"
ARCHITECTURE CONSENSUS · HIERARCHICAL DECOUPLING
最直接的证据,来自两项几乎同期出现的成果。
EVIDENCE · 学术成果
τ0-VLA:慢思考 × 快执行
上海创智学院罗剑岚团队与智元机器人具身研究中心联合发布。它提出了一套"慢思考 - 快执行"的分层架构:高层系统负责任务规划,用世界模型在"脑内"推演几步之后再决定怎么做;低层系统只负责把决策稳定地转化成动作执行。
两层分工之后,机器人处理长程任务(比如整理房间这种需要几十个连续决策步的任务)的成功率——
长程任务成功率
27.5% → 45%
绝对提升 +17.5 个百分点
值得一提的是,这个团队此前已经先后做过强化学习后训练系统 LWD 和预训练世界模型 τ0-WM——τ0-VLA 是把"规划、世界模型、执行"三块拼成一个完整闭环的最新一步。
EVIDENCE · 学术论文
T-Rex:视觉和触觉,根本不在一个节奏上
李飞飞、英伟达 Jim Fan、佐治亚理工徐丹飞等人联合发表的论文,主题是给灵巧手加触觉。团队最初的做法很直觉:把触觉信号编码成 token,和视觉、语言 token 一起塞进同一个 Transformer——这也是行业里大多数人的默认做法。
结果任务成功率不升反降,从 17% 掉到了 6%。
⚠️ 失败根因
两种信号根本不在一个节奏上:• 视觉:处理一帧几百毫秒,只能跑到 5–10Hz• 触觉:要捕捉"正在滑"和"已经滑了"的临界点,需要 20Hz 以上硬塞进同一个低频网络,两种信号谁都没被真正利用好。
团队后来改用一套异步架构,让视觉和触觉分开处理、协同工作——12 项任务的平均成功率做到了 65%(纯视觉方案只有 35%),开锁这类需要精细触感的任务甚至做到了 70% vs 0%。

📌 本章小结
两项工作指向同一个判断:具身智能不再相信"塞进更多模态、堆进同一个模型"就能获得更强能力,"把不同节奏的信号拆开处理、再协同"正在成为新的架构默认选项。
· · ·
主线 02 / THE SECOND THREAD
竞争焦点:模型之外,数据基建正在成为真正的护城河
DATA INFRASTRUCTURE · THE NEW MOAT
第二条线索,来自资本和产业侧。
EVIDENCE · 行业专访
NVIDIA Cosmos · Max Li 的判断
英伟达 Cosmos 团队负责人 Max Li 在专访里给出一个明确判断:action 数据必须成为预训练的一部分,这是物理 AI 底层逻辑正在被重写的标志。
他们的目标是让 Cosmos 成为物理 AI 领域的——
战略目标
物理 AI 的 "CUDA"
—— 一层所有人都绕不开的基础设施
EVIDENCE · 资本动向
正奇未来:8 个月,三轮融资,每轮都超募
由华为、百度前高管吴书林创立,成立 8 个月完成三轮融资,累计数亿元,且每轮都超募。
它做的不是单一款机器人,而是提出了 "Door-to-Door" 自主移动任务框架,用短途出行机器人 QUORRA 作为产品入口,持续采集真实生活场景里的移动数据,反哺 "QUORRA DoorMind" 世界模型。
⟳ 产品 → 数据 → 模型 → 产品 飞轮
公司自己给出的定位很直白:终局不是做一家卖得好的硬件公司,而是做"产品 → 数据 → 模型"自我强化的飞轮,让自己成为下一代物理 AI 绕不开的空间智能底座。
📊 数据规模与成本的硬数字
这条逻辑跟前面 T-Rex 论文里暴露的问题正好对上——
• 灵巧手数据的采集成本是平行夹爪的 5–10 倍,是当前触觉能力落后于视觉能力的重要原因之一
• τ0-VLA 能做到目前最大规模的真机数据预训练,靠的是 4 万多小时的真实物理交互数据积累

📌 本章小结
数据规模和数据质量,正在取代模型架构本身,成为具身智能公司之间比拼的核心变量。
· · ·
主线 03 / THE THIRD THREAD
下一道关卡:从"能完成一个动作",到"能完成一整段任务"
LONG-HORIZON TASKS · THE NEXT FRONTIER
第三条线索,是能力边界正在往哪个方向推进。
EVIDENCE · 模型设计
τ0-VLA:直接冲着长程任务去的
这项工作本身就是冲着"长程任务"去的——过去两年主流的 VLA 模型(π0.5、GR00T),已经能理解语言指令并完成短程操作;但面对需要多步骤持续推进、且要根据环境变化调整策略的任务,表现明显偏弱。
短程任务靠反应就够,长程任务需要记忆、推演和纠错。这也是为什么"想清楚再执行"的分层设计会成为突破口。
EVIDENCE · 产业一线
极智嘉陈曦:泛化解决"能不能",效率解决"值不值"
极智嘉联合创始人陈曦在专访里提出一个尖锐区分:泛化解决的是"能不能"的问题,效率解决的是"值不值"的问题,脱离效率谈泛化没有商业价值。
这句话背后的现实是,极智嘉是港股上市公司里少数真正盈利的机器人企业之一——它的判断更接近一线交付经验,而不是实验室结果。
另有观察者在行业展会现场记录到:不少演示机器人依赖预设固定流程,一旦现场环境和彩排有出入就容易出问题——这恰恰从反面说明,真正决定机器人能不能大规模商用的,不是单个动作做得多标准,而是能不能在环境变化时持续、稳定地完成一整段任务。
"
机器人真正的能力转折点其实在几年前就已经出现——当时机器人开始能够行走,并通过强化学习与物理世界对齐;物理 AI 业务营收已经接近百亿美元规模,是下一个千亿级赛道。
—— 黄仁勋 / NVIDIA CEO
🎯 最值得跟踪的指标
如果要把黄仁勋的乐观判断对应到一个具体、可持续跟踪的技术指标上——长程任务成功率的提升曲线,大概率就是最值得盯住的那个数字。

📌 本章小结
真正决定机器人能不能大规模商用的,不是单个动作做得多标准,而是能不能在环境变化时持续、稳定地完成一整段任务——这正是"长程任务能力"要解决的问题。

· · ·
OUTLOOK / 展望
这三条主线,接下来会往哪些细分方向长出新公司?
THREE THREADS · THREE NEW ARENAS
把三条主线放在一起看,可以往前推一步——接下来可能冒出来的三个细分赛道:
NEW ARENA · 01
分层解耦 → 独立的"任务规划层"
就像操作系统最终从应用层里独立出来一样,专门做"机器人大脑"——世界模型和任务规划——的中间件层,很可能会从整机公司里分离出来,成为被多家硬件厂商共用的标准组件。
NEW ARENA · 02
数据基建 → 专业化的数据供应链
真机数据采集、遥操作标注、灵巧手动作数据的规模化生产——成本高、门槛高,注定不会是每家机器人公司自己包办的事。参考当年 NLP 领域数据标注产业的兴起,物理 AI 领域很可能会出现专门的数据服务商,靠给多家客户提供高质量真机数据获得规模效应。
NEW ARENA · 03
长程任务 → 新的评测与验证产业
一旦"能不能完成一整段任务"成为衡量机器人商用价值的核心指标,怎么科学、标准化地衡量这件事本身,就会变成刚需——就像大模型评测行业在 LLM 爆发之后迅速成型一样,具身智能大概率也会走出一批专门做长程任务基准测试、仿真验证的公司。
一句话总结
这三条线目前都还在早期,但方向已经足够清晰:架构在收敛、竞争焦点在转移、能力边界在明确推进。这大概就是这一周看似分散的几条新闻,真正值得记下来的地方。
· · · · · ·
我会持续跟踪具身智能、AI 成本、大模型生态这些方向的一手信息,读原文、拆证据,尽量把行业里正在发生但还没被讲清楚的判断说明白。
欢迎关注我的公众号,一起看接下来会发生什么。
夜雨聆风