夜雨聆风学习资料网

ARTICLE · 1083692

Physical AI 已到范式前夜:触觉撬开最后一毫米,统一模型轮廓初现

Physical AI 已到范式前夜:触觉撬开最后一毫米,统一模型轮廓初现
9月GPT-6 Astra发布,粗活干得漂亮:积木取放成功率95%,是Claude Fable 5.1的近5倍。但一到毫米级精度就露怯:凹槽拼图插入,成功率只有10%——每次都能精准走到正上方,偏偏最后一按就错位、打滑。
业内一句话戳中要害:纯数字模型活在无损的向量世界里,物理世界的最后一毫米,永远藏着摄像头看不见的摩擦力、形变和接触状态。
过去三个月,整个领域都在 rush 同一件事:把触觉,真正塞进世界模型里。
不是当成外挂补充,而是从底层重构具身智能的输入输出体系。目前已经清晰分出两条技术路线,更重要的是——很多人直觉里的「触觉符号化」「物理世界收敛」,正在被实验一步步验证。
两条路线:殊途同归的触觉革命
路线一:触觉原生,和视觉平权的联合预测
第一条路最激进——直接把触觉提升到和视觉同等的地位,模型同时预测「下一步的画面」和「下一步的触觉」,从预训练阶段就深度绑定。
代表工作是7月NeoteAI联合复旦推出的𝑁₀-TWAM,也是首个大规模触觉原生世界动作模型。
它的核心不是直接喂传感器原始图像,而是先转换成NeoForce力空间:fx/fy剪切力、fz压力、接触掩码,全部是带物理单位的标准化量。相当于把触觉翻译成了模型能懂的「统一语言」——也就是大家常说的「触觉符号化」。
结果非常直白:8项真机任务平均成功率46.3%,而纯视觉的SOTA只有30%。差距最大的恰恰是「摄像头失明时刻」:把瓶子直立放稳,70% vs 20%;插座插拔,70% vs 60%。视线被挡住的地方,就是触觉的绝对主场。
产业界也在快速跟进:9月理想发布的ME-Dex-1.0,用「标准手模型」统一不同机械臂的触觉坐标,未来触觉和未来视频联合生成,走的也是同一条触觉原生路线。
路线二:触觉门控,只在关键点位出手核验
第二条路更务实,也更符合工程逻辑——触觉不用全程在线,只在接触瞬间、受力关键点当「裁判」,做核验和校正。
这里有个非常反直觉的发现:如果把触觉全程硬塞进模型,成功率反而会下降9%。
原因很简单:自由空间里触觉全是噪声,反而会把注意力从视觉目标上拽走。触觉的价值本来就只在「接触发生的那一刻」。
代表工作CVPR 2026的AT-VLA,做了一个可学习的「触觉门」:
- 没接触时,就是原版VLA,视觉主导,性能不打折;
- 接触瞬间,注意力自动切换到触觉token。
再配上快慢双流(慢语义推理+快触觉反射),0.04秒闭环,成功率直接从22%拉到50%。
更极致的HiTac-WAM把这个思路做到了极致:执行前先给每个动作预测「接触→形变→滑移风险」三层未来,按风险排序;执行中一旦实测触觉和预测偏差超标,立刻触发重规划。
最终真机成功率从基线31.1%,先靠触觉排序提到61.1%,再加反射回路冲到72.2%。
GPT-6的物理课,和巨头的暗战
纯符号推理的天花板,就是物理世界的地板GPT-6的表现,刚好画出了纯大模型路线的边界:
- 强项:宏观、粗粒度、靠几何推理就能搞定的任务,95%成功率,成本还低;
- 短板:毫米级接触、需要力反馈的精细操作,直接跌到10%,和上一代没拉开差距。
本质原因其实很简单:
大模型的成功,是在人类构造的符号世界里的成功。文字、图像、代码,都是离散、平滑、无损的符号;但物理世界是连续的、有摩擦的、有隐状态的——你看不见接触面的粗糙程度,猜不准物体的重量,算不出形变的回弹。靠纯视觉+推理,可以走完99%的路程,但最后一毫米的接触,必须靠触觉来闭环。
巨头都在押注下一张入场券
产业端的动作已经非常明确:
- OpenAI 3月成立内部机器人部门,Altman确认自研人形机器人,和Figure断约后转做自研Helix;
- NVIDIA 129亿美元收购Hugging Face,把世界模型+机器人作为下一代核心赛道;
- 国内理想、宇树等企业也在密集发布触觉+世界模型方案,从硬件到模型全线推进。
巨头都明白:下一个十年的Physical AI,触觉是绕不开的入场券。
两个深层判断和正在浮现的统一范式
触觉符号化能复刻视觉的胜利吗?
方向完全正确,但必须补上三个前提,否则只会适得其反:
1. 符号必须是物理量,不是传感器外观
不能直接拿凝胶图像当输入,必须转成力、力矩、滑移量这些有物理意义的量,才能跨传感器、跨本体复用。
2. 不能全程同权,必须门控稀疏
触觉是事件驱动的,自由空间几乎无信息,全程硬塞只会干扰视觉,接触门控才是最优解。
3. 双频率系统
慢系统做语义规划,快系统做触觉反射,就像人的大脑+脊髓反射,各司其职。
简单说:触觉不是第二个视觉,它是物理世界的「纠错信号」和「接触开关」。
物理世界收敛,统一模型一定会出现?
物理世界受定律约束,解空间比开放的文本、图像窄得多,所以必然会收敛出一个高效的统一架构。
但要修正一点:收敛≠容易解。
接触动力学是混合非光滑系统:接触瞬间的切换、摩擦的不确定性、柔性形变,都会带来不连续和分叉。再加上传感器噪声、磨损、隐状态不可见,注定了它不会像NLP那样一个Transformer打天下。
但强信号已经出现:过去三个月,𝑁₀-TWAM、ME-Dex、DexTacWAM三套独立工作,架构正在高度趋同:
多专家(视觉/触觉/动作)+ 共享注意力 + 联合未来预测 + 接触门控 + 高频反射 + 分阶段训练
这很像2017年Transformer出现前夜的格局——候选的统一范式已经隐约可见,就是:
力空间原生表征 + 扩散流匹配世界模型 + 慢推理快反射双系统
结尾
从去年的世界模型爆发,到今年的触觉全面上车,具身智能正在完成从「看得到」到「摸得到」的关键一跃。
GPT-6没跨过的最后一毫米,恰恰是下一代AI的起跑线。毕竟,真正的智能,从来都不是只活在屏幕里的。

相关学习资料