夜雨聆风学习资料网

ARTICLE · 1093694

AI 编程撞上具身智能

AI 编程撞上具身智能

我先问你一个问题。

过去一年,我们聊 AI 编程,聊的是 Copilot 帮你补全代码、Agent 帮你改 Bug。但最近一周,几条新闻放在一起看,味道变了。

斯坦福和 Caltech 用 GPT-6 直接指挥 Unitree 机器人整理陌生厨房;Black Forest Labs 开源了一个 70 亿参数的世界动作模型,在机器人控制基准上登顶;Perceptron 发布 35B 具身智能体模型,控制无人机、四足机器人,速度提升 4.7 倍。

与此同时,一位开发者写下了停用 AI 编码一个月的复盘,记录下失去代码掌控、单任务烧掉 30 美元 token 的真实代价。

表面上,这是两条平行的新闻线。一条关于软件,一条关于硬件。

本质上,它们正在同一张桌子上碰杯。

现象:机器人开始“听懂人话”了

先说最直观的变化。

过去,教机器人做任务,你得采集大量环境专属数据,训练专门的策略模型。换一个厨房,可能就要重新来一遍。

但这次斯坦福和 Caltech 的工作,叫 HomeBody。它用 GPT-6 Astra 直接调用技能库,驱动机器人完成长程任务。不需要环境专属训练数据,也不需要额外的策略学习。

这意味着什么?

意味着具身智能的瓶颈,可能正从“数据采集”转向“技能接口与推理可靠性”。

再看 FLUX 3 Action。70 亿参数,以视频数据训练,在 RoboLab-120 上拿到 42.92%,超过更大模型。这说明视频预训练加动作预测的路线,可能比纯 VLA 更高效。

还有 EmbodiedSWE。它用编码智能体为机器人长时程任务生成监督信号,发现前沿编码智能体可以跨任务、跨本体迁移解法。

你发现没有?AI 编程和具身智能,正在打通。

表面原因:模型变强了

表面上看,这些进展都归功于模型能力提升。

GPT-6 更强了,所以能直接驱动机器人。视频预训练更成熟了,所以 7B 模型能超过更大模型。编码智能体更聪明了,所以能生成监督信号。

这没错。但这不是本质。

本质原因:交易成本在重构

我们退一步看商业底层逻辑。

机器人这件事,过去为什么难?因为交易成本太高。

你要为每一个新环境、每一个新任务,付出巨大的数据采集和策略训练成本。这个成本,本质上是“适配成本”。

但现在,HomeBody 证明 VLM 可以直接调用技能库。这意味着,适配成本从“训练”转移到了“推理”。

推理成本,随着模型效率提升,正在快速下降。

FLUX 3 Action 只有 70 亿参数,却登顶基准。这说明什么?说明参数效率在提升。单位算力能买到的智能,变多了。

EmbodiedSWE 更直接。它把机器人数据稀缺问题,部分转化为代码级合成与验证问题。代码生成和验证,恰恰是 AI 编程最擅长的领域。

这就是本质:AI 编程积累的能力,正在外溢到具身智能。

原来需要采集数据、训练策略的环节,现在可以用代码合成、推理调用来替代。交易成本的结构,变了。

案例:一边是 30 美元,一边是 4.7 倍

但别急着乐观。

那位停用 AI 编码一个月的开发者,给出了另一面。他记录了几个真实代价:失去代码掌控、测试未覆盖场景、单任务烧掉 30 美元 token。

这告诉我们什么?

AI 编程的边际收益,在某些场景下正在递减。当任务复杂度上升,Agent 的可靠性下降,审查成本上升。

而 Perceptron 的 Mk1.5,用单一 35B 模型控制无人机、四足机器人和智能眼镜,请求完成速度最高提升 4.7 倍。它已经在 OpenRouter 上线。

这意味着物理智能体模型,开始以 API 形式进入开发者生态。

一边是软件 Agent 的边际收益递减,一边是物理 Agent 的通用化与实时化。这两条线交汇的地方,就是机会和风险并存的地方。

方法建议:三个可执行动作

如果你是从业者或创业者,我给你三条建议。

第一,重新审视你的技能接口。如果你的机器人软件栈还是分层控制加模仿学习,现在可以开始思考:哪些环节可以被 VLM 直接调用替代?哪些技能可以封装成标准接口?

第二,把代码能力当作具身智能的杠杆。EmbodiedSWE 的思路值得借鉴:用编码智能体生成监督信号,用代码合成解决数据稀缺。你的 AI 编程团队,可能比你想象的更接近机器人业务。

第三,建立 Agent 使用规范。那位开发者的复盘是真实教训。在团队里明确:什么任务适合交给 Agent,什么任务必须人工审查,token 成本如何控制。边际收益递减不是放弃的理由,而是精细化管理的起点。

金句收束

AI 编程和具身智能,正在从两条平行线,变成一条螺旋上升的曲线。

软件里踩过的坑,硬件里可能还要再踩一遍。但软件里积累的能力,硬件里可以直接复用。

真正的机会,不在模型本身,而在交易成本重构的缝隙里。

谁先看清这个缝隙,谁就能在下一轮里,少烧一点 token,多走一步路。

相关学习资料