ARTICLE · 1093694
AI 编程撞上具身智能
我先问你一个问题。
过去一年,我们聊 AI 编程,聊的是 Copilot 帮你补全代码、Agent 帮你改 Bug。但最近一周,几条新闻放在一起看,味道变了。
斯坦福和 Caltech 用 GPT-6 直接指挥 Unitree 机器人整理陌生厨房;Black Forest Labs 开源了一个 70 亿参数的世界动作模型,在机器人控制基准上登顶;Perceptron 发布 35B 具身智能体模型,控制无人机、四足机器人,速度提升 4.7 倍。
与此同时,一位开发者写下了停用 AI 编码一个月的复盘,记录下失去代码掌控、单任务烧掉 30 美元 token 的真实代价。
表面上,这是两条平行的新闻线。一条关于软件,一条关于硬件。
本质上,它们正在同一张桌子上碰杯。
现象:机器人开始“听懂人话”了
先说最直观的变化。
过去,教机器人做任务,你得采集大量环境专属数据,训练专门的策略模型。换一个厨房,可能就要重新来一遍。
但这次斯坦福和 Caltech 的工作,叫 HomeBody。它用 GPT-6 Astra 直接调用技能库,驱动机器人完成长程任务。不需要环境专属训练数据,也不需要额外的策略学习。
这意味着什么?
意味着具身智能的瓶颈,可能正从“数据采集”转向“技能接口与推理可靠性”。
再看 FLUX 3 Action。70 亿参数,以视频数据训练,在 RoboLab-120 上拿到 42.92%,超过更大模型。这说明视频预训练加动作预测的路线,可能比纯 VLA 更高效。
还有 EmbodiedSWE。它用编码智能体为机器人长时程任务生成监督信号,发现前沿编码智能体可以跨任务、跨本体迁移解法。
你发现没有?AI 编程和具身智能,正在打通。
表面原因:模型变强了
表面上看,这些进展都归功于模型能力提升。
GPT-6 更强了,所以能直接驱动机器人。视频预训练更成熟了,所以 7B 模型能超过更大模型。编码智能体更聪明了,所以能生成监督信号。
这没错。但这不是本质。
本质原因:交易成本在重构
我们退一步看商业底层逻辑。
机器人这件事,过去为什么难?因为交易成本太高。
你要为每一个新环境、每一个新任务,付出巨大的数据采集和策略训练成本。这个成本,本质上是“适配成本”。
但现在,HomeBody 证明 VLM 可以直接调用技能库。这意味着,适配成本从“训练”转移到了“推理”。
推理成本,随着模型效率提升,正在快速下降。
FLUX 3 Action 只有 70 亿参数,却登顶基准。这说明什么?说明参数效率在提升。单位算力能买到的智能,变多了。
EmbodiedSWE 更直接。它把机器人数据稀缺问题,部分转化为代码级合成与验证问题。代码生成和验证,恰恰是 AI 编程最擅长的领域。
这就是本质:AI 编程积累的能力,正在外溢到具身智能。
原来需要采集数据、训练策略的环节,现在可以用代码合成、推理调用来替代。交易成本的结构,变了。
案例:一边是 30 美元,一边是 4.7 倍
但别急着乐观。
那位停用 AI 编码一个月的开发者,给出了另一面。他记录了几个真实代价:失去代码掌控、测试未覆盖场景、单任务烧掉 30 美元 token。
这告诉我们什么?
AI 编程的边际收益,在某些场景下正在递减。当任务复杂度上升,Agent 的可靠性下降,审查成本上升。
而 Perceptron 的 Mk1.5,用单一 35B 模型控制无人机、四足机器人和智能眼镜,请求完成速度最高提升 4.7 倍。它已经在 OpenRouter 上线。
这意味着物理智能体模型,开始以 API 形式进入开发者生态。
一边是软件 Agent 的边际收益递减,一边是物理 Agent 的通用化与实时化。这两条线交汇的地方,就是机会和风险并存的地方。
方法建议:三个可执行动作
如果你是从业者或创业者,我给你三条建议。
第一,重新审视你的技能接口。如果你的机器人软件栈还是分层控制加模仿学习,现在可以开始思考:哪些环节可以被 VLM 直接调用替代?哪些技能可以封装成标准接口?
第二,把代码能力当作具身智能的杠杆。EmbodiedSWE 的思路值得借鉴:用编码智能体生成监督信号,用代码合成解决数据稀缺。你的 AI 编程团队,可能比你想象的更接近机器人业务。
第三,建立 Agent 使用规范。那位开发者的复盘是真实教训。在团队里明确:什么任务适合交给 Agent,什么任务必须人工审查,token 成本如何控制。边际收益递减不是放弃的理由,而是精细化管理的起点。
金句收束
AI 编程和具身智能,正在从两条平行线,变成一条螺旋上升的曲线。
软件里踩过的坑,硬件里可能还要再踩一遍。但软件里积累的能力,硬件里可以直接复用。
真正的机会,不在模型本身,而在交易成本重构的缝隙里。
谁先看清这个缝隙,谁就能在下一轮里,少烧一点 token,多走一步路。