夜雨聆风学习资料网

ARTICLE · 1060686

让AI动脑,让代码动手

让AI动脑,让代码动手

让AI动脑,让代码动手

相比传统机器人系统,LLM能够理解自然语言指令,并根据环境状态进行高层决策,因此具备成为机器人决策大脑的潜力。然而,机器人控制与纯语言任务存在明显差异:机器人需要持续进行高频、低延迟的闭环交互,每一次决策都可能涉及空间位置、动作方向、接触状态和安全约束。

Jev robot control项目由OpenRoboto团队开源,在MuJoCo仿真中以xArm7机械臂完成拾取苹果并放置到盘子任务,系统对比了TypeSafe AI的Jev 1.13(System One决策模型)、GPT-6 Astra与GPT-4.1 mini。

核心架构采用混合控制范式,模型仅输出离散高层意图(Approach/grasp/lift等)及X/Y/Z方向(Positive/hold/negative)与夹爪状态,共享底层控制器通过逆运动学执行小步笛卡尔增量,并反馈几何与接触信息,形成闭环。创新点在于将AI限定为快速、结构化、带置信度的判断层,而将连续运动、物理执行与安全逻辑交由确定性代码负责,避免生成式大语言模型的冗长推理与解析开销。

实验显示(单次seed-0试验),Jev以约113个决策周期成功完成任务,API成本仅约0.019美元(约为GPT-6的1/315),墙钟时间约26%;GPT-6亦成功但成本与延迟显著更高;GPT-4.1 mini则触及160周期上限失败。

对具身智能的启示,在封闭循环机器人控制中,专用System One模型可大幅降低成本与延迟,推动AI判断+代码执行的分层范式,有望提升实际部署可行性。

研究局限包括仅单次试验(非统计成功率)、纯仿真环境(无真实机器人、无视觉感知、依赖特权状态)、墙钟时间受API等待主导,以及任务复杂度较低,结果对提示词、网络与定价敏感。

Link:github.com/openroboto-ai/jev-robot-control

收录于具身智能
作者提示: 个人观点,仅供参考
广东,17分钟前,

相关学习资料