夜雨聆风学习资料网

ARTICLE · 1044001

桌面级实体AI入口:Microduck把强化学习与真机部署压缩到同一平台

桌面级实体AI入口:Microduck把强化学习与真机部署压缩到同一平台
关注本公众号并设星⭐标,不错过最新精彩内容

Hugging Face 的 Microduck 价值不在于“做了一只可爱的机器鸭”,而在于把真实机器人、强化学习仿真、模型发布、浏览器体验和社区技能连接成一条低门槛闭环,实体 AI 正从少数实验室的设备能力变成开发者可以直接参与的开放平台。Microduck 提供 25 厘米、约 800 克、15 个电机的可训练双足平台;Pollen Robotics 在 GitHub 和 Hugging Face Hub 持续更新运行时、强化学习环境、策略模型和浏览器仿真器;OpenWAM、TANGO 等近期工作则从模型预训练和全身导航侧说明,机器人学习正在走向“开放模型+仿真+真机部署”的组合竞争。

今日重磅

Hugging Face Microduck:25 厘米机器鸭把强化学习和真机部署放到同一条链路

摘要:Pollen Robotics 官网将 Microduck 定义为一款面向实体 AI 和强化学习的 25 厘米双足机器人。官方规格显示,它搭载 15 个电机、前置摄像头、8×8 ToF 激光雷达、两颗 IMU、可动喙部和约 50Hz 的板载策略控制回路,整机重量约 800 克。它预置行走、坐下与站立、踢球、用喙抓取、摔倒起身和轮滑等行为,同时开放 SDK、物理仿真环境、强化学习训练脚本和 Sim2Real 部署流程。Microduck 没有把“机器人本体”和“训练平台”拆成两个产品。开发者可以先在仿真中训练策略,再导出为 ONNX,加载到真实机器人上运行;如果现实中的摩擦、齿隙、电压和动作延迟与仿真不一致,再回到训练环境调整。这个闭环和传统教育机器人最大的区别,是机器人不只是执行固定程序,而是允许用户把运动策略本身当作可训练、可发布、可复用的对象。需要明确的是,官网所说的“开源”主要指软件栈:SDK、仿真、训练流程和运行时开放,机械与电子设计文件并没有全部开放。

来源:Pollen Robotics / Hugging Face

行业新闻

Pollen Robotics 开源 Microduck 运行时:50Hz 控制、ONNX 策略和可回滚更新

摘要:Microduck GitHub 仓库显示,机器人运行时采用 Rust 架构,在约 800 克本体上通过 50Hz 控制回路驱动 15 个舵机,并负责摄像头、通信、策略加载和软件更新。运行时支持将训练好的 ONNX 策略安装到机器人上,策略可以按步态、站立、踢球、翻滚或其他技能进行热切换;更新系统还强调签名校验、健康检查和自动回滚。开源机器人要真正可用,除了模型和仿真,还必须把运行时、策略加载、升级和故障恢复做成工程系统。

来源:GitHub / Pollen Robotics

Microduck RL 训练仓库持续更新:MuJoCo Warp、PPO 与 Hugging Face Jobs 接入

摘要:Pollen Robotics 的 microduck_rl 仓库把 Microduck 的强化学习训练环境、任务配置和导出流程公开出来。仓库支持 MuJoCo Warp、PPO、域随机化、舵机齿隙模拟和 ONNX 导出,并提供通过 Hugging Face Jobs 运行训练任务的方式。当前任务已经覆盖平地与粗糙地形行走、跌倒恢复、坐站、抓取、踢球、前滚、轮滑和旋转等行为。这使 Microduck 从“会走的成品”变成“可以持续训练新行为的研究平台”,也把 Sim2Real 中最容易被忽略的执行器、摩擦和电压误差显式化。

来源:GitHub / Pollen Robotics

Hugging Face 社区近期围绕 Microduck 补齐安全、远程推理和长时序策略

摘要:Microduck 仓库近期公开的 Pull Request 显示,社区正在同时推进多个方向:让安全层明确说明拒绝、限幅或清零了什么;探索从鸭子摄像头运行远程模型的 Space;增加 LSTM ONNX 策略的循环状态支持;完善策略更新通道,以及改进模式切换、启动和回滚逻辑。它们共同说明,开放机器人生态的下一步不只是“再训练一个动作”,而是把远程推理、时序策略和安全边界纳入可维护的系统。开源机器人从 Demo 走向长期使用,安全、升级、远程计算和状态管理会与模型精度同等重要。

来源:GitHub / Pollen Robotics

数据相关报道:Microduck 的数据闭环由五层组成

摘要:从数据层看,物理参数数据包括电压、摩擦、齿隙、延迟、舵机状态,用于缩小仿真与真机差异,决定策略能否落地。运动轨迹数据包括行走、坐站、踢球、抓取、翻滚,用于训练和评估运动技能,把动作变成可复用策略。失败恢复数据包括摔倒、模式切换、异常、回滚,用于训练稳定性和安全机制,让机器人学会继续工作。策略模型数据包括 ONNX 权重、manifest、版本信息,用于安装、替换和共享技能,形成 Hub 化分发接口。社区任务数据包括新技能、仿真场景、社区模型、反馈,用于扩展行为库和评测覆盖,形成开发者生态飞轮。机器鸭真正开放的不是一组动作视频,而是一条从物理建模到策略分发的训练管线。

来源:GitHub / Hugging Face

前沿论文

OpenWAM:把世界—动作模型预训练拆成可组合的开放模块

摘要:9 月 7 日提交的 OpenWAM 提出一个开放、模块化的 World-Action Model 预训练框架。研究团队把生成骨干、视觉表征、动作能力、世界到动作的信息流、推理方式和训练数据拆开进行控制实验,并用约 6400 小时人类第一视角与机器人数据训练 OpenWAM-α。论文在八个仿真基准和真实机器人实验中覆盖单臂、双臂和灵巧手,强调世界知识与可执行动作之间需要专门的动作容量和同步训练。具身基础模型的竞争正在从“模型规模”转向“世界知识如何真正流入动作控制”。

来源:arXiv

TANGO:只用仿真训练,让人形机器人在杂乱环境中做全身导航

摘要:9 月 8 日提交的 TANGO 面向杂乱室内环境中的人形机器人导航。它接收自然语言指令和第一视角 RGB 图像,直接预测 29 自由度关节动作;训练数据完全由仿真生成,包括全局路径规划、全身运动生成、障碍物感知动作编辑和强化学习跟踪。论文还报告了在 Unitree G1 上的零样本真实部署,机器人可以在没有真实导航训练数据的情况下完成语言引导的复杂场景穿行。TANGO 把全身控制、语言指令和仿真数据结合起来,说明“没有真机数据”并不等于“无法做真实世界验证”,关键在仿真动作是否足够接近身体约束。

来源:arXiv / Hugging Face Daily Papers

开源生态

Hugging Face Microduck Simulator:在浏览器里运行 MuJoCo 和真实策略

摘要:Microduck Simulator 是 Pollen Robotics 在 Hugging Face Spaces 上提供的浏览器仿真器。项目说明显示,MuJoCo 物理计算通过 WebAssembly 在浏览器中运行,ONNX Runtime Web 以 50Hz 执行真实训练策略,不依赖服务器后端;用户可以切换腿式行走和轮滑模式,还能在同一页面观察最多三个其他浏览器中的“幽灵鸭”。浏览器仿真把具身智能的第一步从“安装复杂机器人环境”变成“打开网页就能试”,有助于扩大教育和开发者入口。

来源:Hugging Face Spaces / Pollen Robotics

Hugging Face Hub:Microduck 策略模型开始形成可安装技能目录

摘要:Hugging Face Hub 已提供 Pollen Robotics 的 microduck-policies 模型仓库,采用 ONNX 格式并使用 Apache-2.0 许可证。Microduck RL 文档规定,策略模型可以带有 policy 文件和 manifest,通过机器人运行时安装、切换和回滚;社区用户也可以发布自己的踢球、鞠躬、跑步、跳跃或其他行为策略。机器人技能正在获得类似模型权重的分发形态,未来“下载一个策略并让机器人学会一个动作”可能成为常规开发流程。

来源:Hugging Face Hub / Pollen Robotics

Microduck Emotions:把情绪动作和真实机器人经验整理成开放数据

摘要:Hugging Face 数据集页面显示,microduck-emotions 包含 14 种机器鸭情绪动作、关键帧、声音、视频和方法说明,数据量约 7.54MB。页面还记录了真实机器人调试经验,例如头部质量前移会改变步态、声音播放与喙部舵机状态之间存在耦合。虽然它不是传统的机器人轨迹大数据集,但它把“动作设计—真实硬件反馈—失败修正”以可读方式保存下来。开源机器人数据不应只保留最终模型,也应保留真实硬件调试过程和失败原因,这些内容对复现最有价值。

来源:Hugging Face Datasets / Pollen Robotics

公司情报

Pollen Robotics:从 Reachy 到 Microduck,Hugging Face 正在形成开放机器人产品线

摘要:Pollen Robotics 官网将自身定位为 Hugging Face 旗下的开放机器人团队,产品覆盖 Reachy Mini、Reachy 2 和 Microduck。当前产品线一端是面向人机互动、创意编程和 AI 实验的桌面机器人,另一端是面向强化学习和物理 AI 的小型双足平台。两者共同使用开放 SDK、模型和数据社区,形成从交互机器人到运动学习平台的梯度。Hugging Face 的机器人路线不是只做一个“机器鸭爆款”,而是试图用不同价位和不同能力的本体承接开发者、教育和研究需求。

来源:Pollen Robotics

Microduck:把机器人策略做成可热切换的软件资产

摘要:Microduck RL 仓库给出的训练与发布流程显示,开发者可以在仿真中训练新任务,导出 ONNX 策略,上传到 Hub,再通过机器人命令安装。仓库还要求策略满足统一的观测与动作接口,允许运行时在行走、站立、翻滚和其他技能之间切换。这个设计让硬件平台和技能开发相对解耦。一旦“策略即软件包”的方式稳定下来,机器人能力更新就不必完全依赖整机固件或人工现场调试。

来源:GitHub / Pollen Robotics

Hugging Face Jobs:把机器人强化学习训练从本地 GPU 扩展到云端任务

摘要:Microduck RL 的 HF Jobs 文档提供了从本地训练迁移到 Hugging Face 托管 GPU 的流程,支持提交训练任务、上传 checkpoint、使用持久化缓存和通过 WandB 查看过程。对小型机器人平台来说,云端训练的意义不是替代本地仿真,而是让没有高端 GPU 的开发者也能尝试更大规模的并行环境和更长时间的强化学习。机器人开源生态的门槛正在从“你有没有机器人”进一步降低到“你能否获得一次可控的训练预算”。

来源:GitHub / Pollen Robotics

结尾总结

本期的主线不是“机器鸭很可爱”,而是 Hugging Face 正在把机器人生态做成类似模型生态的结构:Microduck 是本体入口,MuJoCo 和 RL 是训练层,ONNX 和 manifest 是部署层,Hugging Face Hub 是技能分发层,Spaces 是低门槛体验层,社区 PR 和数据集则负责持续迭代。这条路线的优势是开发门槛低、复现路径清晰、社区可以并行贡献;它的限制也很明显:Microduck 的本体能力和传感器规模有限,软件开源不等于硬件完全开放,桌面级策略的成功也不能直接外推到工业人形机器人。真正值得观察的是,Hugging Face 能否把机器鸭上形成的“策略—数据—仿真—真机”闭环迁移到 Reachy、机械臂以及更复杂的人形平台。

本期资讯要点回顾:Microduck为25厘米、约800克、15电机双足平台,50Hz控制回路;支持MuJoCo Warp、PPO训练与ONNX策略导出;运行时采用Rust架构,支持策略热切换与自动回滚;Hugging Face Hub提供microduck-policies模型仓库;浏览器仿真器通过WebAssembly运行MuJoCo;OpenWAM用约6400小时数据训练模块化WAM;TANGO在Unitree G1上实现零样本仿真到真实全身导航。

如需转载,请注明出处
#行业资讯#具身智能#才创科技#才创机器人+
⭐加入知识星球,了解更多资讯

相关学习资料