乐于分享
好东西不私藏

具身智能相关论文开源代码推荐20260319

具身智能相关论文开源代码推荐20260319

点击下方卡片,关注【具身智能小站】公众号

商务请联系:jszn576
注:具身交流群可加v:yzz010329

📅 2026年3月

👋 大家好!

来了!2026 年新开始的一个系列,主要是整理具身智能领域最近发表的提供开源代码或数据集的项目(论文),希望对相关领域的小伙伴有所帮助。获取这些论文的开源项目链接,可以直接在本文中查看。欢迎转发和关注!!👇

📊 今日数据统计

领域
篇数
🤖 具身智能
10 篇

🤖 开源论文(重点板块)

🔬 KiRAS:基于关键帧引导的自模仿学习,实现四足机器人的鲁棒与自适应技能学习

📌 Quadruped Robot · Reinforcement Learning · Imitation Learning · Multi-Skill Learning · Keyfram

✨ 受动画关键帧启发,利用单帧姿态作为技能表示,通过自模仿学习和技能初始化技术,在一个策略中实现多种敏捷技能及其在复杂地形上的平滑切换

📖 通过模仿多个特定技能的数据集,四足机器人可以在单个策略中习得多样化的技能。然而,复杂地形数据的缺乏限制了这类多技能策略在非结构化环境中的泛化能力。受动画技术启发,本文采用关键帧作为最小且通用的技能表示,以放松数据集约束。为此提出KiRAS框架,一个端到端的框架,首先在平坦地形上通过关键帧引导的自模仿学习获取多样化技能,然后在粗糙地形上继续训练同一策略网络以增强鲁棒性。为防止灾难性遗忘,引入了基于熟练度的技能初始化技术。在Solo-8和Unitree Go1机器人上的实验表明,KiRAS能够在挑战性地形上实现鲁棒的技能获取和平滑的技能转换。

💡 学习复杂技能,有时只需要抓住几个关键“瞬间”。将人类抽象的关键帧概念引入强化学习,为数据高效的多样化技能习得开辟了新路径。

🔗 项目链接:https://lainweigh.github.io/kiras

🔬 HALO:通过可微仿真弥合重载人形机器人敏捷运动技能的仿真到现实鸿沟

📌 Humanoid Robot · Sim-to-Real · System Identification · Differentiable Simulation · Reinforcement Learnin

✨ 提出基于可微仿真的两阶段系统辨识框架,先校准本体模型再辨识负载,实现重载条件下的零样本策略迁移

📖 部署在真实场景中的人形机器人经常需要携带未知负载,这会引入显著的模型失配,削弱仿真到现实强化学习方法的有效性。为应对这一挑战,本文提出一个基于可微仿真器MuJoCo XLA的两阶段梯度系统辨识框架。第一阶段使用无负载数据校准机器人名义模型,第二阶段辨识未知负载的质量分布。通过在策略训练前显式减少结构化模型偏差,该方法使得强化学习策略能够在重载条件下零样本迁移到实物硬件上。大量仿真和实物实验证明,与现有基线相比,该方法能实现更精确的参数辨识、更优的运动跟踪精度以及更强的敏捷性和鲁棒性。

💡 与其让策略在大量随机化的动力学中“盲目”寻找鲁棒解,不如先让机器人通过可微仿真精确“感知”自身的变化,再进行针对性训练。

🔗 项目链接:https://mwondering.github.io/halo-humanoid/

🔬 AnoleVLA:基于深度状态空间模型的轻量化视觉-语言-动作模型

📌 Vision-Language-Action Model · Mobile Manipulation · State Space Model · Mamb

✨ 采用Mamba状态空间模型作为骨干网络,实现高效的序列建模,在资源受限平台上实现更快、更准的语言引导操作

📖 本文针对语言引导的机器人操作问题,提出了一种轻量化的VLA模型AnoleVLA。现有VLA模型通常基于Transformer,其自注意力的平方复杂度在处理长序列时成为部署瓶颈。AnoleVLA采用深度状态空间模型(如Mamba)作为骨干,利用其线性复杂度高效处理多模态序列,生成平滑的机器人轨迹。在Meta-World仿真和真实移动操作臂上的实验表明,AnoleVLA在任务成功率上超越了同量级的基线模型(如SmolVLA),且推理速度约为大规模模型π0.5的三倍,展示了其在资源受限环境下高效部署的潜力。

💡 对于追求实时响应的机器人来说,线性的状态空间模型或许是比平方复杂度的Transformer更优雅、高效的序列建模选择。

🔗 项目链接:https://anolevla-8z7l8.kinsta.page/

🔬 ReMAP-DP:通过重投影多视角对齐点图与扩散策略实现高精度机器人操作

📌 Robotic Manipulation · Diffusion Policy · 3D Vision · Multimodal Fusion

✨ 利用重投影的多视角RGB图像和像素对齐的点图,通过双流Transformer融合语义与几何特征,显著提升高精度任务性能

📖 基于2D视觉表示的通用机器人策略擅长语义推理,但内在缺乏显式的3D空间感知能力,难以完成高精度任务。现有3D集成方法因点云的结构不规则性或多视角渲染的几何失真而难以奏效。本文提出ReMAP-DP,一个通过标准化视角重投影与结构感知的双流扩散策略协同工作的新框架。通过将重投影视图与像素对齐的点图耦合,双流架构利用可学习的模态嵌入融合冻结的语义特征和显式的几何描述符,确保了精确的隐式块级对齐。在RoboTwin 2.0和ManiSkill 3等仿真环境以及真实世界实验中的结果表明,ReMAP-DP在多样化的操作任务中表现出色,尤其在高精度任务上大幅超越DP3等强基线方法。

💡 将纷繁复杂的3D点云规整到与图像完美对齐的2D网格上,是实现预训练视觉大模型与精确空间几何无缝融合的巧妙桥梁。

🔗 项目链接:https://icr-lab.github.io/ReMAP-DP/

🔬 从自我到世界:基于强化学习的具身多智能体系统协同空间推理

📌 Multi-Agent System · Spatial Reasoning · Vision-Language Model · Reinforcement Learning · GRPO

✨ 提出E2W评测基准和CoRL框架,通过交叉视角空间奖励,让VLM学会融合多个智能体的局部视角进行全局推理与抓取

📖 从分布式的局部视角理解世界是多智能体具身系统的一个基本挑战。每个智能体通过自我中心的视角感知环境,这常受限于遮挡和歧义。为研究此问题,本文引入了Ego-to-World评测基准,评估VLM在全局计数、关系定位和动作导向抓取三项任务中融合异构视角的能力。为应对这一挑战,本文提出了CoRL框架,一个结合了思维链有监督微调和基于GRPO强化学习的两阶段训练方法。其核心组件——交叉视角空间奖励,通过将推理步骤与视觉证据关联,确保跨视角实体解析的一致性,引导模型做出正确的最终预测。实验表明CoRL在推理和感知指标上均超越了强大的闭源和开源基线,并在真实多机器人操作中验证了其有效性。

💡 当单个机器人的视野受限时,多机器人协同的本质是学会如何将各自的“片面之词”拼凑成一个完整的“客观世界”图景。

🔗 项目链接:https://github.com/hengzzzhou/CoRL

🔬 GraspALL:面向任意弱光环境下机器人衣物抓取的自适应结构补偿

📌 Robotic Grasping · Garment Manipulation · Multimodal Fusion · Illumination Robustness

✨ 通过参数化亮度曲线和双响应库,根据光照强度动态融合RGB与深度特征,实现全天候鲁棒抓取

📖 在动态变化的光照条件下实现精确的衣物抓取,对于服务机器人的全天候运行至关重要。然而,低光照环境会严重削弱衣物的结构特征,导致抓取鲁棒性下降。现有方法通常利用非RGB模态的光照不变性来增强RGB特征,但忽略了在不同光照下对非RGB特征依赖程度的变化,可能导致错位的非RGB线索引入。本文提出GraspALL模型,其创新之处在于将连续的光照变化编码为可量化的参考,用以指导RGB与非RGB模态根据光照强度进行自适应特征融合,从而生成光照一致的抓取表征。在自建数据集上的实验表明,GraspALL在不同光照条件下相比基线方法将抓取精度提升了32-44%。

💡 与其让模型对所有情况一视同仁,不如教会它“看天吃饭”——根据环境光照强弱,智能地调整对不同感官信息的信任程度。

🔗 项目链接:https://github.com/Zhonghaifeng6/GraspALL

🔬 VLA-Thinker:一种面向具身智能的“边看边想”推理框架

📌 Vision-Language-Action Model · Chain-of-Thought · Reinforcement Learning · GRPO

✨ 将视觉感知建模为可动态调用的推理动作,实现感知-推理-行动的交织协作,大幅提升长程任务表现

📖 现有的具身VLA模型虽然引入了思维链推理,但通常遵循基于文本的范式:视觉信息仅作为静态上下文编码一次,而推理主要在语言空间中进行。这种设计限制了跨模态交互,使模型无法主动重新审视环境以解决歧义或从中间错误中恢复。本文提出VLA-Thinker,一种“边看边想”的推理框架,将视觉感知视为推理过程中可显式调用的动作。通过两阶段训练策略(先进行思维链数据的有监督微调启动,再使用GRPO进行轨迹级强化学习对齐),VLA-Thinker在LIBERO和RoboTwin 2.0基准测试上均取得了显著的性能提升,在LIBERO上达到了97.5%的成功率。

💡 让VLA模型像人一样,在思考过程中不仅能“自言自语”,还能“抬头观察”,是实现真正鲁棒和灵活具身智能的关键一步。

🔗 项目链接:https://cywang735.github.io/VLA-Thinker/

🔬 一策通用:面向多机械臂本体的统一操作策略

📌 Cross-embodiment Manipulation · Imitation Learning · Dexterous Hand · 3D Vision

✨ 通过学习几何感知的隐式动作表征,在一个统一策略中同时训练多种夹爪与灵巧手,显著提升数据效率和技能迁移能力

📖 跨本体操作对于提升机器人操作的扩展性和降低数据采集成本至关重要。然而,不同本体(如二指夹爪与多指灵巧手)之间动作空间和结构的巨大差异给联合训练带来了挑战。为此,本文提出“一策通用”(OPFA)框架,通过学习一种几何感知的隐式表征,将不同本体的动作统一到一个共享的隐式动作空间,并设计一个统一的隐式重定向解码器来恢复特定本体的动作,无需针对每个本体进行单独的解码器微调。在11种不同末端执行器上的大量实验表明,OPFA通过利用异构本体数据显著提升了策略性能,例如,相比单源训练,跨本体联合训练可将成功率提升50%以上。

💡 与其为每个机器人本体设计独立的控制器,不如让它们学习一种共享的“空间语言”,从而实现技能和数据在不同形态间的自由流通。

🔗 项目链接:https://mujc2021.github.io/opfa/

🔬 基于大型语言模型智能体的机器人超声扫描框架

📌 Robotic Ultrasound · Embodied AI · LLM · Reinforcement Learning

✨ 利用强化学习微调的大语言模型智能体,根据临床指南动态调用工具,实现多器官自主超声扫描

📖 传统的机器人超声系统通常依赖为特定解剖结构设计的固定程序,难以适应新的扫描任务。本文提出了一个统一的自主机器人超声扫描框架,该框架利用基于大语言模型的智能体来解读超声扫描指南并执行扫描。智能体通过检索指南步骤,根据当前扫描状态动态调整策略并调用感知与控制工具。为进一步提升推理质量和工具选择的正确性,作者采用基于强化学习的策略对智能体进行微调。通过在10个未见过的超声指南上的指令执行实验,以及对胆囊、脊柱和肾脏的实物机器人扫描实验,验证了该框架的可行性和有效性。

💡 让机器人“阅读”并“理解”操作手册,并根据实时观察灵活决策,是实现通用医疗机器人的有效范式。

🔗 项目链接:https://github.com/yuan-12138/RUSSAgent

🔬 四足机器人数据驱动的物理嵌入动力学预测控制与强化学习

📌 Legged Robots · Reinforcement Learning · Model Predictive Control · Lagrangian Neural Networks

✨ 将拉格朗日神经网络嵌入强化学习-模型预测控制框架,实现物理一致的动力学学习,并通过逆动力学规划将推理速度提升4倍

📖 现有的最先进四足机器人控制方法结合了模型预测控制与强化学习,实现了复杂的运动和地形适应,但由于缺乏物理归纳偏置,长期误差累积且可解释性有限。本文通过将拉格朗日神经网络集成到强化学习-模型预测控制框架中,学习物理一致的动力学模型。在部署时,所提出的基于逆动力学的无限时域模型预测控制方案避免了昂贵的矩阵求逆,计算效率提升了4倍,且任务性能损失极小。通过在Unitree Go1机器人上进行的仿真和实机实验,验证了该方法在样本效率、长时程预测误差和实时规划速度方面均优于非结构化的神经网络动力学模型。

💡 将物理定律(如拉格朗日力学)直接嵌入神经网络结构,是实现数据高效、可解释且可外推的机器人动力学的关键路径。

🔗 项目链接:https://www.stochlab.com/PEPC/

本站文章均为手工撰写未经允许谢绝转载:夜雨聆风 » 具身智能相关论文开源代码推荐20260319

猜你喜欢

  • 暂无文章