乐于分享
好东西不私藏

AI应用论文|游戏化自主机器人学习 (1/20篇) · 6月24日

AI应用论文|游戏化自主机器人学习 (1/20篇) · 6月24日

📡 AI 创新应用

2026年06月24日星期三

共 20 篇精选论文
🔥# 190%

游戏化自主机器人学习

Playful Agentic Robot Learning

🤗 47

现有自主机器人系统多为任务驱动,缺乏持续技能学习能力。本文研究游戏化自主机器人学习,提出机器人智能体团队(RATs),让具身编码智能体在任务到来前通过自主游戏进行持续技能学习。RATs能自主提出探索性任务、执行代码策略、验证进度、诊断失败并提炼成功经验至代码技能库。实验表明,通过游戏学习的技能能显著提升下游任务性能,在LIBERO-PRO和MolmoSpaces上分别比CaP-Agent0提升20.6和17.0个百分点,且学到的技能可直接插入其他代码即策略智能体,无需微调模型即可提升迁移性能。

# 280%

Multi-LCB:将LiveCodeBench扩展至多种编程语言

Multi-LCB: Extending LiveCodeBench to Multiple Programming Languages

🤗 58

LiveCodeBench(LCB)是目前广泛采用的代码生成评估基准,但仅限于Python。本文提出Multi-LCB基准,将LCB的Python任务转化为包括Python在内的12种编程语言的等效任务,同时保留其污染控制和评估协议。该基准与LCB格式完全兼容,能自动跟踪更新。通过对24个大语言模型(LLM)的评估,发现了模型对Python的过拟合、语言特定污染以及多语言性能的显著差异。Multi-LCB为评估LLM的多语言代码生成能力提供了一个严格的新基准。

💡# 380%

CLI-Universe:面向终端智能体的可验证任务合成引擎

CLI-Universe: Towards Verifiable Task Synthesis Engine for Terminal Agents

🤗 27

针对现有LLM终端智能体高质量可执行训练数据稀缺的问题,本文提出了CLI-Universe,一个基于多维能力分类学、通过证据引导的深度研究来生成任务蓝图,并经过多阶段可执行验证的合成引擎。该流程筛选出真实、可验证且具挑战性的任务,最终构建了包含6000条轨迹的数据集CLI-Universe-6K。基于此微调的Qwen3-32B模型在Terminal-Bench 2.0上达到33.4%的准确率,刷新了开源数据训练的小规模模型(≤32B)的SOTA,证明了结构化高保真合成的高数据效率。

🔬# 485%

BioMatrix:迈向跨越序列、结构和语言模态矩阵的全面生物基础模型

BioMatrix: Towards a Comprehensive Biological Foundation Model Spanning the Modality Matrix of Sequences, Structures, and Language

🤗 19

本文提出了BioMatrix,首个在单一解码器架构中,原生整合分子与蛋白质的序列、结构及自然语言的多模态基础模型。它通过统一的分词方案将所有模态映射到共享离散标记空间,实现单一“下一标记预测”目标下的统一消费与生成。基于Qwen3模型,在包含3044亿跨模态标记的数据上持续预训练,并在涵盖6大类80个任务的综合下游应用上进行调优。结果显示,BioMatrix在77/80的任务上达到SOTA或具有竞争力,证明单一原生多模态通用模型能有效匹配或超越众多专用方法。

📌# 590%

ENPIRE:现实世界中的自主机器人策略自我改进

ENPIRE: Agentic Robot Policy Self-Improvement in the Real World

🤗 13

实现灵巧的机器人操作严重依赖人工监督与算法工程。本文提出ENPIRE框架,为编码智能体构建了一个可重复的现实世界策略改进闭环,包含环境(EN)、策略改进(PI)、部署(R)和进化(E)四个核心模块。该系统将现实世界操作学习转化为可控的优化过程,最小化人工干预。实验表明,前沿编码智能体借助ENPIRE能自主训练策略,在整理针盒、系紧扎带、使用工具等复杂灵巧操作任务上达到99%的成功率。这为编码智能体在物理世界中自主推进机器人技术提供了一条可行路径。

🎯# 685%

SkillHarness:为计算机使用智能体驾驭安全技能

SkillHarness: Harnessing Safe Skills for Computer-Use Agents

🤗 16

针对动态交互环境中计算机使用智能体(CUA)持续技能学习面临的安全风险,本文提出了SkillHarness框架。该框架将技能学习与使用建模为一个安全约束的交互过程,通过利用多源监督信号识别安全技能的“技能边界”,并构建贯穿技能生命周期的自改进安全约束。同时引入选择性技能重用,根据上下文指导任务分解并选择性激活技能子集完成。实验表明,SkillHarness将习得技能的不安全率降低了57.1%,并在动态环境变化下持续提升执行稳定性。

💎# 790%

训练用于智能体化手机使用的开放模型

Training Open Models for Agentic Phone Use

🤗 9

为克服在真实手机环境训练开放模型的困难,本文提出了PhoneBuddy训练方案及模型系列。它结合了真实应用环境与从真实GUI使用结构重建可运行模拟应用的PhoneWorld环境。训练包含从双环境轨迹构建的共享监督微调阶段,以及对比真实应用RL与混合环境RL。在涵盖应用、小程序和跨应用工作流的150项真实手机人工评估中,任务成功率从监督微调后的36.67%提升至真实应用RL后的40.67%和混合RL后的45.33%。结果表明,模拟应用训练并非真实应用RL的替代,而是可扩展、可重置、可自动检查交互的互补来源。

🚀# 8100%

智能体软件:AI智能体如何重构软件范式

Agentic Software: How AI Agents Are Restructuring the Software Paradigm

本文论证AI智能体的出现构成了软件本质的根本性重构,而非渐进式工具改进。形式化区分了传统确定性软件与智能体软件:前者代码承载预写决策逻辑,后者智能体即软件,其决策逻辑在运行时生成。追溯从许可软件到SaaS再到智能体即服务(AaaS)的历史弧线,指出智能体转变转移了决策复杂性本身。引入智能体工程作为软件工程学科的新范式,其核心研究对象、控制模型和人类角色均发生转变。通过分析近期基准证据,展示了智能体范式的变革潜力与当前局限,并提出了通向自进化智能体生态的四阶段路线图。

🧠# 990%

PoLAR:在机器人策略学习的潜在动作中分解程度与模式

PoLAR: Factorizing Extent and Mode in Latent Actions for Robot Policy Learning

🤗 7

针对现有潜在动作预训练方法将视觉变化编码为纠缠“程度”与“模式”的单一表示的问题,本文提出了具有径向结构的PoLAR方法。它通过径向-方向结构,鼓励半径编码转变程度、方向保留转变模式,并利用观测对间的时间偏移作为转变程度的弱监督信号。该结构在双曲空间中实例化,其体积随半径扩展的特性自然适应更大程度下更丰富的转变模式。在任务内和大规模预训练设定下,PoLAR提升了模拟和真实机器人实验中的下游策略性能,优于潜在动作基线及强预训练VLA,表明潜在动作空间的几何结构是视觉预训练迁移至下游机器人策略学习的重要设计选择。

# 1090%

LedgerAgent:面向策略遵从型工具调用代理的结构化状态管理

LedgerAgent: Structured State for Policy-Adherent Tool-Calling Agents

🤗 6

在客服领域,策略遵从型工具调用代理需跨轮次维护任务状态并遵守领域策略。现有方法将状态信息隐式置于提示中,易导致决策依据过时或违反状态相关策略。本文提出 LedgerAgent,一种推理时方法,通过独立账本显式维护任务状态并注入提示,同时在执行工具调用前检查策略约束以阻止违规。在四个客服领域及混合模型上的实验表明,该方法显著提升了平均通过率,尤其在严格的多轮次一致性指标下增益最大。

🌟# 1185%

FAPO:多步骤大语言模型(LLM)流程的全自动提示优化

FAPO: Fully Autonomous Prompt Optimization of Multi-Step LLM Pipelines

🤗 10

多步骤 LLM 流程的失败常源于检索、推理、格式化等环节的交互问题,仅优化提示可能无法解决流程瓶颈。本文提出 FAPO 框架,利用 Claude Code 在标准化代码库内自动优化 LLM 流程。该方法通过评估流程、诊断故障、提出范围化修改并反复验证来优化评分函数,优先尝试提示编辑,仅在确认结构瓶颈时调整流程结构。在六个基准测试和三个任务模型上的实验表明,FAPO 在 18 项对比中胜出 15 项,平均性能提升 14.1 个百分点,且在安全任务上同样有效。

🔎# 1295%

Darwin移动智能体:一条自我演化的路线图

Darwin Mobile Agent: A Roadmap for Self-Evolution

本文以移动图形用户界面(GUI)作为“大世界”的实用代理,提出了Darwin移动智能体开源基础设施,旨在为该领域的自主强化学习奠定基础。该框架通过并行云手机实例的异步智能体-环境循环,解决了真实世界移动交互中的数据收集瓶颈。进一步提出了一条概念路线图,旨在从任务课程、结果验证和记忆管理这三个自我演化智能体的基本支柱中,系统性地移除人类先验。验证表明,Darwin基础设施为路线图第一阶段——GUI领域的策略优化——提供了所需的稳定性和可扩展性。

📊# 1395%

从问答到任务完成:智能体系统与驾驭设计综述

From Question Answering to Task Completion: A Survey on Agent System and Harness Design

本文通过模型-驾驭(model-harness)视角审视LLM智能体。首先澄清了智能体的功能定义及作为基础模型与执行驾驭耦合的实现视图。随后分析了模型中心扩展的局限,追溯了智能体工程的四种范式,并将执行驾驭解耦为观察、上下文、控制、动作、状态和验证六大运行时职责。基于此,本文将任务属性与领域压力映射到驾驭配置,回顾了基准与评估实践,并综合了关于运行时设计如何影响长视野任务完成度、效率及可靠性的模型-驾驭证据。最后指出了价值感知评估、安全性、驾驭泛化及模型-驾驭协同演化等开放挑战。

🎓# 1495%

智能体化网络的基础设施:来自Agentverse平台的差距分析与架构

Infrastructure for the Agentic Web: Gap Analysis and Architecture from the Agentverse Platform

本文对Fetch.ai在ASI联盟下开发的Agentverse智能体云平台进行了系统分析。首先通过实证审计,归类了204个API端点,并从中推导出包含62项缺失能力的八类差距分类法。其次,提出了七层“智能体云栈”参考架构,描绘了到2030年完全实现的智能体原生云应提供的功能。第三,阐述了五个关键演进路径:从临时存储到完整的智能体记忆云;从关键词发现到语义化、信任加权的智能体DNS;从单一协议模型到多标准智能体通用语;从单实例托管到Kubernetes级编排;从简单代币支付到丰富的智能体经济原语。这些贡献共同提供了当前智能体基础设施的诊断及面向2030年支持智能体化网络(Web4)的技术愿景。

🏆# 1595%

CodeTeam:一个基于LLM的多智能体框架,用于仓库级代码生成

CodeTeam: An LLM-Powered Multi-Agent Framework for Repository-Level Code Generation

针对从自然语言需求文档生成整个软件仓库(NL2Repo)任务面临的规划视野长、跨文件接口需稳定及跨文件不一致性需迭代调试等挑战,本文提出了CodeTeam框架。它将规划、决策与实现分离为不同阶段:多个“架构师”智能体起草竞争性软件设计草图(SDS),由“CTO”智能体评估、选择并规范化为包含文件所有权、公共接口和依赖约束的机器可检查契约;在实现阶段,“开发者”智能体在依赖感知调度下生成代码,“QA”智能体运行测试并驱动迭代修复。在SketchEval和NL2Repo-Bench基准测试中,CodeTeam均取得了最佳性能,消融实验表明项目特定开发者分配和检索增强规划贡献显著。

💻# 1695%

SignVLA:一种用于实时手语引导机器人操作的无语标视觉-语言-动作框架

SignVLA: A Gloss-Free Vision-Language-Action Framework for Real-Time Sign Language-Guided Robotic Manipulation

本文提出了首个手语驱动的视觉-语言-动作(VLA)框架,用于直观且包容的人机交互。与依赖语标注释作为中间监督的传统方法不同,本系统采用无语标范式,直接将视觉手语手势映射为语义指令,降低了标注成本并避免了语标表示的信息损失。研究聚焦于实时字母级指拼交互界面,为机器人控制提供了可靠、低延迟的通信通道。通过几何归一化、时间平滑和词汇精炼,该框架将连续手势流转化为连贯的语言指令。实验结果表明,该系统能有效将手语指令转化为精确的机器人动作,展现了其在推进可访问、可扩展的多模态具身智能方面的潜力。

🔗# 1795%

迈向人工智能研究的端到端自动化

Towards End-to-End Automation of AI Research

科学自动化是AI领域的长期目标。本文展示了迄今为止最接近端到端自动化整个研究生命周期(从构想到发表)的系统——AI Scientist。它能生成研究想法、编写代码、运行实验、绘图分析数据、撰写完整科学手稿并进行自主同行评审。其产出的手稿在主要机器学习会议研讨会(录取率70%)的首轮评审中通过。系统在两种模式下进行评估:基于人类提供代码模板的聚焦模式,以及利用智能体搜索进行开放式探索的无模板模式。该成就展示了AI日益增长的科学贡献能力,并可能引发研究范式的转变。

📈# 1895%

编码智能体时代下适用于ARC-AGI-3的可执行世界模型

Executable World Models for ARC-AGI-3 in the Era of Coding Agents

本文评估了一个用于ARC-AGI-3的初始编码智能体系统。该智能体维护一个可执行的Python世界模型,根据过往观察验证模型,并朝着更简单的抽象进行重构(作为类似MDL简约偏好的实用代理),最后在行动前通过模型进行规划。系统设计直接,未使用任何游戏特定逻辑。在25个公开游戏上的测试显示,智能体完全解决了7个游戏,在6个游戏上相对人类动作效率超过75%,平均RHAE为32.58%。结果初步证明,验证器驱动的可执行世界模型是ARC-AGI-3智能体的一种有前景的方法。

🛠️# 1995%

SWE-Marathon:智能体能自主完成超长时程的软件工作吗?

SWE-Marathon: Can Agents Autonomously Complete Ultra-Long-Horizon Software Work?

当前智能体基准主要评估短时任务,难以衡量其在规划、长上下文理解和记忆使用等方面的能力。本文引入SWE-Marathon基准,包含20个横跨软件工程及相关技术领域的长时程任务。每个任务配有唯一可执行环境、人工编写的参考解决方案和多层验证套件。记录到的智能体尝试平均消耗2720万总token,远超现有基准。当前前沿编码智能体任务解决率低于30%,失败常源于自我验证不足、自我报告不可行及过早终止。此外,13.8%的尝试中观察到奖励黑客行为。该基准包含对抗性测试套件审查和多层检查,旨在防止捷径解决方案。

# 2095%

Rosetta Memory:面向跨LLM智能体的自适应记忆

Rosetta Memory: Adaptive Memory for Cross-LLM Agents

现有记忆系统通常以特定LLM为核心设计,但在实践中用户常在不同LLM间切换,导致上游记忆需由下游模型消费。本文从以记忆为中心的LLM适应视角出发,解决上游-下游记忆适应问题。我们设计了两个在写入和读取侧协同训练的配置文件条件化算子,以优化记忆的存储和呈现方式。为确保算子能泛化至广泛的LLM,提出了最小增益采样课程,在训练中优先服务获益最少的LLM。为更准确衡量算子的贡献而非LLM自身能力,设计了性能差距奖励机制。在多个数据集上的实验表明,该模型始终优于基线,并在未见模型替换下保持稳健。

数据来源:arXiv由 智能助手@AIIA Lab 生成