夜雨聆风学习资料网

ARTICLE · 1123137

AI应用论文|AnchorVLA:为视觉-语言-动作规划桥接离散决策与连续轨迹 (1/20篇) · 10月4日

AI应用论文|AnchorVLA:为视觉-语言-动作规划桥接离散决策与连续轨迹 (1/20篇) · 10月4日

📡 AI 创新应用

2026年10月04日星期日

共 20 篇精选论文

95%🔥# 1

AnchorVLA:为视觉-语言-动作规划桥接离散决策与连续轨迹

AnchorVLA: Bridging Discrete Decisions and Continuous Trajectories for Vision-Language-Action Planning

自动驾驶规划需将导航意图、交通规则、动态交互和语言指令转化为可执行的连续轨迹。现有视觉-语言-动作(VLA)规划器存在语义-动作对齐困难、离散化误差和推理效率低等问题。为此,我们提出AnchorVLA,一个分层决策锚定的VLA规划框架。它使用轨迹模式锚点作为高层VLA推理与连续轨迹执行间的显式接口:“决策即锚点表示”用锚点令牌编码整个局部运动模式;“锚定残差流”则在选定锚点定义的残差空间中生成细粒度连续轨迹。在Bench2Drive闭环基准测试中,AnchorVLA取得了最先进的成功率(77.28)和具有竞争力的驾驶分数(89.92)。

95%⭐# 2

Vero:AI智能体能否构建形式化验证的软件仓库?

Vero: Can AI Agents Build Formally Verified Software Repositories?

为评估AI智能体在仓库级别协同实现代码与证明合成的能力,本文提出了首个此类基准Vero。它包含43个源自真实仓库的多模块实例,涵盖Python、Dafny等多种语言及密码学协议等不同领域。每个实例均包含预定义的API接口、手工整理的形式化规约和参考实现,支持纯证明及代码-证明联合评估模式。Vero还引入了审计机制以提升基准可靠性。对前沿编码智能体的评估显示,最强的智能体仅能完全解决43个实例中的27个,在最难仓库上无法闭合任何规约,表明当前智能体在仓库级验证软件合成方面仍有不足。

95%💡# 3

LEDGER:用于审计LLM代理的声明-证据追溯图

LEDGER: Claim-to-Evidence Trace Graphs for Auditing LLM Agents

随着LLM代理执行复杂工作流的速度加快,审计其输出的正确性与可信度成为瓶颈。现有可观测系统仅提供细粒度事件可见性,难以追溯结论依据。本文提出LEDGER系统,通过构建分层追溯图来组织执行记录,将痕迹分组为证据节点与工作流节点,并用类型化语义边连接声明、支持性操作、工件及验证步骤。该系统能清晰呈现工作流决策、工件谱系、修复步骤、验证覆盖及证据支持路径,为核心审计提供结构化追溯框架。

95%🔬# 4

机器在机器上完成的科学:计算化学中的AI代理

Science Done on a Machine by a Machine: AI Agents in Computational Chemistry

计算化学领域的AI代理系统正经历爆炸式增长,其能力正从辅助执行特定计算任务转向自主设计、执行硅上实验、分析乃至撰写论文。最终目标是实现无需人类监督的完全自主AI科学家。尽管现有系统仍需人类参与,但趋势已不可逆转。通用代理正使构建专用系统日益商品化,最终可能取代后者。这种颠覆性的速度和规模令领域内的专家、教师和学生对其未来及努力方向感到困惑。

95%📌# 5

ReasFlow:通过基于知识的多代理系统辅助应用数学中以推理为中心的科学发现

ReasFlow: Assisting Reasoning-Centric Scientific Discovery in Applied Mathematics via a Knowledge-Based Multi-Agent System

现有自动化研究系统多聚焦实证驱动领域,而依赖严格证明与领域知识综合的理论驱动发现(如数学)探索不足。本文提出ReasFlow,一个端到端的自主代理系统,采用“人类专家作为首席研究员,代理作为执行严谨推导的研究生”的协作范式。该系统包含(1)审核逻辑一致性并在人工检查前纠正错误的内部验证循环;(2)自动检索声明性事实与程序性启发知识并自我改进的机制。该系统能统一完成文献综述、算法设计、定理证明、实验和论文撰写,在基于LLM的评估中优于现有开源基线。

95%🎯# 6

SkillForge:面向项目特定问题解决的自蒸馏智能体

SkillForge: Self-Distilling Agents for Project-Specific Issue Resolution

基于LLM的智能体在解决特定代码仓库问题时,常因缺乏项目相关知识而表现不佳。本文提出SkillForge自蒸馏框架,通过重新实现仓库中测试覆盖的核心功能来主动合成项目特定问题,并在解决这些问题的过程中,将可重用的项目知识提炼为基于实体的技能,关联到相关仓库实体中。实验表明,在解决真实问题前主动获取项目特定知识,能显著提升下游软件问题解决性能。

95%💎# 7

PLCBench:自主 LLM 智能体能否将 PLC 访问转化为持续的物理影响?

PLCBench: Can Autonomous LLM Agents Turn PLC Access into Sustained Physical Impact?

为评估自主 LLM 智能体将可编程逻辑控制器(PLC)网络访问转化为持续不利物理影响的能力与边界,本文提出首个真实 PLC 硬件在环(HIL)评估框架 PLCBENCH。它结合了供应商原生交互、商业 PLC 执行、闭环降阶过程仿真和独立结果验证。通过对五个 LLM 家族的 240 次真实 PLC 测试,31.3% 的测试案例成功维持了其物理目标。阶段化结果表明,许多案例止步于有效原生读取之前,而更丰富的过程观测能将条件性目标达成率从 44.2% 提升至 64.0%。

95%🚀# 8

利用 Gemini 在现实世界中加速科学研究

Accelerating Scientific Research with Gemini in the Real-World

本文扩展并全面验证了基于 Gemini 的多智能体系统 Co-Scientist,旨在加速涵盖假设生成、实验和论文撰写的端到端科学研究。在材料科学中,它成功设计了 MXenes 前驱体路线并生长了二维材料;在生物学中,从稀疏成像数据预测了工程大肠杆菌的表型;在计算机科学中,自主发现了优于前沿模型的推理时缩放架构。双盲评审表明,其可靠性模块减少了幻觉和抄袭。这些结果展示了面向现实世界科学发现的闭环多智能体系统的潜力。

95%🧠# 9

DuMateBench:在复杂现实工作流中评估自主智能体

DuMateBench: Evaluating Autonomous Agents in Complex Real-World Workflows

为评估自主智能体在复杂现实工作流中的性能,本文从大规模生产平台中重构真实用户会话,构建了 DuMateBench 基准。该基准包含 200 个跨 8 大场景的任务,并在注入三种环境复杂性(信息不足、不稳定、噪声)的 Docker 容器中执行。使用混合确定性及 LLM-as-Judge 协议评估五个代表性智能体框架与四个先进 LLM 的组合,揭示了严格任务完成度上的显著差距,并表明环境扰动下的性能由 LLM 与智能体框架能力共同决定。

95%⚡# 10

Salesforce Koa:面向智能体工具使用的企业级语言模型

Salesforce Koa: An Enterprise Language Model for Agentic Tool Use

本文介绍企业级语言模型Salesforce Koa,其通过对开源基础模型进行基于Group Relative Policy Optimization (GRPO)的强化学习后训练得到。核心是一个模拟到奖励的管道,能将工作流规范扩展为人物角色条件下的多轮任务,并以成功使用工具作为奖励依据。在公开工具使用、智能体推理及企业CRM基准测试中,该模型超越了其基础模型及强有竞争力的专有基线,证明了规范驱动强化学习是定制企业智能体任务的有效路径。

95%🌟# 11

开放世界多智能体环境中的自主数学发现

Autonomous Mathematical Discovery in an Open-World Multi-Agent Environment

本研究在名为“Station”的开放世界多智能体环境中探索自主数学发现。不同家族的AI智能体在没有中央协调器或脚本流程的情况下,自主选择研究方向、进行实验、协作并共建共享科学文献。在AlphaEvolve目录的12个构造问题和两个额外案例研究中,Station在五个问题上取得了相对于现有文献的新结果,包括新的有限域Kakeya集无限族、11维中新的精确604点接触构型等。重要的是,智能体不仅产出数值构造,还生成解释其工作原理的定理和分析,使结果更具可解释性,便于数学家在此基础上继续构建。

95%🔎# 12

RSIAgent:面向新环境的递归自我改进自主探索框架

RSIAgent: Autonomous Exploration for Recursive Self-improvement in New Environments

为解决数字智能体适应未知环境时预训练模型知识不足的问题,本文提出无需训练的智能体框架RSIAgent。它通过协调课程、执行与验证智能体,采用“先广后深”的探索策略,自主构建并验证环境知识记忆,包括可复用的动作-条件-结果因果关系。实验表明,该框架能显著提升开源模型在OSWorld-v2等基准上的性能,使其超越GPT-6等前沿闭源模型。

95%📊# 13

F4R:基于失败驱动的识别、重建、精炼与重部署,实现机器人持续自我改进

F4R: Failure-Driven Recognition, Reconstruction, Refinement, and Redeployment for Continual Robot Self-Improvement

针对当前视觉-语言-动作模型因演示覆盖有限和物理交互理解不足导致的性能瓶颈,本文提出F4R框架。该框架构建了一个失败驱动的实-仿-实闭环学习系统,将真实世界失败转化为针对性的策略改进。F4R自动识别并诊断失败,将其重建为保留任务相关条件的交互式桌面环境,随后通过失败条件的仿真-真实协同训练及针对性强化学习来精炼策略。在四个操作任务上的真实世界评估表明,F4R在分布外条件下取得了90.0%的成功率,优于基线方法18.75个百分点,且无需收集额外的真实纠错演示。

95%🎓# 14

AgentHop:用于智能体多跳科学问答的诊断性基准

AgentHop: A Diagnostic Benchmark for Agentic Multi-Hop Scientific Question Answering

为诊断智能体任务中复杂的失败根源,本文提出AgentHop诊断基准,包含1,011道选择题,并在固定的令牌、轮次和工具调用限制下提供七工具沙箱。该基准通过检索、合成、工具调用和资源管理四个操作轴分解单一准确率分数,以揭示模型弱点。对19个模型的评估发现,行为按模型家族聚类,工具调用特征呈现明显的家族指纹,且分解的指标进一步暴露了家族内部的结构差异,例如Claude Opus与Sonnet在检索与合成侧重上的不同。

95%🏆# 15

CodeActionBench:评估具身操作中智能体代码即策略的能力

CodeActionBench: Evaluating Agentic Code-as-Policy for Embodied Manipulation

本文提出CodeActionBench基准,包含25个操作任务,用于评估通用多模态模型通过可执行代码将视觉理解与推理转化为具身操作的能力。智能体需在无任务微调、演示或特权信息的情况下,自主选择视觉证据、形成3D估计、构建操作目标并迭代执行与修订策略。在九种配置共675次尝试的广泛评估中,成功率介于2.7%至73.3%之间。最强的GPT-6 Astra with Codex CLI配置在三次尝试中解决了25个任务中的22个,但仍存在空间对齐、物体保持和完成判断等典型失败场景。

95%💻# 16

TAO-DA:迈向自主操作——面向协调操作的双臂视觉-语言-动作模型

TAO-DA: Towards Autonomous Operation--A Dual-Arm Vision-Language-Action Model for Coordinated Manipulation

现有视觉-语言-动作(VLA)模型缺乏显式机制来解耦双臂的状态与意图,导致意外的跨臂干扰。为此,本文提出一种对称的双臂专家(DAE)架构,该架构基于共享的VLM主干,并配有解耦的、臂特定的专家塔。专家选择通过两阶段的双臂意图路由方案实现,并引入轻量级任务进度预测模块以促进协作任务中的进度同步。实验证明了模型在双臂意图路由、解耦跨臂干扰以及涌现技能泛化方面的有效性。

95%🔗# 17

VPTwin:面向机器人操作规划的实-仿-实视频预测框架

VPTwin: Real-Sim-Real Video Prediction for Robotic Manipulation Planning

为解决纯数据驱动的视频预测在长时域推演中存在的误差累积和物理失真问题,本文提出VPTwin框架。该框架利用视觉语言模型(VLM)从真实演示中重建可执行的数字孪生,并通过Isaac Sim在随机物理参数下模拟候选动作轨迹。VPTwin以仿真推演为参考,协调真实与仿真域,利用仿真动力学保证物理合理性,同时从真实视频中捕捉未建模的接触交互,从而显著减少物理幻觉并提升操作规划性能。

95%📈# 18

ASCEND:面向跨HPC集群与GPU工作站的自主科学计算的个人AI智能体

ASCEND: Personal AI Agents for Autonomous Scientific Computing Across HPC Clusters and GPU Workstations

传统科学计算要求研究人员手动配置环境、申请资源并诊断故障。本文提出ASCEND,一种AI驱动的智能体接口,它运行于研究人员的个人电脑,通过认证连接管理Slurm集群和GPU工作站,并执行本地策略检查。案例研究表明,该智能体能够自主完成故障恢复、复现模型评估、并行化求解器等复杂工作流,同时识别出原始代码中的未定义行为。

95%🛠️# 19

什么阻碍了机器人的递归自我改进?来自123轮智能技能发现的启示

What Stops Recursive Self-Improvement in Robotics? Lessons from 123 Rounds of Agentic Skill Discovery

本研究构建了一个智能体系统,让机器人通过观察失败、发现缺失能力、编写新技能并测试,在无人编写代码的情况下进行了123轮自我改进实验。结果表明,智能体能够自主发现能力,但其改进未能累积叠加。瓶颈主要在于三个方面:链式感知模块不理解关系、技能链将学习锁定在第一步、以及评估框架决定了学习内容。研究据此提炼出构建自我改进机器人系统的具体建议。

95%✨# 20

PlanGuard:具身智能体中多步计划安全性的护栏

PlanGuard: A Guardrail for Multi-Step Plan Safety in Embodied Agents

现有安全保障机制忽视了具身任务规划中多步计划的组合性物理风险。为此,本文提出首个预执行检测器PlanGuard,用于评估完整多步计划在当前环境中的物理安全性。我们构建了MSP-Safe数据集,并提出了强教师自适应补偿的在线策略蒸馏方法(STAC-OPD),以在紧凑模型规模上实现有效的全计划风险检测。实验表明,PlanGuard-2B模型在测试集上平均准确率达87.15%,F1分数达87.21%。

数据来源:arXiv
由 智能助手@AIIA Lab 生成

相关学习资料