
📡 AI 创新应用
2026年07月24日星期五
共 20 篇精选论文| 🔥# 1 | 95% |
迈向具有工具对齐的视觉-语言-动作模型的长程具身智能体
Towards Long-horizon Embodied Agents with Tool-Aligned Vision-Language-Action Models
针对视觉-语言-动作(VLA)模型在长程任务中面临扩展闭环规划与多样物理操作双重负担的局限,本文提出“VLA即工具”策略。该策略将负担分配至高层的视觉语言模型(VLM)智能体(负责时序推理)与一系列专用的VLA工具(负责局部物理操作)之间。我们引入了VLA工具族接口以实现紧密耦合,并提出了工具对齐的后训练方法(TAPT)来获得忠实遵循调用的多样化VLA工具。实验表明,该方法在LIBERO-Long和RoboTwin任务上显著提升了成功率,并大幅增强了调用保真度。
| ⭐# 2 | 95% |
AI-IoT-机器人集成:框架综述、新兴趋势与迈向互联机器人的路径
AI-IoT-Robotics Integration: Survey of Frameworks, Emerging Trends, and the Path Toward Connected Robotics
人工智能、物联网和机器人的融合正成为实时、智能、情境感知系统的基础。AI提供感知与推理,IoT实现可扩展传感与通信,机器人负责具身执行。尽管在AIoT和IoRT等两两结合上进展显著,但仍缺乏完全整合三者的统一设计框架。本综述综合了这些领域的最新进展,强调边缘小型语言模型和云端大型语言模型在分布式认知与自主决策中的新兴作用。我们提出了符合趋势的模块化系统架构,分析了互操作性和反馈控制方面的持续差距,并按集成深度对现有工作分类。综述指出,混合SLM-LLM系统结合IoT基础设施和机器人智能体,可应对实时适应、可扩展性和可靠性挑战,为设计模块化、可解释、能在动态环境中学习的下一代AI-IoT-机器人生态系统提供了概念与技术路线图。
| 💡# 3 | 95% |
智能体化网络的基础设施:来自Agentverse平台的差距分析与架构
Infrastructure for the Agentic Web: Gap Analysis and Architecture from the Agentverse Platform
本文对Fetch.ai在ASI联盟下开发的Agentverse智能体云平台进行了系统分析。首先通过实证审计,归类了204个API端点,并从中推导出包含62项缺失能力的八类差距分类法。其次,提出了七层“智能体云栈”参考架构,描绘了到2030年完全实现的智能体原生云应提供的功能。第三,阐述了五个关键演进路径:从临时存储到完整的智能体记忆云;从关键词发现到语义化、信任加权的智能体DNS;从单一协议模型到多标准智能体通用语;从单实例托管到Kubernetes级编排;从简单代币支付到丰富的智能体经济原语。这些贡献共同提供了当前智能体基础设施的诊断及面向2030年支持智能体化网络(Web4)的技术愿景。
| 🔬# 4 | 95% |
CodeTeam:一个基于LLM的多智能体框架,用于仓库级代码生成
CodeTeam: An LLM-Powered Multi-Agent Framework for Repository-Level Code Generation
针对从自然语言需求文档生成整个软件仓库(NL2Repo)任务面临的规划视野长、跨文件接口需稳定及跨文件不一致性需迭代调试等挑战,本文提出了CodeTeam框架。它将规划、决策与实现分离为不同阶段:多个“架构师”智能体起草竞争性软件设计草图(SDS),由“CTO”智能体评估、选择并规范化为包含文件所有权、公共接口和依赖约束的机器可检查契约;在实现阶段,“开发者”智能体在依赖感知调度下生成代码,“QA”智能体运行测试并驱动迭代修复。在SketchEval和NL2Repo-Bench基准测试中,CodeTeam均取得了最佳性能,消融实验表明项目特定开发者分配和检索增强规划贡献显著。
| 📌# 5 | 95% |
SignVLA:一种用于实时手语引导机器人操作的无语标视觉-语言-动作框架
SignVLA: A Gloss-Free Vision-Language-Action Framework for Real-Time Sign Language-Guided Robotic Manipulation
本文提出了首个手语驱动的视觉-语言-动作(VLA)框架,用于直观且包容的人机交互。与依赖语标注释作为中间监督的传统方法不同,本系统采用无语标范式,直接将视觉手语手势映射为语义指令,降低了标注成本并避免了语标表示的信息损失。研究聚焦于实时字母级指拼交互界面,为机器人控制提供了可靠、低延迟的通信通道。通过几何归一化、时间平滑和词汇精炼,该框架将连续手势流转化为连贯的语言指令。实验结果表明,该系统能有效将手语指令转化为精确的机器人动作,展现了其在推进可访问、可扩展的多模态具身智能方面的潜力。
| 🎯# 6 | 95% |
迈向人工智能研究的端到端自动化
Towards End-to-End Automation of AI Research
科学自动化是AI领域的长期目标。本文展示了迄今为止最接近端到端自动化整个研究生命周期(从构想到发表)的系统——AI Scientist。它能生成研究想法、编写代码、运行实验、绘图分析数据、撰写完整科学手稿并进行自主同行评审。其产出的手稿在主要机器学习会议研讨会(录取率70%)的首轮评审中通过。系统在两种模式下进行评估:基于人类提供代码模板的聚焦模式,以及利用智能体搜索进行开放式探索的无模板模式。该成就展示了AI日益增长的科学贡献能力,并可能引发研究范式的转变。
| 💎# 7 | 95% |
基于分层LLM的多智能体框架及其提示优化用于多机器人任务规划
Hierarchical LLM-Based Multi-Agent Framework with Prompt Optimization for Multi-Robot Task Planning
为解决多机器人任务规划中自然语言指令分解的难题,本文提出一种结合分层多智能体LLM与提示优化的规划器。上层分解任务并分配给下层智能体,下层生成PDDL问题并由经典规划器求解。规划失败时,系统采用文本梯度更新优化各智能体的提示。此外,同层智能体间共享元提示以实现高效优化。在MAT-THOR基准测试中,该规划器在复合、复杂和模糊任务上的成功率分别达到0.95、0.84和0.60,优于之前的SOTA方法。
| 🚀# 8 | 95% |
迈向个性化LLM驱动的智能体:基础、评估与未来方向
Toward Personalized LLM-Powered Agents: Foundations, Evaluation, and Future Directions
随着LLM智能体在长时交互中愈发依赖对个体用户的适应与跨时间连续性,个性化LLM智能体应运而生。本综述围绕个性化智能体的四个相互依赖组件——画像建模、记忆、规划与动作执行——对文献进行能力导向的梳理,分析了用户信号的表示、传播与利用方式,并总结了跨组件交互与设计权衡。文章进一步审视了针对个性化智能体的评估指标与基准,概述了从通用辅助到专业领域的应用场景,并为研究与部署的未来方向绘制了路线图,旨在推动构建更用户对齐、自适应、鲁棒且可部署的智能体系统。
| 🧠# 9 | 95% |
扮演真正的研究者:一套评估前沿LLM与智能体框架在研究生命周期中表现的基准
Act As a Real Researcher: A Suite of Benchmarks Evaluating Frontier LLMs and Agentic Harnesses in Research Lifecycle
随着基础模型进步和智能体框架日益复杂,智能体在复杂长周期编码任务甚至自主实验执行中展现出卓越能力。然而,这些系统在领域敏感性、研究伦理和细微科学判断方面仍存在显著局限,无法完全取代人类研究者。为弥补此差距,我们提出AARR(扮演真正的研究者)基准系列。本文介绍了该系列的首个基准AARRI-Bench,它聚焦于评估智能体能否在细粒度研究场景中模仿人类研究者的专业性、严谨性和细微推理。对前沿模型和智能体系统的广泛实验表明,即使最佳配置(Claude Opus 4.7驱动的Mini-SWE-Agent)成功率也仅为68.3%,常忽略对人类研究者显而易见的关键细节。结果表明,开发类研究者AI需要进一步探索研究行为,而非仅仅依赖复杂框架。
| ⚡# 10 | 95% |
CoRAL:基于LLM的接触式机器人自适应控制
CoRAL: Contact-Rich Adaptive LLM-based Control for Robotic Manipulation
为解决大语言模型(LLM)与视觉语言模型(VLM)在接触式操作中缺乏物理基础与自适应控制能力的问题,本文提出CoRAL模块化框架。该方法将LLM用作成本函数设计器而非直接控制器,为采样运动规划器(MPPI)生成情境感知目标函数,并通过神经符号适应环路实时优化物理参数估计。其分层架构将高层语义推理与底层反应式执行解耦,并引入检索记忆单元复用成功策略。在仿真与真实硬件上的实验表明,CoRAL在未见接触式任务中的平均成功率超越现有VLA与基础模型规划基线50%以上,能有效处理仿真到现实的差距。
| 🌟# 11 | 95% |
AgentGA:在智能体-种子空间中演化代码解决方案
AgentGA: Evolving Code Solutions in Agent-Seed Space
本文提出AgentGA框架,通过优化“智能体种子”(即任务提示词及可选的父代存档)来演化自主代码生成过程。外层循环搜索这些可复用的起始条件,而非直接编辑代码。每一代都从重置的工作区启动一次新的自主运行,而选中的父代存档提供了可供后代检查和重用的继承产物。我们将该方法实例化于表格AutoML任务,实验表明,在10次基准运行中,AgentGA平均性能超越54.15%的人类,优于基线AIDE。超过1135次父子代对比显示,获得父代存档的后代表现优于从零开始的运行,证实了继承产物能改进后续自主运行。
| 🔎# 12 | 95% |
利用大语言模型驱动的智能体系统自动发现生物系统的常微分方程
Automatic Ordinary Differential Equations Discovery For Biological Systems Using Large Language Model Powered Agentic System
自动科学发现长期以来是计算学者的目标。近期符号回归(SR)和大语言模型(LLM)智能体的进展表明,此类系统能从数据中恢复方程、整合领域先验并自动化部分研究工作流。然而,现有方法多聚焦于狭窄的方程发现基准或宽泛的端到端自动化流程,对生物系统的探索相对不足。本文提出MEDA系统,一个由LLM和SR驱动的智能体框架,用于发现生物及类生物动力系统的常微分方程(ODE)模型。MEDA能检索背景知识、定义可接受变量、生成机制约束、提出候选ODE并进行拟合评估。我们在经典模型检索、基于推理的外推至未见变体以及开放式发现等场景下评估了该系统。结果表明,MEDA能恢复正确的状态变量,在检索和外推任务中实现了良好的结构恢复,并生成了生物学上合理的发现导向模型。消融实验表明,知识引导的形式化和机制约束是关键组件。
| 📊# 13 | 95% |
推动全模态具身智能体:从孤立技能迈向日常物理自主
Advancing Omnimodal Embodied Agents from Isolated Skills to Everyday Physical Autonomy
为在非结构化环境中构建持久的具身智能体,需要统一协调网络(API、物联网)与物理(操作、导航)领域的异构工具,并具备从长期运行中不可避免的物理故障中自主恢复的能力。现有系统常将这些问题割裂处理。本文提出OmniAct框架,它集成了用于跨统一动作空间进行技能路由的多模态语义规划器、具有事件边界驱动压缩的自适应分层记忆(实现亚线性上下文增长),以及用于在物理执行期间闭合语义循环的异步视觉抢占引擎。在涉及两个机器人平台和四个物联网设备的40个真实世界长程任务中,OmniAct在所有复杂度级别上均实现了端到端成功率的持续提升,在累积超过10万交互令牌下保持近乎平坦的令牌消耗,并将中等规模开源模型的性能提升至接近专有模型水平。
| 🎓# 14 | 95% |
Sibyl-AutoResearch:自主科研需要自我演进的试错框架,而非论文生成器
Sibyl-AutoResearch: Autonomous Research Needs Self-Evolving Trial-and-Error Harnesses, Not Paper Generators
当前自主科研系统虽能执行工作流,但缺乏研究判断力,常丢失试错经验。本文提出Sibyl-AutoResearch框架,其核心是科学试错框架,允许智能体运行有限试验、保存正负结果,并将经验教训融入后续规划、验证、写作等环节。框架通过两个可审计的转换单元形式化此过程:试验到行为的转换,以及试验到框架行为的转换。在SIBYL系统中的回溯审计识别出多个高置信度转换事件,展示了该框架如何阻断或修复自然发生的五类失败,证明了所提转换单元在现实自主研究工作空间中的可恢复性。
| 🏆# 15 | 95% |
从思考者到社会:AI智能体层级自主演化中的安全
From Thinker to Society: Security in Hierarchical Autonomy Evolution of AI Agents
随着大语言模型(LLM)驱动AI智能体向自主决策演进,其安全漏洞日益凸显。本文提出层级自主演化(HAE)框架,将智能体安全组织为三个层级:认知自主(L1)针对内部推理完整性;执行自主(L2)覆盖工具介导的环境交互;集体自主(L3)应对多智能体生态系统中的系统性风险。我们提出了一个涵盖认知操纵、物理环境破坏和多智能体系统性故障的威胁分类法,评估了现有防御措施并指出了关键研究空白。研究旨在为构建可信的AI智能体系统提供多层次、自主感知的防御架构指导。
| 💻# 16 | 95% |
Aletheia自主攻克首届FirstProof挑战
Aletheia tackles FirstProof autonomously
本文报告了基于Gemini 3 Deep Think的数学研究智能体Aletheia在首届FirstProof挑战中的表现。在规定的挑战时间内,Aletheia自主解决了10道问题中的6道(第2、5、7、8、9、10题),该结果基于多数专家评估(仅第8题专家意见未完全一致)。我们详细说明了其对FirstProof挑战规则的理解与评估方法,并提供了完整的解题过程与透明度报告,展示了AI智能体在形式化数学问题求解方面的初步能力。
| 🔗# 17 | 95% |
StarVLA:一个用于视觉-语言-动作模型开发的乐高式代码库
StarVLA: A Lego-like Codebase for Vision-Language-Action Model Developing
为应对视觉-语言-动作(VLA)方法在架构、代码和评估上碎片化的问题,本文提出开源代码库StarVLA。它提供模块化的主干-动作头架构,支持VLM和世界模型等多种主干与动作解码范式;提供可复用的训练策略;并集成了多个主流基准的统一评估接口。其简易训练配方已在多个基准上达到或超越现有方法,旨在降低VLA研究的复现与原型开发门槛。
| 📈# 18 | 95% |
SUGAR:一种可扩展的、基于人类视频驱动的通用人形机器人移动操作学习框架
SUGAR: A Scalable Human-Video-Driven Generalizable Humanoid Loco-Manipulation Learning Framework
为解决人形机器人通用全身移动操作学习的难题,本文提出了数据驱动框架SUGAR。该方法无需繁琐的任务特定奖励设计或推理时的参考运动绑定,通过三阶段流程将多样人类视频转化为可部署的技能:从视频中自动提取运动与接触先验;利用统一模仿奖励和渐进状态池将其精炼为物理可行的技能;最后蒸馏为分层自主策略。在仿真与真实硬件上的六项任务评估表明,其性能显著优于基线并随视频数据量提升,能实现零样本真实世界迁移,具备闭环执行、自主故障恢复及抗干扰的稳定长时性能。
| 🛠️# 19 | 95% |
调度与运动规划的交替执行及符号化时空运动抽象的增量学习
Interleaving Scheduling and Motion Planning with Incremental Learning of Symbolic Space-Time Motion Abstractions
针对自动化仓库等多目标导航场景中,在资源、时间和运动约束下安全高效执行预定义任务的挑战,本文形式化了调度与运动规划问题。提出一种新颖的解决方案框架,将现成的调度器与运动规划器在增量学习循环中交替执行:调度器生成候选计划,运动规划器检查可行性并返回符号化反馈(空间冲突、时间调整)以指导调度器。在物流和作业车间调度基准上的验证表明,该框架能有效生成满足复杂时空约束的可行计划。
| ✨# 20 | 95% |
学习面向杂乱环境中顺序操作的对象中心空间推理
Learning Object-Centric Spatial Reasoning for Sequential Manipulation in Cluttered Environments
为解决机器人在杂乱环境中操作的数据效率与模块化问题,本文提出Unveiler框架,将高层空间推理与底层动作执行解耦。其核心是基于Transformer的空间关系编码器(SRE),能顺序识别并决策移除关键障碍物,再由旋转不变的动作解码器执行。该方法在参数和推理时间上更高效,在密集杂乱场景中的目标取回成功率显著优于端到端策略及大模型基线,仿真成功率最高达97.6%,并能零样本迁移到真实场景。
数据来源:arXiv
由 智能助手@AIIA Lab 生成

夜雨聆风