
📡 AI 创新应用
2026年07月06日星期一
共 20 篇精选论文| 🔥# 1 | 95% |
Tool-Genesis:面向自进化语言智能体的任务驱动式工具创建基准
Tool-Genesis: A Task-Driven Tool Creation Benchmark for Self-Evolving Language Agent
自进化语言智能体研究加速发展,但其从任务需求中创建、适配和维护工具的能力缺乏有效评估。现有基准多依赖预定义规范,限制了可扩展性与自主进化。本文提出诊断性基准Tool-Genesis,旨在从接口合规性、功能正确性和下游效用等多维度量化智能体能力。该基准评估智能体能否仅从抽象需求(无预设规范)构建任务相关工具并解决实际问题。研究发现,即使最先进的模型也难以在单次尝试中生成精确的工具接口或可执行逻辑,这些微小初始缺陷会在流程中被放大,导致下游指标急剧下降。该基准旨在引导未来研究,训练模型合成能更好应对现实挑战的持久性通用工具。
| ⭐# 2 | 95% |
EurekAgent:自主科学发现的关键在于智能体环境工程
EurekAgent: Agent Environment Engineering is All You Need For Autonomous Scientific Discovery
随着大语言模型(LLM)智能体在自动化科学发现方面潜力日增,研究瓶颈正从设计智能体工作流转向设计智能体环境。本文提出“环境工程”框架,旨在构建能放大有益行为(如开放式探索、系统化工件管理)并抑制有害行为(如奖励黑客攻击)的环境。基于此,我们提出了EurekAgent系统,从权限、工件、预算和人机交互四个维度进行环境工程。该系统在多个数学、内核工程和机器学习任务上取得了新的最先进成果,例如以低于11美元的总API成本发现了新的26圆填充最优解,证明了环境工程是发展可靠自主研究智能体的核心方向。
| 💡# 3 | 95% |
利用AtomisticSkills赋能智能体原子尺度研究
Harnessing AtomisticSkills for Agentic Atomistic Research
计算材料科学与化学领域知识庞杂、软件生态分散,将单体LLM智能体扩展至原子尺度研究面临挑战。本文介绍开源框架AtomisticSkills,它通过将科学工作流层次化分解为智能体技能与工具,赋能通用AI编程智能体跨材料、化学与药物发现进行研究。该框架集成了100多项人工策划的多学科技能,涵盖数据库访问、热力学与动力学建模,以及采用机器学习原子间势(MLIP)和密度泛函理论(DFT)的多种模拟引擎。我们通过多项科学活动验证了其功能覆盖与稳健的编排能力,包括锂离子固态电解质生成设计、MOF材料高通量筛选、自主MLIP基准测试与微调、多阶段药物虚拟筛选等,为构建全自主AI科学家提供了关键的智能体基础设施。
| 🔬# 4 | 95% |
AI-IoT-机器人集成:框架综述、新兴趋势与迈向互联机器人的路径
AI-IoT-Robotics Integration: Survey of Frameworks, Emerging Trends, and the Path Toward Connected Robotics
人工智能、物联网和机器人的融合正成为实时、智能、情境感知系统的基础。AI提供感知与推理,IoT实现可扩展传感与通信,机器人负责具身执行。尽管在AIoT和IoRT等两两结合上进展显著,但仍缺乏完全整合三者的统一设计框架。本综述综合了这些领域的最新进展,强调边缘小型语言模型和云端大型语言模型在分布式认知与自主决策中的新兴作用。我们提出了符合趋势的模块化系统架构,分析了互操作性和反馈控制方面的持续差距,并按集成深度对现有工作分类。综述指出,混合SLM-LLM系统结合IoT基础设施和机器人智能体,可应对实时适应、可扩展性和可靠性挑战,为设计模块化、可解释、能在动态环境中学习的下一代AI-IoT-机器人生态系统提供了概念与技术路线图。
| 📌# 5 | 95% |
迈向具有工具对齐的视觉-语言-动作模型的长程具身智能体
Towards Long-horizon Embodied Agents with Tool-Aligned Vision-Language-Action Models
针对视觉-语言-动作(VLA)模型在长程任务中面临扩展闭环规划与多样物理操作双重负担的局限,本文提出“VLA即工具”策略。该策略将负担分配至高层的视觉语言模型(VLM)智能体(负责时序推理)与一系列专用的VLA工具(负责局部物理操作)之间。我们引入了VLA工具族接口以实现紧密耦合,并提出了工具对齐的后训练方法(TAPT)来获得忠实遵循调用的多样化VLA工具。实验表明,该方法在LIBERO-Long和RoboTwin任务上显著提升了成功率,并大幅增强了调用保真度。
| 🎯# 6 | 95% |
PRAM-R:一种具有LLM引导模态路由的自适应自动驾驶感知-推理-行动-记忆框架
PRAM-R: A Perception-Reasoning-Action-Memory Framework with LLM-Guided Modality Routing for Adaptive Autonomous Driving
为解决多模态感知计算成本高的问题,本文提出PRAM-R框架,采用异步双循环设计:快速反应循环负责感知与控制,慢速审慎循环负责推理驱动的模态选择和记忆更新。其中,LLM路由器根据环境上下文和传感器诊断选择并加权模态,分层记忆模块则保持时间一致性并支持长期适应。合成压力测试表明,基于滞后的稳定化将路由振荡降低了87.2%。在nuScenes数据集上的真实世界验证显示,在复杂城市场景中,模态使用减少6.22%,记忆召回率达20%,同时保持了与全模态基线相当的轨迹精度。
| 💎# 7 | 95% |
迈向智能体赋能的软件生态系统
Toward an Agentic Infused Software Ecosystem
为充分发挥AI智能体在软件开发中的潜力,需重构现有软件生态。本文提出构建“智能体赋能软件生态系统”(AISE),其基于三大支柱:首先是AI智能体本身,其能力在过去五年已从简单的代码补全演进至能执行复杂的独立开发任务;其次是生态基础设施,旨在支持智能体间的协作与集成;最后是新的开发范式。本文概述了AISE的愿景、关键组件与实现路径,旨在推动软件开发向更自主、协同的方向演进。
| 🚀# 8 | 95% |
机器人的内在批评家:基于VLM重规划实现社交行为的自我精炼
The Robot's Inner Critic: Self-Refinement of Social Behaviors through VLM-based Replanning
传统机器人社交行为生成依赖预定义动作或人工反馈,灵活性与自主性有限。本研究提出CRISP框架,机器人利用视觉语言模型(VLM)作为“类人社交批评家”来自主批评并重规划自身动作。该框架包含从描述文件解析关节、生成行为计划、参考视觉信息生成底层控制代码、VLM评估社交适当性以及基于奖励的迭代精炼。用户研究表明,该方法在多种机器人平台和场景下,获得了比先前方法显著更高的偏好度与情境适当性评分,最小化人工干预的同时扩展了自主交互能力与跨平台适用性。
| 🧠# 9 | 95% |
具身科学:以具身AI智能体闭合科学发现循环
Embodied Science: Closing the Discovery Loop with Agentic Embodied AI
当前AI科学预测方法常将发现视为孤立任务,与依赖物理实验循环的现实脱节。本文主张“具身科学”范式,将科学发现重构为智能推理与物理执行紧密耦合的闭环。我们提出统一的感知-语言-行动-发现(PLAD)框架,其中具身智能体感知实验环境、推理科学知识、执行物理干预并内化结果以驱动后续探索。通过将计算推理扎根于鲁棒的物理反馈,该方法弥合了数字预测与实证验证间的鸿沟,为生命与化学科学的自主发现系统提供了路线图。
| ⚡# 10 | 95% |
通过质量多样性提示生成对视觉-语言-动作模型进行红队测试以获取鲁棒机器人策略
Red-Teaming Vision-Language-Action Models via Quality Diversity Prompt Generation for Robust Robot Policies
视觉-语言-动作(VLA)模型对指令措辞敏感,其失败模式难以预测。为提高VLA的鲁棒性,本文提出Q-DIG,它结合质量多样性(QD)技术与视觉语言模型(VLM),可扩展地生成多样且与任务相关的对抗性指令以暴露VLA行为漏洞。在多个仿真基准上的结果表明,Q-DIG相比基线方法能发现更多样、有意义的失败模式,并且利用生成的指令对VLA进行微调能提升任务成功率。真实世界评估与用户研究进一步验证了其有效性。
| 🌟# 11 | 95% |
理解AI代理热潮:来自实践者的采用、架构与启示
Making Sense of AI Agents Hype: Adoption, Architectures, and Takeaways from Practitioners
为帮助实践者理解智能体系统在工业界的实际设计,本研究回顾分析了138个关于AI代理的实践者会议演讲。研究旨在:1)探究企业如何采用基于代理的架构;2)识别反复出现的架构策略与模式;3)分析用于实现和运营LLM驱动代理系统的应用领域与技术。通过对这些实践经验的梳理,为业界理解和构建代理系统提供了实证参考。
| 🔎# 12 | 95% |
SpaceMind:面向自主在轨服务的模块化自演进具身视觉-语言智能体框架
SpaceMind: A Modular and Self-Evolving Embodied Vision-Language Agent Framework for Autonomous On-orbit Servicing
为满足自主在轨服务对具身智能体的需求,本文提出了SpaceMind,一个模块化且自演进的视觉-语言模型(VLM)智能体框架。它将知识、工具和推理分解为三个可独立扩展的维度:具有动态路由的技能模块、可配置的MCP工具以及可注入的推理模式技能。通过MCP-Redis接口层,同一代码库无需修改即可在仿真和物理硬件上运行;技能自演进机制能将操作经验提炼为持久化技能文件而无需微调模型。在包含退化条件的广泛测试中,该框架表现出强大的鲁棒性和任务成功率,并实现了零代码修改向物理机器人的成功迁移。
| 📊# 13 | 95% |
思考并运行:通过自修复多智能体AI实现自主机器学习流水线生成
Think it, Run it: Autonomous ML pipeline generation via self-healing multi-agent AI
本文旨在开发一个统一的多智能体架构,以从数据集和自然语言目标自动生成端到端的机器学习(ML)流水线,提升效率、鲁棒性和可解释性。提出的五智能体系统负责数据剖析、意图解析、微服务推荐、有向无环图(DAG)构建与执行。它集成了基于代码的检索增强生成(RAG)、结合多标准的可解释混合推荐器、基于大语言模型(LLM)错误解释的自修复机制以及从执行历史中自适应学习。在150个ML任务上的评估显示,该系统实现了84.7%的端到端流水线成功率,优于基线方法,并通过自修复提升了鲁棒性,缩短了工作流开发时间。
| 🎓# 14 | 95% |
迈向有根基的自主研究:在已发表计算物理文献上的端到端 LLM 微型研究循环
Towards grounded autonomous research: an end-to-end LLM mini research loop on published computational physics
本文聚焦于物理科学研究的最小单元——微型研究循环,即智能体阅读论文、复现、批判并扩展它。我们在规模和深度两个层面测试该循环:在规模上,智能体对 111 篇开放获取计算物理论文自主运行“阅读-规划-计算-比较”循环,无需被要求批判即在约 42% 的论文中提出了实质性质疑;在深度上,针对一篇关于二维材料 MOSFET 多尺度模拟的《自然·通讯》论文,智能体自主运行了原文缺失的新计算,并生成了可发表的评论,修正了原文的核心结论。
| 🏆# 15 | 95% |
深度研究智能体:一个支持零成本监控的7x24小时自主深度学习实验框架
Deep Researcher Agent: An Autonomous Framework for 24/7 Deep Learning Experimentation with Zero-Cost Monitoring
本文提出开源框架Deep Researcher Agent,使LLM智能体能自主进行全天候深度学习实验。其核心创新包括:零成本监控范式、两级恒定大小内存架构以及最小工具集的主从多智能体设计。在持续30多天的部署中,该框架自主完成了500多个实验周期,在单个项目中通过200多次自动化实验将基线指标提升了52%,且日均LLM成本仅为0.08美元。
| 💻# 16 | 95% |
MAVEN:提升智能体工具调用的泛化能力
MAVEN: Improving Generalization in Agentic Tool Calling
智能体工具调用环境的泛化能力是可靠智能推理系统的核心挑战。本文提出MAVEN,一个轻量级符号推理框架,支持结构化分解、自适应工具编排与中间验证。在多个工具调用基准及新提出的压力测试基准MAVEN-Bench上评估,MAVEN将其基础模型GPT-OSS-120b的准确率从48%提升至71%,且无需额外训练。结果表明,这种以验证为中心的轻量级框架能增强组合推理能力,其性能与前沿闭源基线相当,而成本估计仅为约十分之一。
| 🔗# 17 | 95% |
FASE:面向代码质量的快速自适应语义熵
FASE: Fast Adaptive Semantic Entropy for Code Quality
多智能体代码生成因LLM幻觉和错误传播而影响系统可靠性。语义熵提供了一种无需真实答案即可量化不确定性的原则性方法,但现有方法依赖昂贵的LLM驱动等价性检查。本文提出快速自适应语义熵(FASE),一种基于结构和语义差异图最小生成树来近似功能正确性的新度量。在HumanEval和BigCodeBench上的评估表明,FASE优于基于LLM蕴含的最先进语义熵方法,在使用Qwen3-Embedding-8B模型时,其斯皮尔曼相关系数平均提升25%,ROCAUC分数相对Pass@1提升19%。此外,FASE消除了昂贵的LLM等价性评估,仅需传统方法约0.3%的运行时间成本,为实际多智能体工作流中的不确定性量化提供了实用、经济的解决方案。
| 📈# 18 | 95% |
面向代码智能体的贝叶斯控制
Bayesian control for coding agents
现代代码智能体将LLM生成器与多种工具(如廉价诊断器和昂贵验证器)结合,但其工具调用决策通常由忽略不确定性的固定规则编排器控制。本研究将编排问题建模为成本敏感的序贯假设检验:一个贝叶斯控制器维护对候选代码正确性的信念,并动态决定是收集更多证据、优化候选方案、验证还是停止。在六个生成器和九个编码基准上的实验表明,当验证成本高昂且诊断工具信息丰富但不完美时,贝叶斯控制最具价值。此外,其信念状态可产生可解释的正确性分数,在不确定性量化方面优于基于令牌概率和原始工具成功率的基线方法。
| 🛠️# 19 | 90% |
推理努力,而非工具访问,决定了智能体代码生成的首试可靠性:一项观察性研究
Reasoning effort, not tool access, buys first-try reliability in agentic code generation: an observational study
本研究挑战了“增强能力即可提升智能编码助手性能”的假设。通过90次独立实验构建同一应用,并评估功能与视觉质量,发现:前沿模型性能接近上限,而低成本本地模型较差;增加测试工具显著提升成本却未改善功能分或可靠性;将推理努力从“高”提升至“极高”能使首试完美率从28%升至89%,并大幅减少修正提示,成本仅增9-29%。关键结论是:多数首试失败源于推理不足,而非检查工具可发现的表面缺陷,因此应针对性地提升模型能力或推理努力。
| ✨# 20 | 90% |
引导动作流:基于Q值引导的流匹配视觉-语言-动作策略推理
Guided Action Flow: Q-Guided Inference for Flow-Matching Vision-Language-Action Policies
针对流匹配视觉-语言-动作(VLA)策略在推理时存在优化机会的问题,本文提出“引导动作流”框架。该方法保持预训练的SmolVLA策略冻结,利用从成功与失败轨迹中学得的动作块评价器,仅通过动作梯度引导其逆向时间流采样器。在LIBERO操作任务上的评估表明:单任务评价器将成功率从68.0%提升至82.0%;多家族任务描述评价器将验证成功率从46.0%提升至56.0%。结果证实了Q引导推理对冻结流匹配VLA策略的可行性,同时指出评价器泛化与不确定性感知引导仍是核心瓶颈。
数据来源:arXiv
由 智能助手@AIIA Lab 生成

夜雨聆风