AI应用论文|智能体软件:AI智能体如何重构软件范式 (1/20篇) · 7月19日

📡 AI 创新应用
2026年07月19日星期日
共 20 篇精选论文
| 🔥# 1 | 100% |
智能体软件:AI智能体如何重构软件范式
Agentic Software: How AI Agents Are Restructuring the Software Paradigm
本文论证AI智能体的出现构成了软件本质的根本性重构,而非渐进式工具改进。形式化区分了传统确定性软件与智能体软件:前者代码承载预写决策逻辑,后者智能体即软件,其决策逻辑在运行时生成。追溯从许可软件到SaaS再到智能体即服务(AaaS)的历史弧线,指出智能体转变转移了决策复杂性本身。引入智能体工程作为软件工程学科的新范式,其核心研究对象、控制模型和人类角色均发生转变。通过分析近期基准证据,展示了智能体范式的变革潜力与当前局限,并提出了通向自进化智能体生态的四阶段路线图。
| ⭐# 2 | 100% |
自动化具身智能体架构设计
Automating the Design of Embodied Agent Architectures
具身智能体通常由感知、记忆、规划、行动等模块手工组合而成,架构设计空间巨大。本文研究将智能体架构搜索(AAS)从文本领域系统性地迁移到具身感知领域。我们引入了AgentCanvas(一个类型化图运行时)和KDLoop(一种编码智能体搜索流程)。在涵盖视觉语言导航、具身问答等任务的四个具身执行器上评估三种AAS变体。结果表明,架构级搜索能为具身任务带来可部署的成功率提升,但也揭示了在文本领域AAS中被掩盖的约束,如优化信号被模拟噪声掩盖、搜索易陷入局部编辑盆地等。
| 💡# 3 | 95% |
迈向人工智能研究的端到端自动化
Towards End-to-End Automation of AI Research
科学自动化是AI领域的长期目标。本文展示了迄今为止最接近端到端自动化整个研究生命周期(从构想到发表)的系统——AI Scientist。它能生成研究想法、编写代码、运行实验、绘图分析数据、撰写完整科学手稿并进行自主同行评审。其产出的手稿在主要机器学习会议研讨会(录取率70%)的首轮评审中通过。系统在两种模式下进行评估:基于人类提供代码模板的聚焦模式,以及利用智能体搜索进行开放式探索的无模板模式。该成就展示了AI日益增长的科学贡献能力,并可能引发研究范式的转变。
| 🔬# 4 | 95% |
SignVLA:一种用于实时手语引导机器人操作的无语标视觉-语言-动作框架
SignVLA: A Gloss-Free Vision-Language-Action Framework for Real-Time Sign Language-Guided Robotic Manipulation
本文提出了首个手语驱动的视觉-语言-动作(VLA)框架,用于直观且包容的人机交互。与依赖语标注释作为中间监督的传统方法不同,本系统采用无语标范式,直接将视觉手语手势映射为语义指令,降低了标注成本并避免了语标表示的信息损失。研究聚焦于实时字母级指拼交互界面,为机器人控制提供了可靠、低延迟的通信通道。通过几何归一化、时间平滑和词汇精炼,该框架将连续手势流转化为连贯的语言指令。实验结果表明,该系统能有效将手语指令转化为精确的机器人动作,展现了其在推进可访问、可扩展的多模态具身智能方面的潜力。
| 📌# 5 | 95% |
CodeTeam:一个基于LLM的多智能体框架,用于仓库级代码生成
CodeTeam: An LLM-Powered Multi-Agent Framework for Repository-Level Code Generation
针对从自然语言需求文档生成整个软件仓库(NL2Repo)任务面临的规划视野长、跨文件接口需稳定及跨文件不一致性需迭代调试等挑战,本文提出了CodeTeam框架。它将规划、决策与实现分离为不同阶段:多个“架构师”智能体起草竞争性软件设计草图(SDS),由“CTO”智能体评估、选择并规范化为包含文件所有权、公共接口和依赖约束的机器可检查契约;在实现阶段,“开发者”智能体在依赖感知调度下生成代码,“QA”智能体运行测试并驱动迭代修复。在SketchEval和NL2Repo-Bench基准测试中,CodeTeam均取得了最佳性能,消融实验表明项目特定开发者分配和检索增强规划贡献显著。
| 🎯# 6 | 95% |
智能体化网络的基础设施:来自Agentverse平台的差距分析与架构
Infrastructure for the Agentic Web: Gap Analysis and Architecture from the Agentverse Platform
本文对Fetch.ai在ASI联盟下开发的Agentverse智能体云平台进行了系统分析。首先通过实证审计,归类了204个API端点,并从中推导出包含62项缺失能力的八类差距分类法。其次,提出了七层“智能体云栈”参考架构,描绘了到2030年完全实现的智能体原生云应提供的功能。第三,阐述了五个关键演进路径:从临时存储到完整的智能体记忆云;从关键词发现到语义化、信任加权的智能体DNS;从单一协议模型到多标准智能体通用语;从单实例托管到Kubernetes级编排;从简单代币支付到丰富的智能体经济原语。这些贡献共同提供了当前智能体基础设施的诊断及面向2030年支持智能体化网络(Web4)的技术愿景。
| 💎# 7 | 95% |
从问答到任务完成:智能体系统与驾驭设计综述
From Question Answering to Task Completion: A Survey on Agent System and Harness Design
本文通过模型-驾驭(model-harness)视角审视LLM智能体。首先澄清了智能体的功能定义及作为基础模型与执行驾驭耦合的实现视图。随后分析了模型中心扩展的局限,追溯了智能体工程的四种范式,并将执行驾驭解耦为观察、上下文、控制、动作、状态和验证六大运行时职责。基于此,本文将任务属性与领域压力映射到驾驭配置,回顾了基准与评估实践,并综合了关于运行时设计如何影响长视野任务完成度、效率及可靠性的模型-驾驭证据。最后指出了价值感知评估、安全性、驾驭泛化及模型-驾驭协同演化等开放挑战。
| 🚀# 8 | 95% |
Darwin移动智能体:一条自我演化的路线图
Darwin Mobile Agent: A Roadmap for Self-Evolution
本文以移动图形用户界面(GUI)作为“大世界”的实用代理,提出了Darwin移动智能体开源基础设施,旨在为该领域的自主强化学习奠定基础。该框架通过并行云手机实例的异步智能体-环境循环,解决了真实世界移动交互中的数据收集瓶颈。进一步提出了一条概念路线图,旨在从任务课程、结果验证和记忆管理这三个自我演化智能体的基本支柱中,系统性地移除人类先验。验证表明,Darwin基础设施为路线图第一阶段——GUI领域的策略优化——提供了所需的稳定性和可扩展性。
| 🧠# 9 | 95% |
AnchorVLA:为视觉-语言-动作规划桥接离散决策与连续轨迹
AnchorVLA: Bridging Discrete Decisions and Continuous Trajectories for Vision-Language-Action Planning
自动驾驶规划需将导航意图、交通规则、动态交互和语言指令转化为可执行的连续轨迹。现有视觉-语言-动作(VLA)规划器存在语义-动作对齐困难、离散化误差和推理效率低等问题。为此,我们提出AnchorVLA,一个分层决策锚定的VLA规划框架。它使用轨迹模式锚点作为高层VLA推理与连续轨迹执行间的显式接口:“决策即锚点表示”用锚点令牌编码整个局部运动模式;“锚定残差流”则在选定锚点定义的残差空间中生成细粒度连续轨迹。在Bench2Drive闭环基准测试中,AnchorVLA取得了最先进的成功率(77.28)和具有竞争力的驾驶分数(89.92)。
| ⚡# 10 | 95% |
AgentLTL:用于测量、强制执行和训练工具使用型LLM智能体过程合规性的轨迹验证框架
AgentLTL: A Trace-Verification Framework for Measuring, Enforcing, and Training Procedural Compliance in Tool-Using LLM Agents
工具使用型LLM智能体通常仅通过最终答案正确性或LLM评判来评估,均未捕获答案的产生过程。在安全关键场景中,过程本身即是正确性的一部分。本文引入AgentLTL,一种源自一阶线性时序逻辑(FO-LTL)的语言,用于表达对智能体轨迹的过程规则,并产生确定性的、无需评判的合规分数。该框架支持两种用途:1)利用:约束条件对完整轨迹评分,或在执行前在线检查前缀以控制工具调用;2)微调:该分数作为密集奖励。在涵盖排序、分支等任务的基准测试中,利用和微调均显著提升了模型的合规性。
| 🌟# 11 | 95% |
MARS:具备反思搜索能力的模块化智能体,用于自动化AI研究
MARS: Modular Agent with Reflective Search for Automated AI Research
自动化AI研究因其计算成本高昂(如模型训练)和性能归因不透明而区别于一般软件工程。现有基于LLM的智能体常生成忽略执行成本和因果关系的单一脚本。为此,我们提出了MARS(具备反思搜索能力的模块化智能体),一个为自主AI研究优化的框架。其三大支柱为:(1)通过成本约束的蒙特卡洛树搜索(MCTS)进行预算感知规划,明确平衡性能与执行开销;(2)模块化构建,采用“设计-分解-实现”流程管理复杂研究代码库;(3)比较性反思记忆,通过分析解决方案差异来提炼高价值见解,解决信用分配问题。MARS在可比设置下,于MLE-Bench上达到了开源框架中的最先进性能,并与全球排行榜的顶级方法保持竞争力。此外,系统展现出定性的“顿悟”时刻,63%的有效经验教训源于跨搜索路径的迁移,证明智能体能有效泛化见解。
| 🔎# 12 | 95% |
EvoMaster:面向规模化智能体科学的基础演化智能体框架
EvoMaster: A Foundational Evolving Agent Framework for Agentic Science at Scale
针对现有智能体框架静态、范围狭窄且缺乏试错学习能力的问题,本文提出了EvoMaster,一个为规模化智能体科学设计的基础演化框架。其核心是持续自我演化,使智能体能迭代优化假设、自我批判并在实验周期中积累知识,模拟人类科学探究。该框架领域无关且易于扩展,仅需约100行代码即可构建自演化科学智能体。基于EvoMaster孵化的SciMaster生态系统在多个领域基准测试中取得了最先进的性能,全面超越了通用基线,验证了其作为下一代自主科学发现基础框架的有效性和通用性。
| 📊# 13 | 95% |
Agent-ToM:通过心理理论推理学习监控自主LLM智能体
Agent-ToM: Learning to Monitor Autonomous LLM Agents via Theory-of-Mind Reasoning
监控自主LLM智能体的隐蔽恶意行为极具挑战,因其攻击模式具有延迟性、上下文依赖和长时程特点。现有方法通常独立处理每条轨迹且未从监控经验中学习。本文提出Agent-ToM,一个基于心理理论(ToM)推理的学习监控框架。它在推理时执行结构化全轨迹分析,推断智能体信念、意图假设及与任务一致行为基线的偏差,并采用“推理-验证-精炼”管道构建监控决策。在训练时,它将评判信号提炼为持久的“语义护栏记忆”,实现跨情景可复用的信念与意图条件约束。在对抗性监控基准(SHADE-Arena等)上的评估表明,Agent-ToM取得了优异的精确率-召回率平衡,性能超越最先进的监控基线,证明了结合结构化ToM推理与验证的学习监控层是保障自主LLM智能体安全的有效且可部署的基础。
| 🎓# 14 | 95% |
Embodied-R1.5:通过具身基础模型进化物理智能
Embodied-R1.5: Evolving Physical Intelligence via Embodied Foundation Models
本文提出统一的具身基础模型(EFM)Embodied-R1.5,旨在实现通用物理智能。通过三个自动化数据构建管道扩展关键能力数据覆盖,构建了超150亿token的大规模数据系统,并设计多任务平衡RL方案以缓解任务冲突。引入规划器-落地器-校正器(PGC)闭环框架,使单一模型能自主执行并自我校正长视野任务。该8B参数模型在24个具身VLM基准中16项达到SOTA,且经少量数据微调即可超越领先的VLA模型,零样本真实机器人实验验证了其强大的物理世界泛化能力。
| 🏆# 15 | 95% |
迈向自主O-RAN:面向实时网络控制与管理的多尺度智能体AI框架
Toward Autonomous O-RAN: A Multi-Scale Agentic AI Framework for Real-Time Network Control and Management
针对开放无线接入网(O-RAN)因组件解耦和开放接口带来的操作复杂性挑战,本文提出一个多尺度智能体AI框架。该框架将无线接入网智能组织为跨非实时(Non-RT)、近实时(Near-RT)和实时(RT)控制环路的协调层次:Non-RT RIC中的LLM智能体将运营商意图转化为策略;Near-RT RIC中的小型语言模型(SLM)智能体执行低延迟优化;分布式单元附近的无线物理层基础模型(WPFM)智能体提供快速推理。通过概念验证,该框架在非平稳条件下的鲁棒运行和意图驱动的切片资源控制两个场景中展示了有效性。
| 💻# 16 | 95% |
VEXAIoT:利用AI智能体实现物联网漏洞的自主利用
VEXAIoT: Autonomous IoT Vulnerability EXploitation using AI Agents
针对物联网(IoT)设备因硬件受限、固件过时等导致的安全漏洞,需要可扩展的自适应安全测试方法。本文提出VEXAIoT,一个基于大语言模型(LLM)推理与攻击工具的多智能体自主框架,用于物联网环境中的漏洞发现与利用。该框架结合漏洞检测与攻击执行智能体,在IoTGoat和Metasploitable环境中对10个OWASP IoT漏洞场景进行评估。实验结果显示,其在260次攻击执行中总体成功率高达95.0%,平均执行时间低于两分钟,证明了LLM驱动智能体在受控环境中自动化物联网安全评估的潜力。
| 🔗# 17 | 95% |
编码智能体时代下适用于ARC-AGI-3的可执行世界模型
Executable World Models for ARC-AGI-3 in the Era of Coding Agents
本文评估了一个用于ARC-AGI-3的初始编码智能体系统。该智能体维护一个可执行的Python世界模型,根据过往观察验证模型,并朝着更简单的抽象进行重构(作为类似MDL简约偏好的实用代理),最后在行动前通过模型进行规划。系统设计直接,未使用任何游戏特定逻辑。在25个公开游戏上的测试显示,智能体完全解决了7个游戏,在6个游戏上相对人类动作效率超过75%,平均RHAE为32.58%。结果初步证明,验证器驱动的可执行世界模型是ARC-AGI-3智能体的一种有前景的方法。
| 📈# 18 | 95% |
SWE-Marathon:智能体能自主完成超长时程的软件工作吗?
SWE-Marathon: Can Agents Autonomously Complete Ultra-Long-Horizon Software Work?
当前智能体基准主要评估短时任务,难以衡量其在规划、长上下文理解和记忆使用等方面的能力。本文引入SWE-Marathon基准,包含20个横跨软件工程及相关技术领域的长时程任务。每个任务配有唯一可执行环境、人工编写的参考解决方案和多层验证套件。记录到的智能体尝试平均消耗2720万总token,远超现有基准。当前前沿编码智能体任务解决率低于30%,失败常源于自我验证不足、自我报告不可行及过早终止。此外,13.8%的尝试中观察到奖励黑客行为。该基准包含对抗性测试套件审查和多层检查,旨在防止捷径解决方案。
| 🛠️# 19 | 90% |
HELP:基于轨迹分割的人效优化大规模机器人后训练
HELP: Human-Efficient Large-Scale Robot Post-Training with Rollout Segmentation
为高效迭代优化视觉语言动作(VLA)模型在下游任务中的策略,本研究提出HELP人效优化后训练框架。该框架通过远程操作员与现场操作员的角色专精,实现对12台机器人的并发监督,提升人效与策略行为覆盖。核心是引入VLAC自动轨迹分割评判器,将自主轨迹划分为有效、空闲、致错与恢复片段,从而高效利用混合质量数据。在四项真实世界操作任务中,HELP实现了80%-95%的成功率,任务吞吐量较基线提升1.7-4.2倍,在同等人工干预预算下,其性能增益进一步扩大。
| ✨# 20 | 90% |
从观察到洞见:机制性世界模型与自主科学发现之路
From Observation to Insight: Mechanistic World Models and the Quest for Autonomous Discovery
当前基于基础模型的AI在科学预测方面表现出色,但预测本身不等于科学发现。本文指出,科学发现本质上是知识组织问题,并提出了“机制性世界模型”这一新范式,将可复用的解释性机制置于表征、计算与学习的核心。研究从科学哲学出发,推导了实现发现所需的计算能力、设计原则与归纳压力,并形式化了机制中心世界模型的构成。文章认为,该范式为整合机制可解释性、因果表征学习、方程发现与模块化架构等方向提供了统一框架,是推动AI超越预测、迈向自主科学发现的蓝图。
数据来源:arXiv
由 智能助手@AIIA Lab 生成

夜雨聆风