
📡 AI 创新应用
2026年08月02日星期日
共 20 篇精选论文| 🔥# 1 | 100% |
智能体软件:AI智能体如何重构软件范式
Agentic Software: How AI Agents Are Restructuring the Software Paradigm
本文论证AI智能体的出现构成了软件本质的根本性重构,而非渐进式工具改进。形式化区分了传统确定性软件与智能体软件:前者代码承载预写决策逻辑,后者智能体即软件,其决策逻辑在运行时生成。追溯从许可软件到SaaS再到智能体即服务(AaaS)的历史弧线,指出智能体转变转移了决策复杂性本身。引入智能体工程作为软件工程学科的新范式,其核心研究对象、控制模型和人类角色均发生转变。通过分析近期基准证据,展示了智能体范式的变革潜力与当前局限,并提出了通向自进化智能体生态的四阶段路线图。
| ⭐# 2 | 100% |
自动化具身智能体架构设计
Automating the Design of Embodied Agent Architectures
具身智能体通常由感知、记忆、规划、行动等模块手工组合而成,架构设计空间巨大。本文研究将智能体架构搜索(AAS)从文本领域系统性地迁移到具身感知领域。我们引入了AgentCanvas(一个类型化图运行时)和KDLoop(一种编码智能体搜索流程)。在涵盖视觉语言导航、具身问答等任务的四个具身执行器上评估三种AAS变体。结果表明,架构级搜索能为具身任务带来可部署的成功率提升,但也揭示了在文本领域AAS中被掩盖的约束,如优化信号被模拟噪声掩盖、搜索易陷入局部编辑盆地等。
| 💡# 3 | 100% |
从看见到模拟:利用数字孪生进行可泛化机器人学习与评估的高保真生成式仿真
From Seeing to Simulating: Generative High-Fidelity Simulation with Digital Cousins for Generalizable Robot Learning and Evaluation
为降低真实世界数据收集成本并实现高效的数据增强与评估,本文提出一个生成式框架,可将真实世界全景图映射为高保真仿真场景(数字孪生),并通过语义与几何编辑合成多样化的衍生场景。结合高质量物理引擎,生成的场景支持交互式操控任务。实验表明,该平台具有强仿真-真实相关性,且大规模数据生成能显著提升策略对未见场景和物体变化的泛化能力。
| 🔬# 4 | 100% |
2025年AI智能体指数:记录已部署智能体AI系统的技术与安全特性
The 2025 AI Agent Index: Documenting Technical and Safety Features of Deployed Agentic AI Systems
针对AI智能体生态复杂、发展迅速且文档记录不一致的问题,本文提出了2025年AI智能体指数。该指数基于公开信息及与开发者的通信,系统记录了30个前沿AI智能体的起源、设计、能力、生态及安全特性。研究发现,不同开发者的透明度差异显著,且多数对安全性、评估及社会影响的披露不足。该指数旨在为研究者和政策制定者提供追踪发展的工具。
| 📌# 5 | 100% |
OpenClaw、Moltbook与ClawdLab:从纯智能体社交网络到自主科学研究
OpenClaw, Moltbook, and ClawdLab: From Agent-Only Social Networks to Autonomous Scientific Research
本研究对开源智能体框架OpenClaw和纯智能体社交网络Moltbook产生的大规模AI间交互数据集及相关文献进行多声部综述,并提出了自主科学研究开源平台ClawdLab作为应对已识别架构失效模式的设计科学响应。ClawdLab通过硬性角色限制、结构化对抗性批判、PI主导的治理、多模型编排以及编码为协议约束的领域特定证据要求来解决这些失效模式,其架构天然具备抗女巫攻击能力。一个三层分类法区分了单智能体流水线、预定义多智能体工作流和完全去中心化系统,ClawdLab的可组合第三层架构支持随着AI生态进步而实现复合式改进。
| 🎯# 6 | 100% |
AI智能体已能自主执行实验高能物理分析
AI Agents Can Already Autonomously Perform Experimental High Energy Physics
研究表明,基于大语言模型(LLM)的AI智能体仅需极少专家输入,即可自主执行高能物理(HEP)分析流程的绝大部分阶段。我们提出概念验证框架JFC,它集成了自主分析智能体、基于文献的知识检索与多智能体评审,足以规划、执行并记录可信的HEP分析。我们利用ALEPH等公开数据完成了电弱、QCD及希格斯玻色子测量分析。这些工具旨在减轻分析代码开发的重复性技术负担,使研究者能专注于物理洞察与创新,呼吁社区重新思考人才培养与资源分配策略。
| 💎# 7 | 95% |
从问答到任务完成:智能体系统与驾驭设计综述
From Question Answering to Task Completion: A Survey on Agent System and Harness Design
本文通过模型-驾驭(model-harness)视角审视LLM智能体。首先澄清了智能体的功能定义及作为基础模型与执行驾驭耦合的实现视图。随后分析了模型中心扩展的局限,追溯了智能体工程的四种范式,并将执行驾驭解耦为观察、上下文、控制、动作、状态和验证六大运行时职责。基于此,本文将任务属性与领域压力映射到驾驭配置,回顾了基准与评估实践,并综合了关于运行时设计如何影响长视野任务完成度、效率及可靠性的模型-驾驭证据。最后指出了价值感知评估、安全性、驾驭泛化及模型-驾驭协同演化等开放挑战。
| 🚀# 8 | 95% |
Darwin移动智能体:一条自我演化的路线图
Darwin Mobile Agent: A Roadmap for Self-Evolution
本文以移动图形用户界面(GUI)作为“大世界”的实用代理,提出了Darwin移动智能体开源基础设施,旨在为该领域的自主强化学习奠定基础。该框架通过并行云手机实例的异步智能体-环境循环,解决了真实世界移动交互中的数据收集瓶颈。进一步提出了一条概念路线图,旨在从任务课程、结果验证和记忆管理这三个自我演化智能体的基本支柱中,系统性地移除人类先验。验证表明,Darwin基础设施为路线图第一阶段——GUI领域的策略优化——提供了所需的稳定性和可扩展性。
| 🧠# 9 | 95% |
AnchorVLA:为视觉-语言-动作规划桥接离散决策与连续轨迹
AnchorVLA: Bridging Discrete Decisions and Continuous Trajectories for Vision-Language-Action Planning
自动驾驶规划需将导航意图、交通规则、动态交互和语言指令转化为可执行的连续轨迹。现有视觉-语言-动作(VLA)规划器存在语义-动作对齐困难、离散化误差和推理效率低等问题。为此,我们提出AnchorVLA,一个分层决策锚定的VLA规划框架。它使用轨迹模式锚点作为高层VLA推理与连续轨迹执行间的显式接口:“决策即锚点表示”用锚点令牌编码整个局部运动模式;“锚定残差流”则在选定锚点定义的残差空间中生成细粒度连续轨迹。在Bench2Drive闭环基准测试中,AnchorVLA取得了最先进的成功率(77.28)和具有竞争力的驾驶分数(89.92)。
| ⚡# 10 | 95% |
AgentLTL:用于测量、强制执行和训练工具使用型LLM智能体过程合规性的轨迹验证框架
AgentLTL: A Trace-Verification Framework for Measuring, Enforcing, and Training Procedural Compliance in Tool-Using LLM Agents
工具使用型LLM智能体通常仅通过最终答案正确性或LLM评判来评估,均未捕获答案的产生过程。在安全关键场景中,过程本身即是正确性的一部分。本文引入AgentLTL,一种源自一阶线性时序逻辑(FO-LTL)的语言,用于表达对智能体轨迹的过程规则,并产生确定性的、无需评判的合规分数。该框架支持两种用途:1)利用:约束条件对完整轨迹评分,或在执行前在线检查前缀以控制工具调用;2)微调:该分数作为密集奖励。在涵盖排序、分支等任务的基准测试中,利用和微调均显著提升了模型的合规性。
| 🌟# 11 | 95% |
MARS:具备反思搜索能力的模块化智能体,用于自动化AI研究
MARS: Modular Agent with Reflective Search for Automated AI Research
自动化AI研究因其计算成本高昂(如模型训练)和性能归因不透明而区别于一般软件工程。现有基于LLM的智能体常生成忽略执行成本和因果关系的单一脚本。为此,我们提出了MARS(具备反思搜索能力的模块化智能体),一个为自主AI研究优化的框架。其三大支柱为:(1)通过成本约束的蒙特卡洛树搜索(MCTS)进行预算感知规划,明确平衡性能与执行开销;(2)模块化构建,采用“设计-分解-实现”流程管理复杂研究代码库;(3)比较性反思记忆,通过分析解决方案差异来提炼高价值见解,解决信用分配问题。MARS在可比设置下,于MLE-Bench上达到了开源框架中的最先进性能,并与全球排行榜的顶级方法保持竞争力。此外,系统展现出定性的“顿悟”时刻,63%的有效经验教训源于跨搜索路径的迁移,证明智能体能有效泛化见解。
| 🔎# 12 | 95% |
EvoMaster:面向规模化智能体科学的基础演化智能体框架
EvoMaster: A Foundational Evolving Agent Framework for Agentic Science at Scale
针对现有智能体框架静态、范围狭窄且缺乏试错学习能力的问题,本文提出了EvoMaster,一个为规模化智能体科学设计的基础演化框架。其核心是持续自我演化,使智能体能迭代优化假设、自我批判并在实验周期中积累知识,模拟人类科学探究。该框架领域无关且易于扩展,仅需约100行代码即可构建自演化科学智能体。基于EvoMaster孵化的SciMaster生态系统在多个领域基准测试中取得了最先进的性能,全面超越了通用基线,验证了其作为下一代自主科学发现基础框架的有效性和通用性。
| 📊# 13 | 95% |
Agent-ToM:通过心理理论推理学习监控自主LLM智能体
Agent-ToM: Learning to Monitor Autonomous LLM Agents via Theory-of-Mind Reasoning
监控自主LLM智能体的隐蔽恶意行为极具挑战,因其攻击模式具有延迟性、上下文依赖和长时程特点。现有方法通常独立处理每条轨迹且未从监控经验中学习。本文提出Agent-ToM,一个基于心理理论(ToM)推理的学习监控框架。它在推理时执行结构化全轨迹分析,推断智能体信念、意图假设及与任务一致行为基线的偏差,并采用“推理-验证-精炼”管道构建监控决策。在训练时,它将评判信号提炼为持久的“语义护栏记忆”,实现跨情景可复用的信念与意图条件约束。在对抗性监控基准(SHADE-Arena等)上的评估表明,Agent-ToM取得了优异的精确率-召回率平衡,性能超越最先进的监控基线,证明了结合结构化ToM推理与验证的学习监控层是保障自主LLM智能体安全的有效且可部署的基础。
| 🎓# 14 | 95% |
Embodied-R1.5:通过具身基础模型进化物理智能
Embodied-R1.5: Evolving Physical Intelligence via Embodied Foundation Models
本文提出统一的具身基础模型(EFM)Embodied-R1.5,旨在实现通用物理智能。通过三个自动化数据构建管道扩展关键能力数据覆盖,构建了超150亿token的大规模数据系统,并设计多任务平衡RL方案以缓解任务冲突。引入规划器-落地器-校正器(PGC)闭环框架,使单一模型能自主执行并自我校正长视野任务。该8B参数模型在24个具身VLM基准中16项达到SOTA,且经少量数据微调即可超越领先的VLA模型,零样本真实机器人实验验证了其强大的物理世界泛化能力。
| 🏆# 15 | 95% |
迈向自主O-RAN:面向实时网络控制与管理的多尺度智能体AI框架
Toward Autonomous O-RAN: A Multi-Scale Agentic AI Framework for Real-Time Network Control and Management
针对开放无线接入网(O-RAN)因组件解耦和开放接口带来的操作复杂性挑战,本文提出一个多尺度智能体AI框架。该框架将无线接入网智能组织为跨非实时(Non-RT)、近实时(Near-RT)和实时(RT)控制环路的协调层次:Non-RT RIC中的LLM智能体将运营商意图转化为策略;Near-RT RIC中的小型语言模型(SLM)智能体执行低延迟优化;分布式单元附近的无线物理层基础模型(WPFM)智能体提供快速推理。通过概念验证,该框架在非平稳条件下的鲁棒运行和意图驱动的切片资源控制两个场景中展示了有效性。
| 💻# 16 | 95% |
VEXAIoT:利用AI智能体实现物联网漏洞的自主利用
VEXAIoT: Autonomous IoT Vulnerability EXploitation using AI Agents
针对物联网(IoT)设备因硬件受限、固件过时等导致的安全漏洞,需要可扩展的自适应安全测试方法。本文提出VEXAIoT,一个基于大语言模型(LLM)推理与攻击工具的多智能体自主框架,用于物联网环境中的漏洞发现与利用。该框架结合漏洞检测与攻击执行智能体,在IoTGoat和Metasploitable环境中对10个OWASP IoT漏洞场景进行评估。实验结果显示,其在260次攻击执行中总体成功率高达95.0%,平均执行时间低于两分钟,证明了LLM驱动智能体在受控环境中自动化物联网安全评估的潜力。
| 🔗# 17 | 95% |
编码智能体时代下适用于ARC-AGI-3的可执行世界模型
Executable World Models for ARC-AGI-3 in the Era of Coding Agents
本文评估了一个用于ARC-AGI-3的初始编码智能体系统。该智能体维护一个可执行的Python世界模型,根据过往观察验证模型,并朝着更简单的抽象进行重构(作为类似MDL简约偏好的实用代理),最后在行动前通过模型进行规划。系统设计直接,未使用任何游戏特定逻辑。在25个公开游戏上的测试显示,智能体完全解决了7个游戏,在6个游戏上相对人类动作效率超过75%,平均RHAE为32.58%。结果初步证明,验证器驱动的可执行世界模型是ARC-AGI-3智能体的一种有前景的方法。
| 📈# 18 | 95% |
SWE-Marathon:智能体能自主完成超长时程的软件工作吗?
SWE-Marathon: Can Agents Autonomously Complete Ultra-Long-Horizon Software Work?
当前智能体基准主要评估短时任务,难以衡量其在规划、长上下文理解和记忆使用等方面的能力。本文引入SWE-Marathon基准,包含20个横跨软件工程及相关技术领域的长时程任务。每个任务配有唯一可执行环境、人工编写的参考解决方案和多层验证套件。记录到的智能体尝试平均消耗2720万总token,远超现有基准。当前前沿编码智能体任务解决率低于30%,失败常源于自我验证不足、自我报告不可行及过早终止。此外,13.8%的尝试中观察到奖励黑客行为。该基准包含对抗性测试套件审查和多层检查,旨在防止捷径解决方案。
| 🛠️# 19 | 95% |
RT-SHCUA:用于无人机控制的实时自托管计算机使用智能体
RT-SHCUA: Real-Time Self-Hosted Computer-Use Agent for UAV Control
针对将自托管计算机使用智能体(SHCUA)直接用于无人机(UAV)控制存在的时序、安全与结构不匹配问题,本文提出一种实时安全重构架构RT-SHCUA。该架构将SHCUA的输出转化为具有明确时序、状态、权限、回退和证据语义的契约绑定无人机技能调用,从而将语义推理与机载安全执行分离。慢速的云/边缘推理用于任务理解,机载组件则仅验证并分派及时、授权且状态一致的技能。原型评估表明,RT-SHCUA能在支持降级处理、可信准入和可审计证据保存的同时,保持有界的任务级响应性。
| ✨# 20 | 95% |
ETAS:一种面向智能体系统的效应类型语言
ETAS: An Effect-Typed Language for Agent Systems
ETAS是一种将模型驱动的智能体、工具调用、提示、类型化内存、人工审批、策略及执行轨迹等作为语义程序元素的编程语言。其静态语义通过规约一致性分配普通类型,并用逃逸效应行和动作轨迹抽象来追踪计算行为;动态语义区分请求、处理、拒绝和提交的事件。我们形式化了其核心演算,证明了类型/效应可靠性、处理器轨迹透明性及策略安全性等性质。ETAS的实现为在智能体执行前后进行授权、非确定性、恢复及审计证据推理提供了编程语言基础。
数据来源:arXiv
由 智能助手@AIIA Lab 生成

夜雨聆风