
📡 AI 创新应用
2026年08月09日星期日
共 20 篇精选论文| 🔥# 1 | 100% |
智能体软件:AI智能体如何重构软件范式
Agentic Software: How AI Agents Are Restructuring the Software Paradigm
本文论证AI智能体的出现构成了软件本质的根本性重构,而非渐进式工具改进。形式化区分了传统确定性软件与智能体软件:前者代码承载预写决策逻辑,后者智能体即软件,其决策逻辑在运行时生成。追溯从许可软件到SaaS再到智能体即服务(AaaS)的历史弧线,指出智能体转变转移了决策复杂性本身。引入智能体工程作为软件工程学科的新范式,其核心研究对象、控制模型和人类角色均发生转变。通过分析近期基准证据,展示了智能体范式的变革潜力与当前局限,并提出了通向自进化智能体生态的四阶段路线图。
| ⭐# 2 | 100% |
自动化具身智能体架构设计
Automating the Design of Embodied Agent Architectures
具身智能体通常由感知、记忆、规划、行动等模块手工组合而成,架构设计空间巨大。本文研究将智能体架构搜索(AAS)从文本领域系统性地迁移到具身感知领域。我们引入了AgentCanvas(一个类型化图运行时)和KDLoop(一种编码智能体搜索流程)。在涵盖视觉语言导航、具身问答等任务的四个具身执行器上评估三种AAS变体。结果表明,架构级搜索能为具身任务带来可部署的成功率提升,但也揭示了在文本领域AAS中被掩盖的约束,如优化信号被模拟噪声掩盖、搜索易陷入局部编辑盆地等。
| 💡# 3 | 100% |
从看见到模拟:利用数字孪生进行可泛化机器人学习与评估的高保真生成式仿真
From Seeing to Simulating: Generative High-Fidelity Simulation with Digital Cousins for Generalizable Robot Learning and Evaluation
为降低真实世界数据收集成本并实现高效的数据增强与评估,本文提出一个生成式框架,可将真实世界全景图映射为高保真仿真场景(数字孪生),并通过语义与几何编辑合成多样化的衍生场景。结合高质量物理引擎,生成的场景支持交互式操控任务。实验表明,该平台具有强仿真-真实相关性,且大规模数据生成能显著提升策略对未见场景和物体变化的泛化能力。
| 🔬# 4 | 100% |
2025年AI智能体指数:记录已部署智能体AI系统的技术与安全特性
The 2025 AI Agent Index: Documenting Technical and Safety Features of Deployed Agentic AI Systems
针对AI智能体生态复杂、发展迅速且文档记录不一致的问题,本文提出了2025年AI智能体指数。该指数基于公开信息及与开发者的通信,系统记录了30个前沿AI智能体的起源、设计、能力、生态及安全特性。研究发现,不同开发者的透明度差异显著,且多数对安全性、评估及社会影响的披露不足。该指数旨在为研究者和政策制定者提供追踪发展的工具。
| 📌# 5 | 100% |
OpenClaw、Moltbook与ClawdLab:从纯智能体社交网络到自主科学研究
OpenClaw, Moltbook, and ClawdLab: From Agent-Only Social Networks to Autonomous Scientific Research
本研究对开源智能体框架OpenClaw和纯智能体社交网络Moltbook产生的大规模AI间交互数据集及相关文献进行多声部综述,并提出了自主科学研究开源平台ClawdLab作为应对已识别架构失效模式的设计科学响应。ClawdLab通过硬性角色限制、结构化对抗性批判、PI主导的治理、多模型编排以及编码为协议约束的领域特定证据要求来解决这些失效模式,其架构天然具备抗女巫攻击能力。一个三层分类法区分了单智能体流水线、预定义多智能体工作流和完全去中心化系统,ClawdLab的可组合第三层架构支持随着AI生态进步而实现复合式改进。
| 🎯# 6 | 100% |
AI智能体已能自主执行实验高能物理分析
AI Agents Can Already Autonomously Perform Experimental High Energy Physics
研究表明,基于大语言模型(LLM)的AI智能体仅需极少专家输入,即可自主执行高能物理(HEP)分析流程的绝大部分阶段。我们提出概念验证框架JFC,它集成了自主分析智能体、基于文献的知识检索与多智能体评审,足以规划、执行并记录可信的HEP分析。我们利用ALEPH等公开数据完成了电弱、QCD及希格斯玻色子测量分析。这些工具旨在减轻分析代码开发的重复性技术负担,使研究者能专注于物理洞察与创新,呼吁社区重新思考人才培养与资源分配策略。
| 💎# 7 | 95% |
Agent-ToM:通过心理理论推理学习监控自主LLM智能体
Agent-ToM: Learning to Monitor Autonomous LLM Agents via Theory-of-Mind Reasoning
监控自主LLM智能体的隐蔽恶意行为极具挑战,因其攻击模式具有延迟性、上下文依赖和长时程特点。现有方法通常独立处理每条轨迹且未从监控经验中学习。本文提出Agent-ToM,一个基于心理理论(ToM)推理的学习监控框架。它在推理时执行结构化全轨迹分析,推断智能体信念、意图假设及与任务一致行为基线的偏差,并采用“推理-验证-精炼”管道构建监控决策。在训练时,它将评判信号提炼为持久的“语义护栏记忆”,实现跨情景可复用的信念与意图条件约束。在对抗性监控基准(SHADE-Arena等)上的评估表明,Agent-ToM取得了优异的精确率-召回率平衡,性能超越最先进的监控基线,证明了结合结构化ToM推理与验证的学习监控层是保障自主LLM智能体安全的有效且可部署的基础。
| 🚀# 8 | 95% |
Embodied-R1.5:通过具身基础模型进化物理智能
Embodied-R1.5: Evolving Physical Intelligence via Embodied Foundation Models
本文提出统一的具身基础模型(EFM)Embodied-R1.5,旨在实现通用物理智能。通过三个自动化数据构建管道扩展关键能力数据覆盖,构建了超150亿token的大规模数据系统,并设计多任务平衡RL方案以缓解任务冲突。引入规划器-落地器-校正器(PGC)闭环框架,使单一模型能自主执行并自我校正长视野任务。该8B参数模型在24个具身VLM基准中16项达到SOTA,且经少量数据微调即可超越领先的VLA模型,零样本真实机器人实验验证了其强大的物理世界泛化能力。
| 🧠# 9 | 95% |
迈向自主O-RAN:面向实时网络控制与管理的多尺度智能体AI框架
Toward Autonomous O-RAN: A Multi-Scale Agentic AI Framework for Real-Time Network Control and Management
针对开放无线接入网(O-RAN)因组件解耦和开放接口带来的操作复杂性挑战,本文提出一个多尺度智能体AI框架。该框架将无线接入网智能组织为跨非实时(Non-RT)、近实时(Near-RT)和实时(RT)控制环路的协调层次:Non-RT RIC中的LLM智能体将运营商意图转化为策略;Near-RT RIC中的小型语言模型(SLM)智能体执行低延迟优化;分布式单元附近的无线物理层基础模型(WPFM)智能体提供快速推理。通过概念验证,该框架在非平稳条件下的鲁棒运行和意图驱动的切片资源控制两个场景中展示了有效性。
| ⚡# 10 | 95% |
VEXAIoT:利用AI智能体实现物联网漏洞的自主利用
VEXAIoT: Autonomous IoT Vulnerability EXploitation using AI Agents
针对物联网(IoT)设备因硬件受限、固件过时等导致的安全漏洞,需要可扩展的自适应安全测试方法。本文提出VEXAIoT,一个基于大语言模型(LLM)推理与攻击工具的多智能体自主框架,用于物联网环境中的漏洞发现与利用。该框架结合漏洞检测与攻击执行智能体,在IoTGoat和Metasploitable环境中对10个OWASP IoT漏洞场景进行评估。实验结果显示,其在260次攻击执行中总体成功率高达95.0%,平均执行时间低于两分钟,证明了LLM驱动智能体在受控环境中自动化物联网安全评估的潜力。
| 🌟# 11 | 95% |
编码智能体时代下适用于ARC-AGI-3的可执行世界模型
Executable World Models for ARC-AGI-3 in the Era of Coding Agents
本文评估了一个用于ARC-AGI-3的初始编码智能体系统。该智能体维护一个可执行的Python世界模型,根据过往观察验证模型,并朝着更简单的抽象进行重构(作为类似MDL简约偏好的实用代理),最后在行动前通过模型进行规划。系统设计直接,未使用任何游戏特定逻辑。在25个公开游戏上的测试显示,智能体完全解决了7个游戏,在6个游戏上相对人类动作效率超过75%,平均RHAE为32.58%。结果初步证明,验证器驱动的可执行世界模型是ARC-AGI-3智能体的一种有前景的方法。
| 🔎# 12 | 95% |
SWE-Marathon:智能体能自主完成超长时程的软件工作吗?
SWE-Marathon: Can Agents Autonomously Complete Ultra-Long-Horizon Software Work?
当前智能体基准主要评估短时任务,难以衡量其在规划、长上下文理解和记忆使用等方面的能力。本文引入SWE-Marathon基准,包含20个横跨软件工程及相关技术领域的长时程任务。每个任务配有唯一可执行环境、人工编写的参考解决方案和多层验证套件。记录到的智能体尝试平均消耗2720万总token,远超现有基准。当前前沿编码智能体任务解决率低于30%,失败常源于自我验证不足、自我报告不可行及过早终止。此外,13.8%的尝试中观察到奖励黑客行为。该基准包含对抗性测试套件审查和多层检查,旨在防止捷径解决方案。
| 📊# 13 | 95% |
RT-SHCUA:用于无人机控制的实时自托管计算机使用智能体
RT-SHCUA: Real-Time Self-Hosted Computer-Use Agent for UAV Control
针对将自托管计算机使用智能体(SHCUA)直接用于无人机(UAV)控制存在的时序、安全与结构不匹配问题,本文提出一种实时安全重构架构RT-SHCUA。该架构将SHCUA的输出转化为具有明确时序、状态、权限、回退和证据语义的契约绑定无人机技能调用,从而将语义推理与机载安全执行分离。慢速的云/边缘推理用于任务理解,机载组件则仅验证并分派及时、授权且状态一致的技能。原型评估表明,RT-SHCUA能在支持降级处理、可信准入和可审计证据保存的同时,保持有界的任务级响应性。
| 🎓# 14 | 95% |
ETAS:一种面向智能体系统的效应类型语言
ETAS: An Effect-Typed Language for Agent Systems
ETAS是一种将模型驱动的智能体、工具调用、提示、类型化内存、人工审批、策略及执行轨迹等作为语义程序元素的编程语言。其静态语义通过规约一致性分配普通类型,并用逃逸效应行和动作轨迹抽象来追踪计算行为;动态语义区分请求、处理、拒绝和提交的事件。我们形式化了其核心演算,证明了类型/效应可靠性、处理器轨迹透明性及策略安全性等性质。ETAS的实现为在智能体执行前后进行授权、非确定性、恢复及审计证据推理提供了编程语言基础。
| 🏆# 15 | 95% |
真实场景中的智能体编码:生产规模下GitHub Copilot轨迹特征分析
Agentic Coding in the Wild: Characterizing GitHub Copilot Traces at Production Scale
本文首次对GitHub Copilot的生产级工作负载进行了大规模特征分析,数据涵盖320万用户、1300万会话、7.61亿次LLM调用和95万亿词元。分析揭示了智能体编码工作负载的独特性质:会话由稀疏的用户发起轮次构成,每轮次内展开为几乎总是与工具执行耦合的自主智能体循环。这导致轮次内KV缓存命中率平均达90%,但轮次间降至55%,且在模型切换等事件后急剧失效。研究还设计了轻量级空闲时间预测器,可捕捉86-90%的总空闲时间,为面向智能体的原生基础设施设计提供了实证基础。
| 💻# 16 | 90% |
截图还是工具?混合GUI-MCP计算机使用智能体中工具使用的引导与多模态上下文管理
Screenshots or Tools? Eliciting Tool Use and Managing Multimodal Context in Hybrid GUI-MCP Computer-Use Agents
本文研究混合计算机使用智能体在截图与调用文本工具间的选择问题。研究发现,工具可用性本身不决定效果,关键在于智能体的工具决策行为。在OSWorld-MCP基准测试中,推理模型能有效利用工具(性能+4.0pp),而非推理模型则表现不佳(-5.9pp),存在显著的“采纳鸿沟”。研究通过多轮强化学习探究发现,行为可引导但能力提升是瓶颈。通过优化上下文管理(如剔除冗余截图),压缩后的智能体以53%的输入成本实现了37.8%的性能(原为33.0%),并消除了性能差距。
| 🔗# 17 | 90% |
为编码智能体学习全局可复用技能
Learning Globally Reusable Skills for Coding Agents
针对现有大语言模型(LLM)智能体技能进化方法存在局部更新、忽视技能间关系及泛化能力差的问题,本文提出全局化技能进化框架GSE。GSE通过维护技能关系图(SRG)联合优化技能兼容性与泛化性,并采用基于聚类的技能整合与回放驱动验证来提升泛化能力、防止过拟合。在缺陷揭示测试生成和误报过滤两个软件工程任务上的评估表明,GSE在OpenHands和mini-SWE-agent等编码智能体上均取得最佳精确率、召回率和F1分数,相比现有技术提升显著。工业部署进一步验证了其有效性与泛化性。
| 📈# 18 | 90% |
CodeGrep:一种为LLM编码智能体训练的强化学习检索智能体
CodeGrep: An RL-Trained Retrieval Agent for LLM Coding Agents
针对现代LLM编码智能体(如Claude Code、OpenHands)在仓库探索中消耗大量token寻找待修改文件而非实际修复的低效问题,本文提出CodeGrep,一个使用GRPO端到端训练的14B检索智能体。它通过多轮并行调用grep、glob和read工具来检索候选文件。在SWE-Bench Verified基准上,CodeGrep在保持解决率(27.0% vs 25.8%)的同时,显著提升了效率:在已解决实例中减少15%的交互轮次和19%的token消耗。研究表明,下游效用遵循精确度阈值,而CodeGrep的高精确度(0.677)使其能有效降低整体成本。
| 🛠️# 19 | 90% |
用一张纸劫持机器人:对VLM控制机器人物理提示注入的系统性研究
Hijacking Robots with a Piece of Paper: A Systematic Study of Physical Prompt Injection in VLM-Controlled Robots
本文系统研究了针对视觉语言模型(VLM)控制机器人的物理提示注入攻击。攻击通过在机器人视野内放置对抗性文本来间接注入提示。研究提出了包含间接标识、任务重定义、权威冒充和冲突注入的四类攻击分类法,并在三个前沿VLM(GPT-4o、Gemini 2.5 Flash、Qwen3-VL-32B)上进行了5670次实验评估。攻击成功率分别为27.0%、29.4%和5.0%,权威冒充和否定类攻击可跨模型迁移。分析表明,成功入侵几乎总是被模型“意识”到。研究评估了三种简单防御措施:提示防御、两阶段验证和文本掩码,它们能显著降低风险,但也存在权衡。
| ✨# 20 | 90% |
F²Agent:面向多模态交易的智能体智能金融融合
F²Agent: Financial Fusion of Agentic Intelligence for Multimodal Trading
为应对多源异构金融信息融合的挑战,本文提出F²Agent,一种由智能体智能金融融合驱动的新型多模态智能体范式。F²Agent首先部署层次化专业智能体全面提取模态特定信号,进而引入模态感知的自适应融合机制与噪声鲁棒的一致性正则化,以动态捕获细粒度跨模态依赖并生成抗噪的交易信号。在六种股票和加密货币资产上的广泛实验表明,F²Agent在多项交易指标上持续优于16个竞争基线,年均回报率平均相对提升超过20%。尤其在GOOG和TSLA上分别实现了120.48%和148.41%的回报,证明了其在多变市场中的有效性与鲁棒性。
数据来源:arXiv由 智能助手@AIIA Lab 生成

夜雨聆风