乐于分享
好东西不私藏

AI应用论文|揭秘智能体技能:为何有效以及何时失效 (1/20篇) · 8月20日

AI应用论文|揭秘智能体技能:为何有效以及何时失效 (1/20篇) · 8月20日

📡 AI 创新应用

2026年08月20日星期四

共 20 篇精选论文

80%🔥# 1

揭秘智能体技能:为何有效——以及何时失效

Demystifying Agent Skills: Why They Work-Until They Don't

🤗 138

本文旨在探究LLM智能体技能在推理时有效与失效的根本原因。通过跨基准、智能体框架和LLM的受控实验,结合对比研究与轨迹分析,揭示了技能主要通过提供稳定的过程锚点(占65.7%)来提升性能,而非注入显式知识。研究发现,检索是独立瓶颈,随着技能池扩大,实际使用精度急剧下降。技能在假设脆弱、上下文不兼容或适应性不足时会失效。这些发现超越了聚合成功率评估,为构建可靠的自进化智能体提供了指导。

65%# 2

ASI-Bench:迈向人工超级智能的黎明

ASI-Bench: At the Dawn of Artificial Superintelligence

🤗 52

为评估AI系统超越掌握现有知识、进行创新探索和自主科学执行的能力,本文提出了首个跨领域联合评估基准ASI-Bench。该基准包含11个科学领域的60个项目级研究任务,并逐步撤除人类方法指导以测试AI的自主性。评估发现,当前最先进的智能体-模型配置在完全自主(需自行决定方法)时平均得分仅为26.62,远低于有完整指导时的50.91,表明现有系统仍严重依赖人类指导,距离自主开展端到端项目级科研尚远。

90%💡# 3

Agent Lightning v1.0:迈向受控智能体强化学习

Agent Lightning v1.0: Towards Harnessed Agentic RL

🤗 16

本文提出了Agent Lightning v1.0,一个用于“受控智能体强化学习”的轻量级框架。该范式下,部署时的智能体控制框架直接参与模型后训练,带来了重标记化、样本合并、优势计算等新挑战。该框架支持任意智能体控制框架,并作为研究这些挑战的实用测试平台。在编码智能体上的实验表明,仅使用6K训练样本,RL将Qwen3.5-9B在SWE-bench Verified上的性能从41.8%提升至56.4%。

100%🔬# 4

面向自主量子传感实验科学推理的智能体AI

Agentic AI for Scientific Reasoning in Autonomous Quantum Sensing Experiments

本研究针对金刚石氮空位(NV)中心自主实验,构建了一个基于大语言模型(LLM)智能体的工作流。核心贡献有二:一是实现了集持久项目记录、定量计算与数据分析、确定性实验控制于一体的自主NV实验流程,智能体可完成从选择NV中心到执行复杂脉冲序列(如CPMG)的全过程;二是提出了两个离线基准,用于独立评估智能体的科学推理能力。测试发现,在自主实验中,智能体负责形成科学假设并利用定量工具评估数据,而确定性代码则控制硬件并确保安全,这明确了人机协作的清晰分工。

100%📌# 5

面向IPoDWDM网络生命周期自动化的智能体AI:一种基于MCP的架构

Agentic AI for IPoDWDM Network Lifecycle Automation: An MCP-Enabled Architecture

本文提出一种分布式、与供应商无关的多MCP架构,用于实现基于SDN的多供应商、多层IPoDWDM网络的自动化与自主控制。该框架支持端到端服务生命周期自动化,并利用GNPy模型和光遥测技术实现闭环跨层控制。该架构已在IPoDWDM测试平台上得到实验验证。

90%🎯# 6

StartupBench:基于市场验证的端到端工作流评估通用智能体

StartupBench: Benchmarking General-Purpose Agents on Market-Validated End-to-End Workflows

🤗 8

本文提出了StartupBench,一个基于市场验证的AI初创产品工作流构建的端到端智能体基准。该基准通过系统研究具有实际采用率的AI产品及其工作流,定义了真实世界用户需求的任务,并将其转化为完整的交付导向型任务进行评估。在统一智能体框架下,即使最强模型也仅能成功完成约30%的任务。分析表明,复杂指令遵循和领域专业知识是主要失败原因,揭示了当前通用智能体对许多市场验证工作流的可靠完成能力仍不足。

90%💎# 7

智能体捕捉智能体:临床多智能体系统中的捷径级联与基准博弈

Agents Catching Agents: Shortcut Cascades and Benchmark Gaming in Clinical Multi-Agent Systems

🤗 5

本研究探讨了临床决策支持中语言模型智能体委员会是否会被基准奖励但临床医生会忽略的“捷径”线索所博弈。跨六个公共数据集的实验发现,Gemini委员会能抵抗孤立线索,但社会性合理的捷径(如同伴一致错误答案)会导致测试智能体在38%的情况下采纳。在三种监督智能体中,仅独立于自我报告的“裁判”能有效捕捉这种博弈行为。研究表明,博弈委员会的关键是社会合理性,而非视觉显著性。

95%🚀# 8

AQuA:递归自我改进的量化交易研究智能体

AQuA: Recursively Self-Improving Quantitative Trading Research Agents

本文研究量化投资研究层面的递归自我改进,即自主系统能否利用早期实验证据改进后续迭代中的假设与候选方案。我们提出AQuA,包含两个独立的语言模型驱动研究系统:一个用于符号化因子发现,另一个用于可训练模型开发。两者在封闭沙箱中各自闭环,利用已验证证据指导后续提案。因子系统在加密货币宇宙上实现了约0.190的综合信息系数;模型系统在美股上实现了单股+0.0843的信息系数,并转化为夏普比率高达+2.50的阈值多空策略,且在2021至2025年间每年均取得正收益。

95%🧠# 9

边推理边推测:通过联合智能体-推测器强化学习训练智能体预测其下一个工具调用

Speculate While You Reason: Teaching Agents to Predict Their Next Tool Call via Joint Agent-Speculator RL

针对大语言模型(LLM)智能体在等待工具调用结果时存在延迟的问题,本文提出了一种自推测智能体。该方法将智能体与推测器统一于单一模型,使其既能以智能体模式执行任务,又能以推测器模式根据部分轨迹预测下一个工具调用。为实现此双重模式且不降低性能,我们提出了联合智能体-推测器强化学习方法,从智能体自身轨迹中生成推测目标并交替更新。在搜索问答和对话式工具使用任务上,该方法显著提升了Qwen3系列模型的下一个工具调用预测准确率(Hit@1),同时保持了任务成功率。

95%# 10

智能体人工智能互联网:大规模通信、协调与集体智能

The Internet of Agentic AI: Communication, Coordination, and Collective Intelligence at Scale

自主AI智能体的涌现正将人工智能从孤立模型推理转变为分布式推理、通信与行动系统。本文提出了“智能体人工智能互联网”(IoAI)的愿景:一个异构智能体能够相互发现、协商职责、交换上下文、调用工具并在云、边、端及组织间执行工作流的开放生态系统。我们综合了单智能体AI、多智能体系统、分布式计算等领域的理论基础,分析了可扩展智能体生态系统所需的架构与机制,重点探讨了部署模型、工作流生命周期、通信协议、互操作性、资源管理和信任架构,并以自适应制造等案例说明了其核心研究挑战。

95%🌟# 11

面向关键系统的可信赖智能体AI工程化

Engineering Trustworthy Agentic AI for Critical Systems

本研究将可信赖性作为智能体人工智能(AI)的一等工程属性进行系统综述,弥补了现有文献仅关注任务能力的不足。研究围绕安全、鲁棒、透明、可审计及隐私安全五个维度,构建了贯穿感知到审计的智能体保障工作流,并系统梳理了架构、威胁、机制与度量。通过分析四个工程领域的案例,研究论证了智能体AI可信赖性是一个跨领域的共性问题,并提出了构建可复用保障框架的路径。

95%🔎# 12

多步骤工具增强智能体中的绑定漂移问题

Binding Drift in Multi-Step Tool-Augmented Agents

本研究探讨了工具增强语言模型智能体在多步骤工作流中实体绑定的稳定性问题。研究区分了“绑定漂移”(初始正确后续出错)与“错误传播”(初始错误持续传递),并通过受控实验发现:直觉的“锁定首次绑定”策略会将错误操作放大3倍;而一个基于LLM的廉价重验证器可将错误减少79%,性能接近理论上限。研究表明,消除漂移与抑制传播的防御机制不可互换。

95%📊# 13

超越排行榜:大语言模型智能体在工具使用、规划与推理中的失败模式综述

Beyond the Leaderboard: A Synthesis of Tool-Use, Planning, and Reasoning Failures in Large Language Model Agents

本文综合了2023-2026年间27篇关于大语言模型(LLM)智能体评估的文献,首次构建了一个涵盖工具使用、规划、长程推理、多智能体协作、安全及测量有效性等维度的统一失败模式分类体系。研究识别出六大失败集群:工具调用与参数级错误、规划与约束满足失败、长程任务中的上下文累积退化、多智能体协作失败、对抗或未明确定义条件下的安全失败,以及测量有效性问题。研究发现,失败率随任务长度非线性增长,子任务强性能未必转化为端到端成功,且额外框架支持并不总能提升可靠性。

95%🎓# 14

KAT-Coder-V2.5技术报告

KAT-Coder-V2.5 Technical Report

本文介绍了KAT-Coder-V2.5,这是一个专注于在真实可执行代码仓库内自主行动的智能体模型,而非单轮代码生成器。其能力瓶颈主要在于可复现环境、可验证奖励和高价值轨迹的稀缺。为此,我们提出了端到端的智能体后训练框架:AutoBuilder大规模重构多语言仓库为沙盒环境并进行验证,从中再生任务规范并恢复近成功轨迹;KwaiClawEnv则从可执行服务和真实任务种子合成大规模工具使用轨迹。通过强化学习扩展、多教师策略蒸馏等技术,该模型在PinchBench上取得了最佳工具使用结果,在仓库级软件工程任务上仅次于前沿模型Opus 4.8。

95%🏆# 15

面向代码智能体的贝叶斯控制

Bayesian control for coding agents

现代代码智能体将LLM生成器与多种工具(如廉价诊断器和昂贵验证器)结合,但其工具调用决策通常由忽略不确定性的固定规则编排器控制。本研究将编排问题建模为成本敏感的序贯假设检验:一个贝叶斯控制器维护对候选代码正确性的信念,并动态决定是收集更多证据、优化候选方案、验证还是停止。在六个生成器和九个编码基准上的实验表明,当验证成本高昂且诊断工具信息丰富但不完美时,贝叶斯控制最具价值。此外,其信念状态可产生可解释的正确性分数,在不确定性量化方面优于基于令牌概率和原始工具成功率的基线方法。

95%💻# 16

FASE:面向代码质量的快速自适应语义熵

FASE: Fast Adaptive Semantic Entropy for Code Quality

多智能体代码生成因LLM幻觉和错误传播而影响系统可靠性。语义熵提供了一种无需真实答案即可量化不确定性的原则性方法,但现有方法依赖昂贵的LLM驱动等价性检查。本文提出快速自适应语义熵(FASE),一种基于结构和语义差异图最小生成树来近似功能正确性的新度量。在HumanEval和BigCodeBench上的评估表明,FASE优于基于LLM蕴含的最先进语义熵方法,在使用Qwen3-Embedding-8B模型时,其斯皮尔曼相关系数平均提升25%,ROCAUC分数相对Pass@1提升19%。此外,FASE消除了昂贵的LLM等价性评估,仅需传统方法约0.3%的运行时间成本,为实际多智能体工作流中的不确定性量化提供了实用、经济的解决方案。

95%🔗# 17

MAVEN:提升智能体工具调用的泛化能力

MAVEN: Improving Generalization in Agentic Tool Calling

智能体工具调用环境的泛化能力是可靠智能推理系统的核心挑战。本文提出MAVEN,一个轻量级符号推理框架,支持结构化分解、自适应工具编排与中间验证。在多个工具调用基准及新提出的压力测试基准MAVEN-Bench上评估,MAVEN将其基础模型GPT-OSS-120b的准确率从48%提升至71%,且无需额外训练。结果表明,这种以验证为中心的轻量级框架能增强组合推理能力,其性能与前沿闭源基线相当,而成本估计仅为约十分之一。

95%📈# 18

深度研究智能体:一个支持零成本监控的7x24小时自主深度学习实验框架

Deep Researcher Agent: An Autonomous Framework for 24/7 Deep Learning Experimentation with Zero-Cost Monitoring

本文提出开源框架Deep Researcher Agent,使LLM智能体能自主进行全天候深度学习实验。其核心创新包括:零成本监控范式、两级恒定大小内存架构以及最小工具集的主从多智能体设计。在持续30多天的部署中,该框架自主完成了500多个实验周期,在单个项目中通过200多次自动化实验将基线指标提升了52%,且日均LLM成本仅为0.08美元。

95%🛠️# 19

迈向有根基的自主研究:在已发表计算物理文献上的端到端 LLM 微型研究循环

Towards grounded autonomous research: an end-to-end LLM mini research loop on published computational physics

本文聚焦于物理科学研究的最小单元——微型研究循环,即智能体阅读论文、复现、批判并扩展它。我们在规模和深度两个层面测试该循环:在规模上,智能体对 111 篇开放获取计算物理论文自主运行“阅读-规划-计算-比较”循环,无需被要求批判即在约 42% 的论文中提出了实质性质疑;在深度上,针对一篇关于二维材料 MOSFET 多尺度模拟的《自然·通讯》论文,智能体自主运行了原文缺失的新计算,并生成了可发表的评论,修正了原文的核心结论。

95%# 20

VEXAIoT:利用AI智能体实现物联网漏洞的自主利用

VEXAIoT: Autonomous IoT Vulnerability EXploitation using AI Agents

针对物联网(IoT)设备因硬件受限、固件过时等导致的安全漏洞,需要可扩展的自适应安全测试方法。本文提出VEXAIoT,一个基于大语言模型(LLM)推理与攻击工具的多智能体自主框架,用于物联网环境中的漏洞发现与利用。该框架结合漏洞检测与攻击执行智能体,在IoTGoat和Metasploitable环境中对10个OWASP IoT漏洞场景进行评估。实验结果显示,其在260次攻击执行中总体成功率高达95.0%,平均执行时间低于两分钟,证明了LLM驱动智能体在受控环境中自动化物联网安全评估的潜力。

数据来源:arXiv
由 智能助手@AIIA Lab 生成