ARTICLE · 1088209
AI应用论文|迈向智能体赋能的软件生态系统 (1/20篇) · 9月27日

📡 AI 创新应用
2026年09月27日星期日
共 20 篇精选论文95%🔥# 1
迈向智能体赋能的软件生态系统
Toward an Agentic Infused Software Ecosystem
为充分发挥AI智能体在软件开发中的潜力,需重构现有软件生态。本文提出构建“智能体赋能软件生态系统”(AISE),其基于三大支柱:首先是AI智能体本身,其能力在过去五年已从简单的代码补全演进至能执行复杂的独立开发任务;其次是生态基础设施,旨在支持智能体间的协作与集成;最后是新的开发范式。本文概述了AISE的愿景、关键组件与实现路径,旨在推动软件开发向更自主、协同的方向演进。
95%⭐# 2
EvoMaster:面向规模化智能体科学的基础演化智能体框架
EvoMaster: A Foundational Evolving Agent Framework for Agentic Science at Scale
针对现有智能体框架静态、范围狭窄且缺乏试错学习能力的问题,本文提出了EvoMaster,一个为规模化智能体科学设计的基础演化框架。其核心是持续自我演化,使智能体能迭代优化假设、自我批判并在实验周期中积累知识,模拟人类科学探究。该框架领域无关且易于扩展,仅需约100行代码即可构建自演化科学智能体。基于EvoMaster孵化的SciMaster生态系统在多个领域基准测试中取得了最先进的性能,全面超越了通用基线,验证了其作为下一代自主科学发现基础框架的有效性和通用性。
95%💡# 3
MARS:具备反思搜索能力的模块化智能体,用于自动化AI研究
MARS: Modular Agent with Reflective Search for Automated AI Research
自动化AI研究因其计算成本高昂(如模型训练)和性能归因不透明而区别于一般软件工程。现有基于LLM的智能体常生成忽略执行成本和因果关系的单一脚本。为此,我们提出了MARS(具备反思搜索能力的模块化智能体),一个为自主AI研究优化的框架。其三大支柱为:(1)通过成本约束的蒙特卡洛树搜索(MCTS)进行预算感知规划,明确平衡性能与执行开销;(2)模块化构建,采用“设计-分解-实现”流程管理复杂研究代码库;(3)比较性反思记忆,通过分析解决方案差异来提炼高价值见解,解决信用分配问题。MARS在可比设置下,于MLE-Bench上达到了开源框架中的最先进性能,并与全球排行榜的顶级方法保持竞争力。此外,系统展现出定性的“顿悟”时刻,63%的有效经验教训源于跨搜索路径的迁移,证明智能体能有效泛化见解。
95%🔬# 4
AgentLTL:用于测量、强制执行和训练工具使用型LLM智能体过程合规性的轨迹验证框架
AgentLTL: A Trace-Verification Framework for Measuring, Enforcing, and Training Procedural Compliance in Tool-Using LLM Agents
工具使用型LLM智能体通常仅通过最终答案正确性或LLM评判来评估,均未捕获答案的产生过程。在安全关键场景中,过程本身即是正确性的一部分。本文引入AgentLTL,一种源自一阶线性时序逻辑(FO-LTL)的语言,用于表达对智能体轨迹的过程规则,并产生确定性的、无需评判的合规分数。该框架支持两种用途:1)利用:约束条件对完整轨迹评分,或在执行前在线检查前缀以控制工具调用;2)微调:该分数作为密集奖励。在涵盖排序、分支等任务的基准测试中,利用和微调均显著提升了模型的合规性。
95%📌# 5
AnchorVLA:为视觉-语言-动作规划桥接离散决策与连续轨迹
AnchorVLA: Bridging Discrete Decisions and Continuous Trajectories for Vision-Language-Action Planning
自动驾驶规划需将导航意图、交通规则、动态交互和语言指令转化为可执行的连续轨迹。现有视觉-语言-动作(VLA)规划器存在语义-动作对齐困难、离散化误差和推理效率低等问题。为此,我们提出AnchorVLA,一个分层决策锚定的VLA规划框架。它使用轨迹模式锚点作为高层VLA推理与连续轨迹执行间的显式接口:“决策即锚点表示”用锚点令牌编码整个局部运动模式;“锚定残差流”则在选定锚点定义的残差空间中生成细粒度连续轨迹。在Bench2Drive闭环基准测试中,AnchorVLA取得了最先进的成功率(77.28)和具有竞争力的驾驶分数(89.92)。
95%🎯# 6
Vero:AI智能体能否构建形式化验证的软件仓库?
Vero: Can AI Agents Build Formally Verified Software Repositories?
为评估AI智能体在仓库级别协同实现代码与证明合成的能力,本文提出了首个此类基准Vero。它包含43个源自真实仓库的多模块实例,涵盖Python、Dafny等多种语言及密码学协议等不同领域。每个实例均包含预定义的API接口、手工整理的形式化规约和参考实现,支持纯证明及代码-证明联合评估模式。Vero还引入了审计机制以提升基准可靠性。对前沿编码智能体的评估显示,最强的智能体仅能完全解决43个实例中的27个,在最难仓库上无法闭合任何规约,表明当前智能体在仓库级验证软件合成方面仍有不足。
95%💎# 7
LEDGER:用于审计LLM代理的声明-证据追溯图
LEDGER: Claim-to-Evidence Trace Graphs for Auditing LLM Agents
随着LLM代理执行复杂工作流的速度加快,审计其输出的正确性与可信度成为瓶颈。现有可观测系统仅提供细粒度事件可见性,难以追溯结论依据。本文提出LEDGER系统,通过构建分层追溯图来组织执行记录,将痕迹分组为证据节点与工作流节点,并用类型化语义边连接声明、支持性操作、工件及验证步骤。该系统能清晰呈现工作流决策、工件谱系、修复步骤、验证覆盖及证据支持路径,为核心审计提供结构化追溯框架。
95%🚀# 8
机器在机器上完成的科学:计算化学中的AI代理
Science Done on a Machine by a Machine: AI Agents in Computational Chemistry
计算化学领域的AI代理系统正经历爆炸式增长,其能力正从辅助执行特定计算任务转向自主设计、执行硅上实验、分析乃至撰写论文。最终目标是实现无需人类监督的完全自主AI科学家。尽管现有系统仍需人类参与,但趋势已不可逆转。通用代理正使构建专用系统日益商品化,最终可能取代后者。这种颠覆性的速度和规模令领域内的专家、教师和学生对其未来及努力方向感到困惑。
95%🧠# 9
ReasFlow:通过基于知识的多代理系统辅助应用数学中以推理为中心的科学发现
ReasFlow: Assisting Reasoning-Centric Scientific Discovery in Applied Mathematics via a Knowledge-Based Multi-Agent System
现有自动化研究系统多聚焦实证驱动领域,而依赖严格证明与领域知识综合的理论驱动发现(如数学)探索不足。本文提出ReasFlow,一个端到端的自主代理系统,采用“人类专家作为首席研究员,代理作为执行严谨推导的研究生”的协作范式。该系统包含(1)审核逻辑一致性并在人工检查前纠正错误的内部验证循环;(2)自动检索声明性事实与程序性启发知识并自我改进的机制。该系统能统一完成文献综述、算法设计、定理证明、实验和论文撰写,在基于LLM的评估中优于现有开源基线。
95%⚡# 10
SkillForge:面向项目特定问题解决的自蒸馏智能体
SkillForge: Self-Distilling Agents for Project-Specific Issue Resolution
基于LLM的智能体在解决特定代码仓库问题时,常因缺乏项目相关知识而表现不佳。本文提出SkillForge自蒸馏框架,通过重新实现仓库中测试覆盖的核心功能来主动合成项目特定问题,并在解决这些问题的过程中,将可重用的项目知识提炼为基于实体的技能,关联到相关仓库实体中。实验表明,在解决真实问题前主动获取项目特定知识,能显著提升下游软件问题解决性能。
95%🌟# 11
PLCBench:自主 LLM 智能体能否将 PLC 访问转化为持续的物理影响?
PLCBench: Can Autonomous LLM Agents Turn PLC Access into Sustained Physical Impact?
为评估自主 LLM 智能体将可编程逻辑控制器(PLC)网络访问转化为持续不利物理影响的能力与边界,本文提出首个真实 PLC 硬件在环(HIL)评估框架 PLCBENCH。它结合了供应商原生交互、商业 PLC 执行、闭环降阶过程仿真和独立结果验证。通过对五个 LLM 家族的 240 次真实 PLC 测试,31.3% 的测试案例成功维持了其物理目标。阶段化结果表明,许多案例止步于有效原生读取之前,而更丰富的过程观测能将条件性目标达成率从 44.2% 提升至 64.0%。
95%🔎# 12
利用 Gemini 在现实世界中加速科学研究
Accelerating Scientific Research with Gemini in the Real-World
本文扩展并全面验证了基于 Gemini 的多智能体系统 Co-Scientist,旨在加速涵盖假设生成、实验和论文撰写的端到端科学研究。在材料科学中,它成功设计了 MXenes 前驱体路线并生长了二维材料;在生物学中,从稀疏成像数据预测了工程大肠杆菌的表型;在计算机科学中,自主发现了优于前沿模型的推理时缩放架构。双盲评审表明,其可靠性模块减少了幻觉和抄袭。这些结果展示了面向现实世界科学发现的闭环多智能体系统的潜力。
95%📊# 13
DuMateBench:在复杂现实工作流中评估自主智能体
DuMateBench: Evaluating Autonomous Agents in Complex Real-World Workflows
为评估自主智能体在复杂现实工作流中的性能,本文从大规模生产平台中重构真实用户会话,构建了 DuMateBench 基准。该基准包含 200 个跨 8 大场景的任务,并在注入三种环境复杂性(信息不足、不稳定、噪声)的 Docker 容器中执行。使用混合确定性及 LLM-as-Judge 协议评估五个代表性智能体框架与四个先进 LLM 的组合,揭示了严格任务完成度上的显著差距,并表明环境扰动下的性能由 LLM 与智能体框架能力共同决定。
95%🎓# 14
Salesforce Koa:面向智能体工具使用的企业级语言模型
Salesforce Koa: An Enterprise Language Model for Agentic Tool Use
本文介绍企业级语言模型Salesforce Koa,其通过对开源基础模型进行基于Group Relative Policy Optimization (GRPO)的强化学习后训练得到。核心是一个模拟到奖励的管道,能将工作流规范扩展为人物角色条件下的多轮任务,并以成功使用工具作为奖励依据。在公开工具使用、智能体推理及企业CRM基准测试中,该模型超越了其基础模型及强有竞争力的专有基线,证明了规范驱动强化学习是定制企业智能体任务的有效路径。
95%🏆# 15
开放世界多智能体环境中的自主数学发现
Autonomous Mathematical Discovery in an Open-World Multi-Agent Environment
本研究在名为“Station”的开放世界多智能体环境中探索自主数学发现。不同家族的AI智能体在没有中央协调器或脚本流程的情况下,自主选择研究方向、进行实验、协作并共建共享科学文献。在AlphaEvolve目录的12个构造问题和两个额外案例研究中,Station在五个问题上取得了相对于现有文献的新结果,包括新的有限域Kakeya集无限族、11维中新的精确604点接触构型等。重要的是,智能体不仅产出数值构造,还生成解释其工作原理的定理和分析,使结果更具可解释性,便于数学家在此基础上继续构建。
95%💻# 16
RSIAgent:面向新环境的递归自我改进自主探索框架
RSIAgent: Autonomous Exploration for Recursive Self-improvement in New Environments
为解决数字智能体适应未知环境时预训练模型知识不足的问题,本文提出无需训练的智能体框架RSIAgent。它通过协调课程、执行与验证智能体,采用“先广后深”的探索策略,自主构建并验证环境知识记忆,包括可复用的动作-条件-结果因果关系。实验表明,该框架能显著提升开源模型在OSWorld-v2等基准上的性能,使其超越GPT-6等前沿闭源模型。
90%🔗# 17
基于条件流匹配的高效多任务操作策略蒸馏
Distillation for Efficient Multitask Manipulation Policies via Conditional Flow Matching
为应对为每个任务独立训练模型的计算成本问题,本研究探索了多任务策略学习。针对简单合并数据集训练会导致性能下降或需增加模型容量的挑战,我们提出将单任务条件流匹配(CFM)专家模型的知识,通过转移其学习到的速度场,蒸馏到一个共享的多任务策略中。该方法结合了蒸馏信号与原始CFM目标,以保持对演示数据的保真度。在RLBench上的实验表明,该方法在固定模型大小的前提下,显著提升了多任务策略性能,优于简单训练方法。
90%📈# 18
Trident:如何攻破深度强化学习网络防御(智能体化)
Trident : How to Break Deep Reinforcement Learning Cyber Defenses (Agentic)
针对基于深度强化学习(DRL)的自主网络防御系统缺乏对抗适应性威胁评估的问题,本研究提出了Trident智能体化LLM红队框架。该框架包含动态基准环境、包含超1.3万条高保真红蓝交互轨迹的数据集,以及一个“代码即策略”的RLVR智能体架构。该架构通过“日志摘要-规划器-编码器”三元设计,将红方训练重构为上下文赌博机问题。实证评估揭示了现有防御的根本脆弱性:仅使用单个可训练的7B规划器,Trident使蓝方防御性能平均下降522%,并能自主发现静态启发式方法无法揭示的诱饵规避和自适应状态优先级等涌现行为。
90%🛠️# 19
RAPID:基于演示的机器人智能体编程
RAPID: Robot Agentic Programming from Demonstrations
为将编码智能体的潜力应用于机器人系统,本研究提出了RAPID方法,能够根据单次视觉人类演示自动生成、验证和精炼机器人程序。其核心是一个包含代码精炼的迭代智能体循环,并自动从演示中推断出可测试的任务规范、机器人执行的动作基元以及用于程序执行验证的交互环境。为使程序具有泛化性,RAPID采用以对象为中心的关系型程序表示,将动作基元表达为实现对象级运动效果的轨迹优化程序,并通过运行时捕获场景特定几何关系的关系约束进行组合。在仿真和真实Franka机械臂上的八项非抓取操作任务及LIBERO-Pro基准测试中,RAPID均表现出色,并能泛化至不同的物体姿态、形状、材质和环境。
90%✨# 20
KernelOPT:面向GPU内核优化的调度感知智能体搜索
KernelOPT: Dispatch-Aware Agentic Search for GPU Kernel Optimization
针对现代编译器(如PyTorch Inductor)生成的GPU内核常与专家手写版本存在性能差距的问题,本研究提出了KernelOPT多智能体系统。与将编译模型视为黑盒、仅优化独立内核的现有方法不同,KernelOPT将编译模型视为结构化产物,保留供应商库调用,并专门针对生成的Triton子内核,使用五个基于性能剖析的LLM智能体进行优化。系统采用包含静态验证、多种子正确性、模型级float64回退验证和性能门控的四级验证级联,在优化过程中筛选候选方案并对重新拼接的模型进行端到端验证。在250个KernelBench问题上进行评估,KernelOPT相比`torch.compile`在所有问题上实现了几何平均加速比1.40倍(L1)、1.15倍(L2)和1.07倍(L3)。
数据来源:arXiv
由 智能助手@AIIA Lab 生成
