夜雨聆风学习资料网

ARTICLE · 1038719

AI应用论文|ProgramDistill:从交互式网络应用到可验证的参考引导工程任务 (1/20篇) · 9月18日

AI应用论文|ProgramDistill:从交互式网络应用到可验证的参考引导工程任务 (1/20篇) · 9月18日

📡 AI 创新应用

2026年09月18日星期五

共 20 篇精选论文

90%🔥# 1

ProgramDistill:从交互式网络应用到可验证的参考引导软件工程任务

ProgramDistill: From Interactive Web Apps to Verifiable Reference-Guided SWE Tasks

🤗 44

现有编码智能体评估通常依赖指令描述,但实际开发中常需从现有软件推断行为。本文提出ProgramDistill基准,通过将完整参考应用分解为不同粒度的可重放功能特征来评估智能体。利用自动化流程构建了4063个任务,测试发现前沿智能体在完整应用重建中成功率最高为49.2%,而在部分应用重建中,随着修复深度增加,成功率从100%显著下降至64.0%。该基准为编码智能体的评估与诊断提供了可扩展且难度可控的平台。

80%# 2

广义智能体迭代:用于迭代策略改进与递归自我改进的统一形式化框架

Generalized Agent Iteration: One Formal Framework for Iterative Policy Improvement and Recursive Self-Improvement

🤗 59

递归自我改进(RSI)缺乏统一的形式化框架。本文提出广义智能体迭代(GAI)框架,将经典迭代策略改进与RSI统一为单一学习范式。GAI将智能体建模为系统中可修改组件的配置,学习过程是评估与改进的循环。通过两个关键维度(改进机制是否内置于智能体、评估标准是否外部锚定)区分不同实例,并以此定位现有系统。该框架为分析和设计新的RSI系统提供了原则性基础。

85%💡# 3

Agora:作为集体自动研究共享内存的Git

Agora: Git as Shared Memory for Collective AutoResearch

🤗 39

为解决多个自主研究智能体工作重复、难以积累知识的问题,本文提出Agora系统,将Git作为共享内存,将研究过程记录为仅追加的有向无环图(DAG)。每个研究成果、假设或验证都成为可复现的提交。在一个近12天的实验中,13个无中心规划的语言模型工作者协作解决权重迁移问题,发布了1703项贡献,将评估指标从3.39比特/字节提升至1.899,并向训练好的GPT-2 124M模型性能收敛了62%。结果表明共享研究状态能有效促进集体发现。

60%🔬# 4

重新思考PPO中的评论家学习:理解与缓解价值平坦化

Rethinking Critic Learning in PPO: Understanding and Mitigating Value Flattening

🤗 60

本文揭示了近端策略优化(PPO)中评论家网络的一个系统性故障模式——价值平坦化,即评论家预测的价值函数变化过于平缓,无法匹配真实状态值的剧烈变化。理论分析与在FrozenLake环境中的实验表明,该现象与评论家损失中的隐式方差惩罚及时间相关状态的冗余更新有关。为此,我们提出稀疏近端策略优化(SP³O),仅对每个响应中少数分离良好的状态施加价值损失。在Qwen3-Base上的实验证明,该方法能有效缓解价值平坦化并提升策略性能。

95%📌# 5

询问工具,而非猜测:智能体工具调用掌握其进度,服务系统应读取它

Ask the Tool, Don't Guess: Agent Tool Calls Hold Their Progress, and the Serving System Should Read It

智能体请求在等待工具调用时占用GPU内存,现有服务系统通过猜测工具运行时长来管理KV缓存,但预测不准。本文主张工具应在运行时显式报告进度。对四个公共智能体语料的普查发现,大多数工具时间存在可读的进度信号。一个无需修改智能体行为的轻量级收集器能无损恢复此信号。在需要做出KV缓存决策时,报告的进度比现有最佳预测器准确数倍至一个数量级。将其集成到生产引擎中,可将工具调用后的首令牌时间(TTFT)p90降低约20.7%。

95%🎯# 6

AI智能体能进行开放式AI研究吗?来自两项案例研究的早期证据

Can AI agents conduct open-ended AI research? Early evidence from two case studies

本研究探讨AI智能体能否自动化开放式AI研究。我们提出“影子评估”新方法,让前沿智能体在无人工干预下,尝试解决两篇高质量未发表论文的核心研究问题,并由原作者评审其成果。结果表明,当前智能体虽能完成工程实现,但在判断研究发表标准、创造性应对设计缺陷、有效回溯死胡同、资源意识及指令漂移等关键研究环节上存在系统性失败,未能取得实质性进展。

95%💎# 7

深度研究之深度研究:从Transformer到智能体,从AI到科学AI

Deep Research of Deep Research: From Transformer to Agent, From AI to AI for Science

本文对“深度研究”这一通用智能体的典型垂直应用进行了深入探讨。我们明确了深度研究的定义,并将工业界的深度研究与学术界的科学AI(AI4S)视角统一于一个发展框架中。文章将LLM和Stable Diffusion定位为生成式AI的两大支柱,勾勒了从Transformer到智能体的发展路线图,审视了AI4S在各学科的进展,总结了主流的人机交互范式与系统架构,并讨论了面临的主要挑战与基础研究问题。本文旨在弥合AI与AI4S社区之间的隔阂。

95%🚀# 8

Orchard:一个开源的智能体建模框架

Orchard: An Open-Source Agentic Modeling Framework

为弥合开源智能体研究在基础设施与训练方面的差距,本文提出开源框架Orchard。其核心是轻量级环境服务Orchard Env,为跨领域任务提供沙箱生命周期管理的可复用原语。基于此,我们构建了三个智能体建模方案:Orchard-SWE(代码智能体)在SWE-bench Verified上达到67.5%的新SOTA;Orchard-GUI(视觉语言计算机使用智能体)在多个基准上达到与专有系统竞争的性能;Orchard-Claw(个人助理智能体)仅用少量合成任务训练即取得良好效果。结果表明,一个轻量、开放、与框架无关的环境层能实现跨领域的可复用智能体数据、训练方案与评估。

95%🧠# 9

将视觉-语言-动作模型进化为具备即时工具使用能力的智能体

Evolve Vision-Language-Action Model into an Agent with On-the-fly Tool-use

本文将端到端视觉-语言-动作(VLA)模型与智能体工具使用相结合,提出工具注入框架ART,可将任何VLA模型微调以利用现成的工具模块(用于低层视觉、高层可供性和具身增强)。相比具有连续动作空间的原始VLA模型,ART通过工具使用降低了动作空间的复杂度,不仅提升了跨任务泛化能力,也减少了对数据量的依赖。为验证该框架优势,我们构建了一个仅含30K条轨迹的小型工具使用数据集,并设计了针对长轨迹工具使用推理的训练方案。实验表明,ART在模拟和真实任务(如黑暗环境下的新颖视角抓取)上的成功率比主流基线高20%,其模块化工具利用方式实现了更高效的训练、轻量级部署和新工具的可扩展集成。

95%# 10

面向无人机/无人车集群的传感器驱动任务合成:一种具备硬件强制安全性的TB-CSPN协调架构

Sensor-Driven Mission Synthesis for UAV/UGV Swarms: A TB-CSPN Coordination Architecture with Hardware-Enforced Safety

本文提出一种用于异构无人机/无人车集群的协调架构,能够从不确定、多模态的传感器证据中合成任务动作,同时在执行边界保持硬件强制安全性。该方法结合雷达、射频、声学和视觉观测,通过基于主题的通信空间Petri网(TB-CSPN)进行编排,支持在部分和演化信息下进行增量式任务构建。咨询代理将传感器输出转换为有时限的语义令牌,监督代理则提供任务转换的授权与策略管控释放。这种解释、协调与执行的分离产生了可审计的决策路径,并通过独立的模拟安全包络来钳制或否决不安全执行器命令,从而在存在干扰和对抗的 contested 环境中实现可靠、受控且物理安全的集群协调。

95%🌟# 11

迈向自主O-RAN:面向实时网络控制与管理的多尺度智能体AI框架

Toward Autonomous O-RAN: A Multi-Scale Agentic AI Framework for Real-Time Network Control and Management

针对开放无线接入网(O-RAN)因组件解耦和开放接口带来的操作复杂性挑战,本文提出一个多尺度智能体AI框架。该框架将无线接入网智能组织为跨非实时(Non-RT)、近实时(Near-RT)和实时(RT)控制环路的协调层次:Non-RT RIC中的LLM智能体将运营商意图转化为策略;Near-RT RIC中的小型语言模型(SLM)智能体执行低延迟优化;分布式单元附近的无线物理层基础模型(WPFM)智能体提供快速推理。通过概念验证,该框架在非平稳条件下的鲁棒运行和意图驱动的切片资源控制两个场景中展示了有效性。

95%🔎# 12

大型语言模型在软件工程与软件安全交叉领域:一项以证据为中心的结构化综述与研究议程

Large Language Models at the Intersection of Software Engineering and Software Security:An Evidence-Centered Structured Survey and Research Agenda

本文对LLM在软件工程与安全交叉领域的证据进行了结构化综述。除了任务分类法,还引入了一个保障框架,区分功能正确性、安全性、操作可靠性、证据来源和智能体权限。综述表明,执行反馈和仓库访问能显著改善工程任务完成度,但本身不能确立安全性;反之,静态分析标签或漏洞分类分数很少能确立可部署的正确性。本文识别了重复出现的有效性威胁,并推导出用于跨研究比较的最低报告协议。最终的研究议程优先考虑安全与功能并重的基准、仓库级威胁模型、校准的人类监督、纵向可维护性证据和可复现的智能体评估。核心结论是,模型能力应被视为由任务适当证据支持的保障案例,而非单一基准分数。

95%📊# 13

从语言模型到世界行动系统:智能体AI在数字、社会、虚拟与物理环境中的进展与局限

From Language Models to World-Acting Systems: Progress and Limits of Agentic AI across Digital, Social, Virtual, and Physical Environments

当外围系统允许大语言模型的输出改变外部状态时,它们便成为具有影响力的智能体。本文批判性地综述了截至2026年8月31日的研究进展,发现行动接口的扩展被充分记录,但其在鲁棒性完成、故障恢复、授权与独立验证方面的证据不足。模型间协议(如MCP)提升了互操作性,但未建立可信委托;多智能体组织增加了专业化,也带来了成本和关联故障。我们提出“有依据的委托”作为分析与规范启发,主张仅在证据支持来源追溯、权限限定、故障检测、安全恢复和校准的人类控制时,才扩展行动范围。

95%🎓# 14

利用AtomisticSkills赋能智能体原子尺度研究

Harnessing AtomisticSkills for Agentic Atomistic Research

计算材料科学与化学领域知识庞杂、软件生态分散,将单体LLM智能体扩展至原子尺度研究面临挑战。本文介绍开源框架AtomisticSkills,它通过将科学工作流层次化分解为智能体技能与工具,赋能通用AI编程智能体跨材料、化学与药物发现进行研究。该框架集成了100多项人工策划的多学科技能,涵盖数据库访问、热力学与动力学建模,以及采用机器学习原子间势(MLIP)和密度泛函理论(DFT)的多种模拟引擎。我们通过多项科学活动验证了其功能覆盖与稳健的编排能力,包括锂离子固态电解质生成设计、MOF材料高通量筛选、自主MLIP基准测试与微调、多阶段药物虚拟筛选等,为构建全自主AI科学家提供了关键的智能体基础设施。

95%🏆# 15

EurekAgent:自主科学发现的关键在于智能体环境工程

EurekAgent: Agent Environment Engineering is All You Need For Autonomous Scientific Discovery

随着大语言模型(LLM)智能体在自动化科学发现方面潜力日增,研究瓶颈正从设计智能体工作流转向设计智能体环境。本文提出“环境工程”框架,旨在构建能放大有益行为(如开放式探索、系统化工件管理)并抑制有害行为(如奖励黑客攻击)的环境。基于此,我们提出了EurekAgent系统,从权限、工件、预算和人机交互四个维度进行环境工程。该系统在多个数学、内核工程和机器学习任务上取得了新的最先进成果,例如以低于11美元的总API成本发现了新的26圆填充最优解,证明了环境工程是发展可靠自主研究智能体的核心方向。

95%💻# 16

迈向有根基的自主研究:在已发表计算物理文献上的端到端 LLM 微型研究循环

Towards grounded autonomous research: an end-to-end LLM mini research loop on published computational physics

本文聚焦于物理科学研究的最小单元——微型研究循环,即智能体阅读论文、复现、批判并扩展它。我们在规模和深度两个层面测试该循环:在规模上,智能体对 111 篇开放获取计算物理论文自主运行“阅读-规划-计算-比较”循环,无需被要求批判即在约 42% 的论文中提出了实质性质疑;在深度上,针对一篇关于二维材料 MOSFET 多尺度模拟的《自然·通讯》论文,智能体自主运行了原文缺失的新计算,并生成了可发表的评论,修正了原文的核心结论。

95%🔗# 17

深度研究智能体:一个支持零成本监控的7x24小时自主深度学习实验框架

Deep Researcher Agent: An Autonomous Framework for 24/7 Deep Learning Experimentation with Zero-Cost Monitoring

本文提出开源框架Deep Researcher Agent,使LLM智能体能自主进行全天候深度学习实验。其核心创新包括:零成本监控范式、两级恒定大小内存架构以及最小工具集的主从多智能体设计。在持续30多天的部署中,该框架自主完成了500多个实验周期,在单个项目中通过200多次自动化实验将基线指标提升了52%,且日均LLM成本仅为0.08美元。

95%📈# 18

MAVEN:提升智能体工具调用的泛化能力

MAVEN: Improving Generalization in Agentic Tool Calling

智能体工具调用环境的泛化能力是可靠智能推理系统的核心挑战。本文提出MAVEN,一个轻量级符号推理框架,支持结构化分解、自适应工具编排与中间验证。在多个工具调用基准及新提出的压力测试基准MAVEN-Bench上评估,MAVEN将其基础模型GPT-OSS-120b的准确率从48%提升至71%,且无需额外训练。结果表明,这种以验证为中心的轻量级框架能增强组合推理能力,其性能与前沿闭源基线相当,而成本估计仅为约十分之一。

95%🛠️# 19

Agentao:一个面向可嵌入工具调用LLM智能体的策略治理运行时套件

Agentao: A Policy-Governed Runtime Harness for Embeddable Tool-Using LLM Agents

LLM智能体日益成为调用工具、修改本地状态、使用持久内存并与外部协议交互的执行系统,这带来了权限过高、审计性弱、提示注入等风险。本文提出Agentao,一个面向工具调用LLM智能体的治理优先本地运行时。它通过分层架构将模型生成的动作提议与宿主授权的执行分离,包含宿主接口、宿主合约、运行时核心、权限中介的工具系统,以及内存、回放、插件等支持子系统。该系统展示了如何将权限、状态、协议边界和执行轨迹作为显式的运行时抽象,以构建更易治理、可审查且适合宿主控制本地环境的智能体。

95%# 20

用于复杂序贯决策任务的混合LLM增强强化学习代理

Hybrid LLM-Augmented Reinforcement Learning Agents for Complex Sequential Decision Tasks

LLM在推理、规划与工具使用方面展现出强大能力,但其在需要精确动作优化与环境交互的长视野序贯决策任务中存在困难。强化学习(RL)擅长序贯控制,但缺乏复杂场景所需的高层抽象与任务分解能力。本文提出一种LLM增强的强化学习代理,整合LLM驱动规划与RL动作优化。该架构利用LLM生成子目标、结构化计划与上下文指导,RL代理则通过环境交互优化底层动作。在序贯决策任务上的实验表明,相比纯RL或纯LLM基线,该方法在样本效率、成功率和动作轨迹连贯性上均有提升。

数据来源:arXiv
由 智能助手@AIIA Lab 生成

相关学习资料