ARTICLE · 1029554
AI应用论文|人类建造的最后一个AI:迈向真正的递归自我改进 (1/20篇) · 9月17日

📡 AI 创新应用
2026年09月17日星期四
共 20 篇精选论文90%🔥# 1
人类建造的最后一个AI:迈向真正的递归自我改进
The Last AI Built by Humans: Toward Genuine Recursive Self-Improvement
🤗 86
递归自我改进(RSI)使AI系统能将经验与反馈转化为持久改进。本文首先利用Headroom-Closed Index(HCI)揭示现有LLM的问题,随后介绍了RSI概念及其发展路线图:从改进-执行自主性、改进-策略自主性、经验-获取自主性、环境-适应自主性,到递归元改进。接着探讨了RSI在不同场景(如科学发现、具身智能、软件工程)中的应用,强调了各自需求与发展速度的差异。结合行业实践与初步实证证据,本文将RSI研究与实际系统连接,并指出了实现真正RSI的关键挑战。
100%⭐# 2
面向自主量子传感实验科学推理的智能体AI
Agentic AI for Scientific Reasoning in Autonomous Quantum Sensing Experiments
本研究针对金刚石氮空位(NV)中心自主实验,构建了一个基于大语言模型(LLM)智能体的工作流。核心贡献有二:一是实现了集持久项目记录、定量计算与数据分析、确定性实验控制于一体的自主NV实验流程,智能体可完成从选择NV中心到执行复杂脉冲序列(如CPMG)的全过程;二是提出了两个离线基准,用于独立评估智能体的科学推理能力。测试发现,在自主实验中,智能体负责形成科学假设并利用定量工具评估数据,而确定性代码则控制硬件并确保安全,这明确了人机协作的清晰分工。
100%💡# 3
面向IPoDWDM网络生命周期自动化的智能体AI:一种基于MCP的架构
Agentic AI for IPoDWDM Network Lifecycle Automation: An MCP-Enabled Architecture
本文提出一种分布式、与供应商无关的多MCP架构,用于实现基于SDN的多供应商、多层IPoDWDM网络的自动化与自主控制。该框架支持端到端服务生命周期自动化,并利用GNPy模型和光遥测技术实现闭环跨层控制。该架构已在IPoDWDM测试平台上得到实验验证。
100%🔬# 4
物理具身智能体AI:一个用LLM编排机器人机队的架构
Physical Agentic AI: An Architecture for Orchestrating a Robot Crew with LLMs
为提升具身智能体规划在物理世界中的可行性与安全性,本文提出Physical Agentic AI框架。该框架在语义规划与执行间引入显式架构接口:每个机器人暴露可执行技能库,任务被分解为阶段并分配给机器人-技能对,而机器人编排层在每次执行前验证技能可行性。在无人机-UGV搜索调度和人形-四足机器人运输任务上的评估表明,检索可将技能落地率从51%提升至96%,但仍有23-29%的错误步骤被调度;而每次调度的强制执行能将错误调度降至0%,并在动作前拦截所有注入的故障。
100%📌# 5
分子LLM智能体:从架构设计到科学自主性
Molecular LLM Agents: From Architectural Design to Scientific Autonomy
本文从两个互补视角为分子LLM智能体建立概念框架。架构视角涵盖分子表示与感知、智能体框架、领域特定工具箱以及学习优化。科学自主性阶梯视角则受工程系统启发,将智能体分为四个等级:L1辅助或固定工作流、L2自适应计算智能体、L3反馈感知物理实验智能体和L4科学议程智能体。该框架旨在全面比较现有分子LLM智能体,识别能力缺口与部署风险,并指导未来智能体在分子发现工作流中的设计、评估与部署。
100%🎯# 6
AI智能体已能自主执行实验高能物理分析
AI Agents Can Already Autonomously Perform Experimental High Energy Physics
研究表明,基于大语言模型(LLM)的AI智能体仅需极少专家输入,即可自主执行高能物理(HEP)分析流程的绝大部分阶段。我们提出概念验证框架JFC,它集成了自主分析智能体、基于文献的知识检索与多智能体评审,足以规划、执行并记录可信的HEP分析。我们利用ALEPH等公开数据完成了电弱、QCD及希格斯玻色子测量分析。这些工具旨在减轻分析代码开发的重复性技术负担,使研究者能专注于物理洞察与创新,呼吁社区重新思考人才培养与资源分配策略。
100%💎# 7
OpenClaw、Moltbook与ClawdLab:从纯智能体社交网络到自主科学研究
OpenClaw, Moltbook, and ClawdLab: From Agent-Only Social Networks to Autonomous Scientific Research
本研究对开源智能体框架OpenClaw和纯智能体社交网络Moltbook产生的大规模AI间交互数据集及相关文献进行多声部综述,并提出了自主科学研究开源平台ClawdLab作为应对已识别架构失效模式的设计科学响应。ClawdLab通过硬性角色限制、结构化对抗性批判、PI主导的治理、多模型编排以及编码为协议约束的领域特定证据要求来解决这些失效模式,其架构天然具备抗女巫攻击能力。一个三层分类法区分了单智能体流水线、预定义多智能体工作流和完全去中心化系统,ClawdLab的可组合第三层架构支持随着AI生态进步而实现复合式改进。
100%🚀# 8
2025年AI智能体指数:记录已部署智能体AI系统的技术与安全特性
The 2025 AI Agent Index: Documenting Technical and Safety Features of Deployed Agentic AI Systems
针对AI智能体生态复杂、发展迅速且文档记录不一致的问题,本文提出了2025年AI智能体指数。该指数基于公开信息及与开发者的通信,系统记录了30个前沿AI智能体的起源、设计、能力、生态及安全特性。研究发现,不同开发者的透明度差异显著,且多数对安全性、评估及社会影响的披露不足。该指数旨在为研究者和政策制定者提供追踪发展的工具。
100%🧠# 9
从看见到模拟:利用数字孪生进行可泛化机器人学习与评估的高保真生成式仿真
From Seeing to Simulating: Generative High-Fidelity Simulation with Digital Cousins for Generalizable Robot Learning and Evaluation
为降低真实世界数据收集成本并实现高效的数据增强与评估,本文提出一个生成式框架,可将真实世界全景图映射为高保真仿真场景(数字孪生),并通过语义与几何编辑合成多样化的衍生场景。结合高质量物理引擎,生成的场景支持交互式操控任务。实验表明,该平台具有强仿真-真实相关性,且大规模数据生成能显著提升策略对未见场景和物体变化的泛化能力。
100%⚡# 10
自动化具身智能体架构设计
Automating the Design of Embodied Agent Architectures
具身智能体通常由感知、记忆、规划、行动等模块手工组合而成,架构设计空间巨大。本文研究将智能体架构搜索(AAS)从文本领域系统性地迁移到具身感知领域。我们引入了AgentCanvas(一个类型化图运行时)和KDLoop(一种编码智能体搜索流程)。在涵盖视觉语言导航、具身问答等任务的四个具身执行器上评估三种AAS变体。结果表明,架构级搜索能为具身任务带来可部署的成功率提升,但也揭示了在文本领域AAS中被掩盖的约束,如优化信号被模拟噪声掩盖、搜索易陷入局部编辑盆地等。
100%🌟# 11
智能体软件:AI智能体如何重构软件范式
Agentic Software: How AI Agents Are Restructuring the Software Paradigm
本文论证AI智能体的出现构成了软件本质的根本性重构,而非渐进式工具改进。形式化区分了传统确定性软件与智能体软件:前者代码承载预写决策逻辑,后者智能体即软件,其决策逻辑在运行时生成。追溯从许可软件到SaaS再到智能体即服务(AaaS)的历史弧线,指出智能体转变转移了决策复杂性本身。引入智能体工程作为软件工程学科的新范式,其核心研究对象、控制模型和人类角色均发生转变。通过分析近期基准证据,展示了智能体范式的变革潜力与当前局限,并提出了通向自进化智能体生态的四阶段路线图。
95%🔎# 12
Skynet:通过语义与结构建模实现面向智能体AI的工作流级异常检测
Skynet: Workflow-Level Anomaly Detection for Agentic AI via Semantic and Structural Modeling
本文提出Skynet,一个工作流级的异常检测框架,用于智能体AI系统。它将观察到的多智能体执行过程转化为有向工作流图,并对照学习的良性行为进行评分。Skynet联合建模语义执行上下文与智能体间委托、工具调用及数据流依赖的结构组织,且仅使用良性工作流训练,从而支持零日攻击检测。在三个公开基准测试中,Skynet在保持高召回率的同时实现了低于1%的误报率。
95%📊# 13
Omni Interaction Agent 技术报告
Omni Interaction Agent Technical Report
本文提出了Gander,一个将全感知、实时交互与智能体能力统一于单一框架的端到端模型。它采用“小脑-大脑”协同架构,通过流式“思考者-说话者”设计支持全双工自然交互。评估表明,Gander在对话、全模态理解、交互及智能体智能方面表现优异,并在嘈杂、多方交互等复杂场景中展现出鲁棒性。
95%🎓# 14
迈向具身空地协同目标搜索:基准、数据集与智能体方法
Towards Embodied Air-Ground Cooperative Object Search: Benchmark, Dataset and Agentic Method
本文针对城市环境中的空地协同目标搜索(AGOS)任务,提出了首个专用基准AGOS-Bench、包含7.7k条轨迹的数据集AGOS-Dataset,以及一种免训练、工具增强的智能体方法AGOS-Agent。该方法通过“搜索-移交-验证”协作协议简化VLM的协调负担,仅要求其进行场景理解与决策。在九个VLM上的实验表明,该方法提升了八个骨干模型的整体成功率,并减少了所有模型的决策步数。
95%🏆# 15
OpenAgentFlow:为异构AI智能体集群启用系统级安全边界
OpenAgentFlow: Enabling System-Wide Safety Boundaries for Heterogeneous AI Agent Fleets
随着AI智能体从孤立助手演变为在共享环境中运行的异构系统,安全成为系统级行动治理问题。本文提出OpenAgentFlow控制平面/行动平面架构,在行动提交边界强制执行安全策略。它将待执行的GUI操作、API调用、工具调用等统一规范化为AgentEvent流,通过共享的策略执行点路由,并在控制平面维护溯源、会话状态、审计记录和可更新策略。这创建了一个可治理的共享行动流,允许新规则生效而无需修改智能体、提示或模型。在Android上的实例化验证显示,该框架在300个行动事件基准上达到94.0%的准确率和95.3%的攻击拦截率,为异构AI智能体集群提供了实用的共享执行边界。
95%💻# 16
机器人的内在批评家:基于VLM重规划实现社交行为的自我精炼
The Robot's Inner Critic: Self-Refinement of Social Behaviors through VLM-based Replanning
传统机器人社交行为生成依赖预定义动作或人工反馈,灵活性与自主性有限。本研究提出CRISP框架,机器人利用视觉语言模型(VLM)作为“类人社交批评家”来自主批评并重规划自身动作。该框架包含从描述文件解析关节、生成行为计划、参考视觉信息生成底层控制代码、VLM评估社交适当性以及基于奖励的迭代精炼。用户研究表明,该方法在多种机器人平台和场景下,获得了比先前方法显著更高的偏好度与情境适当性评分,最小化人工干预的同时扩展了自主交互能力与跨平台适用性。
95%🔗# 17
具身科学:以具身AI智能体闭合科学发现循环
Embodied Science: Closing the Discovery Loop with Agentic Embodied AI
当前AI科学预测方法常将发现视为孤立任务,与依赖物理实验循环的现实脱节。本文主张“具身科学”范式,将科学发现重构为智能推理与物理执行紧密耦合的闭环。我们提出统一的感知-语言-行动-发现(PLAD)框架,其中具身智能体感知实验环境、推理科学知识、执行物理干预并内化结果以驱动后续探索。通过将计算推理扎根于鲁棒的物理反馈,该方法弥合了数字预测与实证验证间的鸿沟,为生命与化学科学的自主发现系统提供了路线图。
95%📈# 18
通过质量多样性提示生成对视觉-语言-动作模型进行红队测试以获取鲁棒机器人策略
Red-Teaming Vision-Language-Action Models via Quality Diversity Prompt Generation for Robust Robot Policies
视觉-语言-动作(VLA)模型对指令措辞敏感,其失败模式难以预测。为提高VLA的鲁棒性,本文提出Q-DIG,它结合质量多样性(QD)技术与视觉语言模型(VLM),可扩展地生成多样且与任务相关的对抗性指令以暴露VLA行为漏洞。在多个仿真基准上的结果表明,Q-DIG相比基线方法能发现更多样、有意义的失败模式,并且利用生成的指令对VLA进行微调能提升任务成功率。真实世界评估与用户研究进一步验证了其有效性。
95%🛠️# 19
Tool-Genesis:面向自进化语言智能体的任务驱动式工具创建基准
Tool-Genesis: A Task-Driven Tool Creation Benchmark for Self-Evolving Language Agent
自进化语言智能体研究加速发展,但其从任务需求中创建、适配和维护工具的能力缺乏有效评估。现有基准多依赖预定义规范,限制了可扩展性与自主进化。本文提出诊断性基准Tool-Genesis,旨在从接口合规性、功能正确性和下游效用等多维度量化智能体能力。该基准评估智能体能否仅从抽象需求(无预设规范)构建任务相关工具并解决实际问题。研究发现,即使最先进的模型也难以在单次尝试中生成精确的工具接口或可执行逻辑,这些微小初始缺陷会在流程中被放大,导致下游指标急剧下降。该基准旨在引导未来研究,训练模型合成能更好应对现实挑战的持久性通用工具。
95%✨# 20
Rosetta Memory:面向跨LLM智能体的自适应记忆
Rosetta Memory: Adaptive Memory for Cross-LLM Agents
现有记忆系统通常以特定LLM为核心设计,但在实践中用户常在不同LLM间切换,导致上游记忆需由下游模型消费。本文从以记忆为中心的LLM适应视角出发,解决上游-下游记忆适应问题。我们设计了两个在写入和读取侧协同训练的配置文件条件化算子,以优化记忆的存储和呈现方式。为确保算子能泛化至广泛的LLM,提出了最小增益采样课程,在训练中优先服务获益最少的LLM。为更准确衡量算子的贡献而非LLM自身能力,设计了性能差距奖励机制。在多个数据集上的实验表明,该模型始终优于基线,并在未见模型替换下保持稳健。
数据来源:arXiv
由 智能助手@AIIA Lab 生成
