ARTICLE · 1097513
AI应用论文|有品位的智能体:在长周期任务中衡量与提升品位 (1/20篇) · 9月29日

📡 AI 创新应用
2026年09月29日星期二
共 20 篇精选论文75%🔥# 1
有品位的智能体:在长周期任务中衡量与提升品位
The Tasteful Agent: Measuring and Improving Taste in Long-Horizon Tasks
🤗 159
针对LLM智能体在长周期任务中决策质量(即“品位”)缺乏评估的问题,本文构建了Taste-Bench基准,通过自动挖掘任务轨迹中的决策分岔点来评估模型选择能力。研究发现,前沿模型正确率仅为59.7%,且证据出现较晚的决策更难。通过知识蒸馏将教师模型对结果的判断传递给学生模型,可有效提升其决策能力与端到端任务成功率。
85%⭐# 2
Lean Pool:一个由AI维护的形式化数学档案库
Lean Pool: An AI-Maintained Archive of Formalized Mathematics
🤗 27
Lean Pool是一个形式化数学知识库,其核心特点是由AI智能体负责内容的增长、维护与优化。该研究旨在探索利用AI自动化构建和治理大型、严谨的数学形式化档案,为数学知识的机器可读、可验证与可扩展存储提供新范式。
90%💡# 3
ExplorationBench:在可验证的异世界中对AI系统探索能力的评测
ExplorationBench: Measuring AI Systems' Exploration in Verifiable Alien Worlds
🤗 19
为评估AI系统在未知环境中的科学探索能力(如提出假设、设计实验),本研究提出了ExplorationBench基准。该基准构建于可验证的“异世界”之上,其规则可执行且与常识相悖,从而区分探索与知识复现。基准包含AlienCode和AlienLogic两个沙盒,共140项任务。对10个AI系统的评估表明,最强系统能习得并应用新规则,但探索过程存在性能波动与倒退。该工作推动了AI通过自主探索获取新知识的研究。
90%🔬# 4
PUBG Ally:作为AI队友的具身对话智能体
PUBG Ally: A Conversational Embodied Agent as an AI Teammate
🤗 11
本文介绍了PUBG Ally,一个能在《绝地求生》中作为语音队友与玩家并肩作战的具身智能体。它结合了智能体工具调用与实时游戏控制:语言模型负责高层决策与对话,底层控制层执行具体操作。研究通过近3.9万场真实对局收集数据用于迭代训练,并利用玩家反馈优化评估标准。部署时采用了模型压缩、安全护栏等技术以确保低延迟与安全性。上线后玩家调查显示,其推荐净推荐值高出负面评价25.1个百分点,被玩家视为真正的队友。
70%📌# 5
PACT:从信用分配到评论家对齐
PACT: From Credit Assignment to Critic Alignment
🤗 27
针对大语言模型(LLM)强化学习中令牌级信用分配缺乏明确定义的问题,本文提出了完整性、前缀一致性和中立性三个正则条件,并证明其唯一确定了令牌级信用。基于此分析,揭示了现有算法(如OPD、RLOO)与信用分配的内在联系,并指出广义优势估计(GAE)中评论家误差的影响。为此,提出了策略对齐评论家训练(PACT)方法,通过调整更新顺序并应用重要性采样修正,使评论家与更新后的策略更好对齐。在数学推理与代码任务上,PACT显著优于GRPO、PPO等方法。
80%🎯# 6
LatentPort:超越KV缓存——混合语言模型中循环记忆的跨模型迁移
LatentPort: Beyond KV Cache - Cross-Model Transfer of Recurrent Memory in Hybrid Language Models: A 4B-to-9B Hybrid-State Handoff Without Target Prefix Replay
🤗 17
本研究首次实现了在不同规模的混合语言模型(Qwen3.5 4B到9B)之间,无需目标前缀重放即可进行持久循环推理状态的跨模型迁移。仅迁移注意力KV缓存效果有限,而额外加入门控DeltaNet(GDN)持久状态包可将教师强制负对数似然平均降低0.747纳特/令牌。实验表明,直接复用循环与卷积状态优于学习到的映射。通过一个额外的参数校正模块,接收方9B模型在零历史前缀令牌处理下的性能显著优于继续运行4B模型,并接近原生9B水平。该工作为模型间状态传递提供了新思路。
80%💎# 7
学习发现有趣的数学
Learning to Discover Interesting Mathematics
🤗 13
针对大语言模型(LLM)能生成大量数学定理但其“有趣性”难以评估的问题,本文定义了定理的内在有趣性(证明长度与陈述长度之比),并证明其与下游效用强相关。研究训练了一个270亿参数的模型来预测证明难度,该模型优于前沿通用模型。优化此指标能使模型生成更有趣的定理,并将与Mathlib库的重叠率从91.9%降至30.6%,创造了更多分布外数学知识。该系统能生成候选定理、选择最有趣的进行迭代扩展,为构建自扩展的机器验证数学库提供了路径。
95%🚀# 8
MM-ContextFold:面向多模态智能体检索的上下文折叠
MM-ContextFold: Context Folding for Multimodal Agentic Retrieval
多模态智能体检索(MAR)中,原始多模态输入与累积交互历史导致上下文爆炸问题。本文通过对近万条轨迹的系统性实证研究发现,随着视觉信息被工具提取并文本化,原始图像变得冗余,持续保留会降低任务精度。为此,提出了MM-ContextFold训练免费框架。它维护一个纯文本主上下文进行高层规划,并为依赖图像的子任务生成临时分支上下文。子任务完成后,将结果以文本摘要形式“折叠”回主上下文,并丢弃图像与分支痕迹。在七个基准测试上的实验表明,该方法平均准确率比ReAct提升6.3个百分点,工作上下文长度减少27.5%。
95%🧠# 9
深度研究之深度研究:从Transformer到智能体,从AI到科学AI
Deep Research of Deep Research: From Transformer to Agent, From AI to AI for Science
本文对“深度研究”这一通用智能体的典型垂直应用进行了深入探讨。我们明确了深度研究的定义,并将工业界的深度研究与学术界的科学AI(AI4S)视角统一于一个发展框架中。文章将LLM和Stable Diffusion定位为生成式AI的两大支柱,勾勒了从Transformer到智能体的发展路线图,审视了AI4S在各学科的进展,总结了主流的人机交互范式与系统架构,并讨论了面临的主要挑战与基础研究问题。本文旨在弥合AI与AI4S社区之间的隔阂。
95%⚡# 10
Orchard:一个开源的智能体建模框架
Orchard: An Open-Source Agentic Modeling Framework
为弥合开源智能体研究在基础设施与训练方面的差距,本文提出开源框架Orchard。其核心是轻量级环境服务Orchard Env,为跨领域任务提供沙箱生命周期管理的可复用原语。基于此,我们构建了三个智能体建模方案:Orchard-SWE(代码智能体)在SWE-bench Verified上达到67.5%的新SOTA;Orchard-GUI(视觉语言计算机使用智能体)在多个基准上达到与专有系统竞争的性能;Orchard-Claw(个人助理智能体)仅用少量合成任务训练即取得良好效果。结果表明,一个轻量、开放、与框架无关的环境层能实现跨领域的可复用智能体数据、训练方案与评估。
95%🌟# 11
为安全机器人操作配备障碍感知驾驭框架的编码智能体
Coding Agents with an Obstacle-Aware Harness for Safe Robot Manipulation
编码智能体已成为机器人操作的一种新范式,但其安全性尚未被充分探究。本研究在安全约束下评估编码智能体,即每个任务在操作目标外还包含一个机器人不得触碰的障碍物。实验发现,智能体常为完成任务而碰撞障碍,其规划过程未能将安全约束置于优先地位。通过将操作分解为路径规划和接触执行两阶段,定位了失败根源:在路径阶段,模型缺乏对安全路径的认知和重规划能力;在接触阶段,未意识到接触执行也受同一约束限制。为此提出SafeHarness框架,为模型配备两种障碍感知驾驭机制:障碍感知路径规划预先规划并验证路径,必要时重规划;障碍感知接触执行则选择能避开障碍的接触位置。实验表明,SafeHarness在任务成功率和避障率上均显著超越之前的最佳方法,且分别是无驾驭机制智能体性能的2.3倍和1.5倍。
95%🔎# 12
AQuA:递归自我改进的量化交易研究智能体
AQuA: Recursively Self-Improving Quantitative Trading Research Agents
本文研究量化投资研究层面的递归自我改进,即自主系统能否利用早期实验证据改进后续迭代中的假设与候选方案。我们提出AQuA,包含两个独立的语言模型驱动研究系统:一个用于符号化因子发现,另一个用于可训练模型开发。两者在封闭沙箱中各自闭环,利用已验证证据指导后续提案。因子系统在加密货币宇宙上实现了约0.190的综合信息系数;模型系统在美股上实现了单股+0.0843的信息系数,并转化为夏普比率高达+2.50的阈值多空策略,且在2021至2025年间每年均取得正收益。
95%📊# 13
边推理边推测:通过联合智能体-推测器强化学习训练智能体预测其下一个工具调用
Speculate While You Reason: Teaching Agents to Predict Their Next Tool Call via Joint Agent-Speculator RL
针对大语言模型(LLM)智能体在等待工具调用结果时存在延迟的问题,本文提出了一种自推测智能体。该方法将智能体与推测器统一于单一模型,使其既能以智能体模式执行任务,又能以推测器模式根据部分轨迹预测下一个工具调用。为实现此双重模式且不降低性能,我们提出了联合智能体-推测器强化学习方法,从智能体自身轨迹中生成推测目标并交替更新。在搜索问答和对话式工具使用任务上,该方法显著提升了Qwen3系列模型的下一个工具调用预测准确率(Hit@1),同时保持了任务成功率。
95%🎓# 14
智能体人工智能互联网:大规模通信、协调与集体智能
The Internet of Agentic AI: Communication, Coordination, and Collective Intelligence at Scale
自主AI智能体的涌现正将人工智能从孤立模型推理转变为分布式推理、通信与行动系统。本文提出了“智能体人工智能互联网”(IoAI)的愿景:一个异构智能体能够相互发现、协商职责、交换上下文、调用工具并在云、边、端及组织间执行工作流的开放生态系统。我们综合了单智能体AI、多智能体系统、分布式计算等领域的理论基础,分析了可扩展智能体生态系统所需的架构与机制,重点探讨了部署模型、工作流生命周期、通信协议、互操作性、资源管理和信任架构,并以自适应制造等案例说明了其核心研究挑战。
95%🏆# 15
面向关键系统的可信赖智能体AI工程化
Engineering Trustworthy Agentic AI for Critical Systems
本研究将可信赖性作为智能体人工智能(AI)的一等工程属性进行系统综述,弥补了现有文献仅关注任务能力的不足。研究围绕安全、鲁棒、透明、可审计及隐私安全五个维度,构建了贯穿感知到审计的智能体保障工作流,并系统梳理了架构、威胁、机制与度量。通过分析四个工程领域的案例,研究论证了智能体AI可信赖性是一个跨领域的共性问题,并提出了构建可复用保障框架的路径。
95%💻# 16
多步骤工具增强智能体中的绑定漂移问题
Binding Drift in Multi-Step Tool-Augmented Agents
本研究探讨了工具增强语言模型智能体在多步骤工作流中实体绑定的稳定性问题。研究区分了“绑定漂移”(初始正确后续出错)与“错误传播”(初始错误持续传递),并通过受控实验发现:直觉的“锁定首次绑定”策略会将错误操作放大3倍;而一个基于LLM的廉价重验证器可将错误减少79%,性能接近理论上限。研究表明,消除漂移与抑制传播的防御机制不可互换。
95%🔗# 17
超越排行榜:大语言模型智能体在工具使用、规划与推理中的失败模式综述
Beyond the Leaderboard: A Synthesis of Tool-Use, Planning, and Reasoning Failures in Large Language Model Agents
本文综合了2023-2026年间27篇关于大语言模型(LLM)智能体评估的文献,首次构建了一个涵盖工具使用、规划、长程推理、多智能体协作、安全及测量有效性等维度的统一失败模式分类体系。研究识别出六大失败集群:工具调用与参数级错误、规划与约束满足失败、长程任务中的上下文累积退化、多智能体协作失败、对抗或未明确定义条件下的安全失败,以及测量有效性问题。研究发现,失败率随任务长度非线性增长,子任务强性能未必转化为端到端成功,且额外框架支持并不总能提升可靠性。
95%📈# 18
KAT-Coder-V2.5技术报告
KAT-Coder-V2.5 Technical Report
本文介绍了KAT-Coder-V2.5,这是一个专注于在真实可执行代码仓库内自主行动的智能体模型,而非单轮代码生成器。其能力瓶颈主要在于可复现环境、可验证奖励和高价值轨迹的稀缺。为此,我们提出了端到端的智能体后训练框架:AutoBuilder大规模重构多语言仓库为沙盒环境并进行验证,从中再生任务规范并恢复近成功轨迹;KwaiClawEnv则从可执行服务和真实任务种子合成大规模工具使用轨迹。通过强化学习扩展、多教师策略蒸馏等技术,该模型在PinchBench上取得了最佳工具使用结果,在仓库级软件工程任务上仅次于前沿模型Opus 4.8。
95%🛠️# 19
面向代码智能体的贝叶斯控制
Bayesian control for coding agents
现代代码智能体将LLM生成器与多种工具(如廉价诊断器和昂贵验证器)结合,但其工具调用决策通常由忽略不确定性的固定规则编排器控制。本研究将编排问题建模为成本敏感的序贯假设检验:一个贝叶斯控制器维护对候选代码正确性的信念,并动态决定是收集更多证据、优化候选方案、验证还是停止。在六个生成器和九个编码基准上的实验表明,当验证成本高昂且诊断工具信息丰富但不完美时,贝叶斯控制最具价值。此外,其信念状态可产生可解释的正确性分数,在不确定性量化方面优于基于令牌概率和原始工具成功率的基线方法。
95%✨# 20
FASE:面向代码质量的快速自适应语义熵
FASE: Fast Adaptive Semantic Entropy for Code Quality
多智能体代码生成因LLM幻觉和错误传播而影响系统可靠性。语义熵提供了一种无需真实答案即可量化不确定性的原则性方法,但现有方法依赖昂贵的LLM驱动等价性检查。本文提出快速自适应语义熵(FASE),一种基于结构和语义差异图最小生成树来近似功能正确性的新度量。在HumanEval和BigCodeBench上的评估表明,FASE优于基于LLM蕴含的最先进语义熵方法,在使用Qwen3-Embedding-8B模型时,其斯皮尔曼相关系数平均提升25%,ROCAUC分数相对Pass@1提升19%。此外,FASE消除了昂贵的LLM等价性评估,仅需传统方法约0.3%的运行时间成本,为实际多智能体工作流中的不确定性量化提供了实用、经济的解决方案。
数据来源:arXiv
由 智能助手@AIIA Lab 生成
