ARTICLE · 997838
从高赞论文看AI能力正在如何扩展:Agent进化、复杂协作、科学验收、视觉推理
发布时间:2026-09-15 22:25:48 最近访问:2026-09-15 22:25:47
从高赞论文看AI能力正在如何扩展:Agent进化、复杂协作、科学验收、视觉推理
AI研究的关注点正在从单一模型的能力比较,逐渐扩展到模型如何被组织、如何持续执行、如何验证结果,以及如何利用不同形式的信息完成任务。仅看模型参数规模或单轮测试成绩,已经很难完整描述这类系统的实际能力。Hugging Face Daily Papers的点赞数可以反映社区在一段时间内的关注方向。上周 (8月24日至30日),有四篇论文在平台上受到很高关注,他们分别考察模型之外的系统设计、长期任务执行、结果验证以及视觉推理这几个正在受到关注的问题。论文一:Agent的能力是否取决于它如何组织工作
原文标题:JIT-Agent: Scaling Harness Intelligence via Just-in-Time Harness Evolution(通过即时Harness演化扩展Agent智能)作者:Guibin Zhang, Leo Lu, Fangzhou Xie, Kang Zhu, Junhao Wang, Zhifei Xie, Zhaochen Yu, Zihang Liu, Zhongxiang Sun, Qiankun Li, Yue Liao, Heng Chang, Xiaobin Hu, Qibing Ren, Wangchunshu Zhou, Shuicheng Yan(共16位)论文链接:arXiv:2608.25593, 2026年8月26日
|作者团队介绍
这是一篇来自新加坡国立大学LV Lab (Learning and Vision Lab) 的工作,通讯作者Shuicheng Yan (颜水成) 于2025年回归NUS重新领导该实验室 (此前曾任昆仑万维/Skywork 集团首席科学家,多院院士Fellow)。
第一作者为博士生Guibin Zhang (张贵斌),与Yan长期合作,代表作包括agent记忆与进化方向工作。其中Wangchunshu Zhou (周王春澍) 现任ByteDance Dreamina负责人,是data-centric agent与递归自我改进 (RSI) 方向的活跃倡导者。Zhou与Yan在2025-2026年间合作密切,多篇共同发表被ICML 2026、ICLR 2026接收。论文明确指出JIT-Agent是其"递归自设计与自进化"研究计划的延续,JIT-Agent 是向完整harness层面的统一推进。
JIT-Agent研究的是Agent系统中位于基础模型之外的一层。论文把负责记忆管理、任务规划、行动协议以及工具和技能编排的部分称为Agent Harness。目前的Agent Harness通常由工程师针对具体任务手工设计,例如规定模型什么时候检索信息、如何保存中间结果、如何调用工具以及任务失败后如何重新规划。论文提出的问题是:能否让Harness本身成为一个可以学习、生成和修改的对象。JIT-Agent的核心就是训练一个专门负责生成Harness的模型。对于给定任务,JIT-Agent可以即时生成适合该任务的Harness;如果执行过程中发现Harness不稳定,还可以对其进行修复;同时,系统会从过去的Harness配置和执行结果中提取性能信号,并利用不断扩大的历史配置库改进后续生成。论文把Harness定义为一种可组合、可机器生成的对象,并规定了固定的四模块协议,使不同Harness能够按照统一结构进行生成和比较。论文的实验重点是验证Harness是否能够成为独立于基础模型的性能变量。作者在多个模型家族和Agent任务上进行了测试。结果显示,加入JIT-Agent作为Harness辅助器后,DeepSeek-V4-Flash在DeepSearchQA上的表现超过GPT-5.6,差距为9.1个百分点;在OdysseyBench上高出4.3个百分点;GLM-5.2的性能最高提升20.2个百分点。论文还在DeepSeekV4、Mimo-V2.5和Qwen3.6等不同规模的模型家族上进行了测试,并把JIT-Agent生成的Harness与OpenCode、Claude Code等已有Agent运行框架进行比较。⚙️这项工作的意义在于把过去主要依靠人工设计的Agent框架变成了一个可以学习的对象。如果不同任务需要不同的记忆方式、规划方式和工具调用策略,那么固定Harness就需要不断增加人工规则。JIT-Agent试图让这些规则能够根据任务动态生成。不过,Harness自动生成并不意味着系统自动获得可靠性。生成的Harness本身仍然需要评估,尤其是工具调用、记忆管理和错误恢复是否稳定。论文证明的是Harness设计可以显著影响Agent表现,而不是证明自动生成Harness已经解决了Agent可靠性问题。一个很聪明的人,做不同事情也需要不同的工作方法。买菜、写代码、查资料,不能都按照同一套步骤处理。JIT-Agent研究的是能不能让AI面对不同事情时,自己安排一套合适的工作方法,而且发现方法不好时还能修改。论文二:复杂任务中的AI如何持续推进工作
原文标题:Apodex 1.1: Scaling Agentic Intelligence for Complex Work(面向复杂工作的Agent智能扩展)作者:B. An, B. Li, B. Wang, B. Zhang, B.L. Wang, C. Feng, C. Wei, C. Xue, C. Zhang, D. Ng, D. Ye, E. Min, F. Chen, F. Liu, F. Yang, F. Ye, G. Sun, H. Ji, H. Xu, H. Yang, H. Ye, H. Zhang, H. Zhao, J. Li, J. Lin, J. Xia, K. Jin, K. Wang, K. Yang, L. Bing, L. Lei, L. Su, Le. Wang, Lu. Wang, N. Wang, Q. Ren, Q. Yang, R. Li, S. Bai, S. Du, S. Li, S. Lin, S. Nie, S. Wang, S. Zhang, S.Z. Wang, T. Ge, Ta.Q. Fang, Ti.Q. Fang, W. Fang, W. Li, W. Zhang, X. Chen, X. Li, X. Tang, X. Wang, X. Xu, X. Zhang, X.Q. Wang, X.Y. Wang, Y. Deng, Y. Gao, Y. Hu, Y. Li, Y. Sui, Y. Wang, Y. Xiao, Y. Zhang, Y. Zhou, Z. Chen, Z. Cheng, Z. Feng, Z. Liang, Z. Liu, Z. Zhang(共75位)论文链接:arXiv:2608.23283, 2026年8月25日
|作者团队介绍
这是由Apodex AI公司发布的工业界技术报告。Apodex AI由陈天桥 (盛大集团创始人) 于2026年4月出资创立,总部位于加州,技术瞄准解决"没有标准答案"的前沿难题乃至递归自我改进 (RSI)。
团队的学术领军人物是Shanda Group副总裁兼首席科学家Lidong Bing (邴立东),前阿里达摩院语言技术实验室负责人。署名作者中还包括 Beibin Li, 当前主职为 xAI MTS,此前任职Meta GenAI、Microsoft Research。Liangcai Su是香港大学计算机科学博士生,同时担任Apodex AI Research Scientist Intern,此前是阿里巴巴通义实验室Deep Research Team的创始成员之一。
团队的研究重点集中在Agentic Foundation Models、Deep Research以及复杂任务执行系统,围绕模型、执行环境、工具调用、Agent协调和任务验证共同构建研究体系。
Apodex1.1研究的是复杂现实任务中的持续工作能力。论文认为,通用语言模型已经具备推理和知识综合能力,但复杂工作还需要持续操作文件、信息源和可执行代码,同时维护任务状态、处理失败,并最终交付可以验证的结果。作者把这种能力称为working capability,即围绕现实目标持续取得可验证进展的能力。第一是EnvironmentScaling,扩大Agent可以使用的文件、搜索和代码执行环境,同时让环境中的结果具有更强的可验证性。第二是Agentic Coordination Scaling,训练Agent把长时间任务拆解为多个部分,进行并行委派,整合异步返回的结果,并根据新的信息重新规划。系统通过共享执行Harness和AgentOS维护工具与Agent之间的任务状态和来源信息,再将环境执行轨迹与协调过程用于训练。这种设计对应的是现实工作与传统问答任务之间的差异。一次数学题可以通过最终答案评价,但科研、软件开发或行业研究往往需要几十个相互关联的步骤。某一步失败,可能影响后续所有工作。因此,Agent需要知道任务进行到哪里、哪些结果已经得到、哪些工作还没有完成,以及失败后应该重新执行还是修改原有计划。Apodex1.1在复杂专业工作、金融、科学研究、数学、代码和搜索等任务上进行了评估。论文称其整体表现进入领先性能区间,同时使用的模型规模小于部分前沿系统;其中Apodex1.1Mini为35B参数版本,面向本地部署。论文还展示了Agent Team相对于单Agent执行方式在部分复杂任务上的性能提升。这些结果说明,模型规模并不是复杂Agent工作能力的唯一变量,但具体优势仍然取决于模型、执行环境和Agent框架的组合。⚙️这项研究把Agent的能力单位从一次回答扩展到一项完整工作。对于科研、软件开发、金融分析和深度搜索等场景,用户往往提供的是一个目标,而不是一个可以立即回答的问题。系统需要在较长时间内维持任务状态,并不断处理新的信息。Apodex1.1研究的重点正是这些传统语言模型评价较少涉及的系统问题。如果只是问AI一道菜怎么做,它回答正确就够了。如果让AI负责准备一顿饭,它还得记住买了什么、做到哪一步、出了问题怎么办,最后把所有东西准备好。Apodex1.1研究的就是这种从开始到结束持续完成一项复杂工作的能力。论文三:“做了很多”不等于“完成任务”
原文标题:FrontierChallenge: Evaluating Scientific Workflow Completion(评估科学工作流程的完成情况)作者:Liangcai Su, Zhaopeng Feng, Zhuo Chen, Zhen Zhang, Xiang Lin, Ruilin Li, Handuo Zhang, Ning Wang, Kailong Wen, Yueqi Guo, Feng Xing, Yiling Guo, Chenxiong Qian, Simon Shaolei Du, Lidong Bing, Xinyu Wang(共16位)论文链接:arXiv:2608.24979, 2026年8月25日
|作者团队介绍
这篇评测基准论文与Apodex1.1来自同一研究体系,论文作者中包括Apodex团队的重要研究成员。两篇论文形成"模型+评测"组合。第一作者 Liangcai Su (苏良才) 为香港大学 CS PhD 学生,是Apodex 1.0的核心贡献者,此前为阿里通义实验室DeepResearch Team创始成员。团队还包括华盛顿大学副教授Simon Shaolei Du (机器学习理论知名学者,MIT TR35 亚太区2025年得主)。末位作者Xinyu Wang与Su合作过多篇论文,为阿里达摩院研究员。这是一篇典型的"公司团队 + 高校合作"的基准配套工作,覆盖量子化学、分子动力学、材料表征、分析化学、生命科学、电化学六大科学领域的端到端工作流完成度评测。FrontierChallenge研究的是Agent评测中的一个具体问题:如何判断一个Agent是否真正完成了一项复杂工作。作者认为,现有不少Benchmark关注最终答案、单个程序或者某个领域中的单项能力,但真实科学工作通常要求完成一整套相互关联的步骤,并交付多个可以检查的科学产物。论文构建了一个跨领域的端到端科学工作流Benchmark,共设计300个任务,本论文发布并评估其中97个任务,覆盖量子化学、分子动力学、材料表征、分析化学、生命科学以及电化学和环境科学。每个任务都有固定输入,并规定一组必须交付的科学产物。这样,任务评价就不再只看一个最终答案,而是检查整套交付物是否达到完整完成标准。论文使用两个指标区分不同程度的任务完成情况。Pass Rate表示完整满足任务要求的任务比例,Avg. Score则衡量任务中取得的部分进展。这个区分很重要,因为一个Agent可能已经完成大量中间工作,却因为缺少关键产物而没有真正完成任务。在评估的97个任务中,表现最好的配置也只完成了20个任务,完整通过率为20.6%。在分析化学任务中,最高Avg. Score达到87.6,但最高Pass Rate只有4%;在电化学和环境科学任务中,最高Avg. Score达到94.9,而最高Pass Rate为0%。这说明Agent在这些任务上已经能够完成相当一部分工作,但这些工作并没有转化为完整交付。论文还分析了Claude Code的失败轨迹。在没有通过任务的运行轨迹中,75.5%的轨迹最终出现了声称任务已经完成的语言。这个数字不能理解为“Agent有75.5%的概率撒谎”,论文实际测量的是:在最终未通过的运行轨迹中,有多大比例的轨迹包含了完成任务的表述。作者据此指出,Agent的自我报告不能代替对最终交付物的检查。⚙️FrontierChallenge的应用价值主要在于评价标准。对于科研、工程和专业分析等任务,仅仅统计Agent调用了多少工具、完成了多少步骤,或者最终报告写得是否完整,都不足以判断任务是否完成。更可靠的方法是定义明确的交付物,并在任务结束后逐项检查。这样才能区分“取得了很多进展”和“真正完成了工作”。阿嬷让人准备十道菜,对方做完九道,然后说“全部做好了”。虽然已经做了很多,但第十道没做,事情就没有完成。FrontierChallenge研究的就是这个区别:AI做了多少事情,和任务有没有真正完成,是两件不同的事。论文四:视觉生成能否成为一种推理过程
原文标题:VBVR-Pro: A Scalable and Verifiable Suite for Native Visual Reasoning(面向原生视觉推理的可扩展、可验证研究体系)作者:Junxiang Xu, Ruisi Wang, Fanyi Pu, Maijunxian Wang, Ran Ji, Tongxi Zhou, Chenyang Gu, Jing Zuo, Hongcan Xiao, Yimeng Geng, Wanqi Yin, Wei Chen, Oscar Qian, Zhengan Yan, Ziqi Huang, Haiwen Diao, Liang Pan, Bo Li, Xiangyu Fan, Dezhi Luo, Fengyuan Yu, Zehong Zhao, Qingying Gao, Tinghui Zhu, Yilan Zhang, Jingqi Tong, Pinyuan Feng, Zhengze Jiang, Letian Wang, Ziyu Guo, Renrui Zhang, Jieneng Chen, Sonia Joseph, Constantin Venhoff, Saman Motamed, Mengyue Yang, Chandra Sripada, Alan Yuille, Philip Torr, Lvmin Zhang, Vikash Kumar, Daniel Khashabi, Nikolaus Kriegeskorte, Raphaël Millière, Vincent C. Müller, Anyi Rao, Quan Wang, Ziwei Liu, Dahua Lin, Lei Yang, Hokin Deng, Zhongang Cai(共52位)论文链接:arXiv:2608.26105, 2026年8月26日
|作者团队介绍
这是一支以商汤研究院SenseTime Research为核心、联合全球多所高校的超大型产学研合作团队。通讯作者为商汤研究科学家Zhongang Cai (蔡中昂)与卡内基梅隆大学的Hokin Deng 。团队后段汇集了多位视觉与认知科学领域权威,包括Johns Hopkins University的Alan Yuille和Daniel Khashabi、Oxford的Philip Torr、Columbia的Nikolaus Kriegeskorte等长期研究视觉、机器学习、推理和认知的学者,Zhongang Cai来自南洋理工大学。
这样的作者结构与论文研究的问题相对应:它不仅要建立视觉推理任务,还涉及视觉生成、强化学习、模型评价和机制分析,因此需要视觉生成、AI推理和认知研究等多个方向的知识共同参与。
论文提出的native visual reasoning并不是单纯提高模型理解图片的能力,而是把视觉生成过程本身作为推理媒介。在这种设定下,图像和视频既不是单纯的输入,也不是最终输出,而是问题求解过程中的中间状态。论文首先解决的是视觉推理数据不足的问题。VBVR-Pro构建了300个程序化生成的视觉推理任务,通过控制视觉对象和任务条件形成可扩展的任务空间。作者报告,在这些任务上训练的模型能够迁移到7个外部视觉推理Benchmark,包括RISE-Video、MME-CoF-Pro和BabyVision等。第二个问题是如何评价生成结果。视觉生成任务通常可以让另一个视觉语言模型作为裁判,但这种VLM-as-a-Judge方法本身可能出现判断错误。VBVR-Pro对这种评价方式进行了系统研究,并设计了基于确定性任务规则的reward scorer,根据任务本身可以验证的条件判断结果。例如某些任务可以直接检查目标、颜色或运动轨迹是否满足预设条件。这样得到的评分不仅可以用于评价,还可以作为强化学习的奖励信号。论文报告,使用这些可验证奖励进行多任务强化学习后,模型在视觉推理任务上的表现进一步提高。第三个部分是比较不同视觉生成媒介。论文对30多种图像、视频和交错生成系统进行了控制实验。结果显示,对于需要持续追踪空间和时间状态的任务,视频生成表现最好;交错式生成则提供了计算成本较低的选择。论文进一步通过消融实验和探测实验分析视觉推理轨迹,并据此提出存在对视觉推理具有重要作用的vision-native trajectories。⚙️这项研究的重要价值在于重新考虑视觉表征在推理中的位置。对于空间关系、运动变化和连续状态等问题,视觉状态本身可能比语言描述更直接。比如,机器人操作需要不断判断物体的位置变化,视频生成可以提供连续的中间状态,而不是先把所有信息转换成文字再处理。VBVR-Pro提供的是一个可以训练、评价和比较这种能力的实验框架。不过,论文的实验结果不能直接推广为“视觉生成适合所有推理任务”。目前论文证明的是,在其构建的视觉推理任务以及相关外部Benchmark中,视觉生成能够作为有效的推理媒介,而且不同视觉生成形式在不同任务上的表现存在差异。它更接近于提出并验证一种研究范式,而不是证明视觉推理已经取代语言推理。有些事情只用语言说很难想清楚。比如重新摆家具,直接画一张图,把桌子、椅子和沙发的位置摆出来,再不断调整,就很容易判断方案是否合适。VBVR-Pro研究的是AI能不能采用类似的方法:遇到空间和变化问题时,不只在文字里推理,也通过生成和修改图像、视频来完成部分思考。- JIT-Agent把Agent Harness本身作为可学习和可演化的对象
- Apodex1.1把持续执行、状态维护和多Agent协调纳入复杂工作的能力范围
- FrontierChallenge则进一步要求用完整交付物而不是Agent自己的表述判断任务是否完成
- VBVR-Pro则探索视觉生成能否成为语言之外的推理媒介
从这些论文里可以看到,随着AI开始处理更长、更复杂、更接近现实的工作任务,仅看模型的单次输出,显然已经难以全面评价其实际能力了。我们还需要考察系统如何组织行动、维护状态、验证结果,以及使用什么形式的表征完成问题求解。