编者按:本文转载自CSDN博主「承渊政道」的原创科研实操。作者以第一人称视角,完整记录了自己借助蓝耘元生代MaaS接入GLM-5.1,通过QClaw多轮检索近三年LLM Agent综述论文、最终整理出结构化文献综述初稿的完整过程,涵盖模型选型、Agent工具调用、长上下文推理等关键环节。经授权转载,内容有适度编排,以飨读者。
如果你最近也在跟 LLM Agent 这个方向,大概会有同感:论文铺天盖地,概念一个接一个。Planning、Memory、Tool Use 还没消化完,Multi-Agent、Agent Safety、Harness Engineering、Externalization 又冒出来了。每个词都像入口,但顺着任何一个走进去,都会牵出一长串论文、框架和评估方法。
我这次就卡在这个点上。
手动搜当然可以,但很容易走两个极端:要么只看几篇高引综述,以为摸到了全貌;要么打开几十个网页和 PDF,资料堆了一堆,分类体系却越来越乱。
更麻烦的是,LLM Agent 不是一个单点技术。它同时涉及模型推理、任务规划、长期记忆、工具调用、多智能体协作、评估体系和安全边界。没有一个能持续整理上下文的工作流,最后写出来的综述,大概率只是"论文摘要拼盘"。
所以这次我没有直接让大模型回答"LLM Agent 有哪些综述论文",而是先搭了一个更可复查的科研辅助流程:用蓝耘元生代 MaaS 接入 GLM-5.1,把模型能力接到 QClaw 里,让 QClaw 多轮检索近三年 LLM Agent 综述论文,最终生成一份可以继续人工复核和改写的文献综述初稿。
这篇文章记录的就是这条链路。不是"我有一个朋友用了某平台"的转述,也不是把产品功能重新包装一遍——为什么选这个模型、接入有没有坑、Agent 实际调了哪些工具、整理出的文献脉络有没有参考价值,我都会讲清楚

1.为什么先做模型服务选型,而不是直接打开QClaw开搜
做文献综述这件事,对模型服务的要求和普通问答不太一样。
普通问答可能更看重一句话答得准不准;文献综述则更像一个长链路任务:先理解主题,再拆分检索维度,然后搜索论文、阅读摘要、比较分类体系、去重、归纳趋势,最后还要把结果写成结构化文本。这个过程对模型有几个要求:
上下文要足够长。论文题录、摘要、搜索结果和中间笔记会越堆越多,短上下文很容易丢掉前面的判断。
工具调用要稳定。QClaw 的价值不只在"对话",而在能连续调用搜索、文件写入等工具完成任务。
输出速度不能太慢。综述整理通常需要多轮检索和长文本生成,如果每次等待太久,工作流会被打断。
成本要可控。科研检索不是一次性短问答,长上下文和多轮工具调用都会消耗 token。
基于这个判断,我先在蓝耘元生代 MaaS 平台里看了可用模型和服务商数据。GLM-5.1 这一页给我的第一印象是,它的定位和我这次任务比较贴:支持工具调用、推理和编码能力,适合长任务自主执行。页面摘要里显示GLM-5.1 的上下文长度约192K到202K,输入和输出价格在不同服务商行里有所差异;我最终关注的是蓝耘元生代这一行的综合表现,而不是只看模型名字。

这里有一个容易被忽略的点:同一个模型,不同服务商跑出来的体验可能差很多。模型能力决定上限,服务商的推理链路决定你能不能稳定接近这个上限。对Agent场景来说,这个差异会被放大,因为一次任务里可能连续请求十几次甚至几十次。
从图中看,GLM-5.1 在蓝耘元生代这一行的上下文长度为198K,最大输入长度198K,最大输出长度198K,吞吐为74.98 tokens/s,延迟为 0.51s,近 6 小时可靠性为100%。价格行显示为输入 8 元/M tokens、输出 28 元/M tokens。页面上方的模型摘要区还显示了另一组起步价格信息,所以我在实际选型时没有只看标题价格,而是以服务商行数据作为接入前的直接参考。
2.性能数据怎么看:吞吐、延迟、可靠性缺一不可
我最先看的是吞吐。因为这次任务不是短问答,而是让 Agent 搜论文、读材料、写综述。输出速度直接影响体验,尤其当模型要生成几千字文献整理时,吞吐低会让整个流程变得很拖。
AI Ping 的近7日平均数据显示,在2026-06-10 06:00 到 2026-06-17 06:00 这个窗口里,蓝耘元生代的 GLM-5.1 平均吞吐为 90.37 tokens/s,最低 68.54 tokens/s,最高 99.00 tokens/s。这个数据对我来说很关键,因为它不是某一次"跑得快"的截图,而是一个连续时间窗口里的表现。


第三个指标是排行榜页。图里GLM-5.1 的三个核心指标分别是:首字延迟 TTFT P90 为 0.534s,输出吞吐 TPS 为 86.94 tokens/s,缓存命中率为 85.56%。我会把这类数据理解为"交互体感"的补充:TTFT影响第一段响应什么时候出来,TPS 影响长文本生成速度,缓存命中率则可能影响重复或相似请求的效率。





/maas/zhipuai/GLM-5.1.这一步的工程价值很直接:如果平台支持 OpenAI 兼容协议,很多桌面 Agent、开发框架和已有SDK 都可以低成本迁移。蓝耘官网对 MaaS 平台的描述也提到,它是企业级大模型统一网关与调度平台,支持多模型统一接入;蓝耘官网产品介绍里还提到其大模型服务平台提供智能路由、统一鉴权与成本管控能力。

到这里,基础链路就通了:QClaw负责Agent工作流,蓝耘元生代负责模型推理服务,GLM-5.1 负责长上下文推理和工具调用。
4.给QClaw的任务提示词:别只说“帮我搜”
真正开始检索前,我没有只写"帮我搜论文"。因为这类提示词太宽,模型容易给出一堆没有边界的结果。我给 QClaw 的任务是:
帮我搜近3年 LLM Agent 综述论文,整理成文献综述给我

时间范围:近3年,也就是2023到2026。
文献类型:综述论文,不是普通方法论文。
产出形式:整理成文献综述,而不是只列链接。
QClaw 随后开始多轮调用工具。从过程来看,它先读取 skill 规则,再多角度搜索 LLM Agent 综述论文,接着补充英文论文、特定方向综述,最后写入 Markdown 文件和任务 artifact。整个过程调用了18次工具。

这一步让我比较满意的地方是,它没有停留在"找到几篇论文"的层面,而是把结果按维度整理出来。QClaw 输出的文档概览里,将近三年 LLM Agent 综述归纳为 9 个方向:通用综述、规划、记忆、工具调用、多智能体、效率与上下文压缩、评估、安全、应用领域。

5.QClaw整理出的文献脉络:LLM Agent 已经从“模型能力”走向“系统工程”
结合QClaw 的初稿和我后续复核的公开论文来源,我把近三年 LLM Agent 综述的主线概括为一句话:
LLM Agent 的研究重点,正在从"模型能不能自己完成任务",转向"如何把模型、记忆、工具、协议、评估和安全机制组织成一个可靠系统"。
下面这几类综述,是我认为最值得先读的骨架文献
方向 | 代表综述 | 对我这次综述写作的价值 |
|---|---|---|
通用框架 | Wang 等人的 A Survey on Large Language Model based Autonomous Agents | 给出了 LLM-based Autonomous Agents 的整体框架,适合作为入门综述的主轴。 |
规划 Planning | Huang 等人的 Understanding the planning of LLM agents: A survey | 将规划方法拆成任务分解、计划选择、外部模块、反思和记忆,适合写“Agent 如何做多步任务”。 |
记忆 Memory | Zhang 等人的 A Survey on the Memory Mechanism of Large Language Model based Agents | 系统讨论 Agent 为什么需要记忆,以及记忆模块如何设计和评估。 |
多智能体 | Guo 等人的 Large Language Model based Multi-Agents: A Survey of Progress and Challenges | 将单 Agent 扩展到多 Agent 协作、角色设定、通信和能力演化。 |
工具学习 | Springer 上的 LLM-Based Agents for Tool Learning: A Survey | 适合理解工具调用不只是函数调用,还包括工具选择、工具学习和工具库组织。 |
评估 | A Survey on Evaluation of LLM-based Agents | 将 Agent 评估拆到规划、工具使用、自反思、记忆,以及 Web、软件工程、科学 Agent 等应用场景。 |
安全 | A Comprehensive Survey in LLM(-Agent) Full Stack Safety | 从数据、训练、对齐、部署到商业化全生命周期讨论安全问题,适合补足 Agent 落地风险。 |
外化与运行时工程 | Zhou 等人的 Externalization in LLM Agents | 这篇很新,也很值得读。它把记忆、技能、协议和 harness 看作外化的认知基础设施,解释了为什么 Agent 进步不只依赖更大的模型。 |
显示详细信息
我会把这些综述分成三层来读。
第一层是"Agent 是什么"。Wang 等人的通用综述非常适合作为起点,它把 LLM Agent 的构成、应用和评估放在一个统一视角下。读完这类文章,至少能明确 Agent 不只是聊天,而是一个围绕目标、环境、行动和反馈构建的系统。
第二层是"Agent 如何干活"。这里重点看 planning、memory 和 tool use。Planning 负责把任务拆开,memory 负责跨轮次保存状态,tool use 负责把模型能力扩展到外部世界。Huang 的规划综述和 Zhang 的记忆综述可以配套看:前者回答"怎么规划",后者回答"怎么不忘"。
第三层是"Agent 如何可靠落地"。这部分包括 evaluation、safety、multi-agent 和 externalization。尤其是2025到2026的综述,明显不再满足于讨论一个模型会不会调用工具,而是开始追问:Agent 的可靠性由什么决定?评估集能不能覆盖真实任务?多 Agent 为什么会协作失败?系统外部的记忆、技能、协议和 harness 是不是比模型本体更重要?
这个变化很有意思。早期大家会问"模型会不会推理";现在更真实的问题是"在一个长任务里,模型、工具、记忆和环境如何不互相拖后腿"。这也是我认为 LLM Agent 研究正在工程化的原因。
6.我的文献综述初稿结构
根据这次检索结果,我会把最终文献综述写成下面这个结构:
引言:从 LLM 到 LLM Agent 的研究范式变化。
LLM Agent 基础框架:角色、目标、环境、规划、行动、反馈。
Planning 综述:任务分解、计划选择、反思、外部规划器。
Memory 综述:短期记忆、长期记忆、经验沉淀、记忆评估。
Tool Use 综述:工具调用、工具学习、工具选择、工具安全。
Multi-Agent 综述:角色分工、通信机制、协作失败与治理。
Evaluation 综述:能力评估、过程评估、应用评估、通用 Agent benchmark。
Safety 综述:提示注入、越权调用、数据泄露、自治风险。
Externalization 与 Harness 工程:为什么 Agent 的能力越来越依赖外部基础设施。
未来方向:记忆工程、环境工程、持续学习、安全对齐、科研 Agent。
如果要写成论文式综述,我会把第3到第8节作为主体;如果要写成技术博客,我会把第 9 节展开,因为它和实际开发者最相关。
7.蓝耘元生代在这次流程里到底帮了什么
这次我最直观的感受是,蓝耘元生代没有直接替我"写综述",它提供的是底层模型服务能力。真正的工作链路可以拆成这样:
蓝耘元生代 MaaS 提供 GLM-5.1 的统一 API 接入。
QClaw 通过 OpenAI 兼容协议接入模型。
QClaw 使用工具完成搜索、读取、整理和写入。
GLM-5.1 在长上下文、多轮工具调用和长文本输出中负责推理与生成。
我再对 QClaw 产出的文献维度和论文来源做复核。
这里面最容易被低估的是第1步。如果模型服务不稳定,Agent 的工具链会被频繁打断;如果上下文不够长,文献整理会碎片化;如果成本不可控,长任务就不敢多试几轮。蓝耘元生代对我这次任务的实际帮助,主要体现在三点:
第一,模型接入成本低。OpenAI 兼容协议让 QClaw 接入过程很短,不需要单独改 SDK。
第二,性能数据可参考。模型页和 AI Ping 页能看到吞吐、延迟、可靠性、缓存命中率等指标,选型时不只靠感觉。
第三,长任务体验比较顺。QClaw 这次连续调用 18 次工具,并最终写出 Markdown 文档,整个过程没有因为模型服务中断而失败。
我不想把这写成绝对结论。不同任务、不同时间窗口、不同并发条件下,体验一定会变化。但至少在这次实操里,蓝耘元生代+GLM-5.1+QClaw这套组合确实把"搜论文并整理综述"从手工活变成了半自动科研工作流。
8.这次实践给我的三个科研启发
第一个启发是,科研 Agent 的关键不是"让模型替我思考",而是"让模型帮我维护过程"。
文献综述最麻烦的地方不只是读论文,而是持续维护搜索范围、分类体系、文献去重和中间判断。QClaw这类Agent工具适合做的,正是这些过程性工作。它可以帮我把"搜到什么、按什么维度分、写到哪个文件"连续推进。
第二个启发是,近三年 LLM Agent 综述的关键词已经变了。
2023 年前后,大家更关注 Agent 的统一框架,以及 planning、memory、tool use 三大模块。2024 年之后,多智能体、评估和安全开始变得重要。到2026年,externalization、harness、protocol 这样的词开始频繁出现,说明研究者已经意识到:Agent 不是一个模型,而是一套运行时系统。
第三个启发是,选模型不能只看排行榜。
排行榜能提供参考,但科研工作流更看重"模型能力 + 服务商稳定性 + 接入协议 + 成本 + 工具链适配"。这次我选择GLM-5.1,不是因为它在所有维度都必然最优,而是因为它在这个任务上比较均衡:长上下文、工具调用、推理能力、输出速度和 QClaw 接入成本都满足要求。
9.结论
这次实践让我更确信一件事:对科研来说,Agent 最有价值的地方不是替代研究者,而是把研究者从重复检索、格式整理和初稿拼接里解放出来,让人把精力放回判断、取舍和论证。
蓝耘元生代在这里扮演的是模型基础设施角色,QClaw 扮演的是任务执行入口,GLM-5.1则承担长上下文推理和工具调用。三者组合起来之后,我得到了一条比较完整的科研辅助链路:
选模型服务商 → 接入 Agent 工具 → 多轮搜索论文 → 生成结构化综述 → 人工复核与再写作
这条链路并不复杂,但它有一个优点:每一步都能留下证据。模型服务有性能,API 接入有配置,检索过程有工具调用记录,最终文档有可继续修改的 Markdown。对我来说,这比一段"看起来很聪明"的模型回答更有价值。
如果要用一句话总结这次体验,我会这样说:
蓝耘元生代 + QClaw 没有替我完成科研,但它把“找资料、搭框架、出初稿”这段最耗时间的前置工作,压缩成了一次可复查、可继续迭代的 Agent 工作流。
相关参考资料链接
Lei Wang et al., A Survey on Large Language Model based Autonomous Agents, arXiv, 2023.
Xu Huang et al., Understanding the planning of LLM agents: A survey, arXiv, 2024.
Zeyu Zhang et al., A Survey on the Memory Mechanism of Large Language Model based Agents, arXiv, 2024.
Taicheng Guo et al., Large Language Model based Multi-Agents: A Survey of Progress and Challenges, arXiv, 2024.
LLM-Based Agents for Tool Learning: A Survey, Springer, 2025.
A Survey on Evaluation of LLM-based Agents, arXiv, 2025.
Evaluation and Benchmarking of LLM Agents: A Survey, arXiv, 2025.
A Comprehensive Survey in LLM(-Agent) Full Stack Safety, arXiv, 2025.
Chenyu Zhou et al., Externalization in LLM Agents: A Unified Review of Memory, Skills, Protocols and Harness Engineering, arXiv, 2026.
蓝耘元生代 MaaS 平台:https://maas.lanyun.net/
蓝耘科技官网产品介绍:https://www.lanyun.net/
AI Ping延迟测试:https://aiping.cn/

▲扫码了解更多
推荐阅读

蓝耘科技集团股份有限公司成立于2004年,是国家高新技术企业、国家级专精特新“小巨人”企业,专注于构建面向人工智能时代的算力基础设施与全栈服务能力。公司以自主研发的 “元生代MetaGen” 智能算力操作系统(AIDC-OS)为核心技术生态,深度融合多元异构算力底座与GPU调度云平台、AI模型训推平台、MaaS服务平台、AI数据生成平台、智能体开发平台、蓝耘星河营销智能体、蓝耘天衍桌面端智能体等全栈自研产品矩阵,打造 “算力工厂 + 数据工厂 + 模型工厂” 三位一体的赋能体系,为千行百业提供从底层算力支撑到AI应用落地的全栈式赋能。
元生代MetaGen智能算力操作系统(AIDC-OS)是蓝耘技术生态的底层架构与核心引擎,是驱动智算中心实现智能化资源管理与全流程协同的核心智能中枢。其本质是通过重构AI算力生产关系,将智算中心从硬件堆叠的算力集群升级为“智能电网”式的基础设施,实现算力、数据、模型的高效流动与价值转化。





夜雨聆风



