夜雨聆风学习资料网

ARTICLE · 990684

AI智能体如何获得工具、记忆和控制

AI智能体如何获得工具、记忆和控制

什么是智能体驾驭?

一个定义来自LangChain:“如果你不是模型,你就是驾驭。”在实践中,智能体驾驭是围绕语言模型的软件:工具、记忆、状态、执行、护栏和可观测性。

智能体 = 模型 + 驾驭

模型负责推理。驾驭为这种推理提供一个行动、记忆、检查结果和遵循规则的地方。

这个公式很有用,但它是一个思维模型,而非行业标准。一些供应商仍然将“驾驭”、“框架”和“脚手架”大致视为同义词。

为什么AI智能体需要驾驭

当你要求一个原始语言模型执行多步骤任务时,它会遇到限制。它自身不维护持久状态,不自行执行工具,不管理不断增长的上下文窗口,也无法在无帮助的情况下从失败的工具调用中恢复。

想象一个被要求修复Python项目中失败测试的智能体。没有驾驭,模型可以写出看似修复的代码,但它无法读取实际的测试文件、运行pytest、查看真实错误、编辑失败的函数或确认修复是否通过。有了驾驭,整个循环就变成了智能体独立完成的几分钟工作,每一步都记录在人类可以检查的地方。

不过,Anthropic的指导仍然适用:从尽可能简单的方法开始,只有当任务需要时才添加活动部件。

智能体驾驭由什么构成

各个部分各不相同,但大多数共享一些基本模块。将它们视为一个检查清单,而非严格的产品规格。一个小型智能体可能只需要其中几个部分,而生产级智能体则需要更多。

系统提示和行为规则

驾驭通常控制模型的基线指令。这包括系统提示,但也可能包括项目规则、编码标准、角色约束和安全策略。例如,在LangChain的Deep Agents中,一个AGENTS.md文件可以在任务开始前设定基本规则。

2026年的一些驾驭还使用渐进式指令披露。与其在启动时将所有工具描述加载到上下文中,驾驭只添加可用内容的摘要。只有当模型需要该工具时,才会加载其完整指令。

工具:智能体如何与世界互动

工具让智能体能够执行文本生成之外的操作。常见示例包括网络搜索、文件读写、数据库查询、API调用、浏览器操作、代码执行和终端命令。驾驭控制哪些工具可用、模型何时被允许调用它们,以及结果如何格式化并返回给智能体的上下文。

模型上下文协议(MCP)已成为2026年此功能的标准接口。许多驾驭,包括Anthropic Agent SDK、LangChain Deep Agents和OpenAI Agents SDK,都使用MCP连接外部工具服务器,而无需为每个工具编写自定义集成代码。

记忆和状态

智能体需要知道任务中先前发生了什么。驾驭可以在当前对话中保存短期状态,并在文件、日志、摘要或保存的偏好中保存长期状态。一些驾驭还会将长历史压缩成较短摘要,以便模型不必在上下文中携带每个细节。

执行环境:智能体运行和行动的地方

许多有用的智能体需要实际工作的地方。这可以是文件系统、容器、沙盒终端、浏览器实例或云运行时。没有由驾驭管理的执行环境,工具调用将无处落地。

许多驾驭现在使用隔离的沙盒容器:限定在单个会话的短期环境,任务结束时清理,以便一个智能体任务的文件写入、已安装包和网络调用不会泄漏到另一个任务中。

编排和规划

某些任务不适合单一线性步骤。驾驭可以提供规划工具,将目标分解为子任务并跟踪其状态。它还可以生成子智能体来处理工作的一部分,并仅向主智能体返回摘要。

例如,LangChain Deep Agents在文件系统上的一个文件中跟踪计划步骤,随着任务运行,将每个步骤从“待处理”更新为“已完成”。

护栏和权限

驾驭是放置规则的地方:人工审批、被阻止的工具调用、基于角色的权限和输出检查。OpenAI Agents SDK、LangChain Deep Agents和Microsoft Agent Framework都支持这种控制。更安全的模式是分别检查输入、输出和工具权限。

可观测性和追踪

当一个五十步的智能体任务在第三十七步失败时,追踪能显示发生了什么。追踪记录整个运行过程中的模型调用、工具调用、交接、错误、延迟和成本。OpenAI Agents SDK默认开启追踪。LangSmith在其上添加了调试和评估仪表板。OpenTelemetry已成为以供应商中立格式导出追踪的标准,因此您不会被锁定在一个可观测性工具上。

智能体驾驭 vs. 框架 vs. 运行时:有什么区别?

这个问题经常出现,答案比大多数解释器所暗示的要混乱。这种分类学是有用的,但它并非固定不变。

我将从框架开始,因为许多开发者已经使用过它。

什么是智能体框架?

智能体框架为开发者提供创建智能体的构建模块。它涵盖模型调用、工具定义、记忆模式和智能体循环结构。示例包括早期的LangChain、CrewAI和Google ADK。框架告诉你如何构建智能体,但并不总能告诉你如何在生产中可靠地运行它。

什么是智能体运行时?

智能体运行时是帮助智能体随时间可靠运行的层。它处理持久执行、状态持久化、重试、人机交互步骤和流式传输。LangGraph、Temporal和Inngest都是例子。Harrison Chase提供了这样一个类比:如果Node.js是运行时,Express是框架,那么驾驭就像是Next.js。

是什么让驾驭与众不同?

驾驭比框架更高级。框架给你组件,而驾驭通常已经做出了更多决策:工具、规划、文件系统访问和上下文管理。

智能体驾驭用例:编码、研究、数据和企业

相同的构建模块出现在非常不同的任务中,但组合方式不同。编码智能体和企业工作流智能体都需要驾驭,但它们各自强调驾驭的不同部分。这些类别并非正式标准。它们是观察同一个想法如何适应眼前工作的实用方式。

编码智能体驾驭

编码智能体是一个很好的当前示例,因为驾驭是可见的。为了完成有用的编码工作,智能体需要文件访问、git上下文、终端执行、测试运行、依赖安装和项目规则。Claude Code和Codex都是这种模式的例子:两者都运行在大量驾驭代码上,而不是纯模型API。

一个好的和一个平庸的编码驾驭之间的区别通常体现在小细节上:它如何从失败的测试中恢复,它能否回滚错误的编辑,它如何清晰地向模型暴露git历史。这些细节正是大部分工程努力真正投入的地方。

有关实践示例,DeepSeek自己的驾驭将“一切皆插件”的理念发挥到了极致;请参阅我们的DeepSeek驾驭教程

研究智能体驾驭

研究智能体需要不同的工具集:网络搜索、来源跟踪、笔记记录、引文管理和摘要生成。驾驭管理搜索结果如何存储、来源如何归属,以及长文档如何被分块和卸载,以避免一次性消耗整个上下文窗口。

数据分析智能体驾驭

数据智能体需要访问数据集、SQL数据库、Python执行环境以及架构上下文,以便在开始编写查询之前知道有哪些表和列可用。驾驭还强制执行权限边界,这在智能体可以接触生产数据时非常重要。

企业工作流驾驭

企业部署增加了另一层要求:身份验证、审计日志、审批工作流、基于角色的访问控制以及与内部系统的连接。AWS AgentCore是该类别中的一个托管示例,包含身份、VPC网络和可观测性。Microsoft Agent Framework为Azure或.NET环境中的团队覆盖了类似领域。

你真的需要智能体驾驭吗?

这里有一个直接的方法来思考你是否需要一个。

如果你的系统满足以下一个或多个条件,你可能需要驾驭:

  • 需要使用外部工具

  • 需要跨会话记住进度

  • 需要在真实环境中运行代码

  • 协调多个智能体

  • 需要从部分失败中恢复而不丢失工作

  • 需要人工审批

如果任务是一个可预测的工作流,每个步骤都是预先确定的,那么你可能不需要驾驭。

一个有用的测试:如果任务可以通过一次模型调用完成,或者通过一个带有少量条件语句的小型确定性脚本完成,那么驾驭可能大材小用。一旦任务要求智能体做出决策、使用工具并随时间对结果做出反应,驾驭就开始发挥真正的作用。

我不断看到的一种模式是,团队过早地使用驾驭,为实际上只是一次性文本生成任务构建追踪和沙盒。相反的错误则是痛苦的:直接发布模型,然后在第二次测试失败、第三次工具调用或第五次重启时才发现没有基础设施可以依靠。

最后的思考

如前所述,供应商们并不都使用相同的词来表达相同的事物,框架、运行时和智能体驾驭之间的边界仍在移动。

对于一次性生成,包装器是大材小用。对于必须跨长会话行动、记忆和恢复的智能体,驾驭成为系统的主要部分。选择合适的驾驭越来越成为与选择合适的模型分开的决策。我很好奇下一代模型自身能吸收多少这一层,因为OpenAI和Anthropic的一些动向表明边界将继续变化。但基本思想仍然成立:智能体等于模型加上智能体驾驭。

关注我们,一起开启探索之旅!

真问题 · 真方法 · 真路径 · 真进化。
一个真实的问题、一套可复用的拆解方法、一条只属于你的探索地图,以及一个更会思考和行动的自己
你的困惑值得一次真正的探索。

相关学习资料

返回首页浏览学习资料