ARTICLE · 1039427
AI Agent 专用术语有哪些及如何应用的
AI Agent 领域的术语确实容易混淆,同一个词在不同场景下含义可能不同。要理解它,关键在于从“模型本身”和“模型之外的系统”两个层面来拆解。
🧠 核心架构:模型本身 vs. 外围系统
这是最基础也最容易混淆的一组概念。一个 AI Agent 并不仅仅是那个大语言模型(LLM)。
Model (模型):即大语言模型(LLM),如 Claude、GPT、DeepSeek 等。它的本质是“文本进,文本出”,本身没有记忆,也不会自主循环执行任务。它可能会“表达”调用工具的意图,但无法自己执行。
Scaffolding (脚手架):这是模型所“看到”的一切,是行为定义层。它塑造模型的行为边界,但本身不负责运行。主要包括:
System Prompt (系统提示词):定义 Agent 的身份和总目标。
Tool Descriptions (工具描述):告诉模型有哪些工具可用,以及怎么用。
Context Management (上下文管理):决定模型每一步能看到哪些信息。
Harness (执行框架):这是让模型“跑起来”的执行控制层。它负责调用模型、处理工具调用请求、真正执行工具、把结果塞回上下文,并决定循环是否继续。它像是一个项目经理,负责推进、调度和检查。
三者关系:一个更精确的 Agent 定义是 Agent = Model + Scaffolding + Harness。在日常讨论中,也常简化为 Agent = Model + Harness,这里的 Harness 泛指“模型以外的一切”。例如,Claude Code 官方就称自己为“Claude 外面的 agentic harness”。
⚙️ 核心能力与工作模式
这些术语描述了 Agent 如何思考和行动。
Tool Use / Tool Calling (工具调用):Agent 的“手”。模型输出结构化指令来调用外部工具(如搜索、计算、API),由 Harness 负责执行。Function Calling (函数调用) 是它的另一种叫法。
ReAct (推理+行动):一种经典的 Agent 工作模式,即 “想一步 → 做一步 → 看结果 → 再想” 的循环。
Chain-of-Thought (CoT, 思维链):让模型“一步一步思考”再给出答案,以提高复杂推理任务的准确性。
RAG (检索增强生成):让 Agent 在回答前先去外部知识库(如你的文档)检索相关信息,再基于这些信息生成答案,有效减少幻觉。
Memory (记忆):Agent 的“记事本”。通常分为短期记忆(当前对话上下文)和长期记忆(跨会话持久化的重要信息)。
Context Engineering (上下文工程):比 Prompt Engineering 更广,核心问题是“Agent 每一步看到什么”。它需要动态管理整个上下文窗口,包括系统提示词、工具描述、对话历史、检索到的知识等。
🤝 多智能体与协作
当任务复杂时,单个 Agent 可能力不从心,这时就需要多个 Agent 协作。
Multi-Agent System (MAS, 多智能体系统):由多个自主智能体通过通信、协商、合作等机制组织起来的系统。每个智能体可以专注于特定任务。
Orchestration (编排):安排多个 Agent 谁先干、谁后干,协调它们的协作流程,就像导演安排演员。
Sub-agent (子智能体):在一个主 Agent 的调度下,负责完成特定子任务的 Agent。
A2A (Agent-to-Agent Protocol):一种让智能体之间能够相互协作和交接任务的协议。
🔌 关键协议与标准
为了让不同来源的 Agent 和工具能够互通,一些标准化协议变得至关重要。
MCP (Model Context Protocol, 模型上下文协议):由 Anthropic 提出并开源,旨在标准化 AI 模型与外部工具、数据源的连接方式。可以把它理解为一个“通用适配器”,让 Agent 能方便地接入各种外部能力。
AIP (Agent Interoperability Protocol):提供“身份—描述—发现—交互—工具调用”的统一规则,解决不同智能体如何发现彼此、分配任务的问题。
📚 其他重要术语
Autonomy (自主性):Agent 自主决策和行动的权限大小。它像一个可调节的旋钮,自主性越高,灵活性越强,但成本和不可预测性也越高。
Human-in-the-Loop (人在回路):在关键决策点引入人工确认,确保 Agent 的行为可控、安全。
Fine-tuning (微调):用特定领域的数据对基础模型进行“再培训”,让它更懂某个专业领域。
Rollout:指 Agent 从开始到结束的一次完整运行过程。
RL Environment / Trainer / Reward:训练侧的术语,分别指强化学习环境、训练器和奖励信号,用于通过试错来优化 Agent 的策略。
💡 术语如何应用:以场景为例
这些术语并非纸上谈兵,它们共同构建了 Agent 解决实际问题的能力。
场景:自动完成一份市场分析简报
用户发出指令:“帮我分析一下这个地块的规划潜力,做个简报。”
意图理解与规划:Harness 驱动的 Agent 解析指令,制定步骤:查询内部数据库 → 调用分析工具 → 生成图表 → 撰写报告。
工具调用 (Tool Calling):Agent 通过 MCP 协议,标准化地调用内部数据库查询接口和外部数据分析 API。
执行与循环 (ReAct):Harness 执行工具调用,将返回的数据(如地块属性、周边规划)放回上下文。Agent 看到结果后,决定下一步调用图表生成工具。
记忆与上下文管理:在整个过程中,Memory 帮助记住用户最初的目标和已查询到的关键数据,Context Engineering 确保每一步的上下文窗口都包含最相关的信息。
结果交付:最终,一份图文并茂的报告生成完毕。如果涉及复杂的多维度分析,甚至可以由多智能体系统 (MAS) 协作完成——一个负责数据查询,一个负责可视化,一个负责报告撰写。
人在回路 (Human-in-the-Loop):在发送最终报告前,Agent 可以设置一个确认步骤,将报告草稿提交给用户预览,确保方向正确。
AI Agent 的术语体系反映了它正从“会调模型”向“会设计系统”的工程化阶段演进。理解 Model、Scaffolding、Harness 的三层结构是入门的关键,而 MCP、A2A 等协议则代表了构建开放、互操作 Agent 生态的未来方向。希望这份梳理能帮你建立起一个清晰的理解框架。