ARTICLE · 1048611
AI Agent 基础四件套:Agent、Function Call、MCP 与多 Agent 协作
AI Agent 基础四件套:Agent、Function Call、MCP 与多 Agent 协作
理解这些概念,才算真正走进 AI Agent 的世界
引子:从"聊天"到"干活"的跨越
"AI 能帮我写代码、做数据分析、发邮件,但它要的东西太多了——每次都要我告诉它怎么调用工具、怎么连接数据库、怎么处理结果。"
这是一个从 Agent 1.0 走过来的用户,在"AI拉呱"社群里分享的真实感受。他说的问题,其实不是AI不够聪明,而是缺少一套标准化的"干活基础设施"。
如果把 AI 比作一个刚入职的实习生,裸聊天框就像你只给了实习生一张桌子,没有给他权限、没有给他工具、没有告诉他和谁配合——他再聪明,也只能和你"聊天",无法真正"干活"。
Agent 基础四件套,就是让 AI 从"只会聊天"到"真正干活"的四块基石。
第一件:Agent——AI 的"自主行动体"
Agent 这个词已经被用烂了,但在 Hermes 的语境下,它有明确的定义:具备感知、决策、执行、反馈闭环的自主行动体。
┌─────────────┐ ┌─────────────┐ ┌─────────────┐ ┌─────────────┐
│ 感知 │ ──→ │ 决策 │ ──→ │ 执行 │ ──→ │ 反馈 │
│ (Perception) │ │ (Decision) │ │ (Action) │ │ (Feedback) │
└─────────────┘ └─────────────┘ └─────────────┘ └─────────────┘
↑ │
└──────────────────────────────────────────────────────────┘
(闭环)举个具体的例子,让 Hermes "帮我检查一下服务器状态":
• 感知:Hermes 接收你的指令,理解你需要检查服务器 • 决策:决定用 terminal 工具 SSH 登录服务器,执行 uptime和df -h• 执行:实际调用 terminal 工具,获取服务器状态信息 • 反馈:把结果整理成可读报告返回给你,并记录这次操作的经验
普通聊天界面只完成了"感知"和"反馈"两步,中间最重要的"决策"和"执行"被省略了。 这就是为什么你和 ChatGPT 聊了这么久,它还是不会帮你干活。
第二件:Function Call——AI 调用外部世界的"API 接口"
Function Call 是 LLM 提供的一种能力:模型在生成回复时,不是只输出文本,而是可以输出一个结构化的函数调用请求。
它的工作流程是这样的:
用户输入:"帮我查一下今天的天气"
LLM 解析意图:
→ 输出 Function Call: get_weather(city="北京", date="2026-08-02")
系统执行函数:
→ 调用天气 API,返回结果
LLM 接收结果:
→ 整理成自然语言回复:"今天北京晴,28-35°C..."这个过程的关键在于:LLM 本身不执行函数,它只负责决定"该调用什么函数、传什么参数"。 实际的执行由系统完成——这既保证了安全性,又保持了灵活性。
Hermes 的 Function Call 做了几个关键的增强:
| 动态工具注册 | |
| 工具名模糊匹配 | |
| 参数自动补全 | |
| 错误重试 |
第三件:MCP——让 Agent 接入你所有工具的"通用协议"
MCP(Model Context Protocol)是 Anthropic 推出的开放协议,定义了 AI 应用如何与外部工具和数据源交互的标准接口。
你可以把 MCP 理解为"AI 世界的 USB 接口"——无论是连接数据库、调用 API、还是操作本地文件,只要遵循 MCP 协议,AI 就能即插即用。
MCP 的核心架构
┌──────────────┐ ┌──────────────┐ ┌──────────────┐
│ AI Agent │ ←MCP→ │ MCP Server │ ←API→ │ 外部工具 │
│ (Hermes) │ 协议 │ (中介层) │ 调用 │ (数据库/API)│
└──────────────┘ └──────────────┘ └──────────────┘Hermes 支持的 MCP 连接方式
| stdio | ||
| HTTP | ||
| OAuth |
MCP 目录:一键安装的"应用商店"
Hermes 提供了 MCP 目录功能,预设了 20+ 常用 MCP Server:
• 数据库类:PostgreSQL、MySQL、SQLite • 开发工具类:GitHub、GitLab、Jira • 内容平台类:Notion、飞书、Medium • AI 服务类:Stable Diffusion、Whisper
一条命令就能安装一个 MCP Server:
# 安装飞书 MCP Server
hermes mcp install feishu
# 安装 PostgreSQL MCP Server
hermes mcp install postgres第四件:多 Agent 协作——让多个 AI 像团队一样工作
当单个 Agent 无法满足复杂任务时,就需要多 Agent 协作。Hermes 支持三种协作模式:
模式一:主从式(Master-Slave)
一个主 Agent 负责分解任务,委派给多个子 Agent 执行。
用户请求 → 主 Agent(分解任务)
├── 子Agent A:搜索资料
├── 子Agent B:分析数据
└── 子Agent C:生成报告
↓
主 Agent(汇总结果)→ 用户适用场景:复杂报告生成、多维度数据分析。
模式二:对等式(Peer-to-Peer)
多个 Agent 地位平等,各自负责不同领域,通过消息通道协作。
Agent A(前端开发) ←→ Agent B(后端开发)
↕ ↕
Agent C(数据库) ←→ Agent D(测试)适用场景:全栈开发、大型项目协作。
模式三:流水线式(Pipeline)
任务按阶段顺序传递,每个 Agent 处理一个阶段。
Agent A(需求分析)→ Agent B(架构设计)→ Agent C(编码实现)→ Agent D(测试验证)适用场景:内容创作、自动化工作流。
四件套的协同关系
理解了这四个概念,就能看清它们如何协同工作:
Agent(自主行动体)
├── 使用 Function Call 调用工具
├── 通过 MCP 协议连接外部系统
└── 在需要时,委派给其他 Agent 协作没有 Agent,Function Call 和 MCP 只是技术概念;没有 Function Call,Agent 无法操作外部工具;没有 MCP,Agent 只能操作本地工具,无法接入你的业务系统;没有多 Agent 协作,复杂任务只能串行执行,效率受限。
写在最后
这四件套是理解 Hermes 的技术基石。下一期,我们将用一张全景图,60秒带你建立 Hermes 的完整认知地图——五大模块、四大能力维度、成本与部署分析,全在这篇里。
关注「AI拉呱」,一起探索 AI 技术的前沿落地。
本文是《Hermes Agent 从入门到精通》系列第2篇。