夜雨聆风学习资料网

ARTICLE · 1048611

AI Agent 基础四件套:Agent、Function Call、MCP 与多 Agent 协作

AI Agent 基础四件套:Agent、Function Call、MCP 与多 Agent 协作

AI Agent 基础四件套:Agent、Function Call、MCP 与多 Agent 协作

理解这些概念,才算真正走进 AI Agent 的世界

引子:从"聊天"到"干活"的跨越

"AI 能帮我写代码、做数据分析、发邮件,但它要的东西太多了——每次都要我告诉它怎么调用工具、怎么连接数据库、怎么处理结果。"

这是一个从 Agent 1.0 走过来的用户,在"AI拉呱"社群里分享的真实感受。他说的问题,其实不是AI不够聪明,而是缺少一套标准化的"干活基础设施"

如果把 AI 比作一个刚入职的实习生,裸聊天框就像你只给了实习生一张桌子,没有给他权限、没有给他工具、没有告诉他和谁配合——他再聪明,也只能和你"聊天",无法真正"干活"。

Agent 基础四件套,就是让 AI 从"只会聊天"到"真正干活"的四块基石。

第一件:Agent——AI 的"自主行动体"

Agent 这个词已经被用烂了,但在 Hermes 的语境下,它有明确的定义:具备感知、决策、执行、反馈闭环的自主行动体

┌─────────────┐     ┌─────────────┐     ┌─────────────┐     ┌─────────────┐
│   感知       │ ──→ │   决策       │ ──→ │   执行       │ ──→ │   反馈       │
│ (Perception) │     │ (Decision)  │     │ (Action)    │     │ (Feedback)  │
└─────────────┘     └─────────────┘     └─────────────┘     └─────────────┘
       ↑                                                          │
       └──────────────────────────────────────────────────────────┘
                               (闭环)

举个具体的例子,让 Hermes "帮我检查一下服务器状态":

  • • 感知:Hermes 接收你的指令,理解你需要检查服务器
  • • 决策:决定用 terminal 工具 SSH 登录服务器,执行 uptime 和 df -h
  • • 执行:实际调用 terminal 工具,获取服务器状态信息
  • • 反馈:把结果整理成可读报告返回给你,并记录这次操作的经验

普通聊天界面只完成了"感知"和"反馈"两步,中间最重要的"决策"和"执行"被省略了。 这就是为什么你和 ChatGPT 聊了这么久,它还是不会帮你干活。

第二件:Function Call——AI 调用外部世界的"API 接口"

Function Call 是 LLM 提供的一种能力:模型在生成回复时,不是只输出文本,而是可以输出一个结构化的函数调用请求。

它的工作流程是这样的:

用户输入:"帮我查一下今天的天气"

LLM 解析意图:
→ 输出 Function Call: get_weather(city="北京", date="2026-08-02")

系统执行函数:
→ 调用天气 API,返回结果

LLM 接收结果:
→ 整理成自然语言回复:"今天北京晴,28-35°C..."

这个过程的关键在于:LLM 本身不执行函数,它只负责决定"该调用什么函数、传什么参数"。 实际的执行由系统完成——这既保证了安全性,又保持了灵活性。

Hermes 的 Function Call 做了几个关键的增强:

特性
说明
动态工具注册
工具可以在运行时动态添加/移除,不需要重启
工具名模糊匹配
用户说"发消息",自动匹配 messaging 工具
参数自动补全
缺少参数时,LLM 会主动追问或自动补全
错误重试
工具调用失败时,自动重试或切换备用方案

第三件:MCP——让 Agent 接入你所有工具的"通用协议"

MCP(Model Context Protocol)是 Anthropic 推出的开放协议,定义了 AI 应用如何与外部工具和数据源交互的标准接口

你可以把 MCP 理解为"AI 世界的 USB 接口"——无论是连接数据库、调用 API、还是操作本地文件,只要遵循 MCP 协议,AI 就能即插即用。

MCP 的核心架构

┌──────────────┐         ┌──────────────┐         ┌──────────────┐
│   AI Agent   │  ←MCP→  │   MCP Server │  ←API→  │  外部工具    │
│  (Hermes)    │  协议    │  (中介层)    │  调用    │  (数据库/API)│
└──────────────┘         └──────────────┘         └──────────────┘

Hermes 支持的 MCP 连接方式

连接方式
适用场景
示例
stdio
本地工具
本地文件系统、命令行工具
HTTP
远程服务
公司内部 API、SaaS 服务
OAuth
需要认证的服务
GitHub、Notion、飞书

MCP 目录:一键安装的"应用商店"

Hermes 提供了 MCP 目录功能,预设了 20+ 常用 MCP Server:

  • • 数据库类:PostgreSQL、MySQL、SQLite
  • • 开发工具类:GitHub、GitLab、Jira
  • • 内容平台类:Notion、飞书、Medium
  • • AI 服务类:Stable Diffusion、Whisper

一条命令就能安装一个 MCP Server:

# 安装飞书 MCP Server
hermes mcp install feishu

# 安装 PostgreSQL MCP Server
hermes mcp install postgres

第四件:多 Agent 协作——让多个 AI 像团队一样工作

当单个 Agent 无法满足复杂任务时,就需要多 Agent 协作。Hermes 支持三种协作模式:

模式一:主从式(Master-Slave)

一个主 Agent 负责分解任务,委派给多个子 Agent 执行。

用户请求 → 主 Agent(分解任务)
               ├── 子Agent A:搜索资料
               ├── 子Agent B:分析数据
               └── 子Agent C:生成报告
                     ↓
          主 Agent(汇总结果)→ 用户

适用场景:复杂报告生成、多维度数据分析。

模式二:对等式(Peer-to-Peer)

多个 Agent 地位平等,各自负责不同领域,通过消息通道协作。

Agent A(前端开发) ←→ Agent B(后端开发)
     ↕                      ↕
Agent C(数据库)   ←→ Agent D(测试)

适用场景:全栈开发、大型项目协作。

模式三:流水线式(Pipeline)

任务按阶段顺序传递,每个 Agent 处理一个阶段。

Agent A(需求分析)→ Agent B(架构设计)→ Agent C(编码实现)→ Agent D(测试验证)

适用场景:内容创作、自动化工作流。

四件套的协同关系

理解了这四个概念,就能看清它们如何协同工作:

Agent(自主行动体)
  ├── 使用 Function Call 调用工具
  ├── 通过 MCP 协议连接外部系统
  └── 在需要时,委派给其他 Agent 协作

没有 Agent,Function Call 和 MCP 只是技术概念;没有 Function Call,Agent 无法操作外部工具;没有 MCP,Agent 只能操作本地工具,无法接入你的业务系统;没有多 Agent 协作,复杂任务只能串行执行,效率受限。

写在最后

这四件套是理解 Hermes 的技术基石。下一期,我们将用一张全景图,60秒带你建立 Hermes 的完整认知地图——五大模块、四大能力维度、成本与部署分析,全在这篇里。


关注「AI拉呱」,一起探索 AI 技术的前沿落地。

本文是《Hermes Agent 从入门到精通》系列第2篇。

相关学习资料