很多人问同一个问题:ChatGPT 明明只是个"聊天机器人",为什么现在的 AI 能自己查资料、写代码、调 API、完成一整条工作流?
答案:AI 早已不是"一个模型",而是一套分层架构。从底层的大模型,到顶层的智能体应用,每一层解决一个问题、干一类活。把五层架构拆开看,市面上几乎所有 AI 产品都能对号入座。
本文用一张架构图 + 逐层拆解,帮你把 AI 底层架构一次讲透。
一图看懂:AI 五层架构总览
下图展示了从基础大模型到智能体应用的完整 AI 系统架构:

| 基础层(模型) | |||
| 上下文层(记忆) | |||
| 能力扩展层(工具) | |||
| 智能体层(决策) | |||
| 应用层(行动) |
下面逐层拆解。
第一层:基础层(模型)——AI 的计算核心
要解决的问题:机器如何理解并生成自然语言?
方案:基于 Transformer 架构的大语言模型。它通过自注意力机制建立 Token 之间的关联,从而完成语义理解与文本生成。Token 是模型处理文本的最小单位,可以是子词、单词、字符或符号。
要点:这一层决定 AI 的"智力上限"。模型参数量越大、训练数据越好,基础能力越强,但它只是"会说话",还不会"办事"。
第二层:上下文层(记忆)——AI 的工作台
要解决的问题:模型只知道"训练时的知识",聊完就忘,怎么让它记住上下文、掌握最新信息?
方案:三层记忆机制叠加——
1. Context Window(上下文窗口):模型一次能"看到"的 Token 上限,是短期记忆的载体。 2. Memory(记忆):短期会话记忆 + 长期持久记忆,解决上下文遗忘。 3. RAG(检索增强生成):生成前先从外部知识库检索相关资料,再交由 LLM 整合生成精准答案。
⚠️ RAG 是解决大模型"幻觉"的关键手段。 它由 Facebook AI Research(Lewis 等)于 2020 年在 NeurIPS 上首次提出,核心就三步:检索 → 增强 → 生成。知识库独立于模型、可实时更新,无需重新训练。
第三层:能力扩展层(工具)——AI 的"手和脚"
要解决的问题:大模型只能"打字",怎么让它真正操作外部世界?
方案:通过 Tool Calling(工具调用) + MCP(模型上下文协议),让 AI 调用 API、数据库、搜索引擎等真实工具。
MCP 解决的核心问题:过去 M 个模型对接 N 个工具,需要 M×N 种定制适配;MCP 用一套统一标准,让任意模型都能对接任意工具,被称为 "AI 领域的 USB-C 接口"。
• 由 Anthropic 于 2024 年 11 月推出并开源,基于 JSON-RPC 2.0 • 服务器通过 Resources(资源)/ Tools(工具)/ Prompts(提示模板) 三种元素暴露能力 • OpenAI、Microsoft、Google 等主流厂商均已接入,已成事实标准
第四层:智能体层(决策)——AI 的大脑
要解决的问题:有了模型、记忆、工具,怎么让 AI 学会"自己安排任务"而不是等指令?
方案:引入 Agent(智能体)——在 LLM 基础上叠加目标 + 规划 + 执行能力,形成自主决策闭环。
业界通行的公式是:
Agent = LLM(大脑)+ Planning(规划)+ Memory(记忆)+ Tool Use(工具使用)
主流的规划范式是 ReAct:思考(Reason)→ 行动(Act)→ 观察(Observe) 交替迭代,直到任务完成。判断一个 AI 是不是智能体,标准很简单:如果它只能"回答",它不是智能体;如果它能"推进任务状态",它才是。
第五层:应用层(行动)——AI 的落地形态
要解决的问题:Agent 能力怎么变成可用的产品?
方案:把 Agent 能力封装为 Agent Skill、Workflow、Automation,面向具体业务场景落地:
• Workflow(工作流):固定流程,适合确定性任务 • Agent Skill(智能体技能):可复用的能力封装 • Automation(自动化):定时/触发式自动化执行
合理分工:Workflow 承载稳定流程,Agent 处理不确定决策,二者互补而非互斥。
AI Agent 完整运行流程:六步闭环
把五层架构串起来,一次完整的 Agent 任务是这样跑的:
1. 用户输入:用户下发指令 Prompt,进入上下文窗口 Context Window 2. 记忆增强:联动 Memory 会话记忆 + RAG 外部知识库,补充上下文与专业知识 3. LLM 推理:通过 Transformer 对 Token 序列做注意力计算,进行语义理解与初步生成 4. Agent 规划:智能体自主判断、拆解任务,决定是否需要多步骤执行或调用外部工具 5. 工具执行:基于 MCP 协议,调用 API、数据库、搜索引擎完成实际操作 6. 输出结果:汇总工具返回数据与模型推理结果,返回用户,并写入记忆存档

核心名词速查表
| Transformer | |
| Token | |
| Prompt | |
| Context Window | |
| Memory | |
| RAG | |
| MCP | |
| Tool Calling | |
| Agent |
FAQ
Q:五个层级必须全部具备吗?A:不必。聊天机器人只用到前两层;接入工具后用到第三层;真正自主决策才需要第四层 Agent。层级越多,能力越强,复杂度也越高。
Q:RAG 和微调(Fine-tuning)选哪个?A:RAG 适合需要实时知识、可溯源的场景(客服、企业问答),改知识库即改答案、零成本;微调适合改变模型行为风格。两者可结合使用。
Q:现在学 AI Agent 开发,该从哪层入手?A:推荐从第三层入手——用现成框架(LangChain、Dify、Coze)接 MCP 工具,快速跑通"规划→调用工具→输出"闭环,再向上封装成应用。
总结
AI 底层架构的五层模型,本质是能力逐层叠加:模型会说话 → 记忆让 AI 不忘事 → 工具让 AI 能动手 → Agent 让 AI 会决策 → 应用让 AI 可落地。
留一个可复用的公式:
AI 应用 = 模型 + 记忆 + 工具 + 决策
下次看到任何 AI 产品,对照这张架构图,就能定位它用到了哪几层、还缺哪几层。
夜雨聆风