乐于分享
好东西不私藏

一张图看懂 AI 底层架构:从大模型到智能体的五层拆解

一张图看懂 AI 底层架构:从大模型到智能体的五层拆解
问题:为什么大模型能"自己干活"?

很多人问同一个问题:ChatGPT 明明只是个"聊天机器人",为什么现在的 AI 能自己查资料、写代码、调 API、完成一整条工作流?

答案:AI 早已不是"一个模型",而是一套分层架构。从底层的大模型,到顶层的智能体应用,每一层解决一个问题、干一类活。把五层架构拆开看,市面上几乎所有 AI 产品都能对号入座。

本文用一张架构图 + 逐层拆解,帮你把 AI 底层架构一次讲透。

一图看懂:AI 五层架构总览

下图展示了从基础大模型到智能体应用的完整 AI 系统架构:

层级
核心组件
核心作用
典型能力
基础层(模型)
LLM & Token、Transformer、注意力机制
AI 的底层计算核心
自然语言理解、文本生成、上下文建模
上下文层(记忆)
Context Window、Prompt、Memory、RAG
管理模型输入上下文
Prompt 控制、会话记忆、知识检索
能力扩展层(工具)
MCP、Tool Calling、API、Database
让 AI 不止聊天,能动手
联网搜索、代码执行、数据库查询
智能体层(决策)
Agent、Explore、Plan、Act
AI 自主决策大脑
任务规划、多步骤推理、闭环执行
应用层(行动)
Agent Skill、Workflow、Automation
把 Agent 能力封装成产品
自动化工作流、行业 AI 助手、AI SaaS

下面逐层拆解。

第一层:基础层(模型)——AI 的计算核心

要解决的问题:机器如何理解并生成自然语言?

方案:基于 Transformer 架构的大语言模型。它通过自注意力机制建立 Token 之间的关联,从而完成语义理解与文本生成。Token 是模型处理文本的最小单位,可以是子词、单词、字符或符号。

要点:这一层决定 AI 的"智力上限"。模型参数量越大、训练数据越好,基础能力越强,但它只是"会说话",还不会"办事"。

第二层:上下文层(记忆)——AI 的工作台

要解决的问题:模型只知道"训练时的知识",聊完就忘,怎么让它记住上下文、掌握最新信息?

方案:三层记忆机制叠加——

  1. 1. Context Window(上下文窗口):模型一次能"看到"的 Token 上限,是短期记忆的载体。
  2. 2. Memory(记忆):短期会话记忆 + 长期持久记忆,解决上下文遗忘。
  3. 3. RAG(检索增强生成):生成前先从外部知识库检索相关资料,再交由 LLM 整合生成精准答案。

⚠️ RAG 是解决大模型"幻觉"的关键手段。 它由 Facebook AI Research(Lewis 等)于 2020 年在 NeurIPS 上首次提出,核心就三步:检索 → 增强 → 生成。知识库独立于模型、可实时更新,无需重新训练。

第三层:能力扩展层(工具)——AI 的"手和脚"

要解决的问题:大模型只能"打字",怎么让它真正操作外部世界?

方案:通过 Tool Calling(工具调用) + MCP(模型上下文协议),让 AI 调用 API、数据库、搜索引擎等真实工具。

MCP 解决的核心问题:过去 M 个模型对接 N 个工具,需要 M×N 种定制适配;MCP 用一套统一标准,让任意模型都能对接任意工具,被称为 "AI 领域的 USB-C 接口"

  • • 由 Anthropic 于 2024 年 11 月推出并开源,基于 JSON-RPC 2.0
  • • 服务器通过 Resources(资源)/ Tools(工具)/ Prompts(提示模板) 三种元素暴露能力
  • • OpenAI、Microsoft、Google 等主流厂商均已接入,已成事实标准

第四层:智能体层(决策)——AI 的大脑

要解决的问题:有了模型、记忆、工具,怎么让 AI 学会"自己安排任务"而不是等指令?

方案:引入 Agent(智能体)——在 LLM 基础上叠加目标 + 规划 + 执行能力,形成自主决策闭环。

业界通行的公式是:

Agent = LLM(大脑)+ Planning(规划)+ Memory(记忆)+ Tool Use(工具使用)

主流的规划范式是 ReAct思考(Reason)→ 行动(Act)→ 观察(Observe) 交替迭代,直到任务完成。判断一个 AI 是不是智能体,标准很简单:如果它只能"回答",它不是智能体;如果它能"推进任务状态",它才是。

第五层:应用层(行动)——AI 的落地形态

要解决的问题:Agent 能力怎么变成可用的产品?

方案:把 Agent 能力封装为 Agent Skill、Workflow、Automation,面向具体业务场景落地:

  • • Workflow(工作流):固定流程,适合确定性任务
  • • Agent Skill(智能体技能):可复用的能力封装
  • • Automation(自动化):定时/触发式自动化执行

合理分工:Workflow 承载稳定流程,Agent 处理不确定决策,二者互补而非互斥。

AI Agent 完整运行流程:六步闭环

把五层架构串起来,一次完整的 Agent 任务是这样跑的:

  1. 1. 用户输入:用户下发指令 Prompt,进入上下文窗口 Context Window
  2. 2. 记忆增强:联动 Memory 会话记忆 + RAG 外部知识库,补充上下文与专业知识
  3. 3. LLM 推理:通过 Transformer 对 Token 序列做注意力计算,进行语义理解与初步生成
  4. 4. Agent 规划:智能体自主判断、拆解任务,决定是否需要多步骤执行或调用外部工具
  5. 5. 工具执行:基于 MCP 协议,调用 API、数据库、搜索引擎完成实际操作
  6. 6. 输出结果:汇总工具返回数据与模型推理结果,返回用户,并写入记忆存档

核心名词速查表

术语
一句话解释
Transformer
当前大模型核心架构,靠自注意力机制建模 Token 关联
Token
模型处理文本的最小单位(子词/单词/字符/符号)
Prompt
给模型的输入指令,设定角色、控制行为、规范输出
Context Window
上下文窗口,模型一次能处理的 Token 上限
Memory
短期会话记忆 + 长期持久记忆
RAG
检索增强生成,先检索知识库再生成答案
MCP
模型上下文协议,统一 AI 与工具/数据库/服务的通信标准
Tool Calling
模型主动识别需求、调用外部工具完成实操
Agent
叠加目标+规划+执行的自主智能系统

FAQ

Q:五个层级必须全部具备吗?A:不必。聊天机器人只用到前两层;接入工具后用到第三层;真正自主决策才需要第四层 Agent。层级越多,能力越强,复杂度也越高。

Q:RAG 和微调(Fine-tuning)选哪个?A:RAG 适合需要实时知识、可溯源的场景(客服、企业问答),改知识库即改答案、零成本;微调适合改变模型行为风格。两者可结合使用。

Q:现在学 AI Agent 开发,该从哪层入手?A:推荐从第三层入手——用现成框架(LangChain、Dify、Coze)接 MCP 工具,快速跑通"规划→调用工具→输出"闭环,再向上封装成应用。

总结

AI 底层架构的五层模型,本质是能力逐层叠加:模型会说话 → 记忆让 AI 不忘事 → 工具让 AI 能动手 → Agent 让 AI 会决策 → 应用让 AI 可落地。

留一个可复用的公式:

AI 应用 = 模型 + 记忆 + 工具 + 决策

下次看到任何 AI 产品,对照这张架构图,就能定位它用到了哪几层、还缺哪几层。