乐于分享
好东西不私藏

AI智能体工具全景分类总结

AI智能体工具全景分类总结

AI智能体工具全景分类总结

一、重新理解AI Agent

1.1 AI Agent发展背景

2025~2026年,AI Agent正从传统的聊天机器人(ChatBot)快速演进为具备自主理解目标、任务规划、工具调用、复杂任务执行、长期记忆、跨系统协同等能力的新型智能执行系统。
传统ChatBot的工作模式是被动响应——用户提问,模型生成回答,交互即结束。而Agent的工作模式是主动执行——理解用户意图,拆解任务步骤,调用外部能力,执行并反馈,直至目标完成。
对比维度
ChatBot
AI Agent
核心目标
回答问题
完成任务
交互模式
单轮/多轮对话
规划-执行-反馈循环
能力边界
模型内生知识
模型+工具+记忆+外部系统
状态管理
会话上下文
长期状态+任务进度持久化
典型代表
早期ChatGPT
OpenClaw、Claude Agent、Codex
ChatBot解决的是"回答问题",Agent解决的是"完成任务"。

1.2 Agent演进路线

AI Agent的发展并非严格的线性阶段,而是核心能力持续叠加与融合的过程。下图中,横轴代表时间演进,纵轴代表Agent的自主决策能力,而RAG与Tool能力作为横向渗透能力贯穿始终。
自主决策能力 ↑              │   Autonomous │  OpenClaw / Claude Agent / Hermes Agent   Agent      │  (自主规划 + 多步执行 + 持续学习)              │              │   Tool Agent │  Function Calling / MCP / 插件生态              │  (动态调用外部系统)              │              │   Workflow   │  LangGraph / Dify / Coze   Agent      │  (预定义流程 + 状态管理)              │              │   ChatBot    │  ChatGPT / Claude (基础对话)              │              └────────────────────────────────────────────→ 时间              2022    2023      2024      2025      2026   ═══════════════════════════════════════════════════════════   RAG能力(知识检索增强)━━━━━━━━━━━━━━━━━━━━━━━━━━━━→ 横向渗透   Tool能力(外部系统调用)━━━━━━━━━━━━━━━━━━━━━━━━━━━→ 横向渗透   ═══════════════════════════════════════════════════════════
RAG(检索增强生成)并非一个独立的"阶段",而是一种可以嵌入所有Agent形态的横向能力——从ChatBot的知识库问答,到Workflow Agent的信息检索节点,再到Autonomous Agent的实时知识获取,RAG无处不在。
Tool调用同样贯穿始终:ChatGPT Plugin(2023)即已实现工具调用,发展至今日的MCP统一协议,工具能力在不断标准化和深化。

1.3 当前Agent生态

当前工具已经不再局限于单一形态:
因此,Agent工具的核心区别不再是运行形态,而是其设计理念和能力边界。
类别
代表产品
核心特征
Agent开发框架
LangChain、LangGraph、Deep Agents
开发者通过代码构建Agent
企业AI应用平台
Dify、Coze、FastGPT
可视化/低代码构建AI应用
数据智能Agent
DB-GPT、Wren AI、SQLBot
面向数据查询与分析场景
自主Skill Agent
OpenClaw、Hermes Agent、WorkBuddy
能力驱动,动态组合
办公辅助Agent
WorkBuddy、CodeBuddy
本地文件与办公软件操作
Coding Agent
Cursor、Trae、Claude Code、Codex、OpenCode
软件工程场景深度优化

二、Agent核心能力模型

2.1 Agent 核心能力

AI Agent区别于传统应用的核心,在于它不仅能够生成内容,更能够规划任务、调用能力、保存上下文、操作外部系统。本章将Agent核心能力归纳为两个层级、四大能力
层级
能力
关键词
核心特点
典型场景
代表产品/技术
决策层(如何做事)
Workflow(工作流编排)
DAG、State、Graph、Human-in-loop
人设计路径,AI按流程执行,确定性高
企业固定业务流程、审批自动化
LangGraph、Dify Workflow、Coze
决策层(如何做事)
Skills(能力扩展)
Skill、Plugin、Function Calling
人提供能力模块,AI自主选择组合
个人助手、办公自动化、数据分析
OpenClaw Skill、Claude Skill、Coze Skill
执行层(基础设施)
Memory(长期记忆)
Context、Profile、History、Knowledge
保存用户信息与历史,实现持续交互
数字员工、个性化助手、长周期任务
Mem0、Zep、LangChain Memory
执行层(基础设施)
Tool(工具调用)
API、Database、Browser、MCP
连接外部系统,从"思考"到"执行"
数据查询、系统操作、自动化执行
Function Calling、MCP、Plugin
层级关系说明:Workflow与Skills解决"Agent如何决策"的问题——前者靠人预先设计,后者靠AI自主判断;Memory与Tool解决"Agent凭什么执行"的问题——前者提供历史经验,后者提供外部能力。四者共同构成完整Agent能力模型。

2.2 Workflow(工作流编排)

2.2.1 定义

Workflow是目前企业落地AI Agent最成熟的一种模式。
Workflow通过预定义节点、状态和流程,将复杂任务拆解为多个可监控、可干预的步骤。
其核心思想是:人负责设计任务执行路径,AI负责按照流程完成任务

2.2.2 核心执行模式

典型 Workflow Agent:
用户请求   ↓意图识别 → 路由到对应流程   ↓任务拆解 → 分解为子任务节点   ↓知识检索 → 从知识库/数据库获取上下文   ↓模型推理 → 各节点调用LLM处理   ↓工具调用 → 必要时调用外部API/数据库   ↓结果生成 → 汇总生成最终输出   ↓人工审核 → Human-in-loop节点(关键流程)
例如企业数据分析场景:
用户诉求:”分析本月收入下降原因”Workflow设计:  1. 指标识别节点 → 确认”收入””本月””下降”等关键指标定义  2. 数据查询节点 → 执行SQL查询收入数据(同比、环比)  3. 归因分析节点 → 识别异常维度(产品/地区/渠道)  4. 报告生成节点 → 输出分析报告与建议  5. 人工确认节点 → 报告推送业务负责人审核

2.2.3 核心技术

技术
作用
DAG(Directed Acyclic Graph)
描述任务执行顺序
State Machine(状态机)
管理任务状态变化
Graph Workflow
支持复杂分支流程
Human-in-loop
人工介入和审核

2.1.4 Workflow特点

优势
局限性
不适用场景
流程稳定,执行结果高度可控
灵活性有限,难以应对未预定义的场景
高度不确定的探索性任务(如开放域市场调研)
便于监控审计,每个节点可追踪
需要业务人员提前设计流程
需要实时动态调整策略的任务
适合企业合规与审批场景
复杂流程维护成本高
极端长尾、低频的偶发任务

2.3 Skills(能力扩展)

2.3.1 定义

Skills是Agent对外扩展能力的重要方式。
其核心思想是:人提供能力模块,AI根据任务自主决定什么时候调用、如何组合
Skill本质上是一组可被Agent调用的能力单元,包含指令(Instruction)、知识(Knowledge)、工具(Tools)和执行逻辑(Execution Logic)
以数据Agent为例的Skill拆解:
Data Agent ├── SQL Skill(生成SQL→查库→返回结果) ├── Metadata Skill(理解数据字典与指标定义) ├── Lineage Skill(追踪数据血缘关系) ├── Chart Skill(自动选图型→生成可视化) └── Report Skill(汇总分析→生成报告)

2.3.2 执行过程

用户诉求:”分析收入下降原因”Agent自主决策链路:  Step 1: 调用 Metadata Skill → 确认”收入”指标定义与口径  Step 2: 调用 SQL Skill → 生成并执行查询语句  Step 3: 调用 Analysis Skill → 对查询结果进行多维下钻  Step 4: 调用 Chart Skill → 生成趋势图与对比图  Step 5: 调用 Report Skill → 汇总生成完整报告

2.3.3 Skill核心特点与边界

优势
局限性
不适用场景
能力可插拔,扩展灵活
Skill设计质量要求高(需清晰描述能力边界)
需要严格合规审计的场景(AI自主选择路径,难以预审)
支持复杂任务的动态组合
调试难度较大(链路不可完全预知)
对响应延迟极度敏感的场景(自主决策增加开销)
复用好,一个Skill可被多Agent共享
结果不完全固定,存在一定随机性
结果必须100%确定的业务(如财务结算)

2.4 Memory(长期记忆)

2.4.1 定义

Memory是Agent区别于传统ChatBot的重要能力——Agent不仅处理当前任务,还能保存并利用历史交互信息,实现持续理解用户、积累经验、个性化服务
普通ChatBot每次对话独立,而具备Memory的Agent能够在多次会话中"记住"用户偏好与背景。

2.4.2 Memory类型

类型
说明
存储方式示例
短期记忆(会话级)
当前任务上下文、对话轮次
会话缓存(Redis)
长期记忆(用户级)
用户习惯、偏好、历史任务
向量数据库(如Pinecone)+ 关系库
知识记忆(企业级)
企业知识库、制度文档
RAG系统(如Dify知识库)
经验记忆(任务级)
历史任务执行结果与反馈
结构化日志 + 经验库

2.4.3  示例

首次交互:  用户:”我负责医院运营分析  Agent记录  行业:医疗 | 角色:运营分析 | 关注指标:收入/设备利用率/运营效率后续交互:  用户:”分析一下最近的经营异常  Agent结合记忆理解:     ”经营”在医疗场景主要指临床运营指标     用户历史关注设备利用率和收入     自动聚焦”设备开机率下降”和”收入同比变化”  生成针对性分析,而非通用回答

2.4.4 特点与边界

优势
局限性
不适用场景
支持长期连续交互,体验好
需设计存储架构与生命周期管理
高度匿名化、一次性的查询场景
实现个性化服务
涉及用户数据隐私与合规问题
对数据隔离要求极高的多租户场景
积累任务经验,越用越"聪明"
记忆污染可能导致错误累积
需严格"无状态"处理的场景

2.5 Tool(工具调用)

2.5.1 定义

Tool是Agent连接外部世界的关键能力。Tool让Agent从"会思考"变成"能执行"——通过调用外部API、操作数据库、控制浏览器、执行代码等,Agent得以在真实世界中产生实际影响。
无Tool的Agent:用户输入 → AI生成文本回答 → 结束
有Tool的Agent:用户输入 → Agent规划 → 调用工具 → 获取执行结果 → 反馈优化 → 任务完成

2.5.2 常见Tool类型

工具类型
作用
代表技术/协议
Database
查询数据库、执行SQL
JDBC、SQLAlchemy、MCP Database
API
调用业务系统/第三方服务
RESTful、GraphQL、MCP Server
Browser
访问网页、抓取信息、自主操作UI
Playwright、Puppeteer、Computer Use
Python/Runtime
执行数据分析、计算任务
Python REPL、Code Interpreter
File System
读写文件、管理目录
Local File MCP、S3
RPA
操作企业桌面软件界面
UI Automation、Computer Use
MCP
统一工具连接协议
Model Context Protocol

2.5.3  特点与边界

优势
局限性
不适用场景
连接企业系统,打通数据孤岛
需严格的权限管理与认证机制
无外部系统可调用的纯文本场景
支持端到端自动化执行
存在安全风险(误操作/越权)
高危操作场景(如直接生产环境变更)
能力扩展无限(理论上可接入任何系统)
需要工具治理(版本、可用性、审计)
工具文档不全或接口不稳定的系统

三、Agent RunnTime

3.1 Runtime定义

如果说Workflow是Agent的骨架(提供执行结构)、Skills是手脚(提供行动能力)、Memory是大脑皮层(存储经验)、Tool是感官(感知和作用于外部),那么Runtime就是承载这一切的神经系统——负责让所有组件协同运转,管理Agent生命周期、任务执行状态以及能力调用的运行环境。
Runtime解决的核心问题:
Agent进程如何启动、暂停、恢复、终止?
任务执行状态如何持久化与恢复?
多Agent之间如何通信与协调?
Tool调用如何路由、限流、重试、超时?
Agent行为如何监控、追踪与审计?

3.2  Runtime vs Orchestration(运行与编排的区别)

维度
Orchestration(编排)
Runtime(运行)
关注点
任务逻辑设计(做什么、按什么顺序)
任务执行保障(怎么做、如何稳定运行)
产物
Workflow定义、DAG图、Skill组合策略
进程管理、状态存储、通信管道
类比
建筑图纸
施工队+脚手架+水电供应
代表技术
LangGraph定义图、Coze画布
LangGraph Checkpointer、Agent进程调度
两者关系:Orchestration定义"剧本",Runtime负责"上演"。

3.3 Runtime核心组成和工具

模块
作用
与第二章能力的对应
Planning Engine
任务理解、拆解、执行路径生成
对应Workflow的"设计态"与Skills的"决策态"
State Management
保存执行状态,支持断点续传和回滚
支撑Workflow的State Machine运行
Memory Management
管理短期上下文与长期记忆的存取
直接承载Memory能力的运行时实现
Tool Runtime
执行Tool调用,处理路由、重试、超时、鉴权
承载Tool能力的执行环境
Agent Communication
多Agent间的消息路由与协作协议
多Agent系统的基础设施
Evaluation & Observability
追踪、评估、监控Agent行为
贯穿所有能力的运维层
┌───────────────────────────────────────┐│           用户 / 上层应用              │└───────────────────────────────────────┘                     │  ┌──────────────────┴──────────────────┐  │          Agent Runtime 层            │  │  ┌─────────┐ ┌─────────┐ ┌────────┐ │  │  │Planning │ │ State   │ │ Memory │ │  │  └─────────┘ └─────────┘ └────────┘ │  │  ┌─────────┐ ┌─────────┐ ┌────────┐ │  │  │  Tool   │ │  Comm   │ │  Eval  │ │  │  └─────────┘ └─────────┘ └────────┘ │  └──────────────────┬──────────────────┘                     │  ┌──────────────────┴──────────────────┐  │         外部系统 / 基础设施           │  │  (DB、API、File、第三方服务)          │  └─────────────────────────────────────┘
框架/工具
定位
核心能力
适用场景
LangGraph
Agent状态管理与流程执行框架
State Graph、Checkpoint、Human-in-loop
复杂Workflow Agent生产级部署
Deep Agents
LangGraph高级封装
内置Planner、Sub-agent委派、文件操作
快速构建高级自主Agent
AutoGen
多Agent通信框架
Agent对话协议、群聊管理、工具共享
多Agent协作与博弈场景
CrewAI
角色协作框架
角色定义、任务委派、顺序/并行执行
模拟团队协作的Agent系统
LangSmith
观测与运维平台(全链路贯穿)
Trace、Evaluation、Debug、Monitoring
Agent生产环境质量保障

四、Agent工具生态分类

4.1 Agent工具分类逻辑

第一维度:决策模式(决定Agent"如何思考")
Workflow Agent:人设计路径,AI按流程执行 → 确定性高、易治理
Skills Agent:人提供能力,AI自主选择组合 → 灵活性强、扩展性好
Coding Agent:AI深入软件工程专业领域 → 垂直能力深耕
第二维度:开发方式(决定"谁来构建、如何构建")
编码开发框架:开发者通过代码构建Agent(LangGraph、AutoGen)
低代码/可视化平台:拖拽式构建Agent(Dify、Coze)
垂直应用产品:开箱即用的Agent产品(Cursor、WorkBuddy)
行业专用Agent:针对专业领域优化(DB-GPT、SQLBot)
两个维度交叉,决定工具的能力边界和适用场景。

4.2 Workflow Agent生态

4.1.1 编码开发(LangChain生态)

工具
运行环境
多Agent
开源/商业
一句话定位
LangChain
基础框架
❌ 基础
开源 MIT
模型/工具/Prompt抽象层,Agent应用的"基石"
LangGraph
基础框架
✅ 原生
开源 MIT
状态图编排引擎,多Agent协作的"操作系统"
Deep Agents
基础框架
✅ 封装
开源
LangGraph的高级封装,内置规划/文件操作/子Agent委派
LangSmith
云端SaaS
✅ 配套
商业
全链路追踪/调试/评估/监控/部署,生产级运维
LangChain
LangChain是当前最广泛使用的LLM应用开发框架,将大模型、Prompt、Memory、Tool、Retriever等组件进行抽象封装。它更像Agent应用开发的基础组件库,而非完整的执行平台。
核心能力
说明
Model抽象
统一不同厂商模型调用接口
Prompt管理
模板化提示词与版本管理
Chain
组合任务流程(顺序/并行)
Agent
动态工具调用的基础实现
Memory
会话上下文保存机制
优势
不足
生态成熟,社区活跃
复杂Agent的状态控制能力有限
扩展丰富(数千集成)
生产级状态管理需额外方案(需搭配LangGraph)
LangGraph
LangGraph是构建复杂Agent应用的状态图编排框架,使用Graph描述Agent执行过程,相比LangChain的Chain模式,提供了更强大的状态管理与流程控制能力。
用户请求              ↓          Planner节点       ↙          ↘   SQL Agent     Search Agent   (子图)        (子图)       ↘          ↙      Result Agent节点              ↓          输出结果
核心能力
说明
State
持久化保存任务执行状态
Graph
用节点和边描述复杂执行路径
Node
封装Agent能力单元
Edge
控制流程跳转(条件/并行/循环)
Checkpoint
状态快照,支持任务恢复与回溯
优势
不足
流程控制力强,适合生产环境
开发复杂度较高
支持复杂多Agent协作
需要较强编码能力
与LangSmith无缝集成
学习曲线陡峭
Deep Agents
Deep Agents是基于LangGraph构建的高级Agent框架,面向需要自主规划与执行的复杂任务场景。
核心能力
说明
Planning
自动将目标拆解为多步计划
Sub-Agent委派
动态创建子Agent处理子任务
File System操作
读写文件、目录管理
长期任务支持
断点续传、异步执行
适用场景
说明
自动化研究
自主搜索→阅读→总结→生成报告
软件开发辅助
理解代码库→生成修改→测试验证
复杂数据分析
多源数据采集→清洗→分析→可视化
LangSmith
LangSmith并非开发框架,而是Agent应用的监控、调试与评估平台,贯穿开发到生产的全流程。
能力
说明
Trace
查看Agent完整执行链路(含模型调用、工具执行)
Evaluation
自动化评估Agent输出质量
Debug
定位失败节点与根因
Monitoring
生产环境实时监控与告警
典型Trace链路:
用户问题 → Prompt渲染 → LLM调用 → Tool决策 → SQL执行 → 结果整合 → 最终回答  ↓         ↓           ↓          ↓          ↓          ↓         ↓ 耗时5ms     12ms       1.2s       300ms      45ms       20ms     10ms

4.1.2 可视化低代码Workflow平台

工具
运行环境
多智能体
开源/商业
一句话定位
Coze(扣子)
云端SaaS
✅ 编排
商业
零代码搭Bot,插件最丰富,5分钟上线。2.5已支持Skill和记忆,Workflow与Skills正在融合
腾讯元器
云端SaaS
✅ 编排
商业
腾讯版Coze,依托混元大模型,深度集成微信/QQ生态,可发布到微信小程序
Dify
自托管/云端
✅ 编排
开源 Apache 2.0
可视化工作流+RAG,企业级私有化部署,开源社区活跃
FastGPT
自托管/云端
✅ 编排
开源 MIT
基于LLM的知识库问答系统,可视化Flow编排,可被Coze/Dify集成
DB-GPT
自托管
✅ 编排
开源 Apache 2.0
AI数据应用开发框架,AWEL编排+GraphRAG,专注数据领域
Coze(扣子)
Coze面向业务人员和开发者,提供零代码搭建Bot和Workflow的能力,是当前插件生态最丰富的平台。
核心能力
说明
Workflow
可视化流程编排(拖拽式)
Plugin
海量插件市场,一键接入
Knowledge
知识库管理(支持多格式文档)
Memory
用户级长期记忆(2.5版本)
Skill
能力扩展机制(2.5版本)
优势
适用场景
发展趋势
上手极简,5分钟搭建Bot
企业助手、客服Bot、内容生成
正从纯Workflow平台演进为 Workflow + Skill + Memory 融合平台
发布渠道丰富(飞书/微信/API)
营销活动、信息聚合
与Skills的融合边界越来越模糊
Dify
Dify是开源的企业级LLM应用开发平台,强调私有化部署与RAG能力。
核心能力
说明
Workflow
Agent流程编排(支持Agent节点)
RAG
企业知识库问答(多种检索策略)
Plugin
工具扩展(支持自定义)
Model管理
多模型统一接入与切换
优势
适用场景
开源,可私有化部署,数据不出域
企业知识助手(内部制度/产品文档)
企业IT接受度高,生态成熟
内部ChatBI(自然语言查数据)
社区版功能强大
智能客服与工单自动化
FastGPT
FastGPT专注于知识库问答场景,部署简单,RAG能力突出。
核心能力
说明
知识库管理
多格式文档导入、切片、向量化
Flow编排
可视化编排问答流程
模型接入
支持主流开源/商业模型
优势
适用场景
知识库问答开箱即用
企业产品知识库、制度问答
MIT协议,可自由修改
可被Coze/Dify等平台集成
部署轻量
教育机构知识库、个人知识助手
DB-GPT
DB-GPT面向数据智能场景,用自然语言访问数据库,是数据团队的专用Agent框架。
核心能力
说明
Text2SQL
自然语言生成SQL并执行
AWEL
Agent工作流编排(数据专用)
GraphRAG
基于数据血缘的知识增强
数据分析
自动归因、异常检测
优势
适用场景
深度优化数据场景
企业数据问答与BI分析
支持复杂数据源
数据质量检查与数据助手
开源可定制
数据中台智能化改造

4.3 Skills Agent生态

4.3.1 Skills Agent核心理念

Skills Agent与Workflow Agent的本质区别:
维度
Workflow Agent
Skills Agent
核心思想
流程驱动——按预设路径执行
能力驱动——按需动态组合
执行方式
流程节点顺序/条件执行
Agent自主判断调用哪个Skill
扩展方式
增加/修改流程节点
增加Skill能力单元
核心资产
Workflow模板库
Skill能力库
代表产品
Dify、Coze(早期)
OpenClaw、Claude Agent、Codex
未来企业Agent竞争的核心不再是模型大小,而是谁拥有更丰富、更专业、更可靠的Skill生态。

4.3.2 Skill 架构

核心逻辑:AI作为大脑自主理解目标→拆解任务→选择技能→执行→反思调整,路径由AI动态决定,灵活性强。
                         ┌─────────────┐                         │    Agent    │                         │  (决策大脑) │                         └──────┬──────┘                                │                    ┌───────────┴───────────┐                    │   Skill Selection     │                    │  (技能选择与组合)      │                    └───────────┬───────────┘                                │         ┌──────────────────────┼──────────────────────┐         │                      │                      │    ┌────▼────┐          ┌──────▼──────┐       ┌──────▼──────┐    │Metadata │          │ Instruction │       │    Tool     │    │(能力描述)│          │ (使用指南)  │       │ (执行能力)  │    └─────────┘          └─────────────┘       └─────────────┘         │                      │                      │         └──────────────────────┼──────────────────────┘                                │                    ┌───────────┴───────────┐                    │   Skill Runtime       │                    │  (技能运行环境)        │                    └───────────┬───────────┘                                │                    ┌───────────┴───────────┐                    │   External System     │                    │  (数据库/API/文件)     │                    └───────────────────────┘
组件
作用
Skill Metadata
描述技能名称、能力边界、输入输出格式
Instruction
告诉Agent该Skill适用于什么场景、如何使用
Tool
实际执行能力(代码/API/脚本)
Knowledge
Skill所需的领域知识(可选)
Memory
该Skill的历史调用经验(可选)
Runtime
Skill运行所需的依赖环境

4.3.3 Skill 核心能力

Skill Discovery 技能发现
Agent首先需要知道"有哪些能力可用"。类似人类的认知——医生知道自己是内科还是外科,Agent通过Skill Registry获取能力清单:
Skill Registry├── SQL Skill(数据库查询)├── Search Skill(网页搜索)├── Excel Skill(表格处理)├── Email Skill(邮件发送与分类)├── Coding Skill(代码生成与调试)├── Report Skill(报告生成)└── Browser Skill(网页操作)
Skill Selection 技能选择
当前任务应该调用哪个(或哪些)Skill?
选择方式
原理
适用场景
LLM直接决策
将Skill列表注入Prompt,由LLM选择
Skill数量<50,简单场景
向量检索(RAG式)
将Skill能力描述Embedding,按相似度召回Top-K,再经LLM精排
Skill数量>100,企业级生态
Skill Composition 技能组合
高级Agent不是简单调用一个Skill,而是将多个Skill组合为复杂工作流
数据分析任务 =  Data Query Skill(查询数据)  + Data Quality Skill(质量检查)  + Visualization Skill(可视化图表)  + Report Skill(生成报告)  → 全自动分析报告输出

4.3.4 Skill生命周期

      ┌─────────┐      │ 创建    │ 定义Skill能力边界、编写Instruction      └────┬────┘           ↓      ┌─────────┐      │ 开发    │ 实现Tool逻辑、编写测试用例      └────┬────┘           ↓      ┌─────────┐      │ 注册    │ 发布到Skill Registry,标注元数据      └────┬────┘           ↓      ┌─────────┐      │ 测试    │ 在沙箱环境验证Skill效果      └────┬────┘           ↓      ┌─────────┐      │ 发布    │ 上线至生产环境,供Agent调用      └────┬────┘           ↓      ┌─────────┐      │ 调用    │ Agent在任务中动态选择并执行      └────┬────┘           ↓      ┌─────────┐      │ 优化    │ 根据执行日志与反馈持续迭代      └─────────┘

4.3.5 Skills生态发展路线

阶段
时间
代表技术
特征
不足
Function Calling
2023-2024
OpenAI Function Calling、Anthropic Tool Use
模型调用单个函数,标准化调用接口
能力粒度细,无复用与生态管理
Plugin
2024-2025
ChatGPT Plugin、Coze Plugin
封装API为插件,非开发者可用
平台绑定严重,生命周期管理弱
Skill
2025-至今
OpenClaw Skill、Claude Skill、MCP
封装完整能力(含指令+知识+工具+逻辑),跨平台复用
仍在早期,治理标准待成熟

4.3.6 Skill生态分类

工具
运行环境
记忆机制
多智能体
开源/商业
一句话定位
Hermes Agent
桌面客户端
跨会话持久记忆
✅ 原生
开源 Apache 2.0
自主学习+技能沉淀,能"长大"的数字员工,越用越懂你
WorkBuddy
桌面客户端
会话级
✅ 并行
商业
直接操作本地文件,Word/Excel/PPT深度集成,"能动手"的AI同事
OpenClaw
桌面/自托管
支持持久化
✅ 融合
开源 MIT
跨20+平台AI网关,49个内置技能,原生支持运行Claude Code/Codex
CodeBuddy
桌面客户端
会话级
❌ 单
商业
编程辅助+办公自动化,腾讯生态,跨界融合

重要说明:Coze 2.5已全面支持Skill和记忆机制,这表明Workflow和Skills两大分支正在加速融合——Workflow提供确定性的执行骨架,Skills提供灵活的行动能力,二者共存互补

Hermes Agent
评估维度
详细说明
开源协议
MIT
运行环境
桌面/自托管(Linux / macOS / Windows / WSL2 / Android Termux)
记忆架构
跨会话持久记忆(三层:长效语义记忆 + 工作记忆 + 情景日志)
多智能体
原生支持,最多8个并行子代理,独立上下文/终端/工具集
核心差异化
自进化技能系统:执行任务→自动提炼为Skill文件→后续复用优化
模型支持
模型无关,接入OpenAI/Anthropic/DeepSeek/智谱GLM/混元/Ollama本地模型
消息网关
统一接入Telegram/Discord/Slack/微信/QQ/飞书/企业微信等20+平台
其他能力
定时任务(cron调度)、语音交互、MCP兼容
首选场景
企业数字员工(日报/数据监控)、有长期记忆的社群运营官
不适用场景
要求零运维、完全开箱即用的非技术团队
WorkBuddy
评估维度
详细说明
开源协议
商业(闭源)
运行环境
桌面客户端(macOS / Windows)
记忆机制
会话级
多智能体
支持并行任务执行(后台多任务并发)
核心差异化
深度操作本地文件;专精Excel(去重/汇总/透视/5万行秒级)、Word、PPT
工作模式
Ask(纯问答)、Plan(先出方案)、Craft(直接执行)
模型支持
混元 / DeepSeek / GLM / Kimi / MiniMax(自由切换)
远程控制
支持手机端(微信/企业微信)远程操控电脑执行任务
扩展能力
超20种内置Skills技能包;内置定时任务调度器
企业安全
完整操作审计日志 + 权限管控体系
首选场景
Excel批量数据处理、周报/日报自动生成、本地文件批量整理
不适用场景
需要自托管或私有化部署的严格合规场景
OpenClaw
评估维度
详细说明
开源协议
MIT
运行环境
桌面 / 自托管
记忆机制
支持持久化存储
多智能体
融合型(多Agent协同)
核心差异化
49个内置Skill(文件/浏览器/代码/办公/自动化);原生支持运行Claude Code和Codex
跨平台能力
支持20+消息平台统一接入
模型支持
灵活对接多种模型
首选场景
极客自托管全能助理、跨平台消息聚合与自动化响应
不适用场景
需要商业级企业支持与SLA保障的正式生产环境
CodeBuddy
评估维度
详细说明
开源协议
商业(闭源)
运行环境
桌面客户端 / IDE插件
记忆机制
会话级
多智能体
单Agent
核心差异化
编程辅助(代码生成/补全/解释/单测/Bug修复)+ 办公自动化(腾讯文档/企业微信打通)的跨界融合
模型支持
腾讯混元大模型
生态绑定
深度集成腾讯云、CODING DevOps、TAPD、腾讯文档、企业微信
首选场景
腾讯生态内的开发者与业务人员
不适用场景
非腾讯生态或需要多模型自由切换的团队
场景速选矩阵
用户画像 / 需求
首选工具
次选工具
不推荐
需要长期记忆与自进化的数字员工
Hermes Agent
OpenClaw
WorkBuddy
财务/运营人员批量处理Excel
WorkBuddy
CodeBuddy
极客自托管跨平台AI助理
OpenClaw
Hermes Agent
WorkBuddy
腾讯生态内开发者(编程+办公)
CodeBuddy
OpenClaw
跨20+消息平台统一运营
OpenClaw
Hermes Agent
WorkBuddy
手机远程操控电脑执行任务
WorkBuddy
注重数据隐私、需本地部署
Hermes Agent / OpenClaw
WorkBuddy / CodeBuddy

4.4 Coding 编程框架

核心定位:专注软件工程场景,理解代码库→生成/修改代码→运行测试→调试重构。
代码理解深度、上下文长度、编程准确率是核心价值

特别说明:以下工具的使用形态已多元化。例如Codex既有终端CLI,也有官方桌面GUI(2026年2月发布macOS版,3月发布Windows版),还有Chrome扩展和手机远程控制。分类以核心定位与工作方式为准

4.4.1 工作方式维度

工作方式
特征
代表工具
适合场景
协作式(Copilot)
AI与开发者共同编写,实时交互建议
Cursor、Claude Code
日常编码、结对编程
委托式(Delegate)
AI自主完成子任务,开发者审核结果
Codex、Trae SOLO
明确模块开发、重构任务
自主式(Autonomous)
AI全权负责从需求到部署,可无人值守
OpenCode、Codex Goal模式
原型生成、标准化项目搭建

4.4.2  IDE嵌入式Coding Agent

工具
运行环境
工作方式
多智能体
开源/商业
一句话定位
Cursor
IDE插件
对话式交互
✅ 并行(最多8个)
商业
跨文件协作编辑,"结对编程"体验最佳
Trae(Builder模式)
IDE插件
对话式生成
❌ 单
商业
一句话生成完整项目框架,多模型切换,性价比最高
Trae(SOLO模式)
IDE/桌面
自主委托
✅ 多智能体
商业
AI主导从需求到部署的全流程,可编排多智能体协作

4.3.3 多形态Coding Agent(CLI/桌面/Web)

工具
使用形态
工作方式
多智能体
开源/商业
一句话定位
Claude Code
终端CLI
交互式协作
✅ Agent Teams
商业
超长上下文(1M token),大规模重构首选
OpenAI Codex
CLI/桌面GUI/Web/Chrome扩展
委托式异步 + 自主操作
✅ 并行 + Computer Use
商业
多入口并行,可自主操作图形界面
OpenCode
终端CLI
自主编码
❌ 单
开源 MIT
开源编码代理,连接仓库/终端/工具

4.3.4 各个产品详情表

Cursor
评估维度
详细说明
运行环境
VS Code分支,IDE深度集成
工作方式
协作式,侧边栏Agent模式
多智能体
后台并行,最多8个并行Agent,在云端VM中运行
模型支持
Claude、GPT、Gemini等
核心差异化
跨文件协作编辑(Composer),Tab补全无限
定价
$20/月起
首选场景
日常编码、结对编程、跨文件重构
Claude Code
评估维度
详细说明
运行环境
终端CLI
工作方式
交互式协作,需人工审批编辑
多智能体
Agent Teams(子Agent委派)
核心差异化
1M超长上下文,Hooks + Subagents + Skills
定价
$20/月起
首选场景
大规模重构、深度推理、复杂代码库分析
OpenAI Codex
评估维度
详细说明
运行环境
CLI / 桌面GUI(macOS/Windows)/ Web / Chrome扩展
工作方式
委托式异步,Goal模式可无人值守运行数小时
多智能体
并行执行,git worktree隔离
核心差异化
GPT-5.5兜底,Terminal-Bench 2.0得分82.7%
Computer Use
自主操作图形界面(2026年新能力)
扩展能力
技能管理(Skills)+ 自动化定时任务 + Chrome浏览器操作
角色插件
6款岗位插件,覆盖110项技能、62个外部应用
周活跃用户
500万+,其中20%为非程序员
定价
$20/月起
首选场景
后台自动跑任务、多入口并行开发
OpenCode
评估维度
详细说明
运行环境
终端CLI
工作方式
自主编码
多智能体
单Agent
开源协议
MIT
核心差异化
开源多模型可定制平台
首选场景
开源编码代理,连接仓库/终端/工具链
Gemini CLI / Antigravity CLI
评估维度
详细说明
运行环境
终端CLI → 正迁移至Antigravity桌面平台
工作方式
对话式ReAct循环,1M token上下文窗口
关键变化
Google于2026年5月12日宣布Gemini CLI将迁移至Antigravity CLI,2026年6月18日截止
首选场景
Google生态内的开发者(需关注迁移计划)

五、Codex 的形态演进

由于Codex的变化最大,这里单独说明:
维度
说明
使用形态
终端CLI / 桌面GUI(macOS+Windows)/ 网页版 / Chrome扩展 / 手机远程控制
核心能力升级
多线程并行 + Worktree隔离 + 可视化审阅 + Computer Use(自主操作图形界面)
扩展能力
技能管理(Skills)+ 自动化定时任务 + Chrome浏览器操作
角色插件
6款岗位插件(数据分析、创意制作、销售、产品设计、股票投资、投资银行),覆盖110项技能、62个外部应用
用户规模
周活跃用户超500万,非开发者占20%,增长速度比开发者快3倍以上
定位变化
从"终端委托式编程工具"演变为"支持多入口、跨形态的综合性AI编程平台",正从编程工具向企业工作平台扩展
OpenAI于2026年6月宣布Codex将被整合入ChatGPT,使全球10亿用户能够体验智能体赋能职场和生活。

六、Skill生态全景

6.1 大厂Skill商店

2026年,Skill商店已成为大厂争夺AI时代入口的关键渠道,其作用类似于移动时代的"App Store"。
厂商
核心平台 / 商店
特点与生态定位
腾讯
SkillHub(ClawHub本土化)
依托微信小程序生态,将线下及线上服务封装为标准化Skill
阿里巴巴
阿里云云Skills官网
将云产品能力封装为Skill,首批覆盖12条产品线
字节跳动
扣子(Coze) Skill商店
面向普通开发者,降低创作门槛并支持Skill售卖
百度
文心插件中心
与文心一言大模型和搜索生态绑定
智谱AI
AgentMore Skills广场
整合官方严选、Skill Hub和开源社区三个模块

6.2 专业Skill平台与市场

平台名称
核心定位
关键数据与特点
AgentSkillsHub
开源Agent技能目录
收录大量项目,提供安全分级和质量评分
ClawHub
OpenClaw官方技能商店
被称为"AI Agents的npm"
NanoSkill.ai
营销领域专用平台
聚焦营销工作流
Full Stack Skills
全栈开发技能导航站
拆分为42个可独立安装的包,面向AI编码智能体

6.3 其他Skill Agent及框架

项目名称
类型
核心特点
Nanobot
轻量级开源框架
约4000行代码实现OpenClaw核心能力
goclaw
开源框架
Go语言实现,兼容OpenClaw和AgentSkills规范
Piagent
轻量级网关
功能类似OpenClaw,设计更简洁
Claude Code Skills
开源技能库
拥有数百个技能,支持多款主流AI编程工具

七、工具关系全景图

┌─────────────────────────────────────────────────────────────────────────────┐                         应用层(开箱即用)                                    ┌───────────────────┐  ┌───────────────────┐  ┌────────────────────────┐    Workflow 平台        Skills 桌面产品      Coding 工具                Coze / 腾讯元器      Hermes Agent         Cursor / Trae              Dify / FastGPT       WorkBuddy            Claude Code (CLI)          DB-GPT               OpenClaw             Codex (CLI/GUI/Web)                             CodeBuddy            OpenCode (CLI)            └───────────────────┘  └───────────────────┘  └────────────────────────┘                                                                                   └───────────────────────┼───────────────────────┘                                                                                             ┌───────────────────────────────┴───────────────────────────────────────┐│                        框架层(需要编程)                                ││                Deep Agents(高级Agent封装)                              ││                LangGraph(状态图编排引擎)[reference:113]                  ││                LangChain(基础抽象层)                                   ││                AutoGen / CrewAI(多Agent框架)[reference:114][reference:115]    ││  └───────────────────────────────┬───────────────────────────────────────┘│                                                                             ┌───────────────────────────────┴───────────────────────────────────────┐│                        运维层(贯穿全流程)                              ││            LangSmith(追踪/调试/评估/监控/部署)                         ││  └───────────────────────────────────────────────────────────────────────┘│                                                                             核心主线:Workflow(确定性)  ←→  Skills(自主性)  ←→  Coding(垂直深耕)  横向贯穿:RAG(知识增强)  +  Tool(外部连接)  +  Memory(持续学习)    └─────────────────────────────────────────────────────────────────────────────┘

八、快速选型决策指南

8.1 场景→工具快速索引

用户需求
首选分类
具体工具及推荐理由
业务人员,零代码搭Bot
Workflow 可视化
Coze:插件最丰富,2.5已融合Skills
企业IT,知识库问答+私有化
Workflow 可视化
Dify:开源、可私有化、RAG能力强
数据团队,AI分析数据库
Workflow 可视化
DB-GPT:专为数据场景设计,AWEL+GraphRAG
普通白领,整理电脑文件
Skills 桌面
WorkBuddy:直接操作本地Word/Excel/PPT
极客,跨平台自托管AI助理
Skills 桌面
OpenClaw:开源、跨20+平台、可定制
想有个能学习的AI伙伴
Skills 桌面
Hermes Agent:持久记忆+技能沉淀
程序员,日常编码提速
Coding IDE
Cursor:跨文件协作编辑,体验最佳
程序员,从零生成项目
Coding IDE
Trae(Builder):一句话生成完整项目框架
架构师,重构大项目
Coding 多形态
Claude Code:1M超长上下文,深度推理
程序员,丢后台自动跑任务
Coding 多形态
Codex:多入口+并行,Goal模式无人值守
数据分析师,自然语言查库
Coding 垂直
SQLBot:Text-to-SQL即插即用
硬核开发者,自建AI平台
Workflow 编码
LangGraph + LangSmith:最强控制力

8.2 三维决策矩阵

决策维度
权重建议
Workflow Agent
Skills Agent
Coding Agent
确定性要求(结果可预期)
高→选Workflow
⭐⭐⭐
⭐⭐
灵活性要求(场景多变)
高→选Skills
⭐⭐⭐
⭐⭐
编程深度要求(代码产出质量)
高→选Coding
⭐⭐
⭐⭐⭐
上线速度(快速验证)
高→选低代码
⭐⭐⭐
⭐⭐
私有化/合规要求
高→选开源
视具体工具而定
视具体工具而定
视具体工具而定
非技术人员参与度
高→选可视化
⭐⭐⭐

8.3 企业级就绪度速查

工具
私有化部署
定价模型
模型灵活性
可观测性
企业级就绪评级
Dify
✅ 自托管
开源社区版免费/企业版付费
✅ 多模型
✅ 内置
⭐⭐⭐⭐⭐
DB-GPT
✅ 自托管
开源免费
✅ 多模型
✅ 内置
⭐⭐⭐⭐
LangGraph+Smith
❌ Smith为SaaS
按量付费/订阅
✅ 任意模型
✅ 最强(Smith)
⭐⭐⭐⭐⭐
Coze
❌ 纯云端
按量/订阅
⚠️ 受限
⚠️ 基础
⭐⭐⭐
FastGPT
✅ 自托管
开源免费
✅ 多模型
⚠️ 基础
⭐⭐⭐⭐
OpenClaw
✅ 自托管
开源免费
✅ 任意模型
⚠️ 基础日志
⭐⭐⭐
Cursor/Codex
❌ 桌面客户端
订阅制($20/月起)
❌ 固定模型
⚠️ 基础
⭐⭐(个人)⭐⭐⭐(团队)

九、安全、治理与合规

随着Agent自主调用Tool和执行任务的能力不断增强,安全与治理成为企业规模化采纳Agent的前置条件。2026年,企业AI Agent安全建设迎来关键分水岭:安全防护正式从事后取证审计转向运行时实时拦截,从外挂式被动防护升级为原生集成式主动防御。

9.1 Tool调用权限管理

管控层级
说明
实现方式
哪些Tool可调用
根据Agent身份/角色授权Tool白名单
Tool Registry + RBAC
哪些操作需审批
高危操作(写数据库、发邮件、部署)强制人工确认
Human-in-loop Gate
调用频次与配额
防止无限循环或资源滥用
Rate Limiter + Quota
数据脱敏
敏感字段在返回Agent前脱敏
数据代理层

9.2 审计追踪

审计维度
记录内容
用途
行为链路
完整的Trace(用户输入→规划→Tool调用→输出)
问题回溯、合规举证
决策依据
Agent为何选择某个Skill/Tool的推理日志
可解释性、模型审计
干预记录
人工修改/终止Agent的记录
责任界定
产出物版本
Agent生成的文件/代码/报告的版本历史
变更管理
亚信安全提出的智能体安全管控方案以"身份可信、授权有效、调用可控、审计可溯"为核心目标,覆盖智能体、MCP、大模型、Skills、知识库等AI资产的体系化全生命周期安全治理

9.3 Fail-Safe与降级机制

机制
说明
超时熔断
Tool调用超过阈值自动中断
循环检测
检测到Agent在相似状态间循环时自动暂停
回滚能力
状态Checkpoint支持回退到安全节点
人工紧急停止
提供管理员全局Kill Switch
降级模式
自主Agent降级为只读/仅建议模式

9.4 数据隐私与合规

关注点
建议措施
训练数据隔离
企业数据不用于模型训练(商业API需签署数据保护协议)
本地优先
敏感任务优先使用私有化部署方案(Dify/DB-GPT/OpenClaw)
Memory数据治理
长期记忆中的用户信息需支持查看、修改、删除("被遗忘权")
跨境传输
使用国内模型或自托管方案,避免数据出境合规风险

十、核心趋势与展望

10.1 六大核心趋势

趋势
说明
关键时间节点
形态多元化
Codex从纯CLI演进为CLI+GUI+Web+扩展,多入口并行成为主流
2026年已完成
Workflow + Skills 融合
Coze 2.5已融合Skills和Memory;Dify/DB-GPT在工作流中引入Agent节点
2026 H2加速
Skills + Coding 融合
OpenClaw原生支持运行Coding引擎;CodeBuddy兼顾编程+办公
2026-2027
Computer Use 普及
Codex已支持自主操作图形界面,AI从"对话"走向"操作"
2026突破,2027规模化
从云端到多形态
桌面客户端(WorkBuddy/Hermes)、自托管(Dify/DB-GPT)、云端SaaS(Coze)并存
2026年
MCP成为Skill基础设施
MCP正成为Agent间通信与Skill发现的事实标准协议
2027关键之年

10.2 Skills vs MCP:关系辨析

2026年Skill生态中一个核心讨论是"Skills是否会把MCP干掉"。实际关系如下:
维度
Agent Skills
MCP
本质
静态程序性知识(指令集)
动态工具与数据访问的实时协议
作用
告诉Agent"怎么做"——封装领域知识和工作流
告诉Agent"能连什么"——标准化外部系统接入
关系
Skills不会"接管"MCP,MCP也不会"吞掉"Skills
两者互补:MCP负责连接,Skills负责使用
MCP正在成为Skill发现、分发和消费的标准化通道。MCP SEP提案已将Skills作为MCP的"一等公民"原语,与Tools、Resources、Prompts并列。

10.3 未来演进路线图

         2026 H2                    2027                      2027+           │                          │                          │           ▼                          ▼                          ▼   ┌───────────────┐      ┌───────────────────┐      ┌──────────────────┐   │ Workflow与    │  →   │ MCP成为Skill      │  →   │ 自主Agent从      │   │ Skills在主流  │      │ 发现与分发的      │      │ 技术验证走向     │   │ 平台完成融合  │      │ 事实标准          │      │ 企业级规模化     │   └───────────────┘      └───────────────────┘      └──────────────────┘           │                          │                          │           ▼                          ▼                          ▼   ┌───────────────┐      ┌───────────────────┐      ┌──────────────────┐   │ Coding Agent  │  →   │ Computer Use      │  →   │ Agent安全治理    │   │ 全面引入      │      │ 进入企业生产环境  │      │ 成为企业         │   │ Skill机制     │      │                   │      │ 标配能力         │   └───────────────┘      └───────────────────┘      └──────────────────┘

10.4 终极结论

如今任何一款AI智能体工具,都不再是单一的运行形态,而是在Workflow(确定性)、Skills(自主性)、Coding(垂直深耕)三个维度上各有侧重、正在加速融合。选型时不再看"它是CLI还是GUI",而是看"它的核心设计哲学是什么——流程驱动、能力驱动、还是场景深耕"。
对于企业用户,建议采取分层策略
确定性业务(审批、合规)→ Workflow Agent(Dify/Coze)
辅助性任务(个人助理、数据分析)→ Skills Agent(OpenClaw/Hermes)
专业场景(软件开发、数据科学)→ Coding Agent(Cursor/Codex/DB-GPT)
底层支撑→ LangGraph + LangSmith构建自有的Agent编排与观测能力

三者之间没有绝对边界,未来的Agent平台将同时融合三种能力,关键在于根据自身业务场景选择当下的最佳切入点。

最后:推荐学习一下

LangGraph:自主开发,灵活型很高
Hermes :自主办公