夜雨聆风学习资料网

ARTICLE · 1038583

AI大模型、Agent、Skill、工具和知识库:到底谁是谁的谁(以报告表审核为例讲清楚流程)

AI大模型、Agent、Skill、工具和知识库:到底谁是谁的谁(以报告表审核为例讲清楚流程)

从事咨询行业的你一定要学AI,AI应用层面涉及到哪些基本概念呢?先用一个大白话的场景说清楚大模型、Agent、Skill、工具和知识库之间的关系。

公司招了一个聪明的学霸实习生:看得懂文字、会写材料、脑子转得快——这就相当于大模型

给他配了电脑、电话、记事本,还允许他自己分几步把活干完——这就成了Agent(智能体)

你担心他不懂工作流程,于是写了一份作业流程单:"每个过程都要写出依据的"——这是Skill(技能包)

最后,你把所有涉及的国家和地方相关法律法规、标准、技术规范、以前的成果、专家审查意见整理成一个随时能翻的大型资料柜——这是知识库

而他能用的那些"家伙事儿"——比如电脑里的office、PDF 阅读器、计算器、制图软件——就是Tool(工具)。前面三样都不会自己动,工具是它们唯一能"动手"的接口。

下面一个个说。

一、大模型:那个"聪明但不了解你家情况"的学霸实习生

大模型(也叫 AI 大模型、LLM)= 一个读过海量资料、会读会写会推理的通用大脑。

强项:理解你的话、组织逻辑、写成人话、总结、翻译。

两个短板都很致命:

  1.   它不知道你单位的规矩——你们所的口径、习惯、内部模板,它一概不知;
  2.   它答得越流畅,越容易说得像有依据。你问它一条排放标准限值,它可能张口就给个数字,还配一句很专业的解释——但那个数字可能是他瞎编的,但说起来还振振有词,要是最后核实真答错了马上会说对不起。

这不是它"坏",是工作机制决定的:它按概率往下写,不是按原文往下抄。

国内外常见的有哪些?

国外的:

  • GPT 系列(OpenAI,ChatGPT 用的就是它)
  • Claude 系列(Anthropic,读长文档、写长材料口碑好)
  • Gemini 系列(谷歌)
  • Llama 系列(Meta,开源,可下载到自己电脑上跑)

国内的:

  • DeepSeek(深度求索)——推理能力突出,技术问答用得多
  • 通义千问 Qwen(阿里)——开源版本多,本地部署常用
  • 豆包(字节跳动)
  • Kimi(月之暗面)——以读长文件见长
  • 文心一言(百度)
  • 智谱清言 GLM
  • 讯飞星火
  • MiniMAX
  • 腾讯混元

想用哪个大模型的,需要去官网充值得到API给Agent,Agent才能武装好自己的大脑。当然目前有一些Agent已经连上了自己的大模型,不需要手动设置。

二、Agent:给大模型配上"手和脚"

Agent(智能体)= 大模型 + 记忆 + 会使用工具 + 能分步骤完成一个目标。

差别在哪?跟大模型是"一问一答";跟 Agent 是"交个任务"。

你说一句"把这份报告表核一遍,出一张问题清单",它会自己安排:打开报告表 → 认出引用了哪些标准 → 挨个去资料柜翻原文 → 逐项比对 → 列出问题清单。中途资料不全它会回头找,算错了会重算。这就是 Agent 和聊天框最大的区别:它是干活的,不只是聊天的。

常见的 Agent,按"在哪用、谁在用"分成五类:

类别
代表产品
能干什么
适合谁
① 聊天软件自带的智能体
豆包(有智能体模式)、Kimi、DeepSeek、腾讯元宝
在对话窗口里就能拆步骤、联网查、直接出成品
想省事、不想装软件的人
② 办公型智能体
腾讯 WorkBuddy、字节扣子空间、WPS AI、飞书智能伙伴
接在文档、会议、云盘里干活:整理材料、写纪要、跟进事项
单位文档多、日常泡在 Office 里的人
③ 通用智能体
Manus、扣子空间
一句话交任务,自己上网调研、做表、出报告
做调研、做方案、要交付物的人
④ 搭 Agent 的平台
字节扣子 Coze、阿里百炼、百度文心智能体平台
自己拖拽配置,把所里的规矩做成专属助手
想把"报告表审核"这类流程固化下来的机构
⑤ 装在自己电脑上的桌面助手(社区俗称"小龙虾"🦞,指 OpenClaw 这一族)
OpenClawClaude CodeCursorGitHub Copilot
直接读你硬盘上的文件、跑脚本、连聊天软件派活,数据可以不出本机
有内部资料、在意数据安全、肯折腾的人

第⑤类单独说清楚——这一族共同点是"跑在自己电脑上、能读本机文件、数据不出门":

代表
怎么用
特点与注意
OpenClaw(🦞 图标,这一类产品的起点)
装在自己电脑或一台常开的小机器上,配好模型接口,用聊天软件给它派活
能读写本机文件、跑命令、装插件;数据不出门;属"个人级"工具,权限必须收紧
Claude Code/Cursor/GitHub Copilot
装在自己电脑上,专门写代码、改文档、跑脚本
偏工程活,文件操作稳、可控
各种衍生版、简化版桌面助手
多在各家开源仓库里
名字几乎每月都在变,写文章建议统一叫"桌面型个人助手",只举一两个代表——否则文章发出去两个月,产品名就过期了

这里必须补一句实务提醒:这类东西的能力和风险是同一个来源——它能读写你电脑上的文件。所以用法上要配三条:装在一台单独的机器或单独目录里、只给必要的权限、重要资料先备份。方便和稳妥要一起考虑,不能只图快。

表下再补两句:

  • 手机里那几只"小X"——小爱同学、小艺、小布、蓝心小V——本质是语音助手,能订票、设提醒、开关家电,但还谈不上"自己分步骤把一件复杂活干完",所以没放进上表。

三、Skill:菜谱,不是锅碗瓢盆——中间还隔着一层"工具"

用户 ↓ 给任务Agent(总导演:拆步骤、调谁、看结果、迭代)  ↓ 调用Skill(组合技:一组工具 + 工序 + 禁令)  ↓ 调用Tool 工具层(原子动作:读PDF、查数据库、跑脚本、发消息)  ↓ 读写 大模型(推理引擎)+ 知识库(资料柜)

从下往上看:大模型是脑子、知识库是记忆,工具是手脚,Skill 是把手脚串起来的招式,Agent 是决定"什么时候用、怎么组合"的总导演。

这里最容易被忽略、也最容易和 Skill 搞混的,就是中间的工具(Tool)。专门说清楚:

  • 工具是单个能力:读 PDF、算数、查数据库、调一个标准 API、发一封邮件、跑一段脚本——每个只干一件小事,是最小不可再分的"原子动作";
  • 技能是一整套工序:先干什么、后干什么、按哪条判、输出成什么格式、哪些事绝对不能做。

打个比方:工具是锅碗瓢盆和灶台,技能是菜谱。同样的灶台,有菜谱的人做出来能上桌,没菜谱的只能自己吃。

再举个例子,"查 GB 16297 的无组织限值"这件小事:

  • 工具层:向量检索工具(去知识库翻出 GB 16297 的相关段落)、表格解析工具(把段落里的限值表抽成结构化数据);
  • Skill 层(技能包):先判定污染物是什么 → 再调检索工具查标准号 → 用表格工具提取限值 → 核对适用级别 → 输出"污染物 + 限值 + 依据条款"的标准格式。

Skill = 工具 + 调用顺序 + 判据 + 输出格式 + 禁令。工具是"被封装好"的——你用 Skill 的时候已经在调工具了,只是不用关心具体是哪个。但真要自己搭系统,工具层必须单独拎出来,因为它是唯一能跟外部世界"动手"的那一层:不读文件就进不了知识库,不跑脚本就算不出总量,不调 API 就发不出提醒。

环保咨询里常见的工具有哪些?先有个印象:

工具类型
具体例子
文档处理
PDF 解析、Word 读写、表格提取(PyPDF、unstructured、pandas)
检索
向量搜索、关键词搜索、混合检索(Chroma、Milvus、ES)
数据计算
SQL 查询、Excel 计算、达标/总量核算
外部接口
标准数据库查询、气象数据、GIS/敏感点服务
通知协作
发企微/钉钉消息、生成待办、发邮件
系统操作
跑脚本、调命令行、操作文件

这些工具不绑定任何模型、不绑定任何 Agent 框架——OpenClaw 能用、Dify 能用、扣子也能用,你自己也能写。这是它要单独成层的原因:它是公共基础设施,谁调用都能执行。

环保咨询里的技能包长什么样?以"报告表审核"为例,它其实就是一张检查点清单(注意,清单里的每一步,背后都靠工具层去执行),比如你可以简单设置审核报告的skill:

  1.    项目类别与环评类别对不对得上;
  2.    各要素评价等级判得对不对(大气、地表水、地下水、声环境、土壤、生态);
  3.    执行标准选得对不对——标准号、年份、表号、适用条件;
  4.    正文与表格里的数据前后一不一致;
  5.    章节齐不齐、附件全不全;
  6.    结论与前面各章是否对得上。

外加两条禁令

  • 每条问题都必须写出依据的标准号和条款号,写不出依据的问题一律不报;
  • 不许凭记忆填任何数值,必须回原文。

四、知识库:单位的资料柜,而且要"能翻到原文"

知识库 = 把单位的资料整理好,让 AI 能查、能引用、能追溯到原文。

这里必须分清两个词:

  • 记忆:这一次对话里的上下文,是个人的、临时的;
  • 知识库:共享、有版本、能查到出处,是资产。

知识库的四种部署方式

第一种:云端现成版(最省事,上手最快)

直接使用平台自带的知识库功能,把文件传上去就能问:

  • 腾讯 ima:可以上传文件建自己的知识库,能联网,和微信、公众号生态衔接顺手。
  • WPS 知识库:和云文档、Office 生态绑在一起,适合文档量大、天天在 Word/Excel 里干活的团队,谁改了什么都有记录。
  • 此外还有飞书、钉钉、企业微信自带的知识库,以及 Kimi、豆包的文件问答

优点:今天就能用,目前多数不额外花钱,不用人维护。缺点:文件在别人服务器上,内部资料和涉密内容不要用;文件一多就不好管;各平台之间搬家不轻松,要是平台垮台不做了,资料可能灰飞烟灭。后期随时可能收费。

第二种:本地文件夹式(最踏实,也最省钱)

把标准做成一份份 Markdown 文件(纯文本),结合obsidian放在自己硬盘或共享盘上,AI 直接读文件来回答。

优点:不需要任何服务器,文件永远在自己手里,人和 AI 都能直接看懂,要改就是改文字。缺点:得有人整理。乱堆一堆 PDF 他看不懂。

我目前倾向于用的是这种:一个标准一张卡片,卡片里把封面信息、目录、正文、表格、附录全部录入。文档都是轻量,每次提问时AI检索省时间、更省调用大模型的token费用。

第三种:本地检索库(数据不出门,功能更全)

在自己电脑或单位服务器上装一套:开源模型(如 Qwen、DeepSeek 的开源版本)+ 检索工具(如AnythingLLMCherry StudioRAGFlowDify),把标准文件切块存进向量数据库(常见的有ChromaDB)。

用法:你问一句,它先从库里把最相关的几段原文找出来,再让模型照着这几段回答。

优点:数据不出门,能装几千份文件;缺点:要一台配置非常高的电脑,而且能完成部署配置高一点的本地大模型的,要不然脑子不好使回答出的答案就是幼儿园的水平。

当然现在也可以通过一些智能体的工具能把本地的RAG检索向量来实现,把这两者实现有效串联。

五、走一遍完整流程示范:审核一份报告表

任务:审核一份报告表,出一张问题清单。

假设这是个有喷漆工序的机械加工项目,报告表已经送到你手上。你把任务交给 Agent,只说一句:"按我们的报告表审核技能包,把这份报告表核一遍,输出问题清单。"

第一步,用工具把文件读进来。Agent 调 PDF 解析工具、OCR工具等,打开报告表,把正文、表格、引用的标准号和污染物数据都抽出来——这一步就是"工具层"在干活,大模型和知识库都碰不到原始文件,必须先靠工具读出来。

第二步,按技能包逐项过。项目类别、评价等级、执行标准、数据一致性、章节完整性、结论是否对得上——一项一项来,不凭印象。这是 Skill 层在指挥:它规定了顺序、判据和输出格式。

第三步,遇到标准就去知识库翻原文。比如报告表里写"本项目不开展地下水环境影响评价",它不会直接认下来,而是让检索工具去知识库翻出 “报告表的编制指南”等,再判断"不开展"这句话站不站得住。这一轮是 Agent → Skill → 工具 → 知识库,四层都全串起来了。

第四步,输出一张问题清单(下面几条是示例,项目名称、数值均为虚构):

序号
位置
问题
依据
建议
等级
1
表 3 与正文 5.2
正文写除尘效率 99%,表里写 95%,前后不一致
内部一致性
核实后统一
必改
2
第 4 章
写"不开展地下水评价",但未说明判定依据
编制指南
核实项目原辅料产品特性等
必改
3
第 2 章
未写明声环境功能区依据(GB 3096-2008 哪一类),厂界噪声只给昼间限值
GB 3096-2008、GB 12348-2008
补功能区判定依据与昼夜限值
必改
4
第 5 章
无组织排放执行 GB 16297-1996,未说明当地是否有更严的地方标准
标准适用顺序
核对当地地方标准,从严执行
必改
5
附件
未见"环境保护措施监督检查清单"
报告表格式要求
补齐
建议

可能大家在问,这些工作过程好像都没用到大模型,大模型到底有什么用?

其实,上面的每一步工作,都是大模型在深度烧脑思考:

  • 读文件那一步:工具只负责"把字读出来"(PDF 解析、OCR、提表),大模型负责"把意思读出来"——哪几页是正文、哪一张是附表、OCR 认歪的串要顺回来、提取出来的几列里哪一列是限值哪一列是标准号。工具管字符,大模型管语义。
  • 逐项过那一步:技能包只是"清单",执行清单的人是大模型——它要把这份报告表里的具体内容对应到检查点上("有喷漆工序的机械加工"归到"项目类别"),要判断正文的 99% 和表里的 95% 是不是同一件事,才谈得上"前后不一致"。
  • 翻原文那一步:检索工具只管"像不像",大模型管"对不对"——先把报告表里的话转成检索条件,再把翻回来的几段逐条比对本项目,判断哪一条真正适用(哪个行业、哪一栏)。
  • 出清单那一步:几乎全是大模型——组织语言、填表、配依据、定等级。

一句话:大模型是全程在的那个"脑",工具是手,技能包是规矩,知识库是资料柜。它不显眼,是因为它在做"判断",而判断是看不见的。

AI 工作流五层架构与审核流程架构总览

Agent = 总导演(盯全程)| Skill = 菜谱(规定先查什么后查什么)| Tool = 手脚(抠字/算数/调接口)| 大模型 = 全程在用脑(看懂+判断+写下来)| 知识库 = 资料柜(标准原文/历史案例)


第五步,也是最关键的一步:人复核。AI 报出来的问题里一定有它自己看错的——把报告书的条款套到报告表头上、把两个行业的类别混了、拿旧版本标准当现行有效。哪些留、哪些删、哪条必须要求补充监测,只有人能定

六、AI 能替哪些活,不能替哪些

能替的:翻标准、抄条文、核数据、排版、写初稿、做对照表、查历史资料。

不能替的:现场判断、参数取值、跟主管部门沟通口径、承担责任、签字

三条底线,建议写进制度:

  1.    每一句结论都要能追到出处(哪份标准、哪一页、哪张表);
  2.    没经过人核对的结论,不能进正式成果
  3.    签字权和与人一起担的责任,永远在人。

七、五个合起来,是不是就成了"环保管家的超级 AI 助手"?

是,但要限定范围:它能做成"能干活的合规助手",做不成"能签字的环保管家"。

前面一直在讲四样(大模型、Agent、Skill、知识库),但别忘了还有藏在 Skill 下面的工具层——工具是手脚,不干活就什么都白搭:读不了 PDF,知识库喂不进去;跑不了脚本,总量算不出来;调不了 API,提醒发不出去。完整的系统是五层,不是四样。

能做成的那部分。把五层配齐,环保管家的日常里凡属"信息处理+文书产出+合规对照"的活,基本都能接住:政策法规检索与适用判定、评价类别与等级初判、执行标准与限值核对、台账整理与到期提醒、执行报告和自行监测方案初稿、隐患排查检查表、培训材料与答复函件。这一块大约占日常工作量的大头,也是最能省人的地方。

接不住的那部分,有三条硬边界:

第一,资质和资格不是 AI 给的。环评单位资质早已随法律修改取消,但注册环评工程师的职业资格还在,编制主持人、责任人的签署要落到具体的人头上;检测要有 CMA、危废经营要有许可证、涉及工程设计和施工另有建设主管部门的要求;环保管家本身不是行政许可事项,靠的是服务能力和履约记录。AI 不产生资质,也不具备承担责任的资格。相反,它能把"能力证据"沉淀下来——你们做过什么项目、被评审采纳过什么意见、每张卡片谁核对签的字,这就是可以拿给客户看的履约能力。

第二,责任与签字在人。报告、执行报告、台账的责任签署不能由 AI 代签;专家评审、现场核查必须人到场。这一条不是技术能不能做到的问题,是责任归属的问题。

第三,现场和交涉,AI 到不了。隐患排查的最后一眼、工艺到底改没改、与监管部门沟通口径时的分寸感,这些都靠人。AI 能给你备好材料、列好清单、想好说法,但它不能替你站在现场,也不能替你担那句话。

把它按"参与程度"排一张表,会更清楚(示例):

环保管家的活
AI 能到什么程度
政策法规检索、标准适用判定
可做,复核后采用
评价类别、等级初判
可做,复核后采用
达标核算、总量核算
可做,数据必须回原文核对
台账整理、到期提醒、归档
可做,复核后采用
报告表/执行报告/方案初稿
可做,人定稿
隐患排查、现场核查
只能给检查表,人做
与监管部门沟通、申辩
只能备材料,人去谈
签字盖章、承担责任
不可代劳

所以我的判断是:五者合起来,最合适的定位是"共用的合规助手**"——它把老师傅脑子里的经验变成谁都能调用的能力,把新人从"翻标准"里解放出来去学判断,把重复劳动压下去。它不是替掉环保管家,而是让一个环保管家的产出更稳、更一致、可追溯。

还有一句专业提醒:AI 出的错一旦直接进了报告,行政处罚落在单位和人头上。所以这套东西必须留"核对痕迹"——依据原文、核对人、核对日期、二审记录。将来真被问起来,能拿出这条证据链,才是它真正的价值所在。

最后:配 AI 工作流,最关键的一步是选对 Agent

大模型是脑子,工具是手脚,技能包是菜谱,知识库是资料柜——但这四样都不会自己动。

真正把四样串起来、让整套东西转起来的,是Agent:它去资料柜取原文,照着菜谱往下做,用工具把活干完,再把结果交回来。所以配 AI 工作流,最该花心思的不是"哪个模型更强",而是"谁来当这只干活的手"。

选 Agent,就三条硬标准:

  1.    能不能读你的文件、调得动你的工具。 读不了本机文件、接不上你的 PDF/检索/计算工具、进不了你们的知识库,再强的模型也只能在聊天框里说空话;
  2.    认不认你的技能包。 不能按"必须先查原文、不许凭记忆填数"的规矩办事,它出的东西你不敢直接用;
  3.    输出带不带出处、能不能被审计。 每条结论都能追到标准号和条款号,将来才拿得出证据链。

三条都过,它才算 Agent;一条不过,那只是升级版的搜索框。

但最上面那一层永远不变:Agent 再能干,签字的还是人。

AI 做第一遍,人做最后一遍。签字、判断和责任,始终在人。这个AI搭建思路,其他行业也可参照通用。

相关学习资料