夜雨聆风学习资料网

ARTICLE · 1082187

AI名词越学越多,却还是不知道怎么用?从一句“帮我做个视频”出发,一次讲清大模型、上下文、、技能和智能体如何配合,把事情做完

AI名词越学越多,却还是不知道怎么用?从一句“帮我做个视频”出发,一次讲清大模型、上下文、、技能和智能体如何配合,把事情做完
关注
重播 分享 赞
刚开始接触 AI,最容易遇到的麻烦,是名词越来越多。
昨天还在学怎么写提示词,今天又看到上下文、知识库、MCP、Skill、Agent。每个词单独查一下,似乎能明白;放在同一篇文章里,反而不知道它们是什么关系。
先给自己留一个问题:当我把一件事交给 AI,究竟是谁在理解、谁在找资料,又是谁真的动手?
我们顺着这个问题,走完一项具体任务。下面的小林是个虚构的新手创作者。他想把收藏的资料,做成第一条让普通人也能看懂的知识视频。文章里的配图与同题白板视频使用同一套场景,方便对照着看。
图 1先认识分工,再看这些能力怎样配合
先说清楚 你要让 AI 帮你做什么
周日晚上,小林终于决定开始做视频。
资料收藏了一堆,剪辑软件还没打开。他把材料交给 AI:“帮我做一条讲 AI 的视频。”
AI 很快回了一篇稿子。小林读完第一段,发现里面尽是专业词,连自己都得停下来查。
这时先别急着找更厉害的工具。我们把刚才发生的事拆开看。
负责处理语言、组织回答的,是 LLM,大语言模型。你可以暂时把它理解成这位搭档负责理解和写作的部分。Model,模型,则是更大的类别,语言模型只是其中一种。
图 2模型与大语言模型,以及输入和输出的关系
小林交给它的那段任务要求,叫 Prompt,提示词。这个词听起来很技术,落到日常使用里,就是你把事情怎么交代给它。
“帮我做视频”少了不少信息:给谁看?讲到什么程度?先交脚本,还是直接生成文件?
小林重新说了一遍:“给完全没接触过 AI 的人看,用生活里的例子。先给我故事提纲,别一上来就塞一堆定义。”
要求具体了,检查结果也有了依据。写完之后,可以直接判断:有没有照顾零基础观众?有没有讲出故事?
图 3把受众、表达方式和交付物写进任务说明
刚才说好的 它这次还看得见吗
提纲改了几轮,小林说:“第三段,就照我们刚才定的改。”
这句话能不能被理解,取决于“刚才定的内容”有没有被交到模型面前。
模型这次能参考的信息,叫 Context,上下文。它可能包括当前任务、相关对话、参考文件、工具返回的结果。可以把这些信息想成摆在工作桌上的材料。
小林指着“刚才那一页”说话,但桌上已经没有那一页,搭档就可能理解错。实际应用会帮你组织对话历史,不过它到底带上了什么,仍然取决于具体实现。
图 4上下文像这次任务的工作桌,材料摆上来才能参考
还有两个词与这张桌子有关。
Token,词元,是模型处理文本时使用的单位。它可能对应一个字、一个词的一部分或标点,切分方式也会因模型而异。别把“一个 Token”直接换算成“一个汉字”。
Context Window,上下文窗口,是单次请求可处理的上下文容量上限。材料太多,应用可能会筛选、压缩,或者直接提示超出限制;不同模型对输入、输出等内容的容量计算也有具体规则。
图 5词元是处理单位,上下文窗口是容量限制;图中切分仅作示意
这次的工作桌 和留给下次的笔记
小林又想到一个问题:“下次做视频,还要重说一遍受众和风格吗?”
可以把稳定的偏好记下来:面向新手,多用短句,采用白板画面。之后需要时,把这些内容找出来,再放进当前任务的上下文。
这类保存和取用信息的机制,可以叫 Memory,记忆。实际产品的记忆可能存在文件、数据库或其他存储里。
到这里,两个词就好区分了:上下文讲的是“这一次参考什么”,记忆讲的是“哪些信息保存下来,留待取用”。
存了一本笔记,不代表每次开工都会把整本笔记摊在桌上。信息还得在需要的时候被找出来。
图 6保存偏好,再按任务需要放回上下文
稿子写得顺 事实却不一定对
稿子里出现一句话:“所有 AI 都会永久记住用户。”
小林翻了材料,没找到这个结论。
模型有时会生成听起来合理、实际没有依据或存在错误的内容,这类问题通常叫 Hallucination,幻觉。看到一句说得很肯定的话,仍然需要看它的依据。
图 7把稿子里的结论,与来源逐项对照
为了方便查,小林把官方说明和核对过的材料集中整理起来。这样的可查询资料集合,就是这里所说的 Knowledge Base,知识库。
当稿子讲到记忆功能,系统先检索相关内容,把找到的段落放到模型面前,再让它结合这些材料组织回答。这条路径叫 RAG,检索增强生成。
拿资料柜打个比方:柜子里可以存很多书,写这一段时,只需要取出有关的几页。
但“找来几页”与“这些页支持当前结论”是两件事。找错资料、漏掉条件,照样会把稿子写偏。小林最后还是要核对出处。
图 8知识库保存资料,RAG负责找到有关内容再辅助生成
一张图 一段录音 也是输入
小林接着递过来一张流程图和一段录音,希望 AI 一起参考。
文字、图片、声音、视频,是不同的信息形态,叫 Modality,模态。能够处理多种模态的模型或系统,具有 Multimodal,多模态能力。
具体支持什么输入、能输出什么结果,要看所用模型和应用。能看图片,不意味着这套应用一定能听录音;能理解视频内容,也不意味着它已经接好了视频制作工具。
所以交任务时,不妨具体一点:“请参考这张流程图和这段录音。”然后检查它是否确实读到了这些内容。
图 9文字稿、流程图、录音和样片,对应不同的信息形态
写出了制作步骤 视频文件在哪儿
脚本终于能用了。小林打开文件夹,里面依然没有成片。
视频还需要配音、绘图和合成程序去执行。这些外部能力叫 Tool,工具。它们可以查询信息,也可以执行动作。
以配音为例:模型组织好旁白和声音参数,提出调用请求;运行环境把请求交给配音程序,程序完成后返回音频。模型拿到结果,再决定接下来做什么。
这个过程就是 Tool Calling,也常写作 Tool Use,工具调用。
看到 AI 写出“接下来生成配音”,还不够。小林要找的是生成后的音频文件,或者工具实际返回的结果。
图 10工具调用要走完请求、执行、返回结果的过程
工具很多 怎样接到一起
工具来自不同地方,连接方式也可能不同。AI 应用得知道怎样请求它们、怎样接收结果。
MCP,模型上下文协议,提供一套开放的连接标准,让 AI 应用能用统一方式对接外部工具、资源和提示。可以把它理解成大家约定好的一类接口与通信规则。
在小林的任务里,配音程序负责生成声音;MCP 可以承担一种接入方式。服务是否支持、是否已安装、账号有没有权限、参数是否配置正确,都还得落实。
知道插口叫什么,并不会让桌上自动多出一台机器。
图 11统一连接方式之后,工具仍需安装、配置并取得相应权限
做成一次以后 把方法留下来
第一条视频做出来了。小林想,下次总不能再从头解释一遍制作过程。
他把方法整理成一个任务包:怎样核对来源、怎样写旁白、画面用什么模板、字幕怎么检查,以及哪些脚本可以直接运行。
这类按需读取的可复用任务说明与资源,可以组织成 Skill,技能。在开放的 Agent Skills 格式中,核心是说明文件,还可以包含脚本、参考资料和素材。
关注
重播 分享 赞
Skill 和 Tool 很容易混在一起。放回这次任务就清楚了:手册告诉搭档怎样组织制作,工具负责执行配音、绘图和导出。手册里可以带脚本,但运行脚本需要的环境和服务仍然要具备。
图 12Skill组织做事的方法,Tool承担具体执行
做着做着发现问题 能不能自己改
小林希望进一步省心:“目标是把视频做好,接下来该做什么,你自己安排。”
搭档先把事情拆成核资料、写稿、做样片、检查和出整片。这个环节涉及规划,有时由称作 Planner,规划器的组件承担,也可以直接由模型完成。
图 13把目标拆成可以执行和检查的步骤
样片出来,字幕挡住了图。搭档查看画面,调整布局,再生成一次。
做一步,看结果,判断下一步要不要改变,这种反复推进的过程叫 Loop,执行循环。循环需要停止条件:结果达标就交付;做不下去、资源用完或遇到需要人决定的事,也应该停下来处理。
图 14决定、动作、观察结果、调整,形成有反馈的循环
模型和工具之间 还需要一套运行支撑
这个过程不会只靠一句“继续努力”自动发生。
模型调用要有人组织,工具返回的内容要传回去,任务上下文要管理,执行权限和停止条件也要落到运行环境里。
围绕模型搭起的这套运行支撑,常被叫作 Harness。在这篇文章里,我们用“工作台”帮助理解它。不同项目使用这个词的范围不完全相同,它通常不只指沙盒或权限设置。
图 15Harness把模型调用、工具结果、上下文与执行边界组织起来
这时 我们才把整套系统叫作 Agent
搭档能够围绕目标选择步骤、调用工具,再根据结果调整,讨论的就已经是一套 Agent,智能体系统了。
理解这个词,重点是看任务如何推进。流程可能很简单,也可能需要多轮尝试。它可以使用记忆、检索、技能等能力,但没有一张必须凑齐“六个零件”的固定配方。预先写死的流程与由模型动态决定后续步骤的系统,也有区别。
图 16围绕目标安排步骤、调用工具,并根据反馈继续调整
回到小林面前,最后还是那个可以打开的视频文件。
他要看的很具体:普通人能不能听懂?引用的材料支持稿子吗?字幕有没有挡图?这样的成片,自己愿不愿意发布?
学会这些名词之后,再看到一个“AI 能替你做事”的介绍,就可以沿着任务往下问:它读到了什么信息,接了哪些工具,留下了什么结果,遇到问题又会怎样处理。
这些问题,能帮你判断这位搭档到底做到了哪一步。
图 17最后回到交付物,由人检查表达、事实和发布意愿
20 个名词 放回各自的位置

名词

中文

在这项任务里看什么

Model

模型

使用哪类模型处理任务

LLM

大语言模型

理解语言、组织文本

Prompt

提示词

受众、要求和交付物是否说清楚

Context

上下文

当前任务实际参考了哪些信息

Token

词元

文本被处理和计量的单位

Context Window

上下文窗口

单次请求的容量限制

Memory

记忆

什么被保存,之后怎样取用

Hallucination

幻觉

结论是否缺乏依据或存在错误

Knowledge Base

知识库

可检索的资料放在哪里

RAG

检索增强生成

是否先找相关材料再辅助生成

Modality

模态

输入是文字、图片、声音还是视频

Multimodal

多模态

实际支持哪些信息形态

Tool

工具

哪个外部程序执行动作

Tool Calling / Tool Use

工具调用

请求、执行和结果有没有走通

MCP

模型上下文协议

应用怎样统一对接外部能力

Skill

技能

可复用做法、模板和脚本怎样组织

Planner

规划器

目标怎样拆成步骤

Loop

执行循环

是否根据结果继续调整

Harness

运行支撑

调用、结果、上下文和边界怎样管理

Agent

智能体

系统怎样围绕目标自主推进

相关学习资料