ARTICLE · 1059475
用大白话解释AI术语(一)
1 前言
AI的发展太快了,LLM,prompt,context,harness,Loop,快到一个新的概念还没捂热乎就已经不足以解释更新的进步了。
在我学习AI的过程中一直有个困扰,介绍AI进展的资料,对这些看不懂的术语要么不解释,要么用另一堆看不懂的术语解释,梦回中学时期英语老师让我们用纯英语的词典查看不懂的英语单词,查完问题更多了。
碰巧这些年我积攒了不少当小白的经验,因此做一些学习记录。
本文是入门篇,入选的术语主要服务于“一个普通人如何使用AI”这样一个应用导向的朴素目的,可以理解为0基础的AI术语入门。理论上会在后续篇章里更新MCP,skill,Harness,agent等更多概念的通俗解释。
本文不是那种“如何使用workbuddy提高工作效率100倍”的方法指南,而是对一些耳熟能详的AI术语尽可能得用大白话做的解释,如果你对AI的运行原理没有兴趣,本文应该会无聊。
最后再叠个甲,为了帮助理解,本文可能运用大量常识类比的方法解释,难免会对该术语的原始含义有少量稀释。如果你觉得不对,可以友好留言或报警,感谢。
2 术语解释
2.1 大模型/LLM
一个喂了海量书籍、网页、文章等文本信息来训练,学会了人类语言的规律,能读写总结文字的工具。这个工具并不多神秘,你甚至可以直接下载到你的电脑上。
比如Qwen2-0.5B-Instruct,阿里通义千问的究极小模型,0.5B参数(“参数”的介绍在下文),2020年的丐版Mac就能流畅运行,文件只有几百MB。

附上模型下载地址,有兴趣的可以自行下载体验。
模型介绍:https://huggingface.co/Qwen/Qwen2-0.5B-Instruct-GGUFHugging Fa...
下载地址:https://link.wtturl.cn/?target=https%3A%2F%2Fhuggingface.co%2FQwen%2FQwen2-0.5B-Instruct-GGUF%2Fresolve%2Fmain%2Fqwen2-0_5b-instruct-q4_k_m.gguf&scene=im&aid=582478&lang=zh
注意,如果你好奇下载了,需要知道它并不能用双击方式打开,我放下载链接只是为了消除大模型的神秘感。想要知道如何在本地电脑上运行大模型可以自行另外找教程。
2.1.1 开源/闭源模型
假设你真的找教程在你的个人电脑上把这个大模型跑起来了,那么恭喜,你完成了一次大模型的“部署”。你可以和这个大模型无限制地对话,不需要付费,也不需要网络,只消耗电费。
这种可以任由我们下载在自己的设备上运行,开放源代码的大模型,被称为开源模型。国内的DeepSeek、智谱还有阿里、腾讯等各家大厂开发的大模型均在此列。
话虽如此,你可不要轻易去下载这些公司的旗舰模型,因为要跑更高级的模型,对硬件的要求就更高。比如DeepSeek 目前最新的4.1 flash,参数量是Qwen2-0.5B-Instruct的1000多倍(参数的概念在下文有介绍),就不要勉强可怜的笔记本了,我们还是乖乖用网页或者app的方式使用吧。
与之相对的是闭源模型,OpenAI、Google、Anthropic 这些公司的模型大多属于这一类。你没办法把它下载到自己的设备上,更拿不到源代码,只能用官方提供的工具来使用,比如打开一个ChatGPT网页对话。
2.1.2 模型的认知边界
不知道有没有人记得,最早期的AI应用,如2022年横空出世的ChatGPT,是无法回答“今天是几月几日”这样的简单问题的。就是因为当时的大模型回答完全依赖于训练时输入的文本数据,这些训练数据基本构成了大模型的认知边界。
也正因如此,所有的大模型本身都无法回答这种即时性问题。

除非,你让它上网。
开发者们为了拓展大模型的认知边界,使之不局限于训练数据库,为大模型开发了联网的技能web_search,当大模型发现自己的知识不足以回答你的问题时就会运用这个技能上网搜索,并将其总结后再发你。
也就是说,大模型本身并不会上网,这是一项后天被附加的技能,就跟猴子不会上天但是坐飞机就可以上差不多。
2.1.3 模型的幻觉和误导
容易混淆的是,大模型只是学会了“语言的规律”,而不是“知道客观事实”,对它来说输出答案就是把文本按照训练的经验排列起来而已,所以当遇到不知道的问题时就会开始“编造”,这就是大模型的“幻觉”。
也因为相同的原因,大模型很容易受提示词(你输入的问题)的误导,看起来好像情商很高得在迎合你,其实对它来说,不过是在做习惯性的文本排列罢了,并没有这么多的感情因素存在(少自恋了人类!)。

2.1.4 Token
token是AI世界的文字计量单位,人类创造的语言众多,还有符号、数字、空格和emoji,在大模型的脑子里都会统一转成token来计量(和计费...)。
token和语言没有严格的转化关系,粗略来说,一个汉字≈1~1.5个token。
顺便一提,大模型的工作方式就是:根据前面已有的 token,预测下一个最可能的 token,然后一个一个往外吐,所以你看到的回答是逐字蹦出来的,这就是所谓的“流式输出”。
这个单位可以说大部分开发者都非常得关心(尤其我这种抠里抠搜的金牛座),因为几乎所有大模型都是按照输出和输出的token数来计费的,像下面这样一张模型价格表,上面的数字通常代表每100万token的价格。可以看到输入的价格和输出的价格是不一样的,会分开计算。

2.2 大模型的能力
大模型的能力由很多因素决定,下面的术语都是从普通用户的应用视角来介绍的。
2.2.1 参数
大模型的参数可以近似理解为生物的脑容量,参数越大,学习知识的上限越高。更大参数的模型,就好比一个更聪明的学生,参数量决定这个学生最多能学会多复杂的知识、记住多少规律。脑容量越大,能力上限越高。
为什么是上限而不是能力本身?因为能力还取决于后天的学习,也就是训练的素材有多少。
人类当然比猴子脑容量大,但是一个整天只知道吃香蕉的人类,对比一只努力学高数的猴子,谁的思考能力更强?
前文中介绍的模型Qwen2-0.5B-Instruct的参数量是0.5B,B是Billion(十亿),更大的单位是T,trillion(万亿),0.5B也就是5亿参数,这个量级在大模型的世界中跟领头老大哥比起来只能算是幼儿园小朋友。

开源大模型中许多模型的参数量都已经达到万亿级别(1T以上),闭源模型一般不公开参数量,但是像Fable这样的旗舰模型理论上都是万亿以上。
2.2.2 提示词/Prompt
对大模型来说,输入的一切都是提示词。"帮我写封邮件"是提示词,一份五千字产品说明是提示词,要求"用表格输出"同样是提示词。
相信能读到这里的各位都对怎么给AI提问有自己的心得体会,我就不赘述怎么写提示词了。
参数决定的是大模型的上限,提示词决定的是这一次它到底能发挥出多少。前几年围绕怎么写好提示词还专门有一套技巧,叫提示词工程(prompt engineering)。
对于早期的大模型来说,好的提示词是它把活干好至关重要的信息,但是随着大模型的能力越来越强,越来越“善解人意”,提示词相对早期已经没有那么关键了。(这里不是说就不重要了,把需求讲清楚无论是对人还是对大模型都很重要!!)
2.2.3 上下文/Context
上下文可以理解成大模型的“记忆”,但是大模型本身其实是没有记忆的,它之所以能够“记住”多轮对话中的信息,本质其实是每轮对话都把这个聊天窗口里截至目前的历史信息全部发给它,变相实现了“记忆”的效果。这些每次对话都发给大模型的信息,就是上下文。前年围绕怎么给大模型塞更好的提示词也专门有一套技巧,叫上下文工程(context engineering),现在也基本不再是人们关注的重点了。
由于上下文包括了用户输入的信息和大模型输出的信息,所以提问的轮次越多,每次提问所使用的上下文就会像滚雪球一样越滚越多。

如图所示,这是我在同一个对话窗口中的7轮对话所消耗的token记录,可以看到输入是随着轮次增加而不断增加的,而输出则有多有少。这正是因为前一轮的输出会加入这一轮的输入。
杯子里的水满了会溢出,同样的,一旦某次对话提交的上下文超出了大模型的上下文限制,就会导致“失忆”。所以更高的上下文上限,是衡量大模型能力的重要标准之一。早期的大模型上下文非常有限,比如最早的GPT3.5,上下文只有可怜的4000token,折算成汉字只有3000左右。现在主流的大模型基本都有百万token的上下文了,短短几年时间AI的记忆就从鱼进化到了大猩猩(或者别的什么高级点的动物)。
另外值得一提的是,现在的成熟AI应用,比如豆包这种,每轮对话发给大模型的不仅是当前对话的信息,还包括了大量厂商预置的系统提示词一起作为上下文,如用户的个人信息、输出的语言规范、道德法律底线等等。看似你只是发了个“你好”,其实传输给大模型的可能有几千字。这也是有些AI应用爱说“我将用最简单最不绕弯子来回答你...”这种句式的原因之一。
2.3 阶段性总结一下
目前罗列的术语比我计划得少得多,还有一些有助于理解AI的关键概念,比如容易混淆的大模型和AI应用的关系、前段时间很火的Harness之类的,想要解释得通俗又清楚还需要花费不少篇幅,而本文篇幅已经够长了。