
大模型的参数动辄几千几万亿
Claude Sonnet 1万亿参数
Claude Opus 5万亿参数
甚至 最大的模型 已经要达到了 10万亿

┏
参数到底是什么东西?
为什么大模型的演进,参数会越来越大?
难道参数越大,模型越智能?
┛
我们今天只讲基本的逻辑,不涉及太多专业概念,去建立一个基本的认知
首先,我们要先对 参数 这个词有一个了解
比如说常见的 iPhone17 的参数
XDR 显示屏,2622×1206像素
机身尺寸149.6×71.5×7.95mm,重量约177克
搭载A19芯片,采用3nm工艺,6核CPU
...等等
如果只告诉你所有的参数,你就可以直接定位到这是 苹果17 手机
所以 参数 可以理解是 描述事物的特征
所以也就是说
大眼睛,长得好看,有爱心,又真诚
这些是你的特征,也是你的参数
而在 大模型 的 参数同样是有这个意思
AI 怎么认识苹果?
—— 只要这个东西符合苹果的所有特征,那么 AI 就认为这个是苹果

而 AI 具体是怎么去描述一个事物的呢?
—— 通过多个维度
—— 也可以先理解成类别,或者属性
比如说你会从哪几个属性去描述苹果??
形状
颜色
甜度
...等等
AI 同样如此,比如说在模型中就有多个维度
GPT-2 small,就有 768维
GPT-3,就有 12288 维
GPT-4 没开源,所以不知道
难道 大模型 要给 万事万物 都描述特征吗?
当然不是
大模型,只会对 内置的词汇表 做特征描述
词汇表都有什么内容?
标点符号
单个英文单词,单个字母
数字
...等等
词汇表里面的每个词汇,其实就是一个个Token
你输入的每个内容,都会按照 词汇表 来逐个拆分Token
而 词汇表的 产生
—— 在海量数据中经常一起出现的 字符组合,如果出现频率足够高,就会合成一个固定的 Token 放入表中
更具体的可以看 这篇 → 简单理解 Token 是什么
那这些维度具体都是什么呢?
大模型所说的维度,其实并不是人类可以识别的具体概念,比如说 甜度/大小 等等
在大模型中,这些 维度通常是很抽象的,是模型自己悟出来的
—— 是 模型 在训练的过程中,自动找出了词和词之间一起出现的规律,并自动把这些规律分配到了几百或上千个维度中
并且 维度不是单一的,不是我们理解的 【甜度/大小】这种单一维度
它会把一个概念 通过 成百上千个维度 来组合 共同表达
它有一种专业的定义,叫做
分布式表征
简单地理解,其实就是 维度组合
也就是说,GPT-2 中的 768维,维度之间并不是独立的,他们会组合起来 表示某种抽象特征或属性
举个例子
比如说,如果AI 中存在 “形状” “颜色”这些属性,那他们是通过多个维度 组合来表示的

这当然也不是固定的
可能第15维包含了1%的形状信息和99%的味道信息
可能第300维包含了50%的形状信息和50%的颜色信息
而 维度 的值,其实就是数字
但从理解层面的话,可以理解成 维度的得分吧
假设说存在这些维度 “水果” “科技” “动物”
那么 “人类” 这个词
—— 在 “动物” 的 维度上得分就很高,在 “科技” 和 “水果” 得分就很低
而 “苹果” 这个词
—— 在 “水果” 得分就很高,“动物” 得分就很低
当然这些数值实际更长更复杂
是 32位的浮点数,也就是 4个字节
具体到 GPT-2 中, “苹果” 就会被映射成 一个768维的向量,如下(只截了部分)

所以在这里
参数其实就是维度
一个Token 有 768维,就是有 768个参数
所以 GPT-2 参数的大小就是!
词汇表数量大小 × 768
= 50257个Token × 768
= 约 3859 万参数
其中的 50257,更具体的可以看 这篇 → 简单理解 Token 是什么
但是实际上,GPT-2 参数 是 1.24亿!!!
这三千多万远远不够啊,为什么??
怎么回事??
这背后到底隐藏多少不为人知的秘密?

肯定是因为还有其他的参数啊!!
在专业概念上,上面的 3859 万参数 叫做 嵌入层参数
就是在 GPT-2中,你发的内容,被词汇表拆分成一个个Token后,每个Token会对应一个 768个参数 的向量
所以我理解这类参数可以叫做 ,初始向量参数
还有一种参数,叫 权重参数
具体应该叫 Transformer 参数,但是太复杂,涉及到太多概念,可以先不用理解
我直接称之为 计算参数

为什么需要计算参数?为什么叫计算参数?
已知我们在词汇表中的每个Token ,对应一个 768个参数 的向量
它的含义是固定的
比如 “苹果” 在词汇表中作为一个Token,它对应的 768个参数,可能只能表示它是一个水果
—— 水果,红色,甜的,长在树上...等等
但是!
”苹果“ 并不只表示水果,也可能是手机啊!
那这表示什么,完全由你的问题来指定
—— ”我想吃苹果“
—— ”我要买苹果手机“
所以 计算参数的第一个作用,就是
—— 上下文融合
如果 模型看到上下文是 ”吃苹果“,就会把“苹果”和“吃”联系起来,确认这是一个“水果”的语境
通过 计算参数 去进行逻辑计算,调整 ”苹果“ 初始向量中的参数
—— 也就是调整各种维度的得分,比如说 让水果方面的得分更高
如果模型看到上下文是 ”苹果手机“,就会把 “苹果”和“手机”联系起来,确认这是一个“科技公司”的语境
继续通过计算,把 ”苹果“ 初始向量 中的参数 调整更靠向 ”科技公司“ 方面
更具体的,还有这些内容
情感色彩,因为词汇表达的情感也是多样的。一个负面的词,在表达中也可能是中性或者 正面的比如 在《心花路放》中,雷佳音经典的 ”我尼玛“ 表示了 七种意思
指代关系,比如说你的问题中有“他”、“它”、“他们”等代词,模型要弄懂你到底指代哪个实体
语法关系,同一个单词在不同的上下文中可能扮演完全不同的语法角色,可能 动词 变名词,名词变动词比如说 I saw a saw.(我看到一个锯子),两个 saw 一模一样,但是他们意思完全不同,所以需要上下文判断,比如 第一个 saw 跟在 主语后,是 动词,第二个 saw 跟着冠词 ”a“,所以是名词
等等
那这 便是 计算参数的第一个作用了——上下文融合
通过上下文,去调整 初始向量中的参数,去更准确地确立它的含义
有第一个,就有第二个
第二个作用就是
—— 融合世界的知识
大模型在训练的时候,已经把世界的各种知识 都融合进了 计算参数中,比如什么定理、专业知识啥的
在上一层中, ”苹果“ 的初始向量中的参数,已经进行了上下文融合,有了更加明确的语义,但是这并不足以让 大模型去 推理输出内容
所以 计算参数 进行进一步 去调整 ”苹果“向量中的参数,把 相应的知识 融合进去
如果”苹果“是水果
—— 就可能会融合 “含维C”、“可以做成苹果派”、“牛顿被它砸过发现了万有引力”等知识
如果”苹果“是手机
—— 就可能融合 “乔布斯”、“卖肾”、“iOS 系统” 等知识
那么上面,就是计算参数最重要的 两大作用了
同时,计算参数,也是 模型中最为重要的参数,也是数量最大的一个参数
所以 GPT-2 的参数构成,可以认为是
—— 初始向量参数 + 计算参数 ≈ 1.24亿参数

所以现在应该对 参数 也有了一个基本的认识了
是什么
有什么用
所以这就很好理解了前面的问题
—— 为什么模型的发展,参数会越来越大?
第一,参数越大,在初始向量参数中,描述一件事物就越详细,那么模型回答问题就更加精确
比如极端地说,圆的,红色,甜的,实际上这几个参数 并不能很好地表示出苹果
就可能导致模型理解的根本不是你想表达的意思
所以 GPT-3 的 12288维 比 GPT-2 的 768维,就已经是降维打击了
第二,参数越大,在计算参数中,模型融合进的世界知识就越多,回答问题就更加丰富多彩
OKOKOK
这便是大模型的参数概念了,简化了很多专业的概念内容,保留了主逻辑,初步理解参数的概念是没什么问题的
继续总结一下
参数可以概括为两种
—— 初始向量参数 + 计算参数
—— 专业点说就是,嵌入层参数 + 权重参数
初始向量参数,是从多维度描述事物特征
权重参数,是调整初始向量内的参数数值,来 融合上下文 和 世界的知识
简单吧
(完)
夜雨聆风