ARTICLE · 1112823
AI和大模型—张量计算
AI和大模型—张量计算
张量说白了就是多维数组。标量是零维,向量是一维,矩阵二维,张量三维往上。
大模型处理文字语音,第一步全得变成 Token,再映射成数字向量。每个词都成了高维空间里的坐标点,词和词的关系一下就显出来了。
接着把这些向量塞进矩阵做运算。注意力机制负责挑出上下文里有关联的特征,再跟权重矩阵不断算概率。最后吐出结果,重新丢回上下文接着算。
可真实数据太海量,成千上万个矩阵根本兜不住。这时候就得靠张量上场,把高维空间的运算接过来。
底层其实不复杂,核心就是矩阵乘法和累加。正向算输出,反向算梯度、调参数,全靠它加速。深度学习、图像识别跑得快,指的就是这一步。
原文AI和大模型—张量计算
收录于AI和C++
河北,24分钟前,