乐于分享
好东西不私藏

【AI 白话原理】AI 为什么可以输出复杂的推理过程?

【AI 白话原理】AI 为什么可以输出复杂的推理过程?

AI 原理合辑

使用AI的时候,如果选择深度思考,AI 会输出一长串的思考步骤

包括拆解问题,逻辑推理,甚至反思

比如说 ”等一下,好像算错了,让我重新理解“

那这些复杂的逻辑推理过程,AI 是如何做到的?

首先,AI 大模型的训练有三种阶段

  • 预训练-阶段

  • 监督微调-阶段

  • 强化学习-阶段

别怕,虽然三个陌生概念,但是会尽量简化说明,只了解其大致逻辑

那么进入正题

首先*2,AI 大模型 在 预训练阶段 完成后

—— 就从  初始模型 变成 基座模型

这时候通过海量数据的训练,已经把人类世界的知识,物理规律 内化到了模型中

具体怎么内化的,其实就是修改模型内部的参数,具体可以看 → AI 是怎么训练的

最最最最重要的是,大模型此时不只是掌握了人类的固化知识,更重要是已经 掌握了人类的逻辑推理

比如说 警察探案 和 数学证明,就是逻辑推理,说白了就是这么一种 逻辑结构

—— 因为 xxx,进而 xxx,所以 xxx

而为什么学习常规资料就掌握了逻辑,可以看 →AI 为什么可以推理

但是此时的 基座模型 虽然掌握了逻辑,但是它并不会使用

它并没有拆解问题、一步步推导的习惯,只会直接输出答案

比如说你要问 ”1+1=?“,它只会直接回答 ”2“

完全就不会去推理,懒得一批

所以在一些复杂的数学题上,通常无法回答正确,因为题目根本就没见过,又不会拆解推理,只会胡乱猜一个数字

如果这一段AI的输出,没有太理解,可以先看→ AI 是怎么输出的

那么问题来了

大模型有了逻辑推理能力,但是不会用,这要怎么办

没错,我们要好生引导它,让他学会去主动推理

那这便是

强化学习

长话短说,强化学习的核心

就是通过 奖罚机制,逼迫模型 遇到问题时 主动去拆解问题

具体就是两种奖励

  • 准确性奖励,如果回答的结果是正确的,就给高分

  • 格式奖励,如果输出了思考过程,就给高分

那这个高分,具体是怎么一个作用?

其实和模型的预训练是一样的操作,都是修改模型内参数,不了解的可以看 → AI 是怎么训练的

比如说一个数学题 ”99×99“

如果模型直接输出答案——”9801“,那么就会给低分

如果模型输出具体拆解步骤,就会给高分

第一步,处理个位数乘法,先算 9×9,得 81

第二步,处理十位数与进位,计算 9×90=810,加上进位的 81,得出第一行的结果 891

第三步,处理十位数乘法,同理,用十位上的 90 乘以 99,得出 8910

最后, 将两次的结果相加,即 891+8910,最终得出 9801!

如果高分!那么 大模型就会把 加强大量相关 参数的权重,后面遇到同样的问题,就有更高概率输出类似的答案

如果低分,那么就会 降低相关参数权重,从而减少这么输出的概率

如果不明白调整参数的意思,可以看 →AI 是怎么训练的

久而久之,大模型就锻炼出了 主动推理,拆解问题的能力,改掉了张嘴就来的毛病

那这便是 大模型 可以输出 复杂推理过程 的原因了

但是!

单纯强化学习,也是有缺点的

就是完全靠 大模型自己摸索出来的思考过程,往往可读性很差,还可能多语言混杂,比如说

”First!我们要先这么do,然后...oh sorry,let 我重新 check“  (只是举例

那怎么办?

我们前面说的三种阶段之一

监督微调!

继续长话短说,就是 规范 大模型的回答

教他怎么输出高质量的思考过程

具体的做法就是

—— 给他喂一波高质量的,包含长逻辑链的数据例子 

数据的格式从 【问题 + 答案】,变成了

—— 问题 + 推理步骤 + 答案

而本质上,就是让 大模型 去模仿这个推理的过程,然后去修改 模型中的参数

把 模型自己的推理步骤 往 优质推理步骤上 靠

比如面对同一个问题

大模型先输出 自己的推理步骤,然后逐字和 优质推理步骤 比对,算出误差之后,去调整模型中的参数,让自己可以输出类似的推理格式

这便是监督微调

不过在实际的模型训练过程中,通常是

  • 先用少量优质数据打底,教会它输出的格式

  • 再进行 强化学习,逼出最强的推理上限

所以总的来说

大模型在 预训练的阶段,就已经有了逻辑推理能力,但是它并不会主动使用,更习惯直接输出答案

需要 引导 和 规范 ,让他能够主动去思考,输出推理过程,改变它的输出习惯

这便是为何 AI大模型能够 输出复杂的逻辑推理过程 的 原因

(完)