
使用AI的时候,如果选择深度思考,AI 会输出一长串的思考步骤
包括拆解问题,逻辑推理,甚至反思
比如说 ”等一下,好像算错了,让我重新理解“
那这些复杂的逻辑推理过程,AI 是如何做到的?
首先,AI 大模型的训练有三种阶段
预训练-阶段
监督微调-阶段
强化学习-阶段
别怕,虽然三个陌生概念,但是会尽量简化说明,只了解其大致逻辑
那么进入正题
首先*2,AI 大模型 在 预训练阶段 完成后
—— 就从 初始模型 变成 基座模型
这时候通过海量数据的训练,已经把人类世界的知识,物理规律 内化到了模型中
具体怎么内化的,其实就是修改模型内部的参数,具体可以看 → AI 是怎么训练的
最最最最重要的是,大模型此时不只是掌握了人类的固化知识,更重要是已经 掌握了人类的逻辑推理
比如说 警察探案 和 数学证明,就是逻辑推理,说白了就是这么一种 逻辑结构
—— 因为 xxx,进而 xxx,所以 xxx
而为什么学习常规资料就掌握了逻辑,可以看 →AI 为什么可以推理
但是此时的 基座模型 虽然掌握了逻辑,但是它并不会使用
它并没有拆解问题、一步步推导的习惯,只会直接输出答案
比如说你要问 ”1+1=?“,它只会直接回答 ”2“
完全就不会去推理,懒得一批
所以在一些复杂的数学题上,通常无法回答正确,因为题目根本就没见过,又不会拆解推理,只会胡乱猜一个数字
如果这一段AI的输出,没有太理解,可以先看→ AI 是怎么输出的
那么问题来了
大模型有了逻辑推理能力,但是不会用,这要怎么办
没错,我们要好生引导它,让他学会去主动推理
那这便是
强化学习

长话短说,强化学习的核心
就是通过 奖罚机制,逼迫模型 遇到问题时 主动去拆解问题
具体就是两种奖励
准确性奖励,如果回答的结果是正确的,就给高分
格式奖励,如果输出了思考过程,就给高分
那这个高分,具体是怎么一个作用?
其实和模型的预训练是一样的操作,都是修改模型内参数,不了解的可以看 → AI 是怎么训练的
比如说一个数学题 ”99×99“
如果模型直接输出答案——”9801“,那么就会给低分
如果模型输出具体拆解步骤,就会给高分
第一步,处理个位数乘法,先算 9×9,得 81
第二步,处理十位数与进位,计算 9×90=810,加上进位的 81,得出第一行的结果 891
第三步,处理十位数乘法,同理,用十位上的 90 乘以 99,得出 8910
最后, 将两次的结果相加,即 891+8910,最终得出 9801!
如果高分!那么 大模型就会把 加强大量相关 参数的权重,后面遇到同样的问题,就有更高概率输出类似的答案
如果低分,那么就会 降低相关参数权重,从而减少这么输出的概率
如果不明白调整参数的意思,可以看 →AI 是怎么训练的
久而久之,大模型就锻炼出了 主动推理,拆解问题的能力,改掉了张嘴就来的毛病
那这便是 大模型 可以输出 复杂推理过程 的原因了
但是!
单纯强化学习,也是有缺点的
就是完全靠 大模型自己摸索出来的思考过程,往往可读性很差,还可能多语言混杂,比如说
”First!我们要先这么do,然后...oh sorry,let 我重新 check“ (只是举例
那怎么办?
我们前面说的三种阶段之一
监督微调!
继续长话短说,就是 规范 大模型的回答
教他怎么输出高质量的思考过程
具体的做法就是
—— 给他喂一波高质量的,包含长逻辑链的数据例子
数据的格式从 【问题 + 答案】,变成了
—— 问题 + 推理步骤 + 答案
而本质上,就是让 大模型 去模仿这个推理的过程,然后去修改 模型中的参数
把 模型自己的推理步骤 往 优质推理步骤上 靠
比如面对同一个问题
大模型先输出 自己的推理步骤,然后逐字和 优质推理步骤 比对,算出误差之后,去调整模型中的参数,让自己可以输出类似的推理格式
这便是监督微调
不过在实际的模型训练过程中,通常是
先用少量优质数据打底,教会它输出的格式
再进行 强化学习,逼出最强的推理上限
所以总的来说
大模型在 预训练的阶段,就已经有了逻辑推理能力,但是它并不会主动使用,更习惯直接输出答案
需要 引导 和 规范 ,让他能够主动去思考,输出推理过程,改变它的输出习惯
这便是为何 AI大模型能够 输出复杂的逻辑推理过程 的 原因
(完)
夜雨聆风