乐于分享
好东西不私藏

AI大模型与数学 第9课:高阶导数、泰勒一阶展开、梯度下降数学原理

AI大模型与数学 第9课:高阶导数、泰勒一阶展开、梯度下降数学原理
AI大模型与数学 第9课:高阶导数、泰勒一阶展开、梯度下降数学原理
本课核心定位(AI训练最硬核底层)
前面课程我们掌握了:
函数、极限、连续、导数、链式法则、隐函数
从本课开始:你彻底看懂「梯度下降为什么能更新参数」
所有大模型训练的数学本质只有一句话:
用泰勒一阶近似,把复杂的损失函数,局部当成“直线”去修正。
本课内容:
1. 高阶导数物理意义
2. 泰勒公式完整通俗拆解
3. 一阶泰勒展开严格推导
4. 梯度下降数学原生原理(全网极少讲透)
5. 高阶导数对应AI:曲率、学习率、收敛快慢
一、高阶导数(一阶、二阶、高阶)
定义
一阶导数 f'(x):变化速度(斜率、梯度)
二阶导数 f''(x):变化速度的变化速度(曲率、加速度)
n阶导数:持续对函数求导
面包店终极类比(秒懂)
设:
x = 烘烤温度
f(x) = 面包口感分数
一阶导数:温度变一点,口感变好多少?(更新方向、梯度大小)
二阶导数:温度继续变化,口感变好的速度是变快还是变慢?(收敛曲率)
AI人话
一阶导数:模型参数该往哪走、走多大步
二阶导数:这里地形陡不陡、要不要调学习率
AI真实对应
1. 一阶导数 = 梯度(所有参数更新的依据)
2. 二阶导数 = Hessian矩阵(牛顿优化器、自适应学习率)
3. 高阶导数越高,代表函数局部波动越复杂、模型拟合越精细
二、为什么AI必须「泰勒展开」?
真实神经网络的 Loss 函数:
极度复杂、超级非线性、千万级曲线褶皱
人类无法直接求解全局最小值。
泰勒核心思想:
任何复杂曲线,在极小的局部范围内 ≈ 一条直线
所以:
局部用直线近似 → 一步步逼近最低点 → 梯度下降
这是所有AI训练的唯一底层逻辑。
三、泰勒公式完整版(通俗+严谨)
完整泰勒公式
函数在 x_0 邻域展开:
f(x)
= f(x_0)
f'(x_0)(x-x_0)
\frac{f''(x_0)}{2!}(x-x_0)^2
\frac{f'''(x_0)}{3!}(x-x_0)^3
+\dots
层级拆解
第0项:原始基准值
第1项:一阶线性修正(梯度下降只用这一项)
第2项:二阶曲率修正(牛顿法用)
高阶项:微小误差、可忽略
面包类比
复杂的面包口感曲线:
不用看全局复杂变化,
只看当前温度附近的一小段近似直线,微调温度即可逼近最佳口感。
四、本课重点:一阶泰勒展开(梯度下降本源)
一阶泰勒公式(AI专属简化版)
忽略二阶及以上微小项:
f(x) \approx f(x_0) + f'(x_0)(x-x_0)
严格推导「梯度下降参数更新公式」
设定
当前参数:w_0
更新后参数:w
损失函数:L(w)
一阶泰勒:
L(w) \approx L(w_0) + L'(w_0)\cdot (w-w_0)
训练目标:让 Loss 变小
要求:
< L(w_0)
代入:
L(w_0) + L'(w_0)(w-w_0) < L(w_0)
消去常数:
L'(w_0)(w-w< 0
得到核心逻辑
想要不等式成立:
参数变化方向必须与梯度方向相反
设:
w - w_0 = -\eta \cdot L'(w_0)
最终诞生AI最核心公式
\boldsymbol{w_{new} = w_{old} - \eta \cdot \frac{dL}{dw}}
五、历史性总结:梯度下降不是经验,是数学推导出来的
这一步,打通所有AI底层!
1. 复杂损失函数无法直接求最小值
2. 用一阶泰勒局部线性近似
3. 数学强制要求:参数反向更新
4. 加上学习率 \eta 控制步长
5. 反复迭代 = 大模型训练过程
六、二阶导数在AI中的高级作用(拓展拔高)
二阶项代表「曲面曲率」
二阶导数大:曲面弯得厉害 → 容易震荡 → 学习率要小
二阶导数小:曲面平缓 → 可以大步更新
牛顿优化器原理
加入二阶项修正,收敛更快:
w_{new} = w_{old} - \frac{f'}{f''}
为什么普通GPT不用牛顿法?
二阶导数计算量极大(Hessian矩阵爆炸)
万亿参数大模型只能用一阶泰勒(梯度下降)
七、面包店全套串联(5-9课终极闭环)
把之前总结的体系,本课完美补全最后一块拼图:
1. 连续、间断:烘焙工艺稳不稳定、有没有突变临界点
2. 一阶导数:参数微调对口感的变化速度
3. 四则求导:多原料综合变化率
4. 链式法则:多层工序互相传递影响(反向传播)
5. 隐/参数函数:显性+隐性约束条件
6. 泰勒一阶展开:
不用看懂全局复杂工艺,只看局部微小变化,迭代逼近最优口感 —— 就是AI训练
八、本课AI总结
1. 高阶导数决定模型曲面曲率、收敛速度、优化器特性
2. 一阶泰勒展开是梯度下降的数学基石
3. 大模型无法全局求解最优解,只能局部线性近似、迭代逼近
4. 学习率、梯度更新、反向传播全部源自泰勒公式
5. 所有深度学习框架(PyTorch/TensorFlow)底层迭代逻辑,源于本课推导
九、课后习题
一、高阶导数计算
1. y=x^3 求一、二、三阶导数
2. y=e^{2x} 二阶导数
3. y=\sin x 四阶导数
4. y=\ln(1+x) 二阶导数
二、泰勒一阶展开练习
5. 在 x_0=1 处对 y=x^2 做一阶泰勒展开
6. 在 x_0=0 处对 y=e^x 一阶展开
三、AI思维题(核心)
7. 为什么大模型只能用「一阶近似迭代」,不能直接求全局最优?
8. 用泰勒公式解释:学习率过大会震荡、不收敛
9. 为什么越接近Loss谷底,梯度越小、更新越慢?