AI大模型与数学 第9课:高阶导数、泰勒一阶展开、梯度下降数学原理AI大模型与数学 第9课:高阶导数、泰勒一阶展开、梯度下降数学原理从本课开始:你彻底看懂「梯度下降为什么能更新参数」用泰勒一阶近似,把复杂的损失函数,局部当成“直线”去修正。二阶导数 f''(x):变化速度的变化速度(曲率、加速度)一阶导数:温度变一点,口感变好多少?(更新方向、梯度大小)二阶导数:温度继续变化,口感变好的速度是变快还是变慢?(收敛曲率)2. 二阶导数 = Hessian矩阵(牛顿优化器、自适应学习率)3. 高阶导数越高,代表函数局部波动越复杂、模型拟合越精细局部用直线近似 → 一步步逼近最低点 → 梯度下降\frac{f''(x_0)}{2!}(x-x_0)^2\frac{f'''(x_0)}{3!}(x-x_0)^3只看当前温度附近的一小段近似直线,微调温度即可逼近最佳口感。f(x) \approx f(x_0) + f'(x_0)(x-x_0)L(w) \approx L(w_0) + L'(w_0)\cdot (w-w_0)L(w_0) + L'(w_0)(w-w_0) < L(w_0)w - w_0 = -\eta \cdot L'(w_0)\boldsymbol{w_{new} = w_{old} - \eta \cdot \frac{dL}{dw}}五、历史性总结:梯度下降不是经验,是数学推导出来的二阶导数大:曲面弯得厉害 → 容易震荡 → 学习率要小w_{new} = w_{old} - \frac{f'}{f''}1. 连续、间断:烘焙工艺稳不稳定、有没有突变临界点不用看懂全局复杂工艺,只看局部微小变化,迭代逼近最优口感 —— 就是AI训练1. 高阶导数决定模型曲面曲率、收敛速度、优化器特性3. 大模型无法全局求解最优解,只能局部线性近似、迭代逼近5. 所有深度学习框架(PyTorch/TensorFlow)底层迭代逻辑,源于本课推导5. 在 x_0=1 处对 y=x^2 做一阶泰勒展开7. 为什么大模型只能用「一阶近似迭代」,不能直接求全局最优?9. 为什么越接近Loss谷底,梯度越小、更新越慢?