3. 优化与正则化——让训练更靠谱,把过拟合挡在门外

这篇课把两件最影响深度学习训练成败的事串起来讲:优化(Optimization)与正则化(Regularization)。优化负责把参数一步步推向更小的损失,让模型更贴合数据;正则化负责防止模型把训练集“背下来”,从而在新数据上也能保持稳定表现。

02/24/2026

Batch Gradient Descent — 每次用全量数据确定最稳定的优化方向

批量梯度下降(Batch Gradient Descent, BGD)是一种优化方法:每次更新都使用全部训练数据来计算损失函数的梯度,然后沿该方向更新参数。由于方向来自全数据的平均,更新轨迹通常更平滑、更稳定;但数据越大,每一步“全量扫描”的代价就越高。

02/22/2026

Gradient Descent — 沿着梯度反复更新参数以降低损失的优化方法

梯度下降(Gradient Descent)是一种经典的优化方法,它利用目标函数的梯度,持续降低函数值并寻找最小值。在机器学习与深度学习中,它是最常用的训练工具之一:通过更新权重与偏置来最小化损失。

02/22/2026

Gradient Noise — 随机学习中更新方向为何会抖动,以及这种抖动的作用

梯度噪声(Gradient Noise)指的是在随机梯度下降(SGD)或小批量训练中,用部分数据来估计梯度时产生的估计误差。由于每一步使用的 mini-batch 不同,更新方向会不断出现细微偏差,从而让优化轨迹呈现出“抖动”的效果。

02/22/2026

Mini-batch — 兼顾训练稳定性与速度的小批量分组训练方式

Mini-batch(小批量)是一种训练方式:既不一次性用完整数据集更新,也不每次只用一个样本,而是把数据切成若干小批量(batch),按批次反复迭代更新。在现代深度学习中,它几乎是默认选择,因为能在训练稳定性与计算速度之间取得很好的平衡。

02/16/2026

Mini-batch Gradient Descent — 用小批量估计梯度,实现更快且更稳定的训练

小批量梯度下降(Mini-batch Gradient Descent)把训练数据切分成多个小批量(mini-batch),并在每个小批量上计算损失的梯度来更新参数。它在深度学习里几乎是“默认配置”:相比全批量梯度下降更快;相比随机梯度下降(SGD)又更稳定、抖动更小。

02/22/2026

基于梯度的搜索(Gradient-based Search)——沿着梯度不断改进解的搜索方式

基于梯度的搜索(Gradient-based Search)是一类利用目标函数的梯度信息,在当前解附近做小幅度移动,并反复朝着更优方向更新从而逐步改进解的搜索/优化方法。

02/18/2026

学习率(Learning Rate)——决定参数更新“走多快”的关键尺度

学习率(Learning Rate)是基于梯度下降的训练中最重要的超参数之一:它决定模型参数在每次更新时要改动多大幅度。即使误差与梯度完全相同,不同的学习率也会让模型“迈步”的大小截然不同,从而直接影响训练速度与是否能稳定收敛。

02/18/2026

学习率调度 — 按训练阶段调整更新步长,让优化更稳定、更易收敛

学习率调度(Learning Rate Scheduling)是一种常见的优化策略:在训练过程中不把学习率(learning rate)固定不变,而是随着训练阶段逐步调整,让模型在早期更快探索、在后期更稳收敛。核心思想就是:在合适的时间使用合适的“步长”,该快的时候快,该稳的时候稳。

02/24/2026

德尔塔规则(Delta Rule)——按误差变化量调整权重的基础学习规则

德尔塔规则(Delta Rule)是一条经典的学习规则:为了缩小预测值与目标值(标签)之间的差距(误差),模型会按照这段差距的大小,把权重做小幅度、逐步的修正,让误差在反复更新中逐渐变小。

02/18/2026