☆ 保存 Cosine Annealing(余弦退火)—— 让学习率按周期平滑下降,从而促进稳定收敛的调度方法
02/25/2026
Cosine Annealing(余弦退火)是一种在深度学习训练中常用的学习率调度(learning rate scheduling)方法:它让学习率按照余弦函数的形状逐步下降。训练早期学习率较高以便充分探索,后期则平滑减小更新幅度,从而更稳定地在最优点附近收敛。
**直观理解:**下山时,开始你会用更大的步幅快速前进;快到终点时会自然放慢,避免“冲过头”。余弦退火就是把这种“平滑刹车”的过程用数学方式固定下来:不是突然把学习率砍一刀,而是连续、柔和地降低,让训练动态更稳定。
学习率沿余弦曲线下降,在探索与稳定收敛之间取得平衡。
方法(工作机制与特点)
-
余弦形衰减,避免“硬切换”
- 相比线性衰减或阶梯衰减,余弦退火用余弦曲线控制学习率变化。
- 前期下降较慢,保留探索能力。
- 中期下降更快,减少震荡与噪声更新。
- 末期再次变得平缓,便于精细收敛与微调。
-
核心公式
- 学习率从 \(\eta_{\max}\) 出发,在时间跨度 \(T\) 内逐步逼近 \(\eta_{\min}\)。
- 整个过程是连续的,不会出现突兀跳变。
- \(t\) 可按 step 或 epoch 来定义,取决于实现方式。
-
\[ \eta_t = \eta_{min} + \frac{1}{2}(\eta_{max}-\eta_{min})\Bigl(1+\cos(\frac{t}{T}\pi)\Bigr) \]
当 \(t\) 从 0 增加到 \(T\) 时,学习率沿余弦曲线从 \(\eta_{\max}\) 平滑下降到接近 \(\eta_{\min}\)。
-
用数值例子抓住感觉
- 设 \(\eta_{\max}=0.1\)、\(\eta_{\min}=0.001\)、\(T=100\)。
- \(t=0\) 时 \(\cos(0)=1\),所以 \(\eta_t\approx 0.1\)。
- \(t=50\) 时 \(\cos(\pi/2)=0\),所以 \(\eta_t\approx 0.0505\)。
- \(t=100\) 时 \(\cos(\pi)=-1\),所以 \(\eta_t\) 接近 \(0.001\)。
-
与 Warm Restart 结合(SGDR 风格)
- 余弦退火常与余弦重启一起使用:学习率周期性“抬高”后再余弦下降。
- 每个周期重复一次余弦衰减。
- 这有时能缓解陷入局部最小值的问题。
-
为什么余弦形状常常有效
- 前期:较大学习率帮助探索更广的区域。
- 中期:更快下降减少来回振荡。
- 后期:很小的步长支持细粒度收敛与“打磨”。
- 整体:自然地平衡探索(exploration)与收敛(convergence)。
意义与局限
余弦退火通过平滑设计学习率下降轨迹,往往比阶梯式调度更稳定,特别是在大规模神经网络(包括 Transformer)训练中经常表现良好。但它也依赖合理的超参数设置:例如周期长度 \(T\)、最小学习率 \(\eta_{\min}\)、最大学习率 \(\eta_{\max}\)。如果 \(T\) 太短或 \(\eta_{\min}\) 太大,训练可能过早停滞;如果 \(T\) 太长,收敛可能不必要地变慢。总体而言,它是一种用于塑造训练动态的学习率调度工具。
建议先读 (3/5)
+2
- 3. 优化与正则化——让训练更靠谱,把过拟合挡在门外
- SGDR(Stochastic Gradient Descent with Restarts)— 通过重启学习率调度反复执行“探索—收敛”的优化策略
- Warm Restart — 通过周期性重置学习率恢复探索能力,帮助跳出局部极小值的训练策略
接下来推荐阅读 (5/15)
+5
- 自适应学习率——一种会根据训练状态自动调整步长的优化原理
- AdaGrad(自适应梯度)— 按参数自适应学习率的优化方法
- Nesterov 加速梯度(NAG)——利用“未来梯度”改进 Momentum,降低过冲(Overshooting)
- Momentum — 利用上一轮梯度的“惯性”加速学习的优化方法
- Batch Gradient Descent — 每次用全量数据确定最稳定的优化方向
- Mini-batch Gradient Descent — 用小批量估计梯度,实现更快且更稳定的训练
- 投影梯度法(Projected Gradient Method)—— 每一步都投影回可行域以满足约束的优化方法
- Expectation-Maximization Algorithm (EM Algorithm) — 如何利用 Hidden Variable 学习概率模型
- BFGS — 如何从 Gradient 变化中学习曲率
- L-BFGS — 利用近期变化记录降低内存开销的优化方法
- Hessian Approximation —— 利用曲率近似优化搜索路径的方法
- Quasi-Newton Method——利用历史迭代估计曲率的优化方法
- Iterative Refinement(迭代优化)——逐步改进初始结果的优化原理
- 7.7 KV Cache 与 Shared Key-Value Attention —— MQA、GQA 与 MLA
- 7.6 Transformer LLM 的高效 attention 机制 —— Full Attention、Sparse Attention 与 FlashAttention
同一主题文章 (2/2)
相关概念 (0/0)
暂时没有相关概念文章。
📍 这个概念在 AI 学习地图中的位置
查看这个概念在整个 AI Universe 中的位置。
📍 AI Universe 中的当前位置
☰
重置 显示已完成 · 需要登录 加载中…
🌌 AI Universe
‹
›
⭐ 概念
请选择一个节点。