系统拆解学习率调度的第一性原理:为什么 LR 主宰优化轨迹与泛化(flat/sharp minima),从恒定与阶梯衰减的朴素基线,到线性/常数/余弦三种 Warmup 的动力学成因,再到 Cosine 退火、SGDR 与现代化大模型预训练范式 Warmup-Stable-Decay(WSD),并深入线性缩放律与 Accumulated Warmup 修正、与梯度累积/混合精度/梯度裁剪的交互陷阱,给出可复用的 PyTorch 组合调度器与生产陷阱清单,与本站 RMSNorm、相对位置编码、交叉注意力共同构成 Transformer 内部机制与训练工程深度解系列。
模型微调
2026年10月08日
0 点赞
0 评论
5 浏览