Transformer训练工程

学习率调度深度实战:从 Warmup、Cosine 退火到 WSD 与线性缩放律的大批量预训练工程

系统拆解学习率调度的第一性原理:为什么 LR 主宰优化轨迹与泛化(flat/sharp minima),从恒定与阶梯衰减的朴素基线,到线性/常数/余弦三种 Warmup 的动力学成因,再到 Cosine 退火、SGDR 与现代化大模型预训练范式 Warmup-Stable-Decay(WSD),并深入线性缩放律与 Accumulated Warmup 修正、与梯度累积/混合精度/梯度裁剪的交互陷阱,给出可复用的 PyTorch 组合调度器与生产陷阱清单,与本站 RMSNorm、相对位置编码、交叉注意力共同构成 Transformer 内部机制与训练工程深度解系列。