正则化深度实战:从权重衰减、Dropout 到早停、数据增强与 Stochastic Depth 的训练工程全解
系统拆解正则化的第一性原理:从经验风险到期望风险的泛化间隙、约束/惩罚优化的统一框架;深入权重衰减与 L2 的本质及 AdamW 的"解耦"陷阱(L2 被二阶动量缩放导致衰减失真),并给出"norm 层与 bias 不衰减"的生产级参数分组实现;讲清 Dropout 的反转(inverted)机制与训练/推理鸿沟(忘记 eval() 的高频事故)、Dropout 与 BatchNorm 的冲突;揭示早停与权重衰减的对偶性(早停等价于隐式 L2)与回滚最佳权重的重要性;从隐式正则视角解读数据增强(Mixup/CutMix/RandAugment)及其与标签平滑的桥接;进阶覆盖 Stochastic Depth(DropPath)、模型 EMA 与 SWA;梳理正则手段的协同与冲突(权重衰减×BN、Dropout×BN、增强×统计量、衰减×预热),给出 12 项生产陷阱清单与可复现 PyTorch 正则工具箱。与本站 RMSNorm、相对位置编码、交叉注意力、残差连接、学习率调度、梯度累积、词嵌入、激活函数、损失函数共同构成 Transformer 内部机制与训练工程深度解系列(补全泛化控制一环)。
