人工智能

正则化深度实战:从权重衰减、Dropout 到早停、数据增强与 Stochastic Depth 的训练工程全解

系统拆解正则化的第一性原理:从经验风险到期望风险的泛化间隙、约束/惩罚优化的统一框架;深入权重衰减与 L2 的本质及 AdamW 的"解耦"陷阱(L2 被二阶动量缩放导致衰减失真),并给出"norm 层与 bias 不衰减"的生产级参数分组实现;讲清 Dropout 的反转(inverted)机制与训练/推理鸿沟(忘记 eval() 的高频事故)、Dropout 与 BatchNorm 的冲突;揭示早停与权重衰减的对偶性(早停等价于隐式 L2)与回滚最佳权重的重要性;从隐式正则视角解读数据增强(Mixup/CutMix/RandAugment)及其与标签平滑的桥接;进阶覆盖 Stochastic Depth(DropPath)、模型 EMA 与 SWA;梳理正则手段的协同与冲突(权重衰减×BN、Dropout×BN、增强×统计量、衰减×预热),给出 12 项生产陷阱清单与可复现 PyTorch 正则工具箱。与本站 RMSNorm、相对位置编码、交叉注意力、残差连接、学习率调度、梯度累积、词嵌入、激活函数、损失函数共同构成 Transformer 内部机制与训练工程深度解系列(补全泛化控制一环)。

Dropout 深度实战:从子网络集成、Inverted Dropout 到 DropPath 与 MC Dropout 的生产工程

Dropout 是深度学习里最反直觉、也最容易被误用的正则化手段之一。它在 2012 年以 "Improving neural networks by preventing co-adaptation of feature detectors" 提出,核心思想只有一句话:**在训练时随机"丢弃"一部分神经元,迫使网络不能在固定的神经元组合上抱团作弊**。本文从第一性原理出发,把 Dropout 的…

不确定性校准深度实战:从可靠性图、ECE 到温度缩放与贝叶斯校准的工程全解

系统拆解模型校准的第一性原理:为什么高准确率网络普遍过自信、区分度与校准度解耦;从完美校准定义 P(Ŷ=Y|Ĉ=p)=p、可靠性图(校准曲线)、ECE/MCE/class-wise ECE/Brier/NLL(ECE 非 proper scoring rule,须与 NLL 同报)的评估体系,到参数化缩放谱系(Platt/Isotonic/Vector/Matrix/Temperature Scaling——单标量 T 保留 argmax 与 AUC 的性价比之王)、训练期标签平滑/数据增强/蒸馏反而放大过自信的反作用、以及 MC Dropout/Deep Ensemble/Conformal Prediction 对真实不确定性(认知+偶然)的建模。深入温度缩放实战(在独立验证集、eval 模式、fp32 下拟合 T>1)、12 项生产陷阱清单(训练集泄漏、未 eval、低精度、bin 数、类别不平衡、OOD 检测、多任务、漂移)与可复现 PyTorch 工具箱。与本站 损失函数、正则化、激活函数、RMSNorm、相对位置编码、交叉注意力、残差连接、学习率调度、梯度累积、词嵌入 共同构成 Transformer 内部机制与训练工程深度解系列(补全输出可靠性一环),并与 成员推断/模型提取攻击 共享"置信度"这一攻防面(校准是一把双刃剑)。