KL散度

损失函数深度实战:从交叉熵、标签平滑到 Focal Loss 与多任务损失的训练工程全解

系统拆解损失函数的第一性原理:为什么 0/1 损失不可导、所有可训练损失都是替代损失;从交叉熵的最大似然与 KL 散度推导、log_softmax 的数值稳定性,到标签平滑(ε 软化目标)、Focal Loss(聚焦难样本、α/γ 调参)、BCE+pos_weight 处理类别不平衡,再覆盖回归损失(MSE/MAE/Huber/Log-Cosh/分位)、带温度 KL 的蒸馏损失与基于同方差不确定性的多任务自适应加权,并给出 10 项生产陷阱清单(数值溢出、reduction 与梯度累积、ignore_index、混合精度、软标签类型、类别失衡、蒸馏冲突、多任务尺度失衡、NaN 检测、指标与 loss 解耦)与可复现 PyTorch 工具箱。与本站 RMSNorm、相对位置编码、交叉注意力、残差连接、学习率调度、梯度累积、词嵌入、激活函数共同构成 Transformer 内部机制与训练工程深度解系列(补全训练目标一环)。