训练工程

梯度累积深度实战:从显存墙、小批量退化到有效批次与混合精度训练的协同工程

在大模型训练的工程现场,GPU 显存是最硬的约束。当你想用 128 的全局批量(global batch)去逼近论文里的收敛曲线,却发现单卡连 micro batch=8 都 OOM 时,梯度累积(Gradient Accumulation)几乎是唯一不依赖多机多卡就能"假装大批量"的手段。但它远不是"把 loss 除以 N 再累加起来"那么简单:Batch Normalization 的统计错位…

损失函数深度实战:从交叉熵、标签平滑到 Focal Loss 与多任务损失的训练工程全解

系统拆解损失函数的第一性原理:为什么 0/1 损失不可导、所有可训练损失都是替代损失;从交叉熵的最大似然与 KL 散度推导、log_softmax 的数值稳定性,到标签平滑(ε 软化目标)、Focal Loss(聚焦难样本、α/γ 调参)、BCE+pos_weight 处理类别不平衡,再覆盖回归损失(MSE/MAE/Huber/Log-Cosh/分位)、带温度 KL 的蒸馏损失与基于同方差不确定性的多任务自适应加权,并给出 10 项生产陷阱清单(数值溢出、reduction 与梯度累积、ignore_index、混合精度、软标签类型、类别失衡、蒸馏冲突、多任务尺度失衡、NaN 检测、指标与 loss 解耦)与可复现 PyTorch 工具箱。与本站 RMSNorm、相对位置编码、交叉注意力、残差连接、学习率调度、梯度累积、词嵌入、激活函数共同构成 Transformer 内部机制与训练工程深度解系列(补全训练目标一环)。