DeepNorm

残差连接深度实战:从退化问题与恒等映射、残差流到 Pre-LN 与深度初始化工程

系统拆解残差连接的第一性原理:为何 plain 网络会退化、恒等映射 y=F(x)+x 如何在反向传播中保留永不消失的梯度高速通道(∂L/∂x = ∂L/∂y·(∂F/∂x + I)),并从机制可解释性视角解读 Transformer 的残差流(注意力/MLP 只是写入主干的低秩扰动);深入 Pre-LN 与 Post-LN 的稳定性对比、ReZero/SkipInit/Fixup/LayerScale/DeepNorm 等深度初始化技巧、混合精度下残差累加的数值稳定性,给出可切换 Pre/Post-LN 的生产级 PyTorch 实现与生产陷阱清单,与本站 RMSNorm、相对位置编码、交叉注意力、学习率调度共同构成 Transformer 内部机制与训练工程深度解系列。