热门图集

损失函数深度实战:从交叉熵、标签平滑到 Focal Loss 与多任务损失的训练工程全解

系统拆解损失函数的第一性原理:为什么 0/1 损失不可导、所有可训练损失都是替代损失;从交叉熵的最大似然与 KL 散度推导、log_softmax 的数值稳定性,到标签平滑(ε 软化目标)、Focal Loss(聚焦难样本、α/γ 调参)、BCE+pos_weight 处理类别不平衡,再覆盖回归损失(MSE/MAE/Huber/Log-Cosh/分位)、带温度 KL 的蒸馏损失与基于同方差不确定性的多任务自适应加权,并给出 10 项生产陷阱清单(数值溢出、reduction 与梯度累积、ignore_index、混合精度、软标签类型、类别失衡、蒸馏冲突、多任务尺度失衡、NaN 检测、指标与 loss 解耦)与可复现 PyTorch 工具箱。与本站 RMSNorm、相对位置编码、交叉注意力、残差连接、学习率调度、梯度累积、词嵌入、激活函数共同构成 Transformer 内部机制与训练工程深度解系列(补全训练目标一环)。

CPU 推测执行与瞬态执行攻击:从 Meltdown 到 Spectre 的处理器安全攻防演进

深入分析现代 CPU 推测执行机制及其衍生的瞬态执行安全漏洞,从微架构层面解析 Spectre v1/v2/v3(Meltdown)/v4 的攻击原理与防御演化,覆盖分支预测器毒化、瞬态执行窗口利用、微架构侧信道构建,结合 Linux 内核 KPTI、poline、eIBRS 等防御方案进行深度工程实战分析。