人工智能

模型提取与盗取攻击深度实战:从黑盒 Prediction API 到替代模型克隆与参数反解的安全工程

机器学习即服务(MLaaS)把训练好的模型包装成一个"提问—返回预测"的 API:你传入一条样本,它吐回类别标签或置信度。这种**黑盒**便利的背后藏着一条被长期低估的攻击面——**模型提取(Model Extraction)/ 模型盗取(Model Theft)**:攻击者仅凭查询权限,就能重建出与原模型功能等价、甚至参数完全一致的克隆,从而免费"白嫖"商业模型、绕开付费墙、或为后续对抗攻击铺路…

词嵌入深度实战:从分布假设、Word2Vec 负采样到 GloVe 与上下文化表示的工程全解

词嵌入(Word Embedding)是把离散符号映射为连续稠密向量的技术,它是一切现代 NLP 与 LLM 的底层地基:Transformer 的第一层就是一个巨大的嵌入查找表,检索式增强(RAG)的"语义向量"本质也是嵌入,甚至连多模态对齐都依赖共享嵌入空间。本文从分布假设的第一性原理出发,推导 Word2Vec 负采样与 GloVe 的数学,给出可复现的 PyTorch 实现,并落到 Tra…

梯度累积深度实战:从显存墙、小批量退化到有效批次与混合精度训练的协同工程

在大模型训练的工程现场,GPU 显存是最硬的约束。当你想用 128 的全局批量(global batch)去逼近论文里的收敛曲线,却发现单卡连 micro batch=8 都 OOM 时,梯度累积(Gradient Accumulation)几乎是唯一不依赖多机多卡就能"假装大批量"的手段。但它远不是"把 loss 除以 N 再累加起来"那么简单:Batch Normalization 的统计错位…

残差连接深度实战:从退化问题与恒等映射、残差流到 Pre-LN 与深度初始化工程

系统拆解残差连接的第一性原理:为何 plain 网络会退化、恒等映射 y=F(x)+x 如何在反向传播中保留永不消失的梯度高速通道(∂L/∂x = ∂L/∂y·(∂F/∂x + I)),并从机制可解释性视角解读 Transformer 的残差流(注意力/MLP 只是写入主干的低秩扰动);深入 Pre-LN 与 Post-LN 的稳定性对比、ReZero/SkipInit/Fixup/LayerScale/DeepNorm 等深度初始化技巧、混合精度下残差累加的数值稳定性,给出可切换 Pre/Post-LN 的生产级 PyTorch 实现与生产陷阱清单,与本站 RMSNorm、相对位置编码、交叉注意力、学习率调度共同构成 Transformer 内部机制与训练工程深度解系列。

学习率调度深度实战:从 Warmup、Cosine 退火到 WSD 与线性缩放律的大批量预训练工程

系统拆解学习率调度的第一性原理:为什么 LR 主宰优化轨迹与泛化(flat/sharp minima),从恒定与阶梯衰减的朴素基线,到线性/常数/余弦三种 Warmup 的动力学成因,再到 Cosine 退火、SGDR 与现代化大模型预训练范式 Warmup-Stable-Decay(WSD),并深入线性缩放律与 Accumulated Warmup 修正、与梯度累积/混合精度/梯度裁剪的交互陷阱,给出可复用的 PyTorch 组合调度器与生产陷阱清单,与本站 RMSNorm、相对位置编码、交叉注意力共同构成 Transformer 内部机制与训练工程深度解系列。

交叉注意力深度实战:从编码器-解码器对齐、KV 投影到多模态融合与流式解码工程

系统拆解交叉注意力的第一性原理:Q 来自解码端、K/V 来自编码端,从 Bahdanau 加性注意力、Luong 乘性注意力到现代缩放点积交叉注意力,亲手实现一个生产级 CrossAttention 模块,并深入多模态融合(Whisper/视觉-语言/Perceiver)、流式解码的 cross KV 缓存复用、FlashAttention 适配与生产陷阱清单,与本站 RMSNorm、相对位置编码共同构成 Transformer 内部机制深度解三部曲。