高性能计算

大模型分布式训练并行与显存工程实战:从 ZeRO 分片、FSDP 扁平参数到激活重计算与通信重叠全链路

沿真实工程决策链拆解大模型分布式训练:先算清混合精度 AdamW 的 16 字节/参数显存账本,再区分 DP/TP/PP 三种并行各自解决的维度,深入 ZeRO 三级分片与 FSDP FlatParameter 编排(含 70B 在 64 卡上的单卡显存实测表),给出选择性激活重计算的算力-显存兑换率与 use_reentrant 陷阱,最后落到 prefetch、bucket 与梯度累积 no_sync 的通信-计算重叠实战。

FlashAttention 算法深度解析:从 IO-Aware 优化到 GPU 硬件极致

FlashAttention 通过 IO-Aware 的 Tiling + Recomputation 策略,将 Self-Attention 的 HBM 访问复杂度从 O(N²) 降至 O(N²/d),在不牺牲数学精度的前提下实现 2-4× 端到端训练加速。本文深入推导 Online Softmax 数学基础、解析 FlashAttention/2/3 三代算法演进、剖析 Hopper/Tensor Core 适配优化,并给出一套完整的工程性能分析框架。