CXL 内存扩展在 AI 训练中的实践:梯度检查点、优化器状态与生产部署 深入剖析 CXL (Compute Express Link) 内存在 AI 训练工作负载中的架构设计与工程实践,涵盖 ZeRO-Infinity offload 策略、PyTorch 自定义 CXL 分配器、性能基准测试以及与 HBM/NVMe 的层级对比。 AI应用开发 2026年10月01日 0 点赞 0 评论 3 浏览