CUDA Warp 编程深度实战:从 Bank Conflict 到 Tensor Core 极限优化 深入NVIDIA GPU Warp级并行机制,从Bank Conflict原理到Tensor Core极限优化,涵盖Shared Memory架构、Warp分支发散、FP16矩阵乘实战案例及NSight Compute性能分析 GPU并行计算 2026年09月29日 0 点赞 0 评论 56 浏览
CUDA Unified Memory 深度工程:虚拟内存管理、页面迁移与 OOM 治理实战 深入剖析CUDA Unified Memory的内部机制、页面迁移策略、VMM虚拟内存管理API以及生产环境中的OOM治理方案。涵盖从CUDA 6到CUDA 12的内存模型演进、GPU缺页中断、cuMemAdvise/cuMemPrefetchAsync优化、Split Migration以及自研显存管理器的实战代码。 内存管理 2026年10月03日 0 点赞 0 评论 58 浏览
Linux内核内存管理在LLM推理引擎中的深度工程——从HugePages到KV Cache的NUMA感知实战 深入剖析LLM推理引擎如何利用Linux内核HugePages规避TLB miss、通过NUMA绑定消除跨节点内存访问延迟、使用mlockall避免推理过程中的Page Fault停顿,以及多推理实例场景下的最优NUMA拓扑感知分配。 内存管理 2026年09月29日 0 点赞 0 评论 60 浏览
RDMA 编程实战:从 Verbs API 到零拷贝分布式系统架构 RDMA编程深度实战:从Verbs API到零拷贝分布式系统架构。涵盖RDMA核心概念、QP状态机、批量提交与Doorbell优化、ODP内存管理、内存窗口与FMR策略,以及NCCL在AI训练集群中的RDMA传输层原理,配套完整C语言代码示例。 分布式系统 2026年10月03日 0 点赞 0 评论 63 浏览