GPU 缺页中断与 CUDA Unified Memory — 从 HMM 框架到 AI 推理大显存管理的工程实践 深入解析 GPU MMU 页表管理与 CUDA Unified Memory 的按需页迁移机制,剖析 Linux 内核 HMM 框架的设计原理与 NVIDIA UVM 驱动实现,给出在 AI 推理生产环境中利用 UM 管理超大规模显存的实战方法论。 网络技术 2026年10月07日 0 点赞 0 评论 2 浏览