GPU

unchanged

深入Linux GPU计算子系统:从Vulkan Compute Shader全流程(实例/SPIR-V/描述符/命令缓冲)到DRM子系统架构(KMS/Render Nodes/GEM),探讨DMA-BUF零拷贝共享、内核GPU调度器机制与生产级调试工具。

unchanged

深入剖析 Transformer 推理中 KV Cache 的内存管理机制,从 vLLM 的 PagedAttention 到推测解码的显存优化策略,结合生产级代码实战,揭示如何在不牺牲吞吐的前提下将显存占用压缩到极致。

unchanged

深入剖析 NVIDIA Grace Hopper 超级芯片 NVLink-C2C 统一内存架构的硬件实现和 CUDA Unified Memory 软件栈,从缓存一致性协议到 on-demand paging 页迁移机制,再到大模型推理中的 KV Cache 工程优化。