GPU

AI 推理引擎的批处理与内存管理:从 Continuous Batching 到 PagedAttention 的工程实践

本文深入剖析现代推理引擎解决吞吐-延迟-显存矛盾的两大核心技术:Continuous Batching(迭代级批处理)和 PagedAttention(分页KV Cache)。从操作系统内存管理视角,详解其CUDA实现内核、Prefix Caching机制、分离式架构演进,并提供生产环境调优与避坑指南。

Linux DRM/KMS 显示管理子系统深度实战:从 KMS 原子模式设置到 GPU 渲染管线的全链路架构

深度解析Linux DRM/KMS显示管理子系统:从CRTC/Encoder/Connector/Plane核心硬件抽象模型出发,详解Atomic Modesetting事务性提交机制、VBlank与Page Flip帧同步、DMA-BUF零拷贝共享、GEM显存管理、三大GPU驱动架构(amdgpu/i915/nouveau)、GPU重置恢复、与Xorg/Wayland合成器的协作,以及完整的用户态libdrm编程实战。