系统内核

大模型推理引擎 KV Cache 三级存储架构:从 GPU HBM 到 CPU DRAM 再到 NVMe SSD 的工程实践

深度剖析大推理引擎中 KV Cache 跨 GPU HBM、CPU DRAM、NVMe SSD 三级存储的调度架构与工程实现,涵盖 PagedAttention 的页表管理、CPU 换入换出策略、NVMe KV Cache 引擎设计、预取与淘汰算法,以及 2026 年最新方案对比(vLLM、SGLang、Mooncake、DistServe),附生产级性能基准与优化实践。

io_uring uring_cmd 直通 NVMe 构建零拷贝 KV 存储引擎:架构设计、实现与生产调优

本文深入解析 io_uring 的 uring_cmd 机制如何直通 NVMe 设备绕过 Block Layer,并结合零拷贝缓冲区注册、批量提交与 SQPOLL 模式构建高性能用户态 KV 存储引擎。涵盖从内核机制到底层实现的完整工程路径,包括 WAL 一致性保证、LSM-Tree 存储架构、生产调优策略以及与 SPDK 方案的对比分析。

Linux Kernel io_uring: 异步 I/O 的工程实现与性能优化深度实战

从架构设计、核心数据结构、编程模型、性能优化四个维度,深度解析 Linux io_uring 异步 I/O 的工程实现。涵盖双队列模型、零系统调用模式、SQPOLL、缓冲区注册、链接操作、Multishot 等高级特性,附带 RocksDB/PostgreSQL 生产实践案例和性能基准测试对比。