系统内核

深入理解 GPU Tensor Core 架构与 CUDA 编程实战:从 Ampere 到 Blackwell 的 AI 高性能计算

从工业级 AI 计算的视角,系统性梳理 NVIDIA Tensor Core 的架构演进(Volta→Ampere→Hopper→Blackwell),深入讲解 CUDA WMMA API、Hopper TMA 异步拷贝、Warp Group wgmma 指令、共享内存 Swizzle、多级流水线设计,并提供 FP8 混合精度 GEMM 内核实战案例与 Nsight Compute 性能剖析指南。

Linux 内核 io_uring 与 userfaultfd 联合实战:零拷贝内存管理从理论到 KV 引擎生产部署

探索将io_uring zero-copy提交机制与userfaultfd用户态缺页中断处理深度融合的架构,通过userfaultfd监控mmap区域缺页事件,按需从预注册池中翻转页面配合IORING_OP_READ/WRITE实现从块设备到应用内存的全链路零拷贝,附带Rust+256行KV引擎原型,吞吐提升2.3倍、延迟p99降低58%。