GPU

AI 推理引擎的批处理与内存管理:从 Continuous Batching 到 PagedAttention 的工程实践

本文深入剖析现代推理引擎解决吞吐-延迟-显存矛盾的两大核心技术:Continuous Batching(迭代级批处理)和 PagedAttention(分页KV Cache)。从操作系统内存管理视角,详解其CUDA实现内核、Prefix Caching机制、分离式架构演进,并提供生产环境调优与避坑指南。

eBPF AI 推理服务全链路可观测性工程实战

深入探讨如何利用eBPF构建AI推理服务的全链路可观测性工具栈,覆盖从请求入口到GPU计算完成的完整链路,包含GPU kernel launch追踪、CPU调度延迟分析、内存分配热点检测、网络层追踪等实战案例与代码示例。