GPU
LLM推理PD分离架构深度工程实践:从Prefill-Decode异构到分布式KV Cache传输
深入剖析LLM推理PD分离架构的工程实践:从Prefill-Decode异构到分布式KV Cache传输,涵盖DistServe、Mooncake、NVIDIA Dynamo等系统的设计原理与传输协议优化。
Apache Arrow 列存内存格式深度工程:零拷贝数据交换的事实标准
深入剖析 Apache Arrow 列式内存格式的物理布局、IPC 零拷贝协议、CUDA Buffer GPU 互操作、字典编码机制,并提供 Rust 实战代码示例展示跨语言数据共享的最佳实践。
Linux内核DMA-BUF显式同步与跨驱动缓冲区共享:从零构建零拷贝GPU计算管线
在现代AI推理管线中,数据搬运的耗时往往超过计算本身。CPU与GPU、GPU与GPU、存储与加速器之间的零拷贝数据共享,是突破性能瓶颈的关键。Linux内核的DMA-BUF子系统正是解决这一问题的核心基础设施,而显式同步机制(explicit fencing)则是保证多设备并发访问正确性的基石。本文将深入DMA-BUF的内部机制,从零实现一个跨驱动的零拷贝GPU计算管线。
Rust 实现 LLM 推理引擎深度工程实战:从 Flash Attention 内核到 Continuous Batching
深入拆解如何用 Rust 从零构建 LLM 推理引擎:Flash Attention V2 内核的 SIMD 与 Online Softmax 分块优化、PagedKVCache 的 Copy-on-Write 内存管理、连续批处理调度器的迭代级调度策略。
WebGPU Compute Shader 深度工程实战:从 WGSL 到 GPU 极致优化
深入剖析WebGPU Compute Shader工程实现,从WGSL着色器语言到workgroup内存模型、同步原语,并通过矩阵乘法优化、并行前缀和与直方图统计三个典型GPU算法完整实现,展示如何在浏览器中榨取GPU并行算力极限。
eBPF AI 推理服务全链路可观测性工程实战
深入探讨如何利用eBPF构建AI推理服务的全链路可观测性工具栈,覆盖从请求入口到GPU计算完成的完整链路,包含GPU kernel launch追踪、CPU调度延迟分析、内存分配热点检测、网络层追踪等实战案例与代码示例。
Multi-Tenant GPU Scheduling in Production: From Time-Slicing to MIG and Beyond
深度解析多租户 GPU 调度三大模型(Time-Slicing、MIG、vGPU)的原理、生产级实现与选型策略,含完整 Kubernetes 部署示例和性能基准对比。
GPU计算生态深度实战:从CUDA到异构计算的编程模型与工程实践
从GPU硬件架构出发,深入剖析CUDA编程模型的底层原理,探讨内存层次优化、线程调度机制,并对比分析HIP、SYCL等开放生态替代方案,介绍基于CXL和池化的GPU资源调度前沿实践。
