高性能计算

WebGPU 计算着色器矩阵乘法优化:从 Naive 到 Tiled 深度实战

深入剖析 WebGPU 计算着色器实现高效矩阵乘法的完整管线:从朴素实现到 Tiled 分块策略、Workgroup Memory 利用、寄存器分块优化,包含完整 WGSL 代码、JavaScript 端管线配置、性能基准测试数据(Apple M2 Pro 实测),以及工程实践建议(TILE_SIZE 选择、Bank Conflict 避免、timestamp-query 精确计时等)。

WebGPU Subgroup 操作与 SIMT 性能优化实战:从 shuffle 到 ballot

WebGPU 的 subgroup 原语为 Web 平台带来了 GPU 级别的 SIMD 通信能力。本文深入讲解 subgroup 的核心操作(shuffle/ballot/reduction),并通过 4 个实战场景(高效归约、warp 级前缀和、分支优化、GEMM 分块策略)展示如何利用 subgroup 实现 workgroup 共享内存 3-12x 的性能突破。包含完整 WGSL 实现和 Chrome/Edge 的性能基准数据。

图计算系统深度工程实战:从 Pregel 顶点中心 BSP、PowerGraph GAS 到 GraphBLAS 代数化算子与 GPU 图遍历

拆解现代图计算系统的三条技术路线:Pregel 的顶点中心 BSP 超步与 Combiner/Checkpoint 工程、PowerGraph 的 vertex-cut 与 GAS 模型如何应对幂律分布、GraphBLAS 如何用半环把图算法重写为稀疏线性代数,以及 GPU 上 CSR 遍历的 warp 级负载均衡与前沿策略,并给出工程选型对照表。