LLVM 编译器基础设施深度实战:从 IR 中间表示到 Pass 优化管道、JIT 编译引擎与 MLIR 多级表示的完全工程指南 LLVM编译器基础设施深度实战:从IR中间表示、SSA形式、Pass优化管道系统、Clang前端AST、TableGen后端描述、OrchJIT引擎、Sanitizer内存/并发安全工具、MLIR多级表示框架到生产级工程实践(编译时间优化、PGO、C++ Modules)的完全工程指南 后端开发 2026年09月20日 0 点赞 0 评论 4 浏览
Triton GPU编程语言深度实战:从矩阵乘法到Flash Attention、内核融合与AI编译器优化的完全工程指南 Triton是由OpenAI开发的开源GPU编程语言,提供类似Python的高级语法同时达到接近手写CUDA的性能。本文深入讲解Triton的编程模型、矩阵乘法优化、Flash Attention实现、内核融合技术以及在PyTorch生产环境中的最佳实践。 AI技术 2026年09月20日 0 点赞 0 评论 3 浏览