推理性能优化

Apache TVM 深度学习编译器深度工程实战:从 Relax IR、TensorIR 调度到 MetaSchedule 自动调优与代码生成的全链路解析

沿 Apache TVM 的真实编译链路拆解深度学习编译器内核:Relax 图级 IR 的符号形状与 dataflow 作用域、TensorIR 的 block 抽象如何把调度与计算语义隔离、Schedule 原语(分块/绑定/多级缓存/双缓冲)背后的数据复用与 occupancy 权衡、MetaSchedule 如何把调参变成可版本化的搜索问题,并给出生产环境中静默 fallback、layout 转换、动态 shape 与精度丢失四类故障模式的排查清单。

ONNX Runtime 推理引擎深度工程实战:从图优化、算子融合到执行提供器与内存规划的全链路解析

沿 ONNX Runtime 的真实执行链路拆解推理引擎内核:Session 初始化时的 Graph Transformer 图改写与三级优化、算子融合收益的真实来源、执行提供器如何做图分区以及跨 EP 拷贝的代价、静态内存规划如何用生命周期区间复用显存、IOBinding 零拷贝的适用边界,并给出生产落地清单与常见故障模式。