unchanged 深入剖析 Transformer 推理中 KV Cache 的内存管理机制,从 vLLM 的 PagedAttention 到推测解码的显存优化策略,结合生产级代码实战,揭示如何在不牺牲吞吐的前提下将显存占用压缩到极致。 AI应用与Agent 2026年10月01日 0 点赞 0 评论 28 浏览
模型量化实战:从 AWQ/GPTQ 到 NVIDIA FP8 推理的工程部署与性能调优 深度剖析大语言模型推理中的量化技术路线,从 GPTQ、AWQ、SmoothQuant 到 NVIDIA 硬件级 FP8 推理,结合 vLLM 与 TensorRT-LLM 实战部署,给出一套完整的工程方案。 Linux与内核 2026年10月07日 0 点赞 0 评论 1 浏览