推理部署

LLM 推理 Disaggregated Architecture:Prefill-Decode 分离架构深度实战

随着大模型推理规模从单机走向多机,Prefill与Decode阶段的计算特征差异成为系统瓶颈的根本原因。本文深入剖解NVIDIA Dynamo、Mooncake等工业界Disaggregated Inference架构的设计哲学,涵盖KV Cache传输优化、分布式调度算法、负载均衡策略,并结合真实生产环境数据给出工程实践指南。

大模型蒸馏与小型化深度工程实战:从 Logit、中间特征对齐到合成数据流水线的生产级全解

拆解大模型蒸馏的四类知识表示(Logit/特征/关系/偏好)、温度与梯度 T^2 刻度的真实数学、中间层维度不匹配的投影对齐与关系蒸馏、在线自蒸馏的算力权衡,以及决定蒸馏上限的合成数据流水线:种子分层、拒绝采样验证器、MinHash 去重、难度课程化与评测去污染,附 PyTorch 可运行代码与生产陷阱清单。

LLM 推理优化深度实战(最终版)

深入拆解现代LLM推理引擎核心技术——从PagedAttention的显存管理、Continuous Batching的吞吐优化,到Speculative Decoding的解码加速,附带完整代码示例和vLLM部署实践。