人工智能

LLM 推理优化深度实战(最终版)

深入拆解现代LLM推理引擎核心技术——从PagedAttention的显存管理、Continuous Batching的吞吐优化,到Speculative Decoding的解码加速,附带完整代码示例和vLLM部署实践。

LLM 后训练量化深度实战:从 GPTQ/AWQ 到 FP8 与 KV Cache 量化的显存-带宽极限工程

从 Roofline 模型定量证明 decode 阶段 Tensor Core 利用率仅 0.33% 的内存墙困境出发,系统拆解 LLM 后训练量化的完整工程栈:group-wise 量化粒度、SmoothQuant 的 outlier 迁移、GPTQ 的 Hessian 误差补偿、AWQ 的激活感知缩放、FP8 延迟缩放与 KV Cache 分级量化,并给出逐层重建误差定位法与生产选型决策树。

投机解码深度实战:从草稿-验证采样到 EAGLE 树状草稿,把 LLM 解码延迟砍一半

从内存墙出发推导投机解码的第一性原理,给出可直接运行的接受-拒绝采样完整实现与残差重采样推导,对比独立草稿模型/Medusa/MTP/EAGLE/n-gram 五条路线,讲透树状草稿与 tree attention mask,最后给出 vLLM、SGLang 生产配置、四种不该开启的场景与真实接受率调优方法论。

AI Agent 长程记忆工程实战:从分层记忆模型到遗忘机制与生产级检索闭环

从工程落地视角拆解 AI Agent 长程记忆子系统:情景/语义/程序性三层记忆模型、抽取-去重-固化的写入链路、BM25+向量+元数据过滤的三路混合检索与 RRF 融合、时间衰减与冲突消解驱动的遗忘机制、以及记忆召回率/污染率/无效召回率三大评测指标,附可运行的 Python 实现与生产落地清单。