人工智能

LLM 后训练量化深度实战:从 GPTQ/AWQ 到 FP8 与 KV Cache 量化的显存-带宽极限工程

从 Roofline 模型定量证明 decode 阶段 Tensor Core 利用率仅 0.33% 的内存墙困境出发,系统拆解 LLM 后训练量化的完整工程栈:group-wise 量化粒度、SmoothQuant 的 outlier 迁移、GPTQ 的 Hessian 误差补偿、AWQ 的激活感知缩放、FP8 延迟缩放与 KV Cache 分级量化,并给出逐层重建误差定位法与生产选型决策树。

投机解码深度实战:从草稿-验证采样到 EAGLE 树状草稿,把 LLM 解码延迟砍一半

从内存墙出发推导投机解码的第一性原理,给出可直接运行的接受-拒绝采样完整实现与残差重采样推导,对比独立草稿模型/Medusa/MTP/EAGLE/n-gram 五条路线,讲透树状草稿与 tree attention mask,最后给出 vLLM、SGLang 生产配置、四种不该开启的场景与真实接受率调优方法论。

AI Agent 长程记忆工程实战:从分层记忆模型到遗忘机制与生产级检索闭环

从工程落地视角拆解 AI Agent 长程记忆子系统:情景/语义/程序性三层记忆模型、抽取-去重-固化的写入链路、BM25+向量+元数据过滤的三路混合检索与 RRF 融合、时间衰减与冲突消解驱动的遗忘机制、以及记忆召回率/污染率/无效召回率三大评测指标,附可运行的 Python 实现与生产落地清单。

Model Context Protocol (MCP) 工程实践:构建 AI Agent 的万能接口

深入解析 MCP 协议的核心架构设计、消息传输机制、安全模型,通过生产级实战案例(文件系统 Agent、数据库查询 Agent、多工具协作文档生成 Agent)展示从零构建健壮 MCP Server 的完整路径。涵盖 2026 年 MCP 生态的 Streamable HTTP 扩展、安全模型演进与多 Agent 协作架构。