多查询注意力

分组查询注意力(GQA)与多查询注意力(MQA)深度实战:从 KV 缓存瓶颈、头维度折叠到推理吞吐与显存占用的工程全解

> 自回归大模型推理的真实瓶颈,往往不在算力而在**显存带宽与 KV 缓存占用**。当模型层数、上下文长度、并发数同时放大,多头注意力(MHA)为每个查询头都保留一份独立的 Key/Value,KV 缓存体积随头数线性膨胀,最终把解码速度牢牢钉在 HBM 带宽上限上。分组查询注意力(Grouped Query Attention, GQA)与多查询注意力(Multi-Query Attention…