在自回归解码中,每生成一个新 token 都需要复用此前所有 token 的键和值。键值缓存(KV Cache)将这些中间计算结果缓存起来,后续步骤只需重算新 token 的查询,避免重复计算,是推理加速的基础手段。
为减小缓存占用,实践中发展出多查询注意力(MQA)和分组查询注意力(GQA):MQA 让所有查询头共享同一组键值,GQA 则在二者之间折中,将查询头分组共享键值。GQA 在质量与速度间取得平衡,已被 Llama、Mistral 等现代模型广泛采用。
推理优化的完整技术栈还包括:FlashAttention 降低注意力内存开销、PagedAttention 以分页方式管理 KV 缓存消除碎片、量化(INT8/INT4)减少显存占用、以及投机解码(Speculative Decoding)用小模型并行草稿、大模型批量验证来摊薄单 token 成本。这些手段组合使用,使生产环境能够高效服务长上下文、高并发的推理请求。