KV Cache 是大模型推理中显存占用的主要来源之一,尤其在长上下文场景下占用显著。端侧大模型通过多种 KV Cache 优化技术降低显存需求。
借鉴操作系统虚拟内存分页思想,将 KV Cache 拆分为固定大小的页,非连续存储、按需分配,彻底解决传统注意力机制中长上下文下的内存浪费问题。该技术由 vLLM 首创,MLC-LLM 等框架已在移动端实现。
将 KV Cache 的存储精度从 FP16 压缩至 INT4 或更低,显存占用可缩减 50%—75%。KVTuner(ICML 2025)通过敏感度感知的逐层混合精度搜索,对 Llama-3.1-8B 实现 3.25-bit 近乎无损量化,对 Qwen2.5-7B 等敏感模型可实现 3.92-bit 量化,精度损失极小;KIVI 等方案则通过非对称逐通道和逐 token 量化实现 2.6 倍压缩。
组查询注意力通过减少 KV 头的数量降低 KV Cache 占用。例如 Llama 3.2 3B 使用 8 个 KV 头对应 32 个查询头,实现 4 倍 KV Cache 减少,已成为移动端模型的默认配置。
滑动窗口注意力限制注意力计算的上下文范围,使 KV Cache 占用与上下文长度解耦。Mistral 7B 使用 4096 token 的固定窗口,在超长上下文场景下有效控制显存增长。