首页
学习
活动
专区
圈层
工具
发布
技术百科首页 >端侧大模型 >端侧大模型的 KV Cache 优化有哪些方法?

端侧大模型的 KV Cache 优化有哪些方法?

词条归属:端侧大模型

KV Cache 是大模型推理中显存占用的主要来源之一,尤其在长上下文场景下占用显著。端侧大模型通过多种 KV Cache 优化技术降低显存需求。

1. 分页注意力(PagedAttention)

借鉴操作系统虚拟内存分页思想,将 KV Cache 拆分为固定大小的页,非连续存储、按需分配,彻底解决传统注意力机制中长上下文下的内存浪费问题。该技术由 vLLM 首创,MLC-LLM 等框架已在移动端实现。

2. KV Cache 量化

将 KV Cache 的存储精度从 FP16 压缩至 INT4 或更低,显存占用可缩减 50%—75%。KVTuner(ICML 2025)通过敏感度感知的逐层混合精度搜索,对 Llama-3.1-8B 实现 3.25-bit 近乎无损量化,对 Qwen2.5-7B 等敏感模型可实现 3.92-bit 量化,精度损失极小;KIVI 等方案则通过非对称逐通道和逐 token 量化实现 2.6 倍压缩。

3. 组查询注意力(GQA)

组查询注意力通过减少 KV 头的数量降低 KV Cache 占用。例如 Llama 3.2 3B 使用 8 个 KV 头对应 32 个查询头,实现 4 倍 KV Cache 减少,已成为移动端模型的默认配置。

4. 滑动窗口注意力

滑动窗口注意力限制注意力计算的上下文范围,使 KV Cache 占用与上下文长度解耦。Mistral 7B 使用 4096 token 的固定窗口,在超长上下文场景下有效控制显存增长。

相关文章
大模型的性能提升:KV-Cache
大语言模型(LLM)在生成文本时,通常是一个 token 一个 token 地进行。每当模型生成一个新的 token,它就会把这个 token 加入输入序列,作为下一步预测下一个 token 的依据。这一过程不断重复,直到完成整个输出。
半吊子全栈工匠
2025-06-19
5.9K14
大模型推理优化——从KV Cache到投机解码,原理+实战
我盯着屏幕看推理时间——7秒一个token。心里咯噔一下,这不行啊。回头一看配置,一个Llama-2-7B,单张A100。理论上应该能跑飞快,结果慢得像卡在80年代的拨号上网。
烟雨平生
2026-06-29
3550
React虚拟列表在移动端的优化方法有哪些?
在移动端实现 React 虚拟列表时,需要针对移动设备的性能特点(如屏幕尺寸小、算力有限、触摸交互等)进行特殊优化。以下是关键的优化方法及实现思路:
搜罗万相
2025-08-14
4050
端侧 AI 的推理加速:手机端大模型怎么提速?
我们常用的云端模型可以依赖服务器和数据中心,但手机上的模型就没这么强大的后盾。不仅如此,它还要顾及电池、内存、发热,还有尽量别让用户等太久。
七牛开发者
2026-06-29
1480
【大模型】大模型备案的限定领域有哪些?
大模型是一种机器学习中的模型,它通常用于处理大模型的数据集和复杂的任务。大模型因其出色的性能和表现备受关注。接下来就讨论以下大模型的一些限定领域都有哪些。
AI合规咨询专家
2025-08-26
4430
点击加载更多
问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档
领券