端侧大模型(On-Device Large Language Model)是指部署在终端设备(如智能手机、笔记本电脑、智能汽车、嵌入式硬件等)上本地运行的大语言模型,通过模型压缩、量化、知识蒸馏等技术,在有限的算力、内存和功耗约束下实现高效推理,无需依赖云端网络即可完成 AI 任务处理。其核心特征是"数据不出域、推理不依赖云端、端到端毫秒级响应",在隐私安全、离线可用、低延迟等方面具有显著优势。
端侧大模型的技术核心在于解决大模型参数量大、计算量高的特性与终端设备资源受限之间的矛盾。其核心技术体系涵盖模型轻量化、推理引擎优化和硬件协同三大方向。
模型轻量化是端侧部署的基础,主要包括量化压缩、知识蒸馏和结构化剪枝三大路径。量化压缩将模型权重从高精度浮点数转换为低比特整数,可在保持模型精度的同时大幅减少内存占用;知识蒸馏通过教师-学生模型架构,将大模型的知识迁移至轻量级学生模型;结构化剪枝则通过移除冗余参数进一步压缩模型体积。
端侧推理引擎通过算子融合、即时编译(JIT)、低精度算子定制等手段,在有限硬件资源下最大化推理效率。算子融合将多个小算子合并为大算子,减少核函数启动开销和访存次数;即时编译针对边缘硬件特性实时优化指令调度;低精度算子则针对 INT4/FP4 等量化格式开发硬件原生算子。
边缘设备普遍采用 CPU+GPU/NPU+DSP 的异构架构,推理引擎根据任务特性进行分层调度:计算密集型任务(如注意力计算、矩阵乘法)卸载到 GPU/NPU 张量核心;控制密集型任务放在 CPU 多核执行。通过零拷贝数据传输和统一虚拟内存寻址,实现硬件资源的极致利用。
量化是端侧大模型部署的核心技术,通过降低模型权重和激活值的数值精度来减小模型体积、降低显存占用并提升推理速度。
INT8 量化是端侧部署的"安全区",将 FP16 权重转换为 8 位整数,内存占用减半,精度损失通常在 1% 以内。该技术通过量化感知训练(QAT)或训练后量化(PTQ)实现,对硬件要求低,绝大多数终端设备的 NPU 原生支持 INT8 推理,适合对精度要求较高的场景。
INT4 量化是当前端侧部署的主流方案,将权重压缩至 4 位整数,内存占用降低 75%,精度损失控制在 3%—8%。AWQ(Activation-aware Weight Quantization)是 INT4 量化的事实标准,通过保护关键权重实现近无损压缩。GGUF 格式的 Q4_K_M 方案是最常用的 INT4 量化档位,在精度和速度之间取得最佳平衡,适合大多数端侧部署场景。
量化精度 | 内存压缩比 | 精度损失 | 适用场景 |
|---|---|---|---|
INT8 | 2× | <1% | 高精度需求、NPU 原生支持设备 |
INT4 | 4× | 3%—8% | 大多数端侧场景(主流选择) |
INT2/2-bit | 8×—16× | 5%—15% | 极限压缩、超低资源设备 |
端侧大模型的模型压缩技术形成完整的"量化+剪枝+蒸馏"技术矩阵,各技术路径可组合使用实现更高压缩比。
量化压缩是最易采用、最少依赖重训练的压缩方法。将 FP16 权重转换为 INT4/INT8,模型结构不变、参数量不变,但每个参数占用的比特数大幅减少。该方法无需重训练即可部署,是端侧模型压缩的首选方案。
知识蒸馏通过教师-学生模型架构,将大模型的知识迁移至轻量级学生模型。学生模型学习教师模型的输出分布和中间特征,可在大幅减少参数量的同时保留核心能力。该方法需要训练过程配合,但能实现 10 倍以上的体积压缩。
结构化剪枝通过移除整个通道、注意力头或网络层来压缩模型,剪枝后的模型可在标准硬件上高效运行。与非结构化剪枝相比,结构化剪枝更适配边缘设备,因为非结构化剪枝的高理论压缩率易被通用边缘芯片的索引寻址开销所抵消。
实际部署中通常采用组合方案:先通过知识蒸馏将大模型压缩至合适规模,再结合 INT4 量化和结构化剪枝进一步压缩。这种多级混合压缩可实现 10 倍—20 倍的整体压缩比,精度损失控制在 5%—10%。
KV Cache 是大模型推理中显存占用的主要来源之一,尤其在长上下文场景下占用显著。端侧大模型通过多种 KV Cache 优化技术降低显存需求。
借鉴操作系统虚拟内存分页思想,将 KV Cache 拆分为固定大小的页,非连续存储、按需分配,彻底解决传统注意力机制中长上下文下的内存浪费问题。该技术由 vLLM 首创,MLC-LLM 等框架已在移动端实现。
将 KV Cache 的存储精度从 FP16 压缩至 INT4 或更低,显存占用可缩减 50%—75%。KVTuner(ICML 2025)通过敏感度感知的逐层混合精度搜索,对 Llama-3.1-8B 实现 3.25-bit 近乎无损量化,对 Qwen2.5-7B 等敏感模型可实现 3.92-bit 量化,精度损失极小;KIVI 等方案则通过非对称逐通道和逐 token 量化实现 2.6 倍压缩。
组查询注意力通过减少 KV 头的数量降低 KV Cache 占用。例如 Llama 3.2 3B 使用 8 个 KV 头对应 32 个查询头,实现 4 倍 KV Cache 减少,已成为移动端模型的默认配置。
滑动窗口注意力限制注意力计算的上下文范围,使 KV Cache 占用与上下文长度解耦。Mistral 7B 使用 4096 token 的固定窗口,在超长上下文场景下有效控制显存增长。
GGUF(GGML Universal Format)是由 llama.cpp 生态定义的端侧大模型标准格式,已成为开源社区的事实标准。
GGUF 是文件格式而非量化算法,规定"量化好的模型如何存成文件"。其核心设计思想是"单文件自包含"——将模型权重、分词器、架构参数、上下文长度、Prompt 模板、量化元数据全部打包在一个 .gguf 文件中,下载即可运行,无需额外配置。
GGUF 内部按张量分块存储,支持内存映射(mmap)加载,模型文件不需要全量加载进内存,按需将当前层的权重页载入物理内存。这让普通设备也能运行超大模型。GGUF 还原生支持 K-quant 混合精度量化,同一个文件中可混合使用 Q4_K、Q6_K、F32 等不同精度档位。
GGUF 已成为端侧模型的通用标准格式,Hugging Face、Ollama、LM Studio、KoboldCpp 等主流工具均支持 GGUF 格式。llama.cpp 社区通过持续迭代,已支持从 Q2_K 到 Q8_0 的多种量化档位以及 MXFP4(Microscaling FP4)等新一代量化格式,为端侧模型提供了丰富的精度-速度选择空间。
端侧大模型的推理速度受硬件性能、量化精度、模型架构和推理引擎优化等多重因素影响。主流加速技术包括:
INT4/INT8 量化将计算从浮点运算转为整数运算,大幅提升单位算力的吞吐量。GGUF 的 Q4_K_M 方案在移动端(ARM NEON + Metal/GPU 加速)可实现约 18ms—22ms 的单 token 解码延迟;MXFP4 格式相比传统 INT4 在保持精度的同时推理速度更快。
将 Transformer 层的数十个小算子融合为 3—4 个大算子,大幅减少核函数启动次数和访存次数,推理速度提升 40%。即时编译针对边缘硬件特性优化指令调度,充分利用硬件张量核心。
推测解码使用小而快的草稿模型预先猜测多个 token,再由大模型一次性验证。EAGLE-3(NeurIPS 2025)在单流推理场景下可实现约 3 倍—6.5 倍加速,EAGLE-1/2 约 2.5 倍—3 倍,Medusa 约 1.8 倍—2.5 倍。该技术已在 vLLM、SGLang、TensorRT-LLM 等框架中集成,但需注意:高并发场景下 GPU 利用率已饱和,投机解码可能反而降低吞吐量。
替代传统静态批处理,当一个请求完成推理后立即插入新请求,无需等待整个批次完成。GPU 利用率从 30% 提升至 80% 以上,尤其适合多并发场景。
端侧大模型的显存占用由模型权重、KV Cache 和中间激活三部分构成。联合优化这三部分可实现显著的显存节省。
INT4 量化可将 7B 模型的权重从约 14GB(FP16)压缩至约 4GB,压缩比达 75%。结合 INT8 激活量化和 INT4 KV Cache 量化,可实现全链路低比特推理。
KV Cache 量化是显存优化中空间最大的环节。以 Google TurboQuant 为例,该算法在 Needle-in-a-Haystack 长上下文检索测试中,将 KV Cache 压缩至 4 倍,检索精度仍保持 99.7%(与全精度基线持平);在 LongBench 综合基准上,3.5-bit 压缩即可实现与全精度基线完全一致的平均分。KV Pareto 等系统级框架可自动搜索模型权重量化、KV Cache 量化和分页注意力的最优组合配置。
量化与 KV Cache 优化的联合使用效果显著优于单独使用。典型方案中,INT4 权重量化可将 7B 模型权重从约 14GB(FP16)压缩至约 4GB,再结合 KV Cache 量化(如 KVTuner 混合精度方案),可在保持极低精度损失的同时进一步减少 KV Cache 显存占用。实际总内存减少幅度因上下文长度、模型架构和量化方案组合而异,需要根据具体部署场景实测验证。
端侧大模型的精度损失主要取决于量化精度、量化方法和是否采用补偿机制。合理的量化策略可以在极低精度下保持较高的能力保留率。
INT8 量化精度损失通常在 1% 以内,几乎无损;INT4 量化(如 AWQ)可保持约 95% 的质量保留率,困惑度仅上升约 0.3;2-bit 量化在大模型上能力保留率可达 90%—97%,模型越大损失越小。
平滑量化(SmoothQuant)通过数学变换降低激活值的动态范围,从源头减少量化误差;量化感知训练(QAT)让模型在量化模拟环境下学习适应低比特噪声;QLoRA 微调仅需微调 0.1% 的参数即可将量化后的精度损失从 5% 降至 1% 以内。
端侧模型在通用问答、文档摘要、代码辅助等任务上已能达到可用水平,但在复杂的多步推理、长文创作等高难度任务上仍与云端大模型存在差距。实际选型时应根据任务复杂度匹配合适参数规模的模型。
2025—2026 年,端侧大模型推理框架已形成成熟的生态,主流框架各有侧重,覆盖从极客用户到应用开发者的不同需求。
llama.cpp 是端侧部署的事实标准,由 Georgi Gerganov 开源,基于纯 C/C++ 实现,零依赖、极致轻量。其 GGUF 单文件格式和丰富的量化档位使其成为社区最广泛使用的端侧推理方案,支持 CPU、CUDA、Metal、Vulkan、QNN(高通 NPU)等多种硬件后端。
Ollama 是面向开发者的开箱即用本地 LLM 服务,一条命令即可下载、量化并运行模型,自动适配硬件并暴露兼容 OpenAI 的本地 API。其底层使用 GGUF 格式的 llama.cpp 引擎,适合快速原型验证和跨平台开发。
ExecuTorch 是 Meta 推出的移动端推理框架,50KB 的基础运行时是所有框架中最小的,支持 Apple Core ML、高通 QNN/Hexagon NPU、Arm XNNPACK 等 12 种以上硬件后端。已应用于 Instagram、WhatsApp、Quest 3 等数十亿用户的产品中。
MLC-LLM 基于 Apache TVM 机器学习编译器,将模型编译为目标硬件的高效内核。其杀手锏是 WebGPU 支持,可在浏览器中接近原生 80% 的性能运行模型,适合浏览器端推理场景。
MNN-LLM 是阿里巴巴推出的移动端推理框架,在小米 14 等设备上实现了比 llama.cpp 高 8.6 倍的预填充加速。其自动区域融合和 DRAM-Flash 混合存储技术可在内存受限设备上支持长上下文推理。
端侧大模型可结合本地向量数据库和 RAG(检索增强生成)技术,在完全离线的条件下实现知识库问答能力。典型架构是:使用量化嵌入模型(如 nomic-embed-text、mxbai-embed-large)在本地将文档分块并生成向量索引,存入本地向量数据库;查询时,嵌入模型将用户问题向量化,检索相关文档片段,与端侧大模型结合生成回答。
整个流程无需网络传输,数据全程不出设备,适合处理敏感文档(如医疗病历、法律文件、财务报表等)。嵌入模型体积通常在 100MB—800MB,可在消费级设备上流畅运行。
端侧 RAG 的检索效率受本地向量数据库性能限制,通常适用于 1 万条以内的文档集合。对于更大规模的知识库,可采用混合模式:本地完成初步检索和摘要,复杂查询路由至云端处理。
端侧大模型的数据隐私优势来源于架构层面的"物理隔离"——数据从产生到处理再到输出全程不离开用户设备,从网络层面消除了数据泄露的可能性。
用户输入的文本、图片、屏幕截图、本地文件等所有数据都在设备本地完成处理,不经过任何网络传输。对于医疗、法律、金融等受监管行业,这满足了"数据不能外传"的合规要求。
端侧模型不依赖网络连接,可在断网、弱网或高安全要求的内网环境中正常使用。这同时解决了云端 AI 的延迟问题和可用性问题。
端侧部署免去了数据处理评估(DPA)、第三方服务商审计、数据保留策略等合规流程,简化了隐私合规的复杂度。对于 GDPR、个人信息保护法等法规框架下的应用,端侧方案是更直接的合规路径。
端侧大模型的离线运行依赖模型的本地存储和推理引擎的离线执行能力。
GGUF 格式的模型文件可直接存储在本地磁盘中,推理引擎通过内存映射(mmap)按需加载权重,无需网络下载。用户可提前下载所需模型,断网环境下直接加载运行。
llama.cpp、Ollama 等主流推理框架均支持完全离线运行,不依赖任何云端服务。模型启动后所有推理计算在本地 CPU/GPU/NPU 上完成,响应延迟仅取决于硬件性能。
本地知识库的索引和检索均可在离线状态下完成。嵌入模型、向量数据库和大模型三者均部署在本地,形成完整的离线问答能力。
端侧大模型的应用场景围绕"低延迟、高隐私、离线可用、低成本"四大核心优势展开,已在多个垂直领域实现规模化落地。
2025—2026 年,端侧大模型已成为智能手机的标配功能。旗舰手机可在本地运行 3B—7B 参数的模型,支持实时翻译、语音助手、相册语义搜索、通话摘要生成等功能,数据全程不上传云端。
车载场景对延迟和离线能力要求极高。端侧大模型在智能座舱中承担实时语音交互、驾驶员状态监测、车内视觉控制等任务,可在隧道、地下车库等无网络环境下稳定运行。搭载量产级多模态端侧模型的座舱可完成"感知-记忆-推理-执行"的完整闭环。
在笔记本电脑上运行端侧大模型可实现文档摘要、代码辅助、会议纪要生成、邮件润色等办公任务。数据完全本地处理,满足企业对数据安全的严格要求。
机器人、智能眼镜、安防摄像头等终端设备需要本地感知和决策能力。端侧大模型使这些设备在本地完成视觉识别、路径规划、操作决策,仅在需要复杂分析时连接云端,大幅降低带宽成本和响应延迟。
选择端侧大模型需要综合考虑硬件配置、任务复杂度、精度要求和部署成本等因素。
设备类型 | 推荐模型规模 | 量化档位 | 典型速度 |
|---|---|---|---|
4GB 内存手机 | 1B | Q2_K / Q3_K | 40—60 tok/s |
6—8GB 内存手机 | 3B | Q4_K_M | 30—50 tok/s |
旗舰手机(8GB+) | 3B—7B | Q4_K_M / Q5_K_M | 18—55 tok/s |
16GB 内存笔记本 | 8B—14B | Q4_K_M | 20—40 tok/s |
Mac(48GB+) | 32B—70B | Q4_K_M | 15—25 tok/s |
简单分类、提取、短文本生成等轻量任务适合 1B—3B 小模型;文档分析、代码辅助、多轮对话等中等复杂度任务推荐 4B—8B 模型;长文本处理、复杂推理等高难度任务建议 8B—32B 模型配合长上下文优化。
优先选择 INT4(Q4_K_M)作为默认量化档位,在精度和速度之间取得最佳平衡。对精度要求极高的场景可选用 INT8 或 FP16;对资源极度受限的场景可考虑 INT2/2-bit 量化,但需接受更大的精度损失。
llama.cpp 提供最广泛的硬件兼容性和量化选项,适合技术用户和嵌入式部署;Ollama 适合快速原型开发和跨平台应用;ExecuTorch 适合移动端 App 集成。选择框架时应考虑目标硬件的原生支持情况和社区生态成熟度。