量化是端侧大模型部署的核心技术,通过降低模型权重和激活值的数值精度来减小模型体积、降低显存占用并提升推理速度。
INT8 量化是端侧部署的"安全区",将 FP16 权重转换为 8 位整数,内存占用减半,精度损失通常在 1% 以内。该技术通过量化感知训练(QAT)或训练后量化(PTQ)实现,对硬件要求低,绝大多数终端设备的 NPU 原生支持 INT8 推理,适合对精度要求较高的场景。
INT4 量化是当前端侧部署的主流方案,将权重压缩至 4 位整数,内存占用降低 75%,精度损失控制在 3%—8%。AWQ(Activation-aware Weight Quantization)是 INT4 量化的事实标准,通过保护关键权重实现近无损压缩。GGUF 格式的 Q4_K_M 方案是最常用的 INT4 量化档位,在精度和速度之间取得最佳平衡,适合大多数端侧部署场景。
量化精度 | 内存压缩比 | 精度损失 | 适用场景 |
|---|---|---|---|
INT8 | 2× | <1% | 高精度需求、NPU 原生支持设备 |
INT4 | 4× | 3%—8% | 大多数端侧场景(主流选择) |
INT2/2-bit | 8×—16× | 5%—15% | 极限压缩、超低资源设备 |