端侧大模型的模型压缩技术形成完整的"量化+剪枝+蒸馏"技术矩阵,各技术路径可组合使用实现更高压缩比。
量化压缩是最易采用、最少依赖重训练的压缩方法。将 FP16 权重转换为 INT4/INT8,模型结构不变、参数量不变,但每个参数占用的比特数大幅减少。该方法无需重训练即可部署,是端侧模型压缩的首选方案。
知识蒸馏通过教师-学生模型架构,将大模型的知识迁移至轻量级学生模型。学生模型学习教师模型的输出分布和中间特征,可在大幅减少参数量的同时保留核心能力。该方法需要训练过程配合,但能实现 10 倍以上的体积压缩。
结构化剪枝通过移除整个通道、注意力头或网络层来压缩模型,剪枝后的模型可在标准硬件上高效运行。与非结构化剪枝相比,结构化剪枝更适配边缘设备,因为非结构化剪枝的高理论压缩率易被通用边缘芯片的索引寻址开销所抵消。
实际部署中通常采用组合方案:先通过知识蒸馏将大模型压缩至合适规模,再结合 INT4 量化和结构化剪枝进一步压缩。这种多级混合压缩可实现 10 倍—20 倍的整体压缩比,精度损失控制在 5%—10%。