蒸馏和量化是两种互补的模型压缩方法。蒸馏通过跨模型知识迁移创建新的轻量模型,可以从根本上改变模型架构和参数量。量化则在不改变模型结构的前提下,降低参数的数值精度,如从 FP32 降至 INT8。蒸馏关注的是"用什么模型",量化关注的是"用什么精度表示参数"。
在实际部署中,蒸馏和量化通常组合使用以获得最大压缩效果。典型的流水线是先通过蒸馏将 70B 参数的教师模型压缩至 7B 学生模型,实现约 10 倍的规模缩减;再对学生模型进行 INT8 量化,额外获得 2 倍的体积缩减。最终模型体积可达原始模型的 1/20,推理成本降低 15 倍以上。
量化感知蒸馏将量化模拟融入蒸馏训练过程。学生在训练时以低精度方式前向传播,教师提供高精度指导信号。这种方法使学生模型在训练阶段就适应低精度运算,部署时的精度损失更小。腾讯云 TI-ONE 平台支持此类联合优化方案,可在蒸馏训练的同时进行量化感知校准。