蒸馏的核心洞察在于:教师模型的"知识"不仅编码在最终预测结果中,还隐藏在输出概率分布里。这些信息被称为"暗知识"(Dark Knowledge),包含了类别之间的相似性关系和不确定性模式。通过引入温度参数(Temperature)对 Softmax 函数进行缩放,可以提取这些暗知识。当温度 T 大于 1 时,输出分布变得更加平滑,原本被掩盖的类别间关系得以显现。这一数学机制由 Geoffrey Hinton 等人在 2015 年的论文中首次提出,成为蒸馏技术的理论基础。
蒸馏训练的总损失由两部分组成:硬损失是学生模型预测与真实标签之间的交叉熵,确保学生学到正确的分类结果;软损失是学生模型软化输出与教师模型软化输出之间的 KL 散度,确保学生继承教师的知识分布。两者通过平衡系数加权组合,通常硬损失权重在 0.3 至 0.7 之间。这种双通道学习机制使学生既能掌握标准答案,又能理解教师模型的判断逻辑。
蒸馏之所以有效,是因为教师模型在大规模数据上预训练后形成了丰富的内部表征结构。学生模型通过模仿这些表征,能够以较少的参数量复现教师的大部分能力。研究表明,软标签中包含的类别间相对概率信息,比单一硬标签携带的信息量大得多,这是蒸馏能够"以小博大"的根本原因。