知识蒸馏是一个更广泛的概念,涵盖所有通过教师-学生框架进行知识迁移的技术,适用于图像分类、目标检测、语音识别等各类机器学习任务。大模型蒸馏是知识蒸馏在大语言模型领域的具体应用,针对 LLM 的特殊架构和任务特点进行了适配和优化。
大模型蒸馏面临一些独特的技术挑战。教师模型规模巨大,生成蒸馏数据的推理成本高昂。学生模型与教师模型的容量差距可能高达百倍,直接蒸馏容易出现知识迁移障碍。大模型的输出空间极大,传统的软标签蒸馏需要处理海量词汇表上的概率分布。链式思维蒸馏等新技术正是为应对这些挑战而发展起来的。
传统知识蒸馏主要关注输出层的概率分布匹配。大模型时代的蒸馏方法更加多元化,涵盖了中间层特征对齐、注意力模式迁移、推理过程学习等多个维度。DeepSeek-R1 等最新实践表明,通过高质量的推理轨迹蒸馏,小模型可以获得远超同尺寸基座模型的推理能力。