回放(Replay)是最直接的抗遗忘方法。在蒸馏训练数据中混合一部分通用领域的数据,使学生模型在学习特定任务的同时不断"复习"通用知识。混合比例通常为总 batch 的 20% 至 30%。该方法简单有效,但需要维护一个代表性的通用数据缓冲区。
通过在损失函数中添加正则化项,限制学生模型参数偏离原始基础模型的程度。EWC(弹性权重巩固)等方法识别对通用能力重要的参数,对其更新施加更强的惩罚。输出分布层面的正则化则要求学生模型的输出与基础模型的输出保持一定的相似度。
最新的 RAFT 框架提出了数据精炼与自适应蒸馏相结合的两阶段方案。在数据阶段,通过自条件重写和余弦相似度过滤构建与模型分布兼容的训练数据。在优化阶段,采用答案条件的在策略蒸馏,让原始指令调优模型在学生生成的轨迹上提供软监督信号。该方法在五个领域测试中平均将领域准确率提升 23.2%,同时恢复了 SFT 导致的通用能力退化。
自蒸馏微调(SDFT)可作为性能恢复机制,对抗压缩和灾难性遗忘带来的性能下降。理论分析表明,大模型的生成能力本质上依赖于其隐藏层构建的高维流形结构。自蒸馏通过对齐学生与教师激活轨迹的流形结构,有效恢复因微调或量化损失的模型能力。