大模型蒸馏过程分为两个阶段。第一阶段独立训练教师模型,使其在目标任务上达到较高性能。第二阶段冻结教师模型参数,使用相同输入同时前向传播教师和学生模型,计算复合损失并更新学生模型参数。训练完成后,学生模型可独立部署,不再依赖教师模型。
高质量的蒸馏数据是成功的关键。通常需要从生产环境中抽取代表性样本,至少 1 万条以上,理想情况下 5 万条或更多。对于推理任务,应引导教师模型生成包含链式思维的回答,而不仅仅是最终答案。数据需要经过去重、质量过滤等处理,剔除教师模型的拒绝回答、格式错误的输出和低质量完成。
训练完成后的学生模型完全独立于教师模型。推理时不需要访问教师模型的任何参数或中间结果,仅需将输入送入学生模型即可获得输出。一个 8B 参数的学生模型在单张消费级 GPU 上即可运行,推理延迟通常在 100 毫秒以内,而其 70B 参数的教师模型可能需要多张 A100 GPU 协同推理。