最核心的评估指标是蒸馏模型在目标任务上的准确率。应构建至少 500 条、理想情况下 2000 条以上的独立测试集。对于结构化输出任务,采用精确匹配或程序化正确性检查。对于生成式任务,结合 ROUGE 分数和大模型裁判评估。生产部署的常见阈值是达到教师准确率的 95%。
针对狭窄任务进行蒸馏可能导致灾难性遗忘。应在蒸馏前后分别运行 MMLU、HumanEval 等通用基准测试,追踪分数变化。通常 2 至 3 个点的 MMLU 回归是可接受的,若超过 10 个点则表明训练过程损害了模型的通用能力。
应在计划使用的服务配置下测量延迟指标,包括首 token 时间、tokens 每秒吞吐量、端到端延迟等。在 A10G GPU 上使用 vLLM 框架服务量化后的 8B 蒸馏模型,通常可实现 80 至 120 tokens 每秒的吞吐量,首 token 时间低于 200 毫秒。
蒸馏模型可能出现校准不良的问题,即在错误答案上表现出过度自信。应测试模型的置信度校准情况:当学生模型表达 80% 的置信度时,其实际正确率是否接近 80%。校准不良在下游决策依赖置信度分数的产品中尤其危险。