首页
学习
活动
专区
圈层
工具
发布
技术百科首页 >大模型蒸馏 >如何评估蒸馏模型的质量?

如何评估蒸馏模型的质量?

词条归属:大模型蒸馏

1. 领域任务准确率

最核心的评估指标是蒸馏模型在目标任务上的准确率。应构建至少 500 条、理想情况下 2000 条以上的独立测试集。对于结构化输出任务,采用精确匹配或程序化正确性检查。对于生成式任务,结合 ROUGE 分数和大模型裁判评估。生产部署的常见阈值是达到教师准确率的 95%。

2. 通用能力回归检测

针对狭窄任务进行蒸馏可能导致灾难性遗忘。应在蒸馏前后分别运行 MMLU、HumanEval 等通用基准测试,追踪分数变化。通常 2 至 3 个点的 MMLU 回归是可接受的,若超过 10 个点则表明训练过程损害了模型的通用能力。

3. 推理延迟与吞吐量

应在计划使用的服务配置下测量延迟指标,包括首 token 时间、tokens 每秒吞吐量、端到端延迟等。在 A10G GPU 上使用 vLLM 框架服务量化后的 8B 蒸馏模型,通常可实现 80 至 120 tokens 每秒的吞吐量,首 token 时间低于 200 毫秒。

4. 校准度评估

蒸馏模型可能出现校准不良的问题,即在错误答案上表现出过度自信。应测试模型的置信度校准情况:当学生模型表达 80% 的置信度时,其实际正确率是否接近 80%。校准不良在下游决策依赖置信度分数的产品中尤其危险。

相关文章
渠道质量评估模型
| 导语  获客是大多数的商业场景下的重中之重,高效的获客在节省成本和用户质量提升方面的重要性不必再赘述。实际业务场景中,我们面临的是获客质量,获客量级和获客成本之间的博弈,其中两个方面的正向提升必然会导致另一方面的负向。在这三个维度中,量级和成本是天然的比较好衡量的,而质量则是一种更复杂更综合也更长期的维度,对质量的准确衡量,就显得尤为重要,本文希望结合日常工作中我对腾讯业务场景的理解,通过一些框架性的说明,来为大家构建评估模型提供一些思路。 01 背景 获客是大多数的商业场景下的重中之重,高效的获客在
腾讯大讲堂
2020-11-02
3.5K0
干货分享!如何评估 大型语言模型(LLMs)的输出质量?评估方法大盘点!
 大型语言模型(LLM)展现出了杰出的性能,并为我们提供了新的解题思路。但在实际应用过程中,如何评估大型语言模型的输出质量对于我们来说也至关重要。因为大模型的输出是概率性的---这意味着同样的Prompt产生的结果都有可能不同,大模型评估能够衡量模型输出的质量水平,能够确保用户的体验。为此,今天给大家整理了一些LLMs输出结果的评估方法。
ShuYini
2023-10-12
6.1K0
团队交付质量如何评估
话题源于一位同事的提问:你认为用什么质量指标可以反映项目交付的一个质量?粗看之下有点蒙,质量指标,什么鬼?再思考一下,哦,原来是说交付质量的事,那不是有很多质量指标么?多数和BUG相关,例如BUG数量、Reopen BUG数、BUG解决时长等等,好像都能体现交付质量啊。仔细想想,草率了,我们衡量交付质量,不能只看这些,质量不应该简简单单地缺陷关联上就可以了。再想想,于是有了本文。
CKL的思考
2023-02-01
1.6K0
专访 | 监管机器翻译质量?且看阿里如何搭建翻译质量评估模型
阿里机器翻译团队在本次比赛中,参加了英语到德语和德语到英语两个语向的句子级别和词级别的七项质量评估任务,收获了六项世界冠军。其中,德语到英语的统计机器翻译评估任务中(German-English SMT),句子级别和词级别的预测任务分别取得第一名;英语到德语的统计机器翻译评估任务中 (English-German SMT),句子级别取得第一名,词级别的词预测和漏词预测分别取得第一名。同时,英语到德语的神经网络机器翻译评估任务中 (English-German NMT),词级别的词预测取得第一名。
机器之心
2018-08-07
1.2K0
如何评估CAN总线信号质量
CAN总线网络的性能在很大程度上取决于其信号质量。信号质量差可能导致通信错误,进而引发系统故障、效率降低甚至安全隐患。因此,评估和确保CAN总线信号质量是维护系统健康和可靠性的关键。
不脱发的程序猿
2025-06-10
5960
点击加载更多
问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档
领券