首页
学习
活动
专区
圈层
工具
发布
技术百科首页 >大模型蒸馏 >大模型蒸馏的核心原理是什么?

大模型蒸馏的核心原理是什么?

词条归属:大模型蒸馏

1. 暗知识与温度参数

蒸馏的核心洞察在于:教师模型的"知识"不仅编码在最终预测结果中,还隐藏在输出概率分布里。这些信息被称为"暗知识"(Dark Knowledge),包含了类别之间的相似性关系和不确定性模式。通过引入温度参数(Temperature)对 Softmax 函数进行缩放,可以提取这些暗知识。当温度 T 大于 1 时,输出分布变得更加平滑,原本被掩盖的类别间关系得以显现。这一数学机制由 Geoffrey Hinton 等人在 2015 年的论文中首次提出,成为蒸馏技术的理论基础。

2. 复合损失函数的设计思想

蒸馏训练的总损失由两部分组成:硬损失是学生模型预测与真实标签之间的交叉熵,确保学生学到正确的分类结果;软损失是学生模型软化输出与教师模型软化输出之间的 KL 散度,确保学生继承教师的知识分布。两者通过平衡系数加权组合,通常硬损失权重在 0.3 至 0.7 之间。这种双通道学习机制使学生既能掌握标准答案,又能理解教师模型的判断逻辑。

3. 知识迁移的理论依据

蒸馏之所以有效,是因为教师模型在大规模数据上预训练后形成了丰富的内部表征结构。学生模型通过模仿这些表征,能够以较少的参数量复现教师的大部分能力。研究表明,软标签中包含的类别间相对概率信息,比单一硬标签携带的信息量大得多,这是蒸馏能够"以小博大"的根本原因。

相关文章
通俗讲解大模型的蒸馏是什么?
最近看到了一则新闻,说Anthropic在今年2月23日发过一篇技术报告,名字叫《Detecting and preventing distillation attacks》,提到了3家中国公司deepseek、minimax、kimi,创建了24000个假账号,和claude模型进行了1600万次交互,用于数据硬蒸馏。
bisal
2026-06-02
3650
人工智能之知识蒸馏 第二章 知识蒸馏的核心原理与核心架构
在第一章中,我们建立了知识蒸馏的基础认知,了解了它作为模型压缩“利器”的背景与意义。本章将深入其核心,详细解析知识蒸馏的“骨架”——师生模型架构,探讨其背后的价值权衡,并明确其适用的边界。
咚咚王
2026-04-14
4130
苹果也在蒸馏大模型,给出了蒸馏Scaling Laws
众所周知,知识蒸馏技术当前正被大模型领域广泛使用,它可以在大幅压缩模型体量的同时保持一定的性能、降低模型时延、提升模型精度,与此同时还能对知识域进行集成和迁移。
机器之心
2025-02-19
3670
老婆问我:“什么是大模型的“蒸馏”?”
最近,老婆刷到一条新闻:“科学家用大模型‘蒸馏’出小模型,效果堪比原版!”她一脸懵地问我:AI 模型还能像酿酒一样“蒸馏”?难道要架个锅炉煮代码?
不惑
2025-03-17
5230
原来,这些顶级大模型都是蒸馏的
「除了 Claude、豆包和 Gemini 之外,知名的闭源和开源 LLM 通常表现出很高的蒸馏度。」这是中国科学院深圳先进技术研究院、北大、零一万物等机构的研究者在一篇新论文中得出的结论。
机器之心
2025-02-03
8450
点击加载更多
问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档
领券