首页
学习
活动
专区
圈层
工具
发布
技术百科首页 >大模型蒸馏 >大模型蒸馏是如何工作的?

大模型蒸馏是如何工作的?

词条归属:大模型蒸馏

1. 两阶段训练流程

大模型蒸馏过程分为两个阶段。第一阶段独立训练教师模型,使其在目标任务上达到较高性能。第二阶段冻结教师模型参数,使用相同输入同时前向传播教师和学生模型,计算复合损失并更新学生模型参数。训练完成后,学生模型可独立部署,不再依赖教师模型。

2. 数据准备与生成

高质量的蒸馏数据是成功的关键。通常需要从生产环境中抽取代表性样本,至少 1 万条以上,理想情况下 5 万条或更多。对于推理任务,应引导教师模型生成包含链式思维的回答,而不仅仅是最终答案。数据需要经过去重、质量过滤等处理,剔除教师模型的拒绝回答、格式错误的输出和低质量完成。

3. 推理阶段的独立运行

训练完成后的学生模型完全独立于教师模型。推理时不需要访问教师模型的任何参数或中间结果,仅需将输入送入学生模型即可获得输出。一个 8B 参数的学生模型在单张消费级 GPU 上即可运行,推理延迟通常在 100 毫秒以内,而其 70B 参数的教师模型可能需要多张 A100 GPU 协同推理。

相关文章
老婆问我:“什么是大模型的“蒸馏”?”
最近,老婆刷到一条新闻:“科学家用大模型‘蒸馏’出小模型,效果堪比原版!”她一脸懵地问我:AI 模型还能像酿酒一样“蒸馏”?难道要架个锅炉煮代码?
不惑
2025-03-17
5230
低成本复刻别人的AI?什么是大模型蒸馏技术?
“大模型蒸馏”可以把它理解为:用一个能力更强、更贵、更慢的大模型当老师,让一个更小、更便宜、更可控的模型学习它的回答方式、任务能力、推理风格和领域知识。
fanstuck
2026-06-04
5460
理解 RAG:大模型的外部记忆系统是如何工作的
RAG(Retrieval-Augmented Generation,检索增强生成)已经成为现代大语言模型(LLM)生态中最核心的技术之一。 无论是企业知识问答、智能客服,还是 Agent 记忆系统,几乎都离不开它的支持。
JanYork_简昀
2025-11-13
1.4K0
苹果也在蒸馏大模型,给出了蒸馏Scaling Laws
众所周知,知识蒸馏技术当前正被大模型领域广泛使用,它可以在大幅压缩模型体量的同时保持一定的性能、降低模型时延、提升模型精度,与此同时还能对知识域进行集成和迁移。
机器之心
2025-02-19
3670
通俗讲解大模型的蒸馏是什么?
最近看到了一则新闻,说Anthropic在今年2月23日发过一篇技术报告,名字叫《Detecting and preventing distillation attacks》,提到了3家中国公司deepseek、minimax、kimi,创建了24000个假账号,和claude模型进行了1600万次交互,用于数据硬蒸馏。
bisal
2026-06-02
3650
点击加载更多
问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档
领券