首页
学习
活动
专区
圈层
工具
发布
技术百科首页 >大模型蒸馏 >大模型蒸馏如何解决灾难性遗忘?

大模型蒸馏如何解决灾难性遗忘?

词条归属:大模型蒸馏

1. 回放策略

回放(Replay)是最直接的抗遗忘方法。在蒸馏训练数据中混合一部分通用领域的数据,使学生模型在学习特定任务的同时不断"复习"通用知识。混合比例通常为总 batch 的 20% 至 30%。该方法简单有效,但需要维护一个代表性的通用数据缓冲区。

2. 正则化约束

通过在损失函数中添加正则化项,限制学生模型参数偏离原始基础模型的程度。EWC(弹性权重巩固)等方法识别对通用能力重要的参数,对其更新施加更强的惩罚。输出分布层面的正则化则要求学生模型的输出与基础模型的输出保持一定的相似度。

3. 自适应蒸馏策略

最新的 RAFT 框架提出了数据精炼与自适应蒸馏相结合的两阶段方案。在数据阶段,通过自条件重写和余弦相似度过滤构建与模型分布兼容的训练数据。在优化阶段,采用答案条件的在策略蒸馏,让原始指令调优模型在学生生成的轨迹上提供软监督信号。该方法在五个领域测试中平均将领域准确率提升 23.2%,同时恢复了 SFT 导致的通用能力退化。

4. 自蒸馏恢复机制

自蒸馏微调(SDFT)可作为性能恢复机制,对抗压缩和灾难性遗忘带来的性能下降。理论分析表明,大模型的生成能力本质上依赖于其隐藏层构建的高维流形结构。自蒸馏通过对齐学生与教师激活轨迹的流形结构,有效恢复因微调或量化损失的模型能力。

相关文章
伪排练解决NLP灾难性遗忘
有时你需要微调一个预训练模型,以添加新的标签或修正某些特定错误。这可能会引入“灾难性遗忘”问题。伪排练是一个很好的解决方案:使用原始模型对示例进行标注,并将它们混入你的微调更新过程中。
用户11764306
2026-06-06
1270
大模型挑战深潜系列:LLM的灾难性遗忘
以前我们总觉得,模型遗忘无非就是“新权重覆盖了旧权重”。但近期的理论物理和高维空间研究无情地戳破了这个简单的假设。在109B到1.5T参数规模的大模型(如Llama、Qwen系列)中,遗忘的机制远比这复杂得多。
赛博解生
2026-04-09
4120
AI模型应对灾难性遗忘的技术
尽管机器学习模型取得了巨大进步,但专家们仍在努力解决确保机器不会忘记之前学习的知识的问题,尤其是在学习新知识时。
云云众生s
2024-10-11
8030
告别灾难性遗忘:大模型持续学习与 Nested Learning 架构解析
欢迎回到大模型挑战专栏!在上一篇文章中,我们深度分析了大语言模型(LLM)的“阿喀琉斯之踵”——**灾难性遗忘(Catastrophic Forgetting)**问题,探讨了为什么在静态部署状态下,模型一旦接触非独立同分布(Non-IID)的新数据,其内部精心调优的权重就会被野蛮覆盖,导致原有的核心能力土崩瓦解。
赛博解生
2026-04-09
7600
伪排练:解决NLP灾难性遗忘的简易方案
当连续优化两个学习任务时,若第二个任务的权重初始化依赖于第一个任务的权重,则会出现灾难性遗忘问题。理想情况下,优化器应不受初始化影响,始终找到最优解,但现实中这难以实现。
用户11764306
2025-08-15
2320
点击加载更多
问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档
领券