arXiv发布新研究:基于条件锚定的生成蒸馏提升大语言模型持续学习稳定性
文 / Mr.Xu
发布时间:
摘要:arXiv发布了一项关于大语言模型持续学习的新研究,提出了一种名为条件锚定的生成蒸馏(CAGD)方法。该方法通过保留少量旧提示并利用冻结的前一模型重建生成状态和预测分布,从而在持续学习过程中保护模型行为并减少遗忘问题。实验结果表明,CAGD在多个任务顺序中显著降低了最终留出损失,展示了其在处理模型遗忘和功能保留方面的有效性,为大语言模型的持续学习提供了新的技术路径。
研究背景与动机
大语言模型(LLM)在持续学习过程中面临一个关键挑战:模型在适应新任务时,可能会改变对旧任务的输出分布,导致灾难性遗忘问题。现有的方法通常依赖于保留所有旧提示-答案对,但这在实践中可能不可行或效率低下。
方法概述
本研究提出了一种名为条件锚定的生成蒸馏(CAGD)的新方法,其核心思想包括:
- 保留少量旧提示:通过选择性地保留少量对模型行为有代表性的旧提示,降低存储需求。
- 利用冻结的前一模型:使用冻结的先前模型生成旧提示的完成状态和生成状态。
- 匹配预测分布:在训练新任务时,通过软目标匹配前一模型的预测分布,从而保护模型行为。
CAGD方法将传统重放方法中混淆的三个角色分离:条件选择要保护的行为,教师展开定位相关状态,软目标指定预测如何变化。
实验结果
在219M参数的掩码扩散语言模型上进行的实验中,CAGD在四种任务顺序中显著降低了最终留出损失:
- 在一个任务顺序中,从2.927降至1.114。
- 在完全相反的任务顺序中,从2.168降至0.891。
此外,使用相同的软目标,相较于硬重放,CAGD在教师生成的支持保持一致的情况下,将最终平均损失降低了0.055。
技术亮点
- 分离角色:CAGD将传统重放方法中混淆的三个角色分离,提供了更精细的控制。
- 教师展开蒸馏:对于自回归语言生成,教师展开蒸馏允许对序列发散进行精确的链式法则分解。
- 局部去噪漂移控制:对于掩码扩散语言建模,CAGD直接控制教师生成完成的局部去噪漂移。
行业影响与开发者建议
CAGD为大语言模型的持续学习提供了一种有效的方法,特别是在处理模型遗忘和功能保留方面。其低存储需求和高效的训练过程使其适用于资源受限的应用场景。开发者可以尝试将CAGD集成到现有的持续学习框架中,以提升模型的稳定性和适应性。
未来展望
未来研究可以进一步探索CAGD在不同模型架构和任务类型中的适用性,并尝试结合其他技术(如元学习或强化学习)以进一步提升持续学习的效果。
—— 完 ——消息来源:ArXiv NLP/LLM (cs.CL) (2026-10-07)
社区整体评论区
正在加载实时智能评论与划词标注…