智客 ZICQ
EN 登录 / 注册
智客前沿 大模型 #LeapLabTHU #KL-Free OPD #LLM #知识蒸馏 #C-MOPD

LeapLabTHU 发布 KL-Free OPD:无需 KL 散度的 LLM 在线策略蒸馏方法

Mr.Xu 的头像

文 / Mr.Xu

发布时间:

中文阅读 (Chinese) English Version

摘要:LeapLabTHU 推出了一种无需 KL 散度的在线策略蒸馏方法(KL-Free OPD),旨在优化大语言模型(LLM)的训练效率。研究表明,KL 散度并非 OPD 的必要条件,仅需保留更新方向即可实现有效蒸馏。团队进一步提出仅需关注教师与学生模型间差异较大的少量 token 的方向,即可达到与传统方法相似的训练效果。基于此,团队开发了共识多教师在线策略蒸馏(C-MOPD),在数学和代码基准测试中表现优于传统多教师在线策略蒸馏(MOPD)。这一突破为 LLM 的高效训练提供了新思路。


突破性研究:KL-Free OPD 的提出

自知识蒸馏技术问世以来,KL 散度一直是其标准损失函数。然而,LeapLabTHU 的研究团队发现,在线策略蒸馏(OPD)中,KL 散度并非不可或缺。研究表明,仅需保留更新方向即可实现有效的蒸馏,而无需依赖 KL 散度。具体来说,蒸馏过程仅需关注教师与学生模型间差异较大的少量 token 的方向,而非所有 token。

方法与实验

研究团队提出了一种简单的奖励分配机制:对于教师概率高于学生的 token 分配 (+1),反之分配 (-1),以此鼓励模型向教师方向更新。实验表明,这种方法几乎可以复现使用反向 KL 散度的 OPD 训练模式。进一步分析发现,仅需关注教师与学生模型间差异较大的少量 token 的方向,即可达到与传统方法相似的训练效果。

基于这一发现,团队开发了共识多教师在线策略蒸馏(C-MOPD),该方法让每个样本由所有教师模型共同监督,避免了传统多教师在线策略蒸馏(MOPD)中因样本路由到单一教师而可能引发的领域能力冲突。实验结果显示,C-MOPD 在数学和代码基准测试中表现优于 MOPD。

技术亮点

  • 无需 KL 散度:KL 散度并非 OPD 的必要条件,简化了蒸馏过程。
  • 高效更新方向保留:仅需关注教师与学生模型间差异较大的少量 token 的方向。
  • 共识多教师蒸馏:C-MOPD 通过多教师共同监督提升训练效果。

行业影响与开发者建议

KL-Free OPD 的提出为 LLM 的高效训练提供了新的思路,尤其在资源受限或对训练效率有高要求的场景中具有重要意义。开发者可以尝试使用 C-MOPD 方法,以提升模型在数学和代码任务中的表现。此外,该研究也为未来知识蒸馏技术的进一步优化提供了新的方向。

代码与资源

研究团队已将 KL-Free OPD 的代码开源,开发者可以访问 GitHub 仓库 获取更多信息。


消息来源:Hugging Face Daily Papers (2026-09-27)

—— 完 ——

主题标签: #LeapLabTHU #KL-Free OPD #LLM #知识蒸馏 #C-MOPD

社区整体评论区

正在加载实时智能评论与划词标注…