智客 ZICQ
EN 登录 / 注册
智客前沿 大模型 #Hugging Face #N-OPSD #数学推理 #模型训练

Hugging Face提出Neighborhood OPSD:提升数学推理模型训练效率

Mr.Xu 的头像

文 / Mr.Xu

发布时间:

中文阅读 (Chinese) English Version

摘要:Hugging Face的研究团队提出了一种名为Neighborhood On-Policy Self-Distillation(N-OPSD)的新方法,用于提升数学推理模型的训练效率。该方法通过在参数空间中进行局部扰动,挖掘出与参考上下文对齐的互补修正信息,并利用这些信息为学生模型提供更丰富的监督信号。实验结果表明,N-OPSD在多个基准测试中显著提升了Qwen模型(1.7B、4B和8B版本)的性能,展示了其在数学推理任务中的强大潜力。


核心突破

Hugging Face的研究团队提出了一种名为Neighborhood On-Policy Self-Distillation(N-OPSD)的新方法,旨在提升数学推理模型的训练效率。N-OPSD通过以下方式实现了对传统On-Policy Self-Distillation(OPSD)的改进:

  • 局部扰动与互补修正:在参数空间中进行局部扰动,挖掘出与参考上下文对齐的互补修正信息。
  • 专家池构建:通过离线贪婪选择构建一个紧凑的冻结专家池,以最大化过滤后的参考标记收益。
  • 在线路由机制:采用MaxPeak选择锚定标记,并通过分位数选择匹配专家,确保学生模型从最佳专家的完整下一个标记分布中学习。

技术亮点

  • 局部扰动:通过在参数空间中进行局部扰动,N-OPSD能够捕捉到传统OPSD方法无法发现的互补修正信息。
  • 专家池构建与选择:离线贪婪选择和在线路由机制确保了专家池的多样性和高效性,从而为学生模型提供更丰富的监督信号。
  • 性能提升:在AIME 2024、AIME 2025和HMMT February 2025等基准测试中,N-OPSD在Qwen模型(1.7B、4B和8B版本)上的表现均显著优于传统OPSD方法。

行业影响

N-OPSD的提出为数学推理模型的训练提供了一种新的高效方法,具有以下潜在影响:

  • 提升模型性能:通过更丰富的监督信号,N-OPSD能够显著提升数学推理模型的性能。
  • 降低训练成本:更高效的训练方法意味着更低的计算成本和更快的模型迭代速度。
  • 推动AI应用:在教育、金融分析等领域,N-OPSD有望推动AI模型在复杂推理任务中的应用。

开发者建议

  • 尝试N-OPSD方法:对于正在开发数学推理模型的开发者,建议尝试N-OPSD方法以提升模型性能。
  • 关注专家池构建:在应用N-OPSD时,应重点关注专家池的构建和选择机制,以确保监督信号的多样性和有效性。
  • 结合其他技术:可以结合其他技术(如多模态学习)进一步提升模型在复杂任务中的表现。

消息来源:Hugging Face Daily Papers (2026-09-30)

—— 完 ——

主题标签: #Hugging Face #N-OPSD #数学推理 #模型训练

社区整体评论区

正在加载实时智能评论与划词标注…