Hugging Face提出Neighborhood OPSD:提升数学推理模型训练效率
文 / Mr.Xu
发布时间:
摘要:Hugging Face的研究团队提出了一种名为Neighborhood On-Policy Self-Distillation(N-OPSD)的新方法,用于提升数学推理模型的训练效率。该方法通过在参数空间中进行局部扰动,挖掘出与参考上下文对齐的互补修正信息,并利用这些信息为学生模型提供更丰富的监督信号。实验结果表明,N-OPSD在多个基准测试中显著提升了Qwen模型(1.7B、4B和8B版本)的性能,展示了其在数学推理任务中的强大潜力。
核心突破
Hugging Face的研究团队提出了一种名为Neighborhood On-Policy Self-Distillation(N-OPSD)的新方法,旨在提升数学推理模型的训练效率。N-OPSD通过以下方式实现了对传统On-Policy Self-Distillation(OPSD)的改进:
- 局部扰动与互补修正:在参数空间中进行局部扰动,挖掘出与参考上下文对齐的互补修正信息。
- 专家池构建:通过离线贪婪选择构建一个紧凑的冻结专家池,以最大化过滤后的参考标记收益。
- 在线路由机制:采用MaxPeak选择锚定标记,并通过分位数选择匹配专家,确保学生模型从最佳专家的完整下一个标记分布中学习。
技术亮点
- 局部扰动:通过在参数空间中进行局部扰动,N-OPSD能够捕捉到传统OPSD方法无法发现的互补修正信息。
- 专家池构建与选择:离线贪婪选择和在线路由机制确保了专家池的多样性和高效性,从而为学生模型提供更丰富的监督信号。
- 性能提升:在AIME 2024、AIME 2025和HMMT February 2025等基准测试中,N-OPSD在Qwen模型(1.7B、4B和8B版本)上的表现均显著优于传统OPSD方法。
行业影响
N-OPSD的提出为数学推理模型的训练提供了一种新的高效方法,具有以下潜在影响:
- 提升模型性能:通过更丰富的监督信号,N-OPSD能够显著提升数学推理模型的性能。
- 降低训练成本:更高效的训练方法意味着更低的计算成本和更快的模型迭代速度。
- 推动AI应用:在教育、金融分析等领域,N-OPSD有望推动AI模型在复杂推理任务中的应用。
开发者建议
- 尝试N-OPSD方法:对于正在开发数学推理模型的开发者,建议尝试N-OPSD方法以提升模型性能。
- 关注专家池构建:在应用N-OPSD时,应重点关注专家池的构建和选择机制,以确保监督信号的多样性和有效性。
- 结合其他技术:可以结合其他技术(如多模态学习)进一步提升模型在复杂任务中的表现。
—— 完 ——消息来源:Hugging Face Daily Papers (2026-09-30)
主题标签: #Hugging Face #N-OPSD #数学推理 #模型训练
社区整体评论区
正在加载实时智能评论与划词标注…