智客 ZICQ
EN 登录 / 注册
智客前沿 大模型 #Hugging Face #大语言模型 #推理效率 #OPPD #机器学习

Hugging Face提出OPPD:革新大语言模型推理效率与准确性

Mr.Xu 的头像

文 / Mr.Xu

发布时间:

中文阅读 (Chinese) English Version

摘要:Hugging Face的研究团队提出了一种名为On-Policy Power Distillation (OPPD)的新方法,旨在提升大语言模型在单次生成中的推理效率和准确性。该方法通过训练模型生成符合特定分布的答案,显著提高了模型在复杂推理任务中的表现。在MATH500和GSM8K数据集上的实验结果表明,OPPD相较于未训练模型,单次生成的准确率分别提升了23.0和27.3个百分点。此外,OPPD在不使用参考答案的情况下,显著优于基于奖励优化的方法GRPO,展现出其在数学推理任务中的巨大潜力。


核心突破

Hugging Face的研究团队提出了一种名为On-Policy Power Distillation (OPPD)的新方法,旨在提升大语言模型在单次生成中的推理效率和准确性。该方法的核心创新点包括:

  • 训练模型生成符合特定分布的答案:通过将模型生成的答案的概率分布进行幂次变换并重新归一化,OPPD能够将概率集中在模型认为最可能的答案上,从而提高推理的准确性。
  • 无需大量候选样本:传统方法需要为每个查询生成大量候选样本,而OPPD通过训练模型直接生成符合特定分布的答案,减少了对候选样本的需求。
  • 显著提升推理性能:在MATH500和GSM8K数据集上的实验结果表明,OPPD相较于未训练模型,单次生成的准确率分别提升了23.0和27.3个百分点。此外,OPPD在不使用参考答案的情况下,显著优于基于奖励优化的方法GRPO。

技术亮点

  • 幂次变换与重新归一化:OPPD通过将模型生成的答案的概率分布进行幂次变换并重新归一化,将概率集中在最可能的答案上。
  • 顺序蒙特卡洛采样器:OPPD使用顺序蒙特卡洛采样器生成候选答案,并使用冻结的教师模型的幂次分布对其进行加权。
  • 最大似然更新:在训练过程中,OPPD使用相同的概率对每个答案进行最大似然更新,从而实现对模型的有效训练。

行业影响

OPPD的提出为大语言模型在复杂推理任务中的应用提供了新的技术路径,特别是在数学推理和问题解决方面展现出巨大潜力。其无需大量候选样本的特点,使其在资源受限的环境中更具优势。此外,OPPD与基于奖励优化的方法GRPO互补,进一步提升了模型的推理性能。

开发者建议

  • 尝试OPPD方法:对于需要在单次生成中提高推理效率和准确性的开发者,建议尝试OPPD方法。
  • 结合其他技术:可以将OPPD与其他技术(如GRPO)结合使用,以进一步提升模型性能。
  • 关注后续研究:关注Hugging Face在OPPD方面的后续研究,以获取更多技术细节和应用案例。

结论

OPPD的提出为大语言模型在复杂推理任务中的应用提供了新的技术路径,特别是在数学推理和问题解决方面展现出巨大潜力。其无需大量候选样本的特点,使其在资源受限的环境中更具优势。


消息来源:Hugging Face Daily Papers (2026-10-05)

—— 完 ——

主题标签: #Hugging Face #大语言模型 #推理效率 #OPPD #机器学习

社区整体评论区

正在加载实时智能评论与划词标注…