Hugging Face提出RP-OPD+RL框架:革新语言模型任务训练方法
文 / Mr.Xu
发布时间:
摘要:Hugging Face提出了一种名为Rubric-Privileged On-Policy Distillation (RP-OPD) + RL的两阶段训练框架,用于解决基于评分标准(Rubric)的强化学习(RL)中训练信号稀疏的问题。该框架首先利用评分标准作为特权教师上下文进行密集的token级监督,然后在第二阶段通过RL进一步优化评分奖励。实验结果表明,该方法在HealthBench、ResearchQA和RubricHub Science等任务上表现优异,显著提升了模型在复杂任务中的表现,同时减少了奖励黑客行为,为基于评分标准的RL训练提供了创新解决方案。
背景与挑战
在语言模型任务中,许多开放性任务的评估无法通过精确的结果验证来完成。基于评分标准(Rubric)的强化学习(RL)通过将开放性响应与明确的评分标准进行对比来解决这一问题。然而,由于奖励是在完整响应后分配的,训练信号无法直接识别哪些具体决策导致了最终得分,这限制了模型的学习效率与性能表现。
解决方案:RP-OPD + RL框架
Hugging Face提出了一种两阶段训练框架来解决上述问题:
-
Rubric-Privileged On-Policy Distillation (RP-OPD): 在这一阶段,学生模型在没有直接访问评分标准的情况下,通过匹配教师模型(具备评分标准知识)的下一个token分布来学习。这种方法利用评分标准作为特权上下文,提供了更密集的token级监督。
-
强化学习(RL): 在第二阶段,RL直接优化评分奖励,使模型在RP-OPD的基础上进一步提升性能,突破蒸馏阶段的性能瓶颈。
实验结果
研究团队在HealthBench、ResearchQA和RubricHub Science等任务上进行了实验,结果表明:
-
性能提升: RP-OPD + RL框架在所有评估任务中均取得了最高得分,显著优于仅使用监督微调(SFT)或传统RL的方法。
-
奖励黑客行为的减少: 与SFT + RL基线方法相比,RP-OPD + RL在RubricHub Science任务中表现出更少的奖励黑客行为,即模型不会为了获得高分而提供不相关的内容。
技术亮点
-
两阶段训练策略: 通过先进行RP-OPD再进行RL的两阶段训练,模型能够更有效地利用评分标准信息,提升学习效率。
-
特权教师上下文: RP-OPD阶段利用评分标准作为特权上下文,为学生模型提供更丰富的学习信号。
-
减少奖励黑客行为: 该方法在优化评分奖励的同时,减少了模型为了获得高分而采取的策略性行为。
行业影响与开发者建议
-
对AI研究的影响: 该框架为基于评分标准的RL训练提供了新的思路,尤其适用于需要复杂评估标准的任务,如医疗、科学研究等领域。
-
对开发者的建议: 开发者可以尝试将RP-OPD + RL框架应用于自己的项目中,特别是在处理开放性任务和复杂评估标准时,以提升模型性能。
-
未来研究方向: 未来可以进一步探索如何将RP-OPD + RL框架扩展到更多类型的任务,以及如何优化两阶段训练策略以适应不同的应用场景。
—— 完 ——消息来源:Hugging Face Daily Papers (2026-10-02)
主题标签: #Hugging Face #强化学习 #语言模型 #RP-OPD #RL
社区整体评论区