智客 ZICQ
EN 登录 / 注册
智客前沿 大模型 #Hugging Face #强化学习 #ReSPO #序列策略优化 #MoE架构

Hugging Face发布ReSPO:革新强化学习中的序列策略优化方法

Mr.Xu 的头像

文 / Mr.Xu 智客前沿编译 · 审校

发布时间:

中文阅读 (Chinese) English Version

摘要:Hugging Face推出了一种名为ReSPO(Reshaped Sequence Policy Optimization)的新方法,用于解决强化学习中梯度饥饿问题。ReSPO通过引入基于α-散度变分目标和指数方差控制倾斜的双分支序列级核函数,取代了传统的裁剪策略。该方法在早期训练中有效利用长正推理轨迹,并在MoE Qwen3模型上加速优化过程,提升最终训练得分和基准测试性能,展示了其在非策略学习中的潜力。


强化学习中的梯度饥饿问题与ReSPO解决方案

在强化学习中,从可验证奖励(RLVR)中学习通常会重复使用多个策略更新中的回溯轨迹,这增加了当前策略与数据生成策略之间的不匹配。传统方法中,裁剪策略优化容易导致梯度饥饿问题:裁剪操作抑制了低重要性权重尾部的欠生成正响应,同时允许高权重尾部严重过生成的负响应占主导地位。

为了解决这一问题,Hugging Face提出了ReSPO(Reshaped Sequence Policy Optimization)。ReSPO通过以下方式革新了序列策略优化:

  • 双分支序列级核函数:ReSPO引入了一个基于α-散度变分目标和指数方差控制倾斜的平滑双分支序列级核函数。

    • 正分支:保留欠生成正响应的非零梯度权重。
    • 负分支:抑制严重过生成的负响应。
  • 优势:

    • 在早期训练中有效利用长正推理轨迹。
    • 在MoE Qwen3模型上加速优化过程。
    • 提升最终训练得分和基准测试性能。

技术亮点与创新

  1. 双分支核函数设计:通过正负分支的分离处理,ReSPO能够更精细地控制梯度更新,避免传统裁剪策略的局限性。
  2. α-散度变分目标:引入α-散度变分目标,使模型在优化过程中更好地平衡探索与利用。
  3. 指数方差控制倾斜:通过指数方差控制倾斜,进一步稳定训练过程,提升模型性能。

行业影响与开发者建议

ReSPO的发布为强化学习领域带来了新的技术路径,特别是在处理长正推理轨迹和非策略学习方面具有显著优势。对于开发者而言,以下几点值得关注:

  • 模型优化:ReSPO可以应用于各种强化学习模型,提升优化效率和最终性能。
  • 资源受限场景:由于其在MoE模型上的优异表现,ReSPO在资源受限场景中具有潜在应用价值。
  • 研究扩展:未来可以进一步探索ReSPO在不同任务和领域中的应用,例如机器人控制、自动驾驶等。

结论

ReSPO的推出标志着强化学习序列策略优化方法的重要进步。其创新的双分支核函数设计和α-散度变分目标为解决梯度饥饿问题提供了新的思路,并在多个实验中展示了其优越的性能。


消息来源:Hugging Face Daily Papers (2026-09-28)

—— 完 ——

主题标签: #Hugging Face #强化学习 #ReSPO #序列策略优化 #MoE架构

编辑部与事实核查说明:本篇专刊由智客前沿资讯管线根据官方技术公告、学术论文及开源工程文档整理编译,经算法实体核验与人工编辑审校后发布。若发现技术事实纰漏,欢迎依据勘误方针或一键向编辑部发送勘误反馈。

社区整体评论区

正在加载实时智能评论与划词标注…