智客 ZICQ
EN 登录 / 注册
智客前沿 大模型 #Hugging Face #强化学习 #低精度执行 #TRIAGE #Qwen模型

Hugging Face发布TRIAGE:革新低精度强化学习优化方法

Mr.Xu 的头像

文 / Mr.Xu

发布时间:

中文阅读 (Chinese) English Version

摘要:Hugging Face推出了一种名为TRIAGE的新方法,用于解决低精度执行在强化学习(RL)中引起的策略优化不稳定问题。TRIAGE通过分段诊断和选择性重平衡策略梯度更新,同时保持原生NVFP4的4位权重和激活前向执行,显著提升了训练稳定性。在Qwen3-4B和Qwen3-30B-A3B模型上的实验表明,TRIAGE在五个数学推理基准测试中达到了全精度性能,同时将推理吞吐量提高了2.3倍。


背景与挑战

低精度执行是加速大语言模型强化学习(RL)训练的重要手段,但其带来的执行差异可能导致策略优化不稳定。现有的方法难以有效识别和解决这种不稳定性对训练过程的影响。

TRIAGE方法概述

Hugging Face推出的TRIAGE方法通过以下方式解决了上述问题:

  • 方向感知稳定性优化:TRIAGE能够识别策略梯度方向上的局部放大和收缩更新贡献,而不仅仅是依赖不匹配幅度。
  • 分段诊断与重平衡:通过分段诊断,TRIAGE可以识别并重新平衡对训练过程有负面影响的更新,从而稳定优化过程。
  • 保留原生NVFP4执行:TRIAGE在保持原生NVFP4 4位权重和激活前向执行的同时,修改优化目标以适应低精度执行环境。

实验结果

在Qwen3-4B和Qwen3-30B-A3B模型上的实验表明:

  • 训练稳定性:TRIAGE在整个训练过程中保持了稳定的优化过程。
  • 性能提升:在五个数学推理基准测试中,TRIAGE达到了与全精度执行相当的水平。
  • 吞吐量提高:与BF16相比,TRIAGE将推理吞吐量提高了2.3倍。

行业影响与开发者建议

TRIAGE的发布为低精度强化学习提供了新的优化思路,尤其适用于资源受限但对性能要求较高的场景。对于开发者而言,以下几点值得关注:

  • 优化策略:TRIAGE展示了通过精细化诊断和重平衡策略提升训练稳定性的潜力。
  • 资源效率:该方法在保持高性能的同时,显著降低了计算资源需求。
  • 应用场景:适用于需要快速推理和高效训练的大规模RL模型开发。

技术亮点

  • 方向感知更新:通过识别策略梯度方向上的局部放大和收缩,TRIAGE实现了更精准的优化。
  • 分段诊断机制:分段处理更新贡献,识别并修复潜在的不稳定因素。
  • 原生执行保留:在不影响原生NVFP4执行的情况下进行优化,提升了方法的实用性。

消息来源:Hugging Face Daily Papers (2026-10-05)

—— 完 ——

主题标签: #Hugging Face #强化学习 #低精度执行 #TRIAGE #Qwen模型

社区整体评论区

正在加载实时智能评论与划词标注…