智客 ZICQ
EN 登录 / 注册
智客前沿 大模型 #Hugging Face #FP4量化 #强化学习 #MoE架构 #TRACE框架

Hugging Face发布TRACE框架:革新FP4强化学习中的量化对齐技术

Mr.Xu 的头像

文 / Mr.Xu

发布时间:

中文阅读 (Chinese) English Version

摘要:Hugging Face推出TRACE(Train-Rollout Quantization Alignment via Compact GuidancE)框架,旨在解决现有FP4强化学习(RL)方法在量化精度上的关键缺陷。TRACE通过引入基于rollout的量化感知训练,将训练端和rollout端的量化结果对齐,减少了量化路径间的差异。此外,TRACE采用了一种高效的量化信息缓存方案,选择性地保留更深层的小数部分和比例信息,从而降低存储和通信开销。实验结果表明,TRACE在推理任务中实现了高达5.4倍的加速,同时在FP4权重/激活和FP4 KV-cache rollout中表现出与BF16 rollout相当的RL性能,为高效强化学习提供了新的技术路径。


背景与挑战

强化学习(RL)在后训练大语言模型(LLM)中的应用面临计算和内存开销巨大的问题,这促使研究人员探索低精度量化技术以提升RL训练的效率。然而,现有的FP4 RL方法存在一个关键缺陷:它们主要独立优化训练路径和rollout路径的量化精度,而不是直接减少两者之间的量化执行路径差异。这种方法限制了RL训练的整体效率和性能表现。

TRACE框架的核心创新

Hugging Face推出的TRACE框架通过以下创新解决了上述问题:

  1. rollout引导的量化感知训练:TRACE利用rollout端的量化结果来指导训练端的FP4舍入决策,从而直接减少训练和rollout路径之间的量化差异。
  2. 高效的量化信息缓存方案:TRACE采用了一种选择性缓存机制,仅保留更深层的小数部分和比例信息,从而降低存储和通信开销。

实验结果与性能表现

TRACE在四个大规模MoE语言模型上进行了评估,涵盖推理、编码和长时RL任务。实验结果表明:

  • TRACE实现了FP4权重/激活和FP4 KV-cache rollout的联合使用,其RL性能与BF16 rollout相当。
  • 在加速方面,TRACE相较于传统方法实现了高达5.4倍的rollout加速。
  • 在最终性能上,TRACE在FP4量化中表现出色,显著优于BF16训练策略的后处理FP4量化方法。

技术亮点

  • 量化路径对齐:通过rollout引导的量化感知训练,TRACE实现了训练和rollout路径的量化一致性。
  • 高效缓存机制:TRACE的缓存方案在减少开销的同时保持了量化精度。
  • 多任务适用性:TRACE在推理、编码和长时RL任务中均表现出色,展示了其广泛的适用性。

行业影响与开发者建议

TRACE框架的推出为低精度RL训练提供了新的技术方案,尤其适用于对计算和内存资源敏感的应用场景。开发者可以借助TRACE,在保持高性能的同时降低资源消耗,从而提升RL模型的训练效率和可扩展性。此外,TRACE的成功应用也表明,量化技术的创新仍然是AI领域的重要研究方向,未来有望在更多场景中实现突破。


消息来源:Hugging Face Daily Papers (2026-10-06)

—— 完 ——

主题标签: #Hugging Face #FP4量化 #强化学习 #MoE架构 #TRACE框架

社区整体评论区

正在加载实时智能评论与划词标注…