智客 ZICQ
EN 登录 / 注册
智客前沿 大模型 #Hugging Face #SFT #SCALE #数学推理 #代码生成

Hugging Face提出SCALE框架:革新SFT模型特征控制与优化

Mr.Xu 的头像

文 / Mr.Xu

发布时间:

中文阅读 (Chinese) English Version

摘要:Hugging Face提出了一种名为SCALE(选择性局部熵引导的自适应控制)的新方法,旨在解决监督微调(SFT)过程中特征抑制、逆转和推断的难题。SCALE通过冻结预训练模型和SFT增量,并使用预测熵最小化学习有界的、特定于token和模块的门控机制,从而实现对已学习特征的抑制、逆转或推断。实验结果表明,SCALE在数学推理和代码生成任务中表现优异,显著超越了现有基线模型,同时在保留通用能力方面也具有竞争力。


背景与挑战

监督微调(SFT)是提升大语言模型(LLM)性能的重要技术,但其学习过程存在显著问题:模型倾向于从最不可能的token中学习,这虽然有助于获取新行为,但也放大了噪声或冲突监督,并可能覆盖有用的预训练知识。现有的token重加权方法只能抑制或放大监督更新,无法逆转已学习的特征,且较大的训练权重并不能实现特征推断,因为它们改变了优化轨迹而非缩放固定的SFT方向。

SCALE方法

为了解决上述问题,Hugging Face提出了SCALE(选择性局部熵引导的自适应控制)方法。其核心思想包括:

  1. 冻结预训练模型和SFT增量:通过冻结预训练模型和SFT增量,确保优化过程的稳定性。
  2. 学习有界的、特定于token和模块的门控机制:通过最小化预测熵,学习门控机制以控制特征的抑制、逆转或推断。
  3. 基于熵减少的适应性调整:根据特征与熵减少的匹配度,决定其调整方向。

实验结果

在Qwen2.5-Math-1.5B、Qwen2.5-Math-7B和Qwen3-4B-Base模型上的实验表明,SCALE在数学推理任务中取得了37.84、43.60和36.57的平均分,超过了最强的基线模型。同时,在HumanEval、HumanEval+和MBPP的代码生成任务中,SCALE也取得了最佳的平均性能。

技术亮点

  • 创新性门控机制:通过学习有界的、特定于token和模块的门控机制,实现对特征的精细控制。
  • 熵引导的适应性调整:基于熵减少的匹配度进行适应性调整,确保调整方向的合理性。
  • 性能提升显著:在数学推理和代码生成任务中表现优异,同时在保留通用能力方面也具有竞争力。

行业影响与开发者建议

SCALE为SFT模型的特征控制与优化提供了新的思路,尤其在处理复杂任务和精细化调整方面具有重要意义。开发者可以尝试将SCALE应用于自己的模型中,以提升其在特定任务上的性能。同时,SCALE的提出也表明,未来在模型优化过程中,精细化控制和适应性调整将成为重要趋势。


消息来源:Hugging Face Daily Papers (2026-09-27)

—— 完 ——

主题标签: #Hugging Face #SFT #SCALE #数学推理 #代码生成

社区整体评论区

正在加载实时智能评论与划词标注…