Hugging Face提出SCALE框架:革新SFT模型特征控制与优化
文 / Mr.Xu
发布时间:
摘要:Hugging Face提出了一种名为SCALE(选择性局部熵引导的自适应控制)的新方法,旨在解决监督微调(SFT)过程中特征抑制、逆转和推断的难题。SCALE通过冻结预训练模型和SFT增量,并使用预测熵最小化学习有界的、特定于token和模块的门控机制,从而实现对已学习特征的抑制、逆转或推断。实验结果表明,SCALE在数学推理和代码生成任务中表现优异,显著超越了现有基线模型,同时在保留通用能力方面也具有竞争力。
背景与挑战
监督微调(SFT)是提升大语言模型(LLM)性能的重要技术,但其学习过程存在显著问题:模型倾向于从最不可能的token中学习,这虽然有助于获取新行为,但也放大了噪声或冲突监督,并可能覆盖有用的预训练知识。现有的token重加权方法只能抑制或放大监督更新,无法逆转已学习的特征,且较大的训练权重并不能实现特征推断,因为它们改变了优化轨迹而非缩放固定的SFT方向。
SCALE方法
为了解决上述问题,Hugging Face提出了SCALE(选择性局部熵引导的自适应控制)方法。其核心思想包括:
- 冻结预训练模型和SFT增量:通过冻结预训练模型和SFT增量,确保优化过程的稳定性。
- 学习有界的、特定于token和模块的门控机制:通过最小化预测熵,学习门控机制以控制特征的抑制、逆转或推断。
- 基于熵减少的适应性调整:根据特征与熵减少的匹配度,决定其调整方向。
实验结果
在Qwen2.5-Math-1.5B、Qwen2.5-Math-7B和Qwen3-4B-Base模型上的实验表明,SCALE在数学推理任务中取得了37.84、43.60和36.57的平均分,超过了最强的基线模型。同时,在HumanEval、HumanEval+和MBPP的代码生成任务中,SCALE也取得了最佳的平均性能。
技术亮点
- 创新性门控机制:通过学习有界的、特定于token和模块的门控机制,实现对特征的精细控制。
- 熵引导的适应性调整:基于熵减少的匹配度进行适应性调整,确保调整方向的合理性。
- 性能提升显著:在数学推理和代码生成任务中表现优异,同时在保留通用能力方面也具有竞争力。
行业影响与开发者建议
SCALE为SFT模型的特征控制与优化提供了新的思路,尤其在处理复杂任务和精细化调整方面具有重要意义。开发者可以尝试将SCALE应用于自己的模型中,以提升其在特定任务上的性能。同时,SCALE的提出也表明,未来在模型优化过程中,精细化控制和适应性调整将成为重要趋势。
—— 完 ——消息来源:Hugging Face Daily Papers (2026-09-27)
主题标签: #Hugging Face #SFT #SCALE #数学推理 #代码生成
社区整体评论区