Hugging Face提出基于MMD的扩散语言模型后训练优化方法
文 / Mr.Xu
发布时间:
摘要:Hugging Face团队提出了一种针对扩散语言模型(DLMs)的后训练优化方法,通过最小化生成分布与参考分布在特征空间中的最大均值差异(MMD),提升模型生成质量。该方法利用预训练的冻结DLM提取上下文特征,并通过策略梯度或直接微分优化目标函数,避免了全采样轨迹或辅助模型的依赖。实验表明,该方法在OpenWebText数据集上降低了生成困惑度,并在GSM8K基准测试中实现了更好的精度-计算权衡。此外,在16B DMax-LLaDA2.0模型上,该方法提升了数学和代码任务的解码并行性,同时保持或提高了准确性。
技术背景与挑战
扩散语言模型(DLMs)在生成任务中表现出色,但其训练和推理效率一直是研究的重点。现有的优化方法通常依赖于复杂的采样轨迹或辅助模型,这限制了其在实际应用中的效率。
方法与创新
Hugging Face团队提出了一种新的后训练优化方法,通过最小化生成分布与参考分布之间的最大均值差异(MMD),实现对DLMs的优化。具体创新点包括:
- 特征空间优化:利用预训练的冻结DLM提取上下文特征,在特征空间中进行优化,避免了全采样轨迹的依赖。
- 高效目标函数优化:对于离散模型,采用策略梯度优化;对于连续模型,则通过生成潜变量的直接微分进行优化。
- 多观察点采样:在单个遍历过程中保留每个token位置的上下文特征,从而获得每个序列的多个观察点,提升优化效率。
实验结果
实验结果表明,该方法在以下方面表现出色:
- 生成困惑度降低:在OpenWebText数据集上,生成困惑度显著降低,同时保持了与基线相当的熵。
- 精度-计算权衡优化:在GSM8K基准测试中,该方法实现了更好的精度-计算权衡。
- 解码并行性提升:在16B DMax-LLaDA2.0模型上,该方法提升了数学和代码任务的解码并行性,同时保持或提高了准确性。
行业影响与开发者建议
该方法为扩散语言模型的优化提供了新的思路,尤其在以下方面具有重要意义:
- 提升模型效率:通过避免复杂的采样轨迹和辅助模型,显著提升了DLMs的训练和推理效率。
- 增强模型性能:在多个基准测试中,该方法均表现出色,展示了其在复杂任务中的潜力。
- 推动多语言AI发展:该方法可应用于多语言DLMs,进一步推动多语言AI技术的进步。
建议开发者关注该方法的实现细节,并尝试将其应用于自己的DLMs中,以提升模型性能。
—— 完 ——消息来源:Hugging Face Daily Papers (2026-10-05)
主题标签: #Hugging Face #扩散模型 #MMD优化 #后训练 #DLM
社区整体评论区