智客 ZICQ
EN 登录 / 注册
智客前沿 大模型 #Salt++ #多模态生成 #因果建模 #少步蒸馏 #Xingtong Ge

Xingtong Ge发布Salt++:提升少步流式多模态生成性能的新框架

Mr.Xu 的头像

文 / Mr.Xu

发布时间:

中文阅读 (Chinese) English Version

摘要:Xingtong Ge团队推出了一种名为Salt++的新框架,旨在解决少步流式音频-视频生成中的两大关键挑战:因果建模和步骤蒸馏。Salt++采用两阶段后训练方法,包括因果自流(CSF)和上下文对齐的自回归分布匹配蒸馏(AR DMD)。CSF通过调整历史信息并保持噪声目标不变,激励学生模型提取语义信息并改善跨模态对齐。AR DMD通过共享因果掩码和前缀,在生成器采样、伪分数训练和真实分数评估中匹配生成和参考分布,从而实现高效蒸馏。在JavisBench基准测试中,Salt++在480p分辨率下将视觉和运动质量分别提高了57%和45%,并在扩展到1664x960生成时,在七个指标中的六个上优于双向LTX-2。


背景与挑战

少步流式音频-视频生成需要同时进行因果建模和步骤蒸馏。然而,传统的训练方法面临两大挑战:

  1. 教师强制(Teacher Forcing):将干净的历史与噪声目标配对,但仅通过速度预测间接监督预测性上下文表示。
  2. 因果分布匹配蒸馏(DMD):在因果生成器中直接重用双向评分模型,导致生成和评分上下文之间的不匹配。

Salt++框架

为了应对这些挑战,Xingtong Ge团队提出了Salt++,这是一个两阶段的后训练框架,包括以下两个核心组件:

1. 因果自流(CSF)

CSF通过调整历史信息并保持噪声目标不变,激励学生模型提取语义信息并改善跨模态对齐。具体来说,一个具有噪声混合历史的学生模型将其中间表示与干净历史的指数移动平均教师模型对齐。这种自监督信号鼓励学生模型提取语义信息,从而提高跨模态对齐效果。

2. 上下文对齐的自回归DMD

上下文对齐的AR DMD在生成器采样、伪分数训练和真实分数评估中共享因果掩码和前缀,通过块条件KL目标匹配生成和参考分布。在经过校准的教师指导下,它执行干净前缀的少步蒸馏,然后适应生成的历史,而无需切换目标或进行单独的一致性蒸馏。

实验结果

在JavisBench基准测试中,Salt++在480p分辨率下将视觉和运动质量分别提高了57%和45%,显著优于OmniForcing。在扩展到1664x960生成时,Salt++在七个指标中的六个上优于双向LTX-2。

此外,Salt++还引入了分尺度后训练阶段,使其能够进行4步1664x960生成,并在六个指标上优于现有的双向LTX-2。

行业影响与开发者建议

  • 多模态生成领域的突破:Salt++为少步流式多模态生成提供了一种高效的训练框架,能够显著提升生成质量和效率。
  • 跨模态对齐的改进:CSF和AR DMD的结合为跨模态对齐提供了新的思路,有助于开发更强大的多模态模型。
  • 开发者建议:建议开发者关注Salt++的框架设计,特别是在处理复杂多模态任务时,可以借鉴其因果建模和步骤蒸馏的方法。

结论

Salt++框架通过创新的两阶段后训练方法,解决了少步流式多模态生成中的关键挑战,展示了其在提升生成质量和效率方面的巨大潜力。


消息来源:Hugging Face Daily Papers (2026-09-29)

—— 完 ——

主题标签: #Salt++ #多模态生成 #因果建模 #少步蒸馏 #Xingtong Ge

社区整体评论区

正在加载实时智能评论与划词标注…