智客 ZICQ
EN 登录 / 注册
智客前沿 大模型 #Hugging Face #MoE架构 #模型优化 #推理效率 #KV缓存

Hugging Face发布SlimWise框架:革新MoE模型推理效率与精度平衡

Mr.Xu 的头像

文 / Mr.Xu

发布时间:

中文阅读 (Chinese) English Version

摘要:Hugging Face推出SlimWise框架,通过针对不同推理阶段定制专家池,显著提升MoE模型的推理效率。SlimWise在预填充阶段使用完整模型,在解码阶段使用剪枝模型,并直接重用预填充生成的KV缓存,避免了转换开销。在Qwen3.6-35B-A3B模型上的实验表明,SlimWise在50%专家剪枝下将解码吞吐量提升了1.81倍,同时保持了最小的精度损失。该框架还引入了低成本的蒸馏阶段,以进一步优化生成长度和精度问题,为MoE模型的实际应用提供了高效解决方案。


背景与挑战

在现代人工智能系统中,混合专家模型(MoE)因其高效激活少量专家的能力而广受欢迎。然而,在批量解码过程中,几乎整个专家池都会被访问,导致专家权重流量成为主要瓶颈。尽管专家剪枝可以减少这种流量,但传统方法通常也会剪枝计算密集型的预填充阶段,导致模型质量下降,而吞吐量提升有限。

SlimWise的创新解决方案

Hugging Face推出的SlimWise框架通过针对不同推理阶段定制专家池,解决了上述问题。具体来说,SlimWise在预填充阶段使用完整模型,而在解码阶段使用剪枝模型,并直接重用预填充生成的KV缓存,避免了转换开销。这种方法在多个MoE骨干网络和剪枝标准下,显著缩小了与完整模型相比的精度差距。

技术亮点

  1. 训练自由的KV缓存交接:无需重新训练即可实现预填充和解码阶段的KV缓存重用,简化了部署流程。
  2. 低成本的蒸馏阶段:通过训练解码器从完整模型的KV缓存继续生成,仅更新一小部分参数,进一步优化了生成长度和精度问题。
  3. 多场景支持:SlimWise在vLLM中实现,支持预填充-解码(PD)分离和PD共置服务,适用于多种应用场景。

实验结果

在Qwen3.6-35B-A3B模型上的实验表明,SlimWise在50%专家剪枝下将解码吞吐量提升了1.81倍,同时保持了最小的精度损失。此外,SlimWise还揭示了基准测试精度可能掩盖生成长度方面的显著变化,并提出了相应的解决方案。

行业影响与未来展望

SlimWise的推出为MoE模型的实际应用提供了高效解决方案,特别是在资源受限的环境中。其创新方法不仅提升了推理效率,还保持了模型精度,为AI模型的部署和优化提供了新的思路。未来,SlimWise有望在更多领域和模型架构中得到应用,进一步推动AI技术的发展。

开发者建议

  • 优化部署流程:利用SlimWise的KV缓存重用机制,简化MoE模型的部署流程。
  • 关注蒸馏阶段:在模型训练中引入低成本的蒸馏阶段,以优化生成长度和精度。
  • 探索更多应用场景:尝试将SlimWise应用于其他类型的模型和任务,以探索其更广泛的应用潜力。

消息来源:Hugging Face Daily Papers (2026-09-28)

—— 完 ——

主题标签: #Hugging Face #MoE架构 #模型优化 #推理效率 #KV缓存

社区整体评论区

正在加载实时智能评论与划词标注…