AMap发布IntBMoE:革新稀疏专家混合模型,突破性能与效率瓶颈
文 / Mr.Xu
发布时间:
摘要:AMap推出了一种名为IntBMoE的新型稀疏专家混合模型,通过块级条件化技术实现了专家组合的完全参与,同时保持计算和内存成本的低消耗。IntBMoE通过将密集专家组合与稀疏块执行相结合,解决了现有MoE模型在参与度、计算成本和内存占用之间难以平衡的问题。实验结果表明,IntBMoE在图像分类、语言建模和序列推荐任务上均表现出色,尤其在处理复杂数据时展现出显著优势。该模型已全面部署在AMap的生成式推荐系统中,为数亿用户提供服务,并在在线A/B测试中实现了2.4%的相对UVCTR提升。
突破性创新:IntBMoE的诞生
稀疏专家混合模型(MoE)通过动态路由机制实现了模型容量的高效扩展,但现有设计在专家参与度、计算成本和内存占用之间难以平衡。IntBMoE通过引入块级条件化技术,巧妙地解决了这一难题。其核心创新点包括:
- 完全参与与稀疏执行结合:IntBMoE通过密集专家组合实现了每个token对整个专家池的完全参与,同时通过稀疏块执行机制将计算成本控制在较低水平。
- 固定内存占用:通过使用学习到的代码本,IntBMoE的内存占用不随输入变化而变化,从而实现了内存占用的固定化。
- 双路径残差门控(DPRG):IntBMoE采用DPRG机制,通过乘法门控将两条独立组合的路径耦合起来,进一步提升了模型的表达能力。
技术亮点
- 专家组合的完全参与:IntBMoE通过密集专家组合,确保每个token都能从整个专家池中受益,解决了传统MoE模型中专家参与度不足的问题。
- 计算与内存效率:通过稀疏块执行和固定内存占用,IntBMoE在保持高性能的同时,大幅降低了计算和内存成本。
- 跨领域适用性:实验结果表明,IntBMoE不仅在图像分类任务中表现出色,在语言建模和序列推荐任务中也展现出强大的泛化能力。
行业影响与应用
IntBMoE已全面部署在AMap的生成式推荐系统中,为数亿用户提供服务,并在在线A/B测试中实现了2.4%的相对UVCTR提升。这一成果展示了IntBMoE在处理大规模用户数据和复杂推荐任务方面的强大能力,为推荐系统领域带来了新的技术突破。
开发者建议
- 模型优化:开发者可以利用IntBMoE的代码库(https://github.com/AMAP-ML/DreamX-Rec/)进行模型优化和定制化开发。
- 跨领域应用:IntBMoE的跨领域适用性使其在图像、语言和推荐系统等多个领域具有广泛的应用前景,开发者可以探索其在不同场景下的应用。
- 性能调优:建议在部署IntBMoE时,根据具体应用场景进行性能调优,以充分发挥其优势。
—— 完 ——消息来源:Hugging Face Daily Papers (2026-09-18)
社区整体评论区
正在加载实时智能评论与划词标注…