智客 ZICQ
EN 登录 / 注册
智客前沿 大模型 #AMap #IntBMoE #MoE架构 #推荐系统 #稀疏模型

AMap发布IntBMoE:革新稀疏专家混合模型,突破性能与效率瓶颈

Mr.Xu 的头像

文 / Mr.Xu

发布时间:

中文阅读 (Chinese) English Version

摘要:AMap推出了一种名为IntBMoE的新型稀疏专家混合模型,通过块级条件化技术实现了专家组合的完全参与,同时保持计算和内存成本的低消耗。IntBMoE通过将密集专家组合与稀疏块执行相结合,解决了现有MoE模型在参与度、计算成本和内存占用之间难以平衡的问题。实验结果表明,IntBMoE在图像分类、语言建模和序列推荐任务上均表现出色,尤其在处理复杂数据时展现出显著优势。该模型已全面部署在AMap的生成式推荐系统中,为数亿用户提供服务,并在在线A/B测试中实现了2.4%的相对UVCTR提升。


突破性创新:IntBMoE的诞生

稀疏专家混合模型(MoE)通过动态路由机制实现了模型容量的高效扩展,但现有设计在专家参与度、计算成本和内存占用之间难以平衡。IntBMoE通过引入块级条件化技术,巧妙地解决了这一难题。其核心创新点包括:

  • 完全参与与稀疏执行结合:IntBMoE通过密集专家组合实现了每个token对整个专家池的完全参与,同时通过稀疏块执行机制将计算成本控制在较低水平。
  • 固定内存占用:通过使用学习到的代码本,IntBMoE的内存占用不随输入变化而变化,从而实现了内存占用的固定化。
  • 双路径残差门控(DPRG):IntBMoE采用DPRG机制,通过乘法门控将两条独立组合的路径耦合起来,进一步提升了模型的表达能力。

技术亮点

  1. 专家组合的完全参与:IntBMoE通过密集专家组合,确保每个token都能从整个专家池中受益,解决了传统MoE模型中专家参与度不足的问题。
  2. 计算与内存效率:通过稀疏块执行和固定内存占用,IntBMoE在保持高性能的同时,大幅降低了计算和内存成本。
  3. 跨领域适用性:实验结果表明,IntBMoE不仅在图像分类任务中表现出色,在语言建模和序列推荐任务中也展现出强大的泛化能力。

行业影响与应用

IntBMoE已全面部署在AMap的生成式推荐系统中,为数亿用户提供服务,并在在线A/B测试中实现了2.4%的相对UVCTR提升。这一成果展示了IntBMoE在处理大规模用户数据和复杂推荐任务方面的强大能力,为推荐系统领域带来了新的技术突破。

开发者建议

  • 模型优化:开发者可以利用IntBMoE的代码库(https://github.com/AMAP-ML/DreamX-Rec/)进行模型优化和定制化开发。
  • 跨领域应用:IntBMoE的跨领域适用性使其在图像、语言和推荐系统等多个领域具有广泛的应用前景,开发者可以探索其在不同场景下的应用。
  • 性能调优:建议在部署IntBMoE时,根据具体应用场景进行性能调优,以充分发挥其优势。

消息来源:Hugging Face Daily Papers (2026-09-18)

—— 完 ——

主题标签: #AMap #IntBMoE #MoE架构 #推荐系统 #稀疏模型

社区整体评论区

正在加载实时智能评论与划词标注…