智客 ZICQ
EN 登录 / 注册
智客前沿 大模型 #AWS #DeepEP #MoE架构 #强化学习 #EFA

AWS发布DeepEP架构优化:MoE强化学习训练吞吐量提升40%

Mr.Xu 的头像

文 / Mr.Xu

发布时间:

中文阅读 (Chinese) English Version

摘要:AWS推出了一种基于Amazon EKS、EFA和DeepEP的架构优化方案,用于大规模混合专家(MoE)强化学习训练。该方案通过优化专家并行通信和资源调度,将强化学习训练的整体吞吐量提升了40%。该架构解决了大规模RLHF和GRPO训练中的关键挑战,包括异构计算资源的协调、高带宽通信的维持以及动态子系统的动态编排。


架构优化与性能提升

AWS近日发布了一种基于Amazon Elastic Kubernetes Service (EKS)、Elastic Fabric Adapter (EFA) 和DeepEP的架构优化方案,用于大规模混合专家(MoE)强化学习(RL)训练。该方案旨在解决以下三个关键挑战:

  1. 异构计算资源的协调:在RLHF和GRPO训练中,生成回滚(rollout)和策略训练(policy training)需要协调不同的计算资源。
  2. 高带宽通信的维持:数百个加速器之间需要维持高吞吐量的通信。
  3. 动态子系统的动态编排:所有子系统必须动态协调,以避免瓶颈或资源闲置。

通过结合Amazon EKS、EFA和DeepEP,该方案实现了以下优化:

  • 专家并行通信优化:DeepEP通过专用调度和组合内核,取代了标准的all-to-all集合通信,从而减少了通信开销。
  • 资源调度优化:Amazon EKS提供了对异构工作节点的精细管理,使得不同类型的任务可以独立扩展。
  • 高性能通信:EFA支持跨节点的高带宽、低延迟通信,结合NVIDIA GPUDirect RDMA,进一步提升了数据传输效率。

技术亮点

  • DeepEP与EFA的集成:DeepEP v2引入了对EFA的原生支持,通过libfabric实现了跨网络结构的可移植性。
  • NVLink与EFA的协同工作:在多节点MoE训练中,NVLink处理节点内的高带宽通信,而EFA负责节点间的专家并行通信。
  • 性能提升:在48个P5en实例上启用DeepEP over EFA后,RL回滚吞吐量提高了40%。

行业影响与开发者建议

  • 对大规模RL训练的影响:该方案为需要处理复杂多任务RL训练的企业和研究机构提供了更高效的解决方案。
  • 成本优化:通过使用Amazon EC2 Spot Instances,开发者可以降低回滚生成的成本,同时保持策略训练的稳定性。
  • 开发者建议:建议开发者根据自身工作负载特性,灵活调整节点组配置,并充分利用Spot Instances进行成本优化。

结论

AWS通过结合EKS、EFA和DeepEP,提供了一种灵活且高效的大规模MoE RL训练架构。该方案不仅提升了训练吞吐量,还优化了资源利用和成本控制,为AI领域的进一步发展提供了强有力的基础设施支持。


消息来源:AWS Machine Learning Blog (2026-09-25)

—— 完 ——

主题标签: #AWS #DeepEP #MoE架构 #强化学习 #EFA

社区整体评论区

正在加载实时智能评论与划词标注…