AWS Machine Learning Blog· Ashvin Nihalani·· 4 天前AI 评分29
在 Amazon EKS 上借助 EFA 与 DeepEP 扩展 MoE 强化学习,吞吐量提升 40%
Scaling MoE reinforcement learning on Amazon EKS with EFA and DeepEP with 40% more throughput
AI 导读
在 Amazon EKS 上结合 EFA 与 DeepEP 扩展 MoE 强化学习,吞吐量提升 40%。RLHF 与 GRPO 需同时平衡大规模 rollout 生成和紧耦合策略训练,两侧速率不匹配会让加速器空闲或引发训练不稳定。更稀疏的 MoE 使训练更受通信而非算力制约;作业超出单实例后,通信从节点内 NVLink 转到更低带宽的节点间链路。
来源:AWS Machine Learning Blog · aws.amazon.com