Geri Dön
AWS, MoE pekiştirmeli öğrenmeyi EKS'te EFA ve DeepEP ile ölçekledi: %40 daha fazla verim
SiTech AI Team2 წთ. საკითხავი

AWS, MoE pekiştirmeli öğrenmeyi EKS'te EFA ve DeepEP ile ölçekledi: %40 daha fazla verim

AWS, MoE modellerinin büyük ölçekli pekiştirmeli öğrenme eğitimi için Amazon EKS, EFA ve DeepEP'i birleştiren bir referans mimari yayımladı. 48 P5en örneğinde DeepEP, rollout verimini yüzde 40 artırdı.

AWS, Mixture-of-Experts (MoE) modellerinin büyük ölçekli pekiştirmeli öğrenme (RL) eğitimi için Amazon EKS üzerinde EFA ve DeepEP'i birleştiren bir referans mimari yayımladı. 25 Eylül 2026 tarihli AWS Machine Learning Blog yazısı, DeepEP'in EFA üzerinde çalışmasıyla toplam rollout veriminin yüzde 40 arttığını bildiriyor.

İletişimle sınırlanan rollout döngüsü

Seyrek MoE mimarileri çıkarım maliyetini düşürür ama eğitimi hesaplama yerine iletişimle sınırlı hâle getirir. Bu yükün başlıca kaynağı Expert Parallelism (EP): Tensor, Data ve Pipeline Parallelism desenlerinin üzerine cihazlar arasında dinamik all-to-all token yönlendirmesi ekliyor.

Asenkron bir RL işi aynı anda iki iş yükü çalıştırır: rollout üretimi toplam verimi en üst düzeye çıkaran dağıtık çıkarımdır, politika eğitimi ise kilit adımda ilerleyen sıkı bağlı çalışanlar gerektirir; tek bir yavaş çalışan tüm işi durdurabilir ya da NCCL zaman aşımlarına yol açabilir. Tek örnek sınırı aşıldığında trafik, düğüm içi NVLink'ten düğümler arası yavaş bağlantılara kayar.

DeepEP'li ve DeepEP'siz verim

DeepEP token'ları EFA üzerinden nasıl taşır

DeepEP, genel all-to-all kolektiflerini iki çekirdekle değiştirir: dispatch token'ları uzak uzmanlara yönlendirir, combine sonuçları toplar; düğüm içinde NVLink, düğümler arasında libfabric kullanılır. AWS, DeepEP'in ilkellerini libfabric'e taşıyan değişiklikleri upstream'e katkı olarak verdi; böylece DeepEP v2 yerel EFA desteği kazandı ve NCCL 2.31 en yeni EFA iyileştirmelerini ekliyor. P5 ve P6 örneklerinde EFA, NVIDIA GPUDirect RDMA ile veriyi doğrudan GPU bellek arabellekleri arasında taşır.

Kıyaslama ne gösteriyor, çalıştırmak ne gerektiriyor

AWS'ye göre 16'sı eğitime, 32'si çıkarıma ayrılan 48 P5en örneğinde, aynı aşırı seyrek MoE modeliyle DeepEP'in EFA üzerinde çalıştırılması rollout verimini yüzde 40 artırdı ve ölçek yaklaşık bin hızlandırıcıya çıktı. Temel, EFA hızlandırmalı expert parallelism olmadan Slime tabanlı bir yığındı (CUDA 12.9, PyTorch 2.9.1, NCCL 2.27, SGLang 0.5.9, Slime 0.2.4), iyileştirilmiş yapı ise DeepEP-over-EFA yığınıydı (CUDA 13.0, PyTorch 2.12, NCCL 2.31, EFA 1.49, DeepEP 2.0, SGLang 0.5.17, Miles 0.1.0).

Yazıda Amazon EKS 1.31 veya üzeri, AWS OFI NCCL eklentisiyle EFA installer 1.49 ve p5.48xlarge ya da p6-b200.48xlarge gibi örnekler sıralanıyor; haberleşen düğümler aynı Availability Zone içinde olmalı. Rollout üretimi Amazon EC2 Spot örneklerine uygundur: bitmemiş görevler kuyruğa döner ve politika eğitimi sabit kapasitede kalır. İşler TorchX ile gönderilir, checkpoint'ler Amazon S3'te saklanır.

SSiTech

SiTech — AI destekli web geliştirme

Hızlı ve modern web siteleri kuruyor, AI'yı gerçek iş akışlarına taşıyoruz. Projeniz veya sorunuz mu var? Yardımcı olmaktan mutluluk duyarız.