
AWS מציגה: אימון RL למודלי MoE על EKS עם EFA ו-DeepEP מעלה תפוקה ב-40%
AWS פרסמה ארכיטקטורת ייחוס לאימון RL בקנה מידה גדול של מודלי MoE על Amazon EKS עם EFA ו-DeepEP. על 48 מופעי P5en, הפעלת DeepEP מעל EFA העלתה את תפוקת ה-rollout הכוללת ב-40 אחוזים.
AWS פרסמה ארכיטקטורת ייחוס לאימון חיזוק (RL) בקנה מידה גדול של מודלי Mixture-of-Experts (MoE) על Amazon EKS עם EFA ו-DeepEP. פוסט בבלוג AWS Machine Learning מ-25 בספטמבר 2026 מדווח על עלייה של 40 אחוזים בתפוקת ה-rollout הודות ל-DeepEP מעל EFA.
לולאת rollout שתלויה בתקשורת
ארכיטקטורות MoE דלילות יותר מוזילות את האינפרנס אך הופכות את האימון לתלוי בתקשורת ולא בחישוב. המקור המרכזי לעומס הוא Expert Parallelism (EP): מעל הדפוסים של Tensor, Data ו-Pipeline Parallelism הוא מוסיף ניתוב דינמי של טוקנים all-to-all בין התקנים.
משימת RL אסינכרונית מריצה שני עומסים במקביל: יצירת rollout היא אינפרנס מבוזר שממקסם תפוקה כוללת, ואילו אימון מדיניות דורש עובדים צמודים הפועלים בסנכרון, שבו מעכב אחד יכול לעצור את כל המשימה או לגרום לטייימאאוטים של NCCL. מעבר למופע אחד עוברת התעבורה מבד NVLink שבתוך הצומת לקישורים איטיים יותר בין הצמתים.
כיצד DeepEP מעביר טוקנים מעל EFA
DeepEP מחליף קולקטיבים גנריים של all-to-all בשני קרנלים: dispatch מנתב טוקנים למומחים מרוחקים ו-combine אוסף את התוצאות, תוך שימוש ב-NVLink בתוך הצומת וב-libfabric בין צמתים. AWS תרמה שינויים ב-upstream שמעבירים את פרימיטיבי DeepEP ל-libfabric, כך ש-DeepEP v2 קיבל תמיכה מקורית ב-EFA, ו-NCCL 2.31 מוסיף את אופטימיזציות ה-EFA העדכניות. במופעים כמו P5 ו-P6 מעביר EFA עם NVIDIA GPUDirect RDMA נתונים ישירות בין מאגרי הזיכרון של ה-GPU.
מה מראה הבנצ'מרק ומה דרוש להרצה
על 48 מופעי P5en, מהם 16 לאימון ו-32 לאינפרנס, עם אותו מודל MoE דליל במיוחד, הפעלת DeepEP מעל EFA העלתה את תפוקת ה-rollout ב-40 אחוזים והגיעה לקנה מידה של כאלף מאיצים. הבסיס היה סטאק מבוסס Slime (CUDA 12.9, PyTorch 2.9.1, NCCL 2.27, SGLang 0.5.9, Slime 0.2.4), והתצורה המשופרת סטאק DeepEP-over-EFA (CUDA 13.0, PyTorch 2.12, NCCL 2.31, EFA 1.49, DeepEP 2.0, SGLang 0.5.17, Miles 0.1.0).
הפוסט מפרט: Amazon EKS 1.31 ואילך, EFA installer 1.49 עם תוסף AWS OFI NCCL, ומופעים כמו p5.48xlarge או p6-b200.48xlarge; הצמתים שמתקשרים חייבים להיות באותו Availability Zone. יצירת rollout מתאימה למופעי Spot של Amazon EC2, כי משימות שלא הושלמו חוזרות לתור ואימון המדיניות נשאר בקיבולת יציבה. משימות נשלחות ב-TorchX וצ'קפוינטים נשמרים ב-Amazon S3.
SiTech — פיתוח אתרים בכוח ה-AI
אנחנו בונים אתרים מהירים ומודרניים ומשלבים AI בתהליכי עבודה אמיתיים. יש לכם פרויקט או שאלה? נשמח לעזור.