NVIDIA Vera Rubin — ממקסמת אינטליגנציה לדולר: העידן החדש של פוסט-טריינינג ב-AI אייג'נטי
פלטפורמת Vera Rubin של NVIDIA דורשת רבע ממספר ה-GPUs של Blackwell עבור עומסי פוסט-טריינינג — זהו אמת מידה חדשה למדד "אינטליגנציה לדולר".
המעבר ל-AI אייג'נטי: למה פוסט-טריינינג הופך לרציף
חשבו על ספורטאי מקצועי. מה שמבדיל בין מבצעים עלית הוא מה שקורה בין המשחקים: שיפור מתמיד, הסתגלות ליריבים חדשים, חידוד מיומנויות על סמך מה שהמשחק האחרון חשף. AI אייג'נטי עובד בדיוק כך. מודל כבר לא פשוט עונה על שאלה — הוא מקבל מטרה וחייב להמשיך להסתגל כשהסביבה משתנה, מקרי קצה צצים, וכלים משתנים משבוע לשבוע.
זה משנה מיסודו את האופן שבו אנו חושבים על הכנת מודלי AI. פוסט-טריינינג (post-training) — השלב שמשכלל מודל לאחר אימון ראשוני על נתונים גולמיים — אינו עוד שלב גמר חד-פעמי. הוא רציף, משום שהסביבה שבה פועלים מודלים אייג'נטיים מתפתחת כל הזמן. הכלים שאגנט משתמש בהם יכולים להשתנות משבוע לשבוע. מקרי קצה עולים בפרודקשן שאף סט בדיקות לא צפה. כל פריסה מביאה עמה מאגר קוד, מדיניות וסביבה משלה.
טביעת הרגל החישובית גדלה לא בגלל שהרצה בודדת גדולה יותר, אלא בגלל שהרצות לעולם לא מפסיקות. זה הופך את הפוסט-טריינינג לעומס המרכזי של העידן האייג'נטי — ולמניע העיקרי של אינטליגנציה לדולר.
מהו פוסט-טריינינג ולמה זה חשוב
פוסט-טריינינג הוא המקום שבו אינטליגנציה נבנית. באימון מקדים (pre-training), המודל לומד לחזות את הטוקן הבא — זה נותן לו שטף בשפה אבל לא אינטליגנציה. פוסט-טריינינג הוא המקום שבו הוא לומד לכתוב קוד, לתכנן משימה רב-שלבית, להשתמש בכלי חיפוש ולהתאושש כשמשהו משתבש.
אינפרנס (inference) הוא מה שבא אחרי: המודל עובד בתפקיד, מתומחר בעלות לטוקן (cost per token). אבל פוסט-טריינינג פועל אחרת. מכיוון שאין תשובה נכונה לשנן — רק תגמול — המודל לומד באמצעות טכניקות למידת חיזוק (RL).
כך התהליך עובד: בהינתן משימה, המודל כותב ניסיון — המעבר קדימה (forward pass) (אותה עבודה שהייתה עושה בתפקיד). הניסיון נצבר, והלקח מעדכן את משקלי המודל — המעבר אחורה (backward pass). על פני מיליוני ניסיונות, האינטליגנציה גדלה. כל צעד אינטנסיבי מבחינה חישובית, והרצת לולאה זו בקנה מידה גדול היא בעיית תזמור: אלפי סביבות שמייצרות rollouts במקביל, אימות תגמולים, ומשקלים מעודכנים שזורמים חזרה לאימון.
הספריות הפתוחות של NVIDIA NeMo — כמו NeMo Gym לסביבות אימון ו-NeMo RL לפוסט-טריינינג מבוזר — הופכות פוסט-טריינינג מקוד מחקר ייחודי לתשתית ניתנת לשחזור ברמת פרודקשן.
אינטליגנציה לדולר: הרחבת cost per token
אם אינפרנס הוא מנוע ההכנסות, פוסט-טריינינג הוא המכפיל: ככל שהמודל מסוגל יותר, כך ערך כל טוקן מוגש גבוה יותר. Cost per token הוא המדד המרכזי למפעל האינפרנס — העלות הכוללת של אספקת מיליון טוקנים.
אינטליגנציה לדולר (intelligence per dollar) יושבת רמה אחת מעל, ועונה על שאלה אחרת: מה עולה לבנות מודל שכדאי לשרת — ולשמור אותו כדאי לשרות ככל שסביבתו משתנה? שני מדדים אלה מקוננים, לא מתחרים. תשתית AI שמורידה את cost per token גם מורידה את העלות של כל נקודת אינטליגנציה שנבנית במודל. וכל נקודת אינטליגנציה שנבנית מעלה את ערך כל טוקן שמפעל האינפרנס משרת.
במילים אחרות: cost per token מודד תפוקה תפעולית; intelligence per dollar מודד האם ההשקעה באינטליגנציית המודל משתלמת. מכיוון שכל מעבר קדימה בפוסט-טריינינג הוא בעצם עבודת אינפרנס — הנמדדת ב-cost per token — כל שיפור ביעילות האינפרנס זורם ישירות למשוואת האינטליגנציה לדולר.
Vera Rubin: רבע מה-GPUs, מקסימום אינטליגנציה
פלטפורמת Blackwell של NVIDIA כבר הורידה את עלות ההרצה, והפכה את הפוסט-טריינינג התכוף שהעידן האייג'נטי דורש לכלכלי בר-קיימא. אבל Vera Rubin מרחיבה מסלול זה באופן דרמטי — היא מאמנת את המודלים הגדולים ביותר עם רבע ממספר ה-GPUs של דור Blackwell.
Vera Rubin תוכננה מקצה לקצה כדי למקסם אינטליגנציה לדולר עבור עומס הפוסט-טריינינג האייג'נטי: יותר rollouts להרצה, יותר סביבות בפעולה בו-זמנית, ומחזורי פוסט-טריינינג שלעולם לא נעצרים. רווח יעילות זה אומר שארגונים יכולים להשיג את אותה אינטליגנציה — או יותר — עם השקעת חומרה נמוכה משמעותית.
זה חשוב מכיוון ש-cost per token ו-intelligence per dollar מקושרים היטב. כל הפחתה בעלות של מעבר קדימה (אינפרנס) מפחיתה ישירות את העלות של כל מחזור למידה בפוסט-טריינינג, מצטברת על פני מיליוני ניסיונות.
Nemotron 3 Ultra: אינטליגנציה במשקלים פתוחים, תוצאות ניתנות לאימות
Nemotron 3 Ultra של NVIDIA — מודל בעל משקלים פתוחים (open-weight) של 550 מיליארד פרמטרים בתערובת מומחים (MoE) — מציע אמות מידה ניתנות לאימות ומתכון פוסט-טריינינג שפורסם במלואו, שהורץ על NeMo RL. הוא השיג 71.7% ב-SWE-bench verified, מדד קידוד אמיתי שבו ייצר תיקון עובד לשבעה מתוך עשרה באגי תוכנה אמיתיים ממיזמי קוד פתוח, כל אחד נבדק מול חבילת הבדיקות של המיזם עצמו.
ריצת הפוסט-טריינינג ל-Nemotron 3 Ultra השתמשה בכ-20 מיליארד טוקני rollout, שהוגדלו מכ-1.2 מיליון rollouts מהדור הקודם Nemotron 3 Super, כל אחד בכ-10,000 טוקנים. חשוב לציין, יחס האינטליגנציה לדולר בין פלטפורמות אינו תלוי בהנחה הספציפית הזו — הערכים המוחלטים גדלים עם מספר הטוקנים, אך היתרון היחסי של Vera Rubin על פני Blackwell נותר קבוע.
המערכת האקולוגית המלאה: NeMo, Dynamo ואימוץ בתעשייה
פלטפורמת Vera Rubin היא חלק ממערכת אקולוגית רחבה ומשולבת של NVIDIA עבור AI אייג'נטי:
- NeMo Gym ו-NeMo RL — ספריות קוד פתוח שהופכות פוסט-טריינינג מקוד מחקר ייחודי לתשתית ניתנת לשחזור. NeMo Gym מטפל בסביבות אימון; NeMo RL מטפל בפוסט-טריינינג מבוזר בקנה מידה.
- NVIDIA Dynamo — תזמור אינפרנס למקסום תפוקה ומיזעור השהיה בפרודקשן.
מובילי תעשייה כבר מנצלים מערכת אקולוגית זו:
- Prime Intellect — מבצעת פוסט-טריינינג רציף של מודלים פתוחים פורצי דרך על NVIDIA Blackwell ומתכננת להגדיל סביבות RL על Vera Rubin. בדיקות ההשוואה שלהם מראות תפוקה גבוהה ב-30% ל-CPU עם מעבדי NVIDIA Vera בהשוואה לארכיטקטורות x86 חלופיות.
- Perplexity — מריצה את מחסנית פוסט-טריינינג ה-RL שלה באופן אסינכרוני על פני מאות GPUs של NVIDIA, עם מנוע העברת משקלים מבוסס RDMA שמסנכרן מודלים עם טריליון פרמטרים מתחת לשתי שניות בין צמתי אימון ואינפרנס.
- Together AI — מציעה פוסט-טריינינג כשירות, כולל כוונון עדין מפוקח, RL ואופטימיזציית העדפות ישירה על פלטפורמת NVIDIA, עם תוכניות לרתום את Vera Rubin בהמשך.
העתיד של אינטליגנציה רציפה
עם הגעת Vera Rubin, NVIDIA מגדירה מחדש כיצד אנו מודדים יעילות השקעות AI. אינטליגנציה לדולר הופכת למדד המגדיר איזו פלטפורמה יכולה לשרת בצורה הטובה ביותר את עידן ה-AI האייג'נטי — שבו מודלים לא רק מגיבים להנחיות אלא מתכננים, מנמקים, משתמשים בכלים, מתאוששים מכישלונות ומשתפרים ללא הרף.
ככל שמודלי AI עוברים מ-Q&A פשוט להתנהגות מורכבת, רב-שלבית ומסתגלת ללא הרף, תפקיד הפוסט-טריינינג רק יגדל. פלטפורמת NVIDIA Vera Rubin — יחד עם ספריות NeMo, מודל Nemotron 3 Ultra ומתזמר האינפרנס Dynamo — יוצרת מערכת משולבת מקצה לקצה הממקסמת את התשואה האינטלקטואלית על כל דולר מושקע.
זהו העידן החדש של תשתית AI. השאלה כבר אינה "כמה GPUs יש לי?" אלא "כמה אינטליגנציה אני מקבל לדולר?"