
השבב Jalapeño של OpenAI עוקף את Nvidia Blackwell בביצועי הסקה
בדיקות של SemiAnalysis מלמדות שהשבב Jalapeño ש-OpenAI פיתחה בעצמה עוקף את Nvidia Blackwell בביצועים לכל וואט, וזאת עם חיזוי טוקן בודד ובלי פענוח ספקולטיבי או הפרדת שלבים כלל.
OpenAI פיתחה שבב הסקה משלה, והמדידות הראשונות מראות שהוא יכול להתחרות בחומרה של Nvidia, AMD ו-Google. התוצאות פורסמו ב-25 באוגוסט ומגיעות מהרצת חבילת InferenceX של SemiAnalysis במעבדות OpenAI, יחד עם מהנדסי החברה.
מהו Jalapeño
השבב, בשם הקוד Jalapeño, הוכרז בכנס Hot Chips ומפותח בשיתוף עם Broadcom. עבודת התכנון החלה באמצע 2024, ומהגיוס הראשוני ועד טייפ-אאוט לייצור עברו כ-16 חודשים, כשטייפ-אאוט ה-CoWoS הושלם בנובמבר 2025. התוצאות שפורסמו נאספו על סטפ A0, כחודש התשיעי לתוכנית; סטפ B0 כבר נמצא בייצור ומשפר את הביצועים לוואט בכ-25 אחוזים.
ביצועים לוואט
הנתון המרכזי הוא תפוקת טוקנים למגה-וואט אחד, כולל עלויות תשתית. במדד זה Jalapeño עוקף את Blackwell כמעט בכל תרחיש שנבדק, והוא עושה זאת עם חיזוי טוקן בודד בלבד — ללא פענוח ספקולטיבי וללא הפרדת prefill מ-decode — בעוד המערכות שהושוו להן הורצו בתצורות הטובות ביותר שלהן עם חיזוי ריבוי טוקנים. בעומסים נמוכים השבב עבר 700 טוקנים לשנייה למשתמש על DeepSeek R1; על Kimi K2.5 הוא התקרב ל-700 טוקנים לשנייה למשתמש והיה מהיר פי תשעה ויותר מהשבב הטוב הבא ב-100 טוקנים לשנייה למשתמש. הערכות GSM8k היו ברמה של שבבי Nvidia.
שבב כללי ודומיין של 2,048 מאיצים
בניגוד לתפיסה לפיה שבבים כאלה מותאמים רק למודלים של בעליהם, SemiAnalysis מתארת את Jalapeño כמאיץ הסקה כללי: הוא הריץ כמה מודלים פתוחים ואת חבילת InferenceX, ואף הראו עליו את Doom, שהוסב בעזרת פרומפטים של Codex. השבב מבוסס על שבב חישוב בגודל רטיקל בתהליך N3P של TSMC, צ'יפלט קלט/פלט ב-N3E, קישורי PCIe Gen 5 למעבד x86 מארח וזיכרון HBM4 עם רוחב פס של כ-15.4TB/s לאריזה. כל ארון מכיל 128 שבבים המחוברים באמצעות מתגי Tomahawk 6 בתפוקה של 102.4Tb/s, ו-16 ארונות — 2,048 מאיצים — יוצרים דומיין הרחבה אחד.
הסתייגויות והשלב הבא
הפרסום מציין גם מגבלות: כל המספרים נמסרו על ידי OpenAI, ההרצות שנבדקו באופן אישי כיסו עומס 8k1k, ותוצאות AgentX עדיין אין. המחברים טוענים גם שהשוואה בין Jalapeño ל-Blackwell אינה הוגנת לגמרי, שכן Jalapeño משתמש ב-HBM4 — אותו דור כמו Rubin. בעלות לטוקן Jalapeño ו-Vera Rubin דומים בקירוב, אך נתוני Jalapeño הושגו ללא פענוח ספקולטיבי, שבדרך כלל מפחית את עלות הטוקן פי כמה. הייצור צפוי לעלות בהדרגה לאורך 2027, רוב התפוקה מיועדת לסוף השנה הבאה, והיעד הבא הוא פריסה של 100 מגה-וואט.
SiTech — פיתוח אתרים בכוח ה-AI
אנחנו בונים אתרים מהירים ומודרניים ומשלבים AI בתהליכי עבודה אמיתיים. יש לכם פרויקט או שאלה? נשמח לעזור.