חזרה
Mistral Large 4 נקבע כמודל הבינה המלאכותית הטוב ביותר מחוץ לארה"ב ולסין
SiTech AI Team3 דק׳ קריאה

Mistral Large 4 נקבע כמודל הבינה המלאכותית הטוב ביותר מחוץ לארה"ב ולסין

מודל הטריליון-פרמטרים החדש של Mistral, Mistral Large 4, קיבל 38 נקודות ב-Artificial Analysis Intelligence Index, מה שהופך אותו למודל האינטליגנטי ביותר מחוץ לארה"ב ולסין, אם כי מודלים סיניים בעלי משקל פתוח עדיין מובילים.

השקה ודירוג ב-Intelligence Index

Mistral השיקה השבוע ב-Research Public Preview את מודל הטריליון-הפרמטרים שלה Mistral Large 4 (ML4) והכריזה כי הוא מרחיב את גבולות הביצועים של מודלים בעלי משקל פתוח. מודל הערבוב של מומחים, שכולל 1,05 טריליון פרמטרים בסך הכל ו-49B עד 52B פרמטרים פעילים, קיבל 38 נקודות ב-Artificial Analysis Intelligence Index v4.3.2. לפי חברת הבנצ'מרקינג העצמאית, תוצאה זו הופכת אותו למודל האינטליגנטי ביותר מחוץ לארה"ב ולסין.

הניקוד שווה ערך לתוצאות GPT-6 Luna (max, 38) ו-DeepSeek V4.1 Flash (max, 39), ו-ML4 קדים מודלים ממדינות דומות כמו דרום קוריאה ואיחוד האמירויות הערביות. עם זאת, לפחות חמישה מודלים סיניים בעלי משקל פתוח קיבלו ניקוד גבוה יותר: של Xiaomi MiMo-V2.6-Pro עם 46 נקודות, של Z.ai GLM-5.3 (max) עם 45, של Moonshot Kimi K3 (max) עם 44, GLM-5.3-Flash עם 42 ו-DeepSeek V4.1 Flash (max) עם 39.

תחומי חוזקה באבטחת סייבר

ML4 קיבל 50 נקודות ב-Artificial Analysis Cyber Index, מה שממקם אותו ברמת GLM-5.3-Flash ומתחת ל-MiMo-V2.6-Pro (56). התוצאה החזקה ביותר שלו נרשמה ב-CyberGym-E2E-AA, שם קיבל 82%, העולה על MiMo-V2.6-Pro (79%) ועל GPT-6 Luna (max, 78%). לפי Mistral, המודל פותר 93% מתוך Cybench, שהוא אוסף של 40 משימות שנלקחו מתחרויות אבטחה. המנכ"ל ארתור מנש אמר באבו דאבי, לפי דיווחי Reuters, כי המודל עולה על מודלים סיניים בתחומים מסוימים, כולל אבטחת סייבר.

תוצאת הסייבר היא רק אחד משלושת המבחנים ב-Cyber Index. ML4 קיבל 16% ב-DeepsecBench-AA ו-51% ב-CWE-Bench-AA. לפי התחזית של Artificial Analysis, ברגע שהמשקלים יוצאו לאור, המודל יהיה בין שלושת מודלי המשקל הפתוח הטובים ביותר ב-Cyber Index. Mistral הציגה את ML4 כטכנולוגיה העדכנית ביותר בקרב מודלים פתוחים לעומסי ייצור, כגון אבטחת סייבר, פיננסים ומשפט, ומצהירה כי הקודק החזותי בעל 1.6B הפרמטרים שלה מאפשר לה לעקוף אפילו מודלים סגורים מובילים ב-grounding חזותי. בין תוצאות נוספות בולטות: DeepSWE v1.1 עם 61,7%, Coding Agent Index עם 49,8%, AutomationBench עם 59,9% ו-Dense 200 עם 42%.

מחיר ומהירות

המחיר נותר אתגר. מחירו של ML4 הוא $1,13 למשימה בודדת של AA במחיר רשימה, או $0,57 בהנחת 50% על השקה, לעומת $0,13 של MiMo-V2.6-Pro ו-$0,25 של GLM-5.3-Flash. המחיר הסטנדרטי הוא $1,36/$4,18 לטוקן קלט/פלט בסדר גודל 1M, ו-$0,14 לטוקן קלט בסדר גודל 1M במטמון. המחיר הגבוה יותר נובע מכך שהפעלת אינדקס AA דורשת 200 מיליון טוקני פלט, לעומת 81 מיליון בחציון. במונחי מהירות, ML4 הציגה 116,1 טוקנים לשנייה ו-1,46 שניות עד טוקן ראשון, מהירות העברה בחציון הקטגוריה שלו בכ-33% וב-2,6 פעם מהיר יותר עד טוקן ראשון, לפי מדידה ב-API הפרטי של Mistral.

אימון וזמינות

ML4 אומן מאפס על 3,800 מעבדים גרפיים של Nvidia Grace Blackwell במרכזי הנתונים הפרטיים של Mistral באירופה, במשך כחודשיים, במקום 3,000 Nvidia H200 ששימשו ל-Large 3 הקטן יותר, שכלל רק 675B פרמטרים ו-41B פרמטרים פעילים. המודל תומך בחלון הקשר של 512k טוקנים, קלט טקסט ותמונה עם פלט טקסט, וה-API שלו מקבל כעת 100 תמונות לבקשה, במקום 8 במודלי Mistral הקודמים. Mistral גייסה 3 מיליארד יורו בסבב Series D, שהיא מכנה אותו סבב ההון הגדול ביותר שגויס אי פעם על ידי חברת טכנולוגיה אירופית, ו-Mistral Compute מתכננת 18,000 שבבי Grace Blackwell. משקלים פתוחים, פרטי ארכיטקטורה ובנצ'מרקים נוספים צפויים עד סוף אוקטובר, ובינתיים המודל עשוי להימדד מחדש.

מקורות: Tomshardware

SSiTech

SiTech — פיתוח אתרים בכוח ה-AI

אנחנו בונים אתרים מהירים ומודרניים ומשלבים AI בתהליכי עבודה אמיתיים. יש לכם פרויקט או שאלה? נשמח לעזור.