
Mistral Large 4 ամենաբարձր մոդելը ԱՄՆ-ի Չինաստանից դուրս
Mistral-ի նոր տրիլիոն պարամետրերով Mistral Large 4-ը Artificial Analysis Intelligence Index-ում ստացել է 38 միավոր, ինչը դրան ԱՄՆ-ի Չինաստանից դուրս ամենաբարձր մտավոր մոդելն է դարձնում, սակայն չինական բաց կշերը դեռ գերակայում են:
Թողարկումը և Intelligence Index-ի վարկանիշը
Mistral-ը այս շաբաթ Research Public Preview-ում թողարկեց իր տրիլիոն պարամետրերով մոդելը Mistral Large 4 (ML4) և հայտարարեց, որ այն ընդլայնում է բաց կշերի արտադրողականության սահմանները: Մասնագետների խառնուրդի մոդելը, որն ունի ընդամենը 1,05 տրիլիոն պարամետր և 49B-ից 52B-ը գործուն պարամետրեր, Artificial Analysis Intelligence Index v4.3.2-ում ստացել է 38 միավոր: Անկախ բենչմարքինգի ընկերության տվյալներով՝ այս արդյունքը դրան ԱՄՆ-ի Չինաստանի դուրս ամենախելաց մոդելն է դարձնում:
Միավորը համեմատելի է GPT-6 Luna-ի (max, 38) և DeepSeek V4.1 Flash-ի (max, 39) արդյունքների հետ, և ML4-ն առաջ է հեռանում Հարավային Կորեայի ու ԱՊԷ-ի նման երկրների մոդելներից: Սակայն գոնե հինգ չինական բաց մոդել է ստացել ավելի շատ միավորներ՝ Xiaomi-ի MiMo-V2.6-Pro-ն 46 միավորով, Z.ai-ի GLM-5.3-ը (max) 45-ով, Moonshot-ի Kimi K3-ը (max) 44-ով, GLM-5.3-Flash-ը 42-ով և DeepSeek V4.1 Flash-ը (max) 39-ով:
Կիբերանվտանգության ուժեղ կողմերը
ML4-ը Artificial Analysis Cyber Index-ում ստացել է 50 միավոր, ինչը գտնվում է GLM-5.3-Flash-ի մակարդակին և հետ է մնում MiMo-V2.6-Pro-ից (56): Նրա ամենաուժեղ արդյունքը գրանցվել է CyberGym-E2E-AA-ում, որտեղ այն ստացել է 82%, ինչը գերազանցում է MiMo-V2.6-Pro-ին (79%) և GPT-6 Luna-ին (max, 78%): Mistral-ի տեսակետով՝ մոդելը լուծում է Cybench-ի 93%-ը, ինչը անվտանգության մրցույթներից վերցված 40 առադրությունների հավաքածու է: Տնօրեն տնտեսական տեսուչ Արթուր Մենշը Աբու Դաբիում ասել է, որ մոդելը չինական մոդելներին գերազանցում է մի շարք ասպեկտներում, այդ թվում՝ կիբերանվտանգության ոլորտում, Reuters-ի տեղեկությամբ:
Կիբերարդյունքը Cyber Index-ի երեք թեստերից միայն մեկն է: ML4-ը DeepsecBench-AA-ում ստացել է 16%, իսկ CWE-Bench-AA-ում՝ 51%: Artificial Analysis-ի կանխատեսմամբ, երբ կշերը արդեն հասանելի լինեն, մոդելը ընկնելու է լավագույն երեք բաց կշերով մոդելների թվում: Mistral-ը ML4-ն ներկայացրել է որպես բաց մոդելների շարքում նորագույն տեխնոլոգիա ձեռնարկատիրական ծանրաբեռնվածությունների համար, այդ թվում՝ կիբերանվտանգության, ֆինանսների և իրավունքի ոլորտներում, և հայտարարում է, որ նրա 1,6B պարամետրերով տեսողական կոդավորիչը հնարավորություն է տալիս տեսողական ներկառուցման համատեքստում գերազանցեններ մինչև առաջատար փակ մոդելներին: Այլ տարածված արդյունքների շարքում են DeepSWE v1.1-ի 61,7%, Coding Agent Index-ի 49,8%, AutomationBench-ի 59,9% և Dense 200-ի 42%:
Գինը և արագությունը
Գինը կրկին մարտահրավեր է մնում: ML4-ի գինը AA-ի մեկ առադրության համար ցուցակային գնով $1,13 է, կամ $0,57 գործարկման 50% զեղչի դեպքում՝ համեմատած MiMo-V2.6-Pro-ի $0,13 և GLM-5.3-Flash-ի $0,25 գների հետ: Ստանդարտ գինը $1,36/$4,18 է 1M մուտքային/ելքային տոկենի համար, իսկ $0,14՝ 1M քեշավորված մուտքային տոկենի համար: Ավելի բարձր գինը պայմանավորված է նրանով, որ AA-ի ինդեքսը գործարկելու համար անհրաժեշտ է 200 միլիոն ելքային տոկեն՝ մեդիանական 81 միլիոնի համեմատ: Արագության տեսակետից՝ ML4-ը ցույց է տելել 116,1 տոկեն վրկ և 1,46 վրկ մինչև առաջին տոկենը, ինը մասնակիորեն 33% ավելի արագ է, քան իր կատեգորիայի մեդիանան, և 2,6 անգամ ավելի արագ է մինչև առաջին տոկենը, ինչպես չափվել է Mistral-ի սեփական API-ում:
Ուսուցումը և հասանելիությունը
ML4-ը զրոյից ուսուցվել է 3 800 Nvidia Grace Blackwell GPU-ներում Mistral-ի սեփական եվրոպական տվյալների կենտրոններում, մոտավորապես երկու ամիսում՝ ոչ թե 3 000 Nvidia H200-ի, որն օգտագործվել է փոքրիկ Large 3-ի համար և որն ունեցել է ընդամենը 675B պարամետր և 41B գործուն պարամետր: Մոդելը աջակցում է 512k տոկենի համատեքստային պատուհանը, տեքստի և պատկերի մուտքագրումը տեքստի ելքագրմամբ, և նրան API-ն այժմ մեկ հարցման համար ընդունում է 100 պատկեր՝ նախորդ Mistral մոդելների 8-ի փոխարեն: Mistral-ը հավաքաբերել է €3 միլիարդ Series D շրջանում, որը եվրոպական տեխնոլոգիական ընկերության կողմից երբևէ հավաքաբերված ամենամեծ կապիտալային շրջանն է, և Mistral Compute-ը նախատեսում է 18 000 Grace Blackwell չիպ: Բաց կշերը, ճարտարագիտության մանրամասները և լրացուցիչ բենչմարքերը ակնկալվում են հասնել հոկտեմբերի վերջին, և այդ ընթացքում մոդելը կարող է նորից գնահատվել:
Աղբյուրները: Tomshardware
SiTech — AI-ով հզորացված վեբ մշակում
Ստեղծում ենք արագ ու ժամանակակից կայքեր և AI-ը ներդնում իրական բիզնես գործընթացներում։ Ունե՞ք նախագիծ կամ հարց։ Ուրախ կլինենք օգնել։