
Mistral Large 4 названо найкращою AI-моделлю за межами США та Китаю
Нова трильйонна модель Mistral Large 4 від Mistral набрала 38 балів за Artificial Analysis Intelligence Index, що робить її найінтелектуальнішою моделлю за межами США та Китаю, хоча китайські відкриті моделі все ще лідирують.
Випуск і рейтинг Intelligence Index
Mistral випустила цього тижня свою трильйонну модель Mistral Large 4 (ML4) у Research Public Preview і заявила, що вона розширює межі продуктивності відкритих ваг. Модель зі сумішшю експертів, яка має всього 1,05 трильйона параметрів та 49B-52B активних параметрів, набрала 38 балів за Artificial Analysis Intelligence Index v4.3.2. За словами незалежної компанії з бенчмаркінгу, цей результат робить її найінтелектуальнішою моделлю за межами США та Китаю.
Бали порівняні з результатами GPT-6 Luna (max, 38) та DeepSeek V4.1 Flash (max, 39), і ML4 випереджає моделі подібних країн, таких як Південна Корея та Об'єднані Арабські Емірати. Однак щонайменше п'ять китайських відкритих моделей набрали більше балів: MiMo-V2.6-Pro від Xiaomi з 46 балами, GLM-5.3 (max) від Z.ai з 45, Kimi K3 (max) від Moonshot з 44, GLM-5.3-Flash з 42 та DeepSeek V4.1 Flash (max) з 39.
Сильні сторони кібербезпеки
ML4 набрала 50 балів за Artificial Analysis Cyber Index, що відповідає рівню GLM-5.3-Flash і поступається MiMo-V2.6-Pro (56). Її найсильніший результат зафіксовано на CyberGym-E2E-AA, де вона отримала 82%, що перевершує MiMo-V2.6-Pro (79%) та GPT-6 Luna (max, 78%). За словами Mistral, модель розв'язує 93% Cybench, що є набором з 40 завдань, взятих з змагань з безпеки. Генеральний директор Артур Менш в Абу-Дабі заявив, що модель перевершує китайські моделі в ряді аспектів, включаючи кібербезпеку, за даними Reuters.
Кіберрезультат — лише один із трьох тестів Cyber Index. ML4 отримала 16% на DeepsecBench-AA та 51% на CWE-Bench-AA. За прогнозом Artificial Analysis, щойно ваги будуть випущені, модель потрапить до трійки найкращих моделей з відкритими вагами за Cyber Index. Mistral представила ML4 як найновішу технологію серед відкритих моделей для промислових навантажень, таких як кібербезпека, фінанси та право, і заявляє, що її 1,6B-параметровий візуальний енкодер дозволяє перевершити навіть провідні закриті моделі у візуальному кріпленні. Серед інших помітних результатів: DeepSWE v1.1 61,7%, Coding Agent Index 49,8%, AutomationBench 59,9% та Dense 200 42%.
Вартість і швидкість
Вартість знову залишається викликом. Ціна ML4 за одне завдання AA за списковою ціною становить $1,13, або $0,57 зі 50% знижкою на запуск, порівняно з $0,13 у MiMo-V2.6-Pro та $0,25 у GLM-5.3-Flash. Стандартна ціна становить $1,36/$4,18 за 1M вхідних/вихідних токенів, а також $0,14 за 1M кешованих вхідних токенів. Вища вартість зумовлена тим, що для запуску індексу AA потрібно 200 мільйонів вихідних токенів, на противагу медіані в 81 мільйон. Що стосується швидкості, ML4 показала 116,1 токена за секунду та 1,46 секунди до першого токена, що приблизно на 33% швидше за медіану її категорії та в 2,6 рази швидше до першого токена, як виміряно на власному API Mistral.
Навчання та доступність
ML4 була навчена з нуля на 3 800 GPU Nvidia Grace Blackwell у власних дата-центрах Mistral в Європі, приблизно за два місяці, замість 3 000 Nvidia H200, що використовувалися для меншої Large 3, яка мала всього 675B параметрів та 41B активних. Модель підтримує контекстне вікно на 512k токенів, введення тексту та зображень з виведенням тексту, а її API тепер приймає 100 зображень на один запит замість 8 у попередніх моделях Mistral. Mistral залучила €3 мільярди в раунді Series D, який називає найбільшим капітальним раундом, коли-небудь залученим європейською технологічною компанією, а Mistral Compute планує 18 000 чіпів Grace Blackwell. Відкриті ваги, деталі архітектури та додаткові бенчмарки очікуються до кінця жовтня, і на цьому етапі модель може бути переоцінена.
Джерела: Tomshardware
SiTech — веброзробка з підтримкою AI
Створюємо швидкі та сучасні сайти й інтегруємо AI у бізнес-процеси. Маєте проєкт чи запитання? Із задоволенням допоможемо.