Mistral випустила Shieldstral — 3B відкрита модель для мультимодальної модерації
Mistral AI представила Shieldstral — класифікатор безпеки на 3 млрд параметрів з відкритими вагами, який приймає правила звичайною мовою під час інференсу й конкурує з моделями у 7 разів більшими. Ліцензія: Apache 2.0.
Що сталося
4 серпня 2026 року Mistral AI представила Shieldstral — класифікатор безпеки з відкритими вагами на 3 мільярди параметрів, призначений для модерації контенту. На відміну від традиційних guardrail-моделей, Shieldstral розглядає модерацію як бінарне запитання-відповідь: політику оператор пише звичайною мовою під час інференсу, а модель повертає калібровану оцінку безпеки.
Чому це важливо
Фіксовані категорії шкоди означають перенавчання щоразу, коли змінюються визначення безпеки. У Shieldstral політика живе в промпті, тож один чекпойнт адаптується до нових правил без перенавчання, а єдиний інтерфейс покриває промпти, відповіді моделі, виявлення відмов і зображення.
Модель випущено під Apache 2.0, і вона працює на одному GPU NVIDIA з 16 ГБ. За даними Mistral, Shieldstral змагається з відкритими моделями у 7 разів більшими та встановлює новий стандарт мультимодальної модерації. Реліз відбувся в межах участі в Open Secure AI Alliance.