
Muse Glimmer: відкрита модель на 30 млрд параметрів для локальних агентів
Meta Superintelligence Labs випустила Muse Glimmer за ліцензією Apache 2.0 — модель на 30 млрд параметрів, оптимізовану для постійно активних локальних агентів і здатну працювати на одному споживчому GPU.
Meta Superintelligence Labs представила Muse Glimmer — модель на 30 мільярдів параметрів, ваги якої опубліковано за дозвільною ліцензією Apache 2.0. Вона розрахована на постійно активні локальні агентні робочі процеси: компанія заявляє, що модель достатньо мала, аби запускатися на Mac або ПК з одним споживчим GPU. Серед сценаріїв використання названо локальних агентів, виклик функцій, локальне програмування та оцінювання LLM-as-a-judge.
Що вміє модель
Muse Glimmer оцінювали на наскрізних агентних бенчмарках — DeepSearch QA, MCP-Atlas, τ-Bench і SWE-Bench, порівнюючи з Gemma4-31B та Qwen3.6-27B у своєму класі розміру. За словами розробника, модель викликає інструменти за точними схемами в тривалих робочих процесах, зберігає послідовний план на довгому горизонті, а в разі помилки інструмента вчиться діагностувати збій і повторити спробу замість зупинки. Окремий perception-енкодер дає змогу приймати текст і зображення разом, тож агент читає скриншоти, діаграми та документи поряд із діалогом. Також заявлено сумісність зі скафолдами на кшталт OpenClaw, регульовану глибину міркувань і навчання на даних понад 100 мов.
Як навчали модель
Навчання відбувалося у три етапи. На попередньому тренуванні модель навчали на виходах більшої моделі-вчителя Muse Spark методом logit distillation зі схожим набором даних. На середньому етапі додали довший контекст і більше агентних даних із насиченішими траєкторіями міркувань. На фінальному етапі поєднали кероване донавчання, on-policy distillation і навчання з підкріпленням у загальних, логічних, програмних та агентних доменах. Компанія каже, що реліз оцінили за стандартами Meta Advanced AI Scaling Framework.
Як 30 млрд параметрів уміщаються на пристрої
За повної точності модель на 30 млрд параметрів потребує понад 55 GB пам'яті — більше, ніж дає будь-який споживчий GPU. Квантування ваг приблизно до 4-бітної точності стискає мовну модель до менш ніж 20 GB, залишаючи місце для KV-кешу, perception-енкодера та драфтера спекулятивного декодування в межах 24 або 32 GB. Швидкість забезпечує легкий драфтер на основі DFlash: невелика мережа пропонує цілі блоки токенів, а основна модель перевіряє їх паралельно. Приріст швидкості декодування становить 3,1 раза на RTX 5090, 1,8 раза на M5 Max і 1,5 раза на M4 Max.
Ваги вже доступні на Hugging Face, документація для розробників — на порталі Meta. Найближчими днями обіцяють оптимізовані інтеграції з llama.cpp, MLX і ExecuTorch, а також запуск через Ollama, LM Studio, Unsloth, vLLM, SGLang, Together AI, Fireworks AI та OpenRouter.
SiTech — веброзробка з підтримкою AI
Створюємо швидкі та сучасні сайти й інтегруємо AI у бізнес-процеси. Маєте проєкт чи запитання? Із задоволенням допоможемо.