
Локальні моделі нарешті добрі: досвід інженерки на Mac 2022 року
Інженерка Вікі Бойкіс каже, що локальні моделі нарешті стали достатньо добрими для агентного кодінгу: на M2 Mac 2022 року з 64 GB пам'яті вони сягають близько 75% точності та швидкості фронтирних моделей, а кожна сесія агента ізольована в Docker.
Інженерка Вікі Бойкіс працює з локальними моделями відколи вони з'явилися, і в дописі від 15 червня 2026 року підсумовує: нарешті вони справді добрі. Її тестова машина — M2 Mac 2022 року з 64 GB оперативної пам'яті та 1 TB дискового простору.
Вона запускала Mistral 7B, Gemma 3, OpenAI OSS-20B, Qwen 3 MoE та інші варіанти Qwen, зокрема Qwen 2.5 Coder, у різних середовищах: чистий llama.cpp з Open WebUI, llama-cpp-python, Ollama, llamafiles і LM Studio.
Де локальні моделі зараз
Переломним моментом авторка називає вихід GPT-OSS — першої моделі, яку вона перестала часто перевіряти порівнянням з API-моделлю. Її особистий критерій простий: чи мушу я звіряти це з API-моделлю?
Із найновішими релізами родини Gemma 4 вона нарешті почала виконувати агентний кодінг локально: цикли працюють приблизно на 75% швидкості та точності фронтирних моделей. Її типова локальна модель — gemma-4-26b-a4b у LM Studio. Нею вона переробила скрипт із ноутбука на репозиторій із п'яти-шести модулів, виправила підказки типів для дженериків, вичитала дописи блогу, написала юніт-тести й з нуля зібрала репозиторій для two-tower моделі рекомендацій. K-V кеш зростає до 64 GB, а ці завдання ще пів року тому були для локальних моделей неможливими.
Як запускати локальних агентів сьогодні
Потрібні три складники: локальний рушій інференсу, агентна оболонка та файл моделі, на який оболонка вказує через локальну адресу. Авторка використовує Pi як оболонку й LM Studio як сервер інференсу, зауважуючи, що прямий llama.cpp, імовірно, був би швидшим.
Задля безпеки кожна сесія Pi працює в контейнері Docker і має дозволи лише для bash, тож не може запускати код Python чи ходити в інтернет. Для моделі вона обрала gemma-4-12b-qat — новішу, меншу й швидшу, без великих втрат у точності.
Що досі не працює
Інференс буває повільним, контекстні вікна малі й обмежені власним обладнанням, а ранні релізи страждають від невідповідності шаблонів промптів, хоча це зазвичай швидко виправляють. Екосистему суттєво спрощують LM Studio і кнопка Use This Model від HuggingFace.
На думку авторки, для промислової розробки це поки не готово. Натомість перевага — прозорість: видно генерацію токенів у реальному часі, можна змінювати контекстне вікно, системний промпт і квантизацію та зіштовхувати моделі між собою.
SiTech — веброзробка з підтримкою AI
Створюємо швидкі та сучасні сайти й інтегруємо AI у бізнес-процеси. Маєте проєкт чи запитання? Із задоволенням допоможемо.