
Qwen3.6 27B — практична золота середина для локальної розробки
Автор блогу Quesma доводить, що щільна модель на 27B добре працює на ноутбуці, переважає швидший варіант MoE на реальних завданнях і сягає рівня фронтирних моделей середини 2025 року.
Локальні мовні моделі рідко сприймалися як серйозний варіант для щоденної роботи, але автор блогу Quesma твердить, що Qwen3.6 27B — перша з них, яку варто тримати постійно. Модель випускається у двох формах: суміш експертів Qwen3.6 35B A3B, швидша, і щільна Qwen3.6 27B — повільніша, але потужніша, саме її автор рекомендує.
Що тестував автор
Окрім звичних перевірок на творче письмо, моделі доручили через OpenCode зібрати шестикутний сапер на pnpm. Вона створила робочий проєкт із належним Node-пакетом з одного запиту й з першої спроби. Швидший варіант 35B A3B працював хутчіше, але проігнорував вимогу створити пакет і зробив усе в одному файлі index.html. Довший запит на лендінг магазину свічок виконувався кілька хвилин і повернув адаптивну сторінку з розумними типовими налаштуваннями. Вердикт автора: за мірками фронтиру — нічого особливого, але практична робота вже виконана.
Запуск локально
Налаштування спирається на llama.cpp, а не на Ollama, і використовує 8-бітну квантизацію з Hugging Face: Qwen3.6-27B-MTP-GGUF від unsloth у варіанті Q8_0, який підтримує передбачення кількох токенів (MTP). Одна команда llama-server запускає модель із чернетковим декодуванням MTP, усіма шарами на GPU, увімкненою flash attention, контекстом 64k і закріпленим портом; рідний контекст моделі — 256k. 8-бітна квантизація вдвічі зменшує обсяг порівняно з BF16 майже без втрат якості, а 4-бітна версія займає менш ніж 18 ГБ — цього досить для пристрою на 32 ГБ.
Продуктивність і місце на ринку
На MacBook M5 Max зі 128 ГБ уніфікованої пам'яті модель видає близько 30 токенів за секунду — у типовому діапазоні фронтирних API — використовуючи близько 95 відсотків GPU. llama.cpp виявився швидшим за mlx-lm, хоча останній оптимізований під Apple silicon; обидва варіанти Qwen3.6 уміщаються в 48 ГБ пам'яті. На споживчій Nvidia RTX 5090 один користувач Hacker News повідомив про приблизно 50 токенів за секунду при контексті 123k із квантизацією Q6_K і KV-кешем Q4_0. В індексі Artificial Analysis модель 27B отримує 37 балів, що автор зіставляє з рівнем фронтиру середини 2025 року — попереду 35B A3B із 32 та Gemma 4 31B із 29. Автор усе одно обирає 27B: утричі менше коду, але вищої якості. Його ширший аргумент: локальні моделі можна донавчати, їх не можна відкликати, і вони підходять для чутливих даних.
SiTech — веброзробка з підтримкою AI
Створюємо швидкі та сучасні сайти й інтегруємо AI у бізнес-процеси. Маєте проєкт чи запитання? Із задоволенням допоможемо.