Назад
Локальний Qwen — не дешевший Opus, це інший інструмент, каже засновник OpenFaaS
SiTech AI Team3 წთ. საკითხავი

Локальний Qwen — не дешевший Opus, це інший інструмент, каже засновник OpenFaaS

Алекс Елліс, засновник OpenFaaS, розповів, що локальні моделі Qwen реально дали його команді: приватність і економію на вузьких задачах, але нескінченні цикли на довгих завданнях.

Алекс Елліс — засновник OpenFaaS, SlicerVM, Actuated та Inlets — опублікував докладний звіт про використання локальних мовних моделей у невеликій софтверній компанії. Його висновок суперечить популярному твердженню із соцмереж: локальний Qwen не є дешевшим Claude Opus, це інший інструмент, який треба спрямовувати на відповідні задачі.

Скільки коштувало обладнання

Перша спроба — одна карта RTX 3090 у 2023 році — виявилася настільки незручною, що експеримент закинули. Qwen 3.5 став першим поколінням, результати якого варто було зберігати. Сьогодні робота йде на RTX 6000 Pro Blackwell із 96 GB VRAM, купленій приблизно за 12 000 доларів; нині та сама карта коштує близько 15 400 доларів. Два розумні розетки вимірюють споживання: RTX 6000 Pro бере близько 600 Вт під час інференсу й працює тихо, а дві 3090 разом споживають близько 750 Вт і дуже гучні.

Розрив у бенчмарках реальний

Qwen 3.6 27B отримує 77.2 бала на SWE-Bench Verified проти 88.6% у Claude Opus 4.8. Елліс наголошує, що бенчмарки — рухома ціль, під яку моделі можна налаштовувати: SWE-Bench побудований на задачах Python, тоді як код компанії написаний на Go. Фронтирні моделі оцінюють у 0.5–2 трильйона параметрів — це інший клас ємності, ніж може вмістити одна споживча відеокарта без втрат. І саме квантування до такого рівня породжує найгіршу поведінку.

Де гроші повернулися

Купівлю виправдали два робочі процеси. Інструмент diag збирає повний знімок інсталяції OpenFaaS у клієнта, який потім аналізує локальна модель у тимчасовій VM — так дані замовника не потрапляють до хмарного провайдера. Крім того, пропустивши базу телеметрії через локальну модель, команда виявила клієнта, який занижував кількість ліцензій і платив у чотири-п'ять разів менше понад рік — саме це повернення коштів окупило карту.

Цикли, галюцинації та операції

Головний збій, з яким стикається Елліс, — зациклення: коли модель попросили запропонувати нові команди faas-cli, вона пів години повторювала ті самі п'ять пропозицій, споживаючи 600 Вт, а в автоматичному код-рев'ю вигадувала проблеми з конкурентністю та race condition — експеримент на цьому й завершився. Саме обслуговування моделі — окрема операційна задача: ідентифікація, квоти, маршрутизація, моніторинг енергії та два незалежні екземпляри llama.cpp для повної довжини контексту. Спекулятивне декодування підняло швидкість зі стабільних 67 до 130–200 токенів за секунду. Його порада — тримати локальні моделі на обмежених задачах (аналіз підтримки, end-to-end тестування) і не залишати їх без нагляду на довгих завданнях. Вартість теж залишається аргументом: хмарні платформи для коду коштують близько 200 доларів на місяць, а Uber нещодавно обмежив витрати співробітників на ШІ до 1500 доларів на розробника й інструмент щомісяця.

SSiTech

SiTech — веброзробка з підтримкою AI

Створюємо швидкі та сучасні сайти й інтегруємо AI у бізнес-процеси. Маєте проєкт чи запитання? Із задоволенням допоможемо.