
Desert Ant Labs випустила 18 локальних ШІ-моделей з єдиним SDK
Європейська лабораторія представила дванадцять стабільних і шість бета-моделей для аудіо, зору та тексту, які працюють на пристрої за мілісекунди — безкоштовно до 100 000 активних пристроїв на місяць.
Європейська лабораторія Desert Ant Labs 8 вересня 2026 року випустила вісімнадцять спеціалізованих моделей, що працюють на пристрої, для аудіо, зору та тексту, єдиний SDK для Swift, Kotlin і JavaScript та модель ціноутворення, за якої локальний інференс безкоштовний.
Одна модель на одне завдання
Дванадцять моделей стабільні, шість — у бета-версії. Кожна відповідає за мілісекунди і нічого не коштує в роботі, тож її можна використовувати на кожному кадрі чи натисканні клавіші й умістити навіть у п'ятирічний телефон, каже компанія. Voz транскрибує десять хвилин аудіо за дві секунди на iPhone — у 4,7 раза швидше за Whisper — із часом початку й кінця кожного слова. Clear — модель на 9 МБ, яка перетворює п'ятихвилинний запис із ноутбука на аудіо студійної якості за одну секунду. Redact маскує імена, адреси та номери карток у реальному часі 27 мовами, щоб вони не потрапляли на сервер. Tongue визначає 84 мови за трьома словами моделлю на 2 МБ: 0,933 проти 0,887 у детектора на 293 МБ, а Redact ловить 88,8% персональних даних проти 91,1% у GLiNER-PII на 2,3 ГБ.
Чому на пристрої
Лабораторія подає локальний інференс як суверенну норму Європи: дані не залишають рук клієнта, функція не залежить від чужої хмари, а те, що ніколи не завантажували, неможливо витребувати. Економіка спирається на вже оплачені обчислення: галузь витратить цього року близько 450 мільярдів доларів на дата-центри, тоді як у світі продають понад мільярд телефонів, планшетів і ноутбуків з дедалі потужнішими чипами — обчислювальної потужності в руках людей більше, ніж у всіх ШІ-дата-центрах Землі. Desert Ant також посилається на дослідників NVIDIA, які, розібравши три агентні системи, оцінили, що 40–70% їхніх звернень до великої моделі могли б піти до малої спеціалізованої. Кожна модель безкоштовна до 100 000 активних пристроїв на місяць.
Від відеододатка до власних моделей
Команда п'ять років розробляла відеододаток Detail, але для створення кліпів Auto Edit і покращення звуку подкастів поверталася до хмарних API, бо витрати на інфраструктуру зростали. Моделі вони навчили самі: Clear замінила Dolby, а Voz прискорила транскрипцію на пристрої в п'ять разів. Clips — модель на 284 МБ, що перетворює десятихвилинне відео на десяток кліпів за п'ять секунд, — замінила Claude Sonnet: у 10 разів швидше та у 470 разів менше енергії за тієї ж якості, твердить компанія. Detail 6, що вийде з iOS 27, замінить усі хмарні API власними моделями, які працюють повністю на пристрої.
Спершу «маленькі мозки»
Першу сотню моделей Desert Ant порівнює з мозочком — маленьким мозком, що виконує постійну фонову роботу, — а згодом обіцяє шар кори, який вирішуватиме, яка модель відповідає: спершу мала локальна, за потреби більша, і хмара лише тоді, коли робота мусить залишити пристрій. Моделі постачаються з обраним типовим налаштуванням і важелями для його зміни, а середовище виконання оптимізують разом із моделлю: Clear і Voz працюють на Neural Engine iPhone, а ті самі ваги Clear — через WebAssembly у браузері. SDK доступний на GitHub, з документацією, CLI для Mac і демо на Hugging Face.
SiTech — веброзробка з підтримкою AI
Створюємо швидкі та сучасні сайти й інтегруємо AI у бізнес-процеси. Маєте проєкт чи запитання? Із задоволенням допоможемо.