Назад
Ollaya запускає decision-моделі у стилі Jev локально, за мілісекунди
SiTech AI Team2 წთ. საკითხავი

Ollaya запускає decision-моделі у стилі Jev локально, за мілісекунди

Ollaya — це runtime з ліцензією Apache-2.0, який запускає decision-моделі на вашому власному обладнанні: типізовані запитання про текст чи JSON отримують калібровані ймовірності за один forward pass, а сервер розмовляє API TypeSafe /v1/systemone.

Ollaya — це локально встановлюваний runtime для decision-моделей, який позиціонують як локальну альтернативу хостинговим моделям TypeSafe Jev. За один forward pass він повертає типізовану відповідь на кожне питання запиту: вибір зі списку критеріїв, булеве значення, число на шкалі або короткий рядок. Runtime поширюється під ліцензією Apache-2.0, код є на GitHub.

Перший приклад на сайті запускає команду ollaya run laya --preset triage на повідомленні "I was charged twice this month and want a refund" і отримує ймовірності замість тексту: intent refund з 1,00, is_urgent no з 0,87 і refund_requested yes з 0,88. Кожен варіант іде разом з імовірністю, тож виклик може задати поріг замість розбору згенерованого тексту.

Швидкість і калібрування

На NVIDIA RTX 4090 Ollaya показує близько 8-10 мс наскрізно для запиту Laya з п'ятьма питаннями через HTTP API. Для порівняння сторінка наводить 236-276 мс як медіанну затримку хостингового TypeSafe Jev API за сторонніми бенчмарками, які враховують і час мережі; Ollaya зауважує, що конфігурації різні, тож це порівняння порядку величин.

Друге твердження — калібрування: після temperature fitting очікувана похибка калібрування Laya становить 0,081 проти 0,246 у Jev. Нижче значення означає, що ймовірність 0,9 ближча до реальних 90% влучань.

Сумісність з API TypeSafe

Ollaya обслуговує /v1/systemone і /v1/models у формах запиту та відповіді TypeSafe, і, за даними сайту, офіційний Python SDK TypeSafe 0.7.1 працює з локальним сервером без змін. У прикладі з рахунком відповідь повертає intent invoice з упевненістю 0,9547 та ймовірностями 0,9698, 0,0172 і 0,013.

Відкриті ваги й платформи

Ваги завантажуються з репозиторіїв авторів на Hugging Face, прикріплені до конкретного commit і перевіряються за sha256; Ollaya їх не перехостює. Для старту доступна Laya від Convai Innovations: англійська модель, модель для 100+ мов і варіант, донавчений на типізовані рішення. Сервер працює на ONNX Runtime, за замовчуванням слухає лише локальний інтерфейс і використовує CPU або NVIDIA GPU.

Збірки є для macOS, Windows 10 і 11, Linux, WSL 2 та Docker на amd64 і arm64. Усі моделі працюють на CPU; NVIDIA GPU на Linux, у WSL 2 або Docker з драйвером R580 чи новішим і CUDA 13 скорочує запит до мілісекунд.

Чому це важливо

Decision-моделі — це категорія малих моделей для типізованої класифікації та оцінювання, які чат-API обробляють повільно й з оплатою за токени: тріаж тікетів, намір, тональність, маршрутизація, прапорці модерації. Локальний запуск залишає чутливі повідомлення на тій машині, де вони вже зберігаються, прибирає лічильник і повертає ймовірність замість речення.

SSiTech

SiTech — веброзробка з підтримкою AI

Створюємо швидкі та сучасні сайти й інтегруємо AI у бізнес-процеси. Маєте проєкт чи запитання? Із задоволенням допоможемо.