Назад
Одна функція Python як Jev-подібна обгортка для LLM, включно з візійними моделями
SiTech AI Team2 წთ. საკითხავი

Одна функція Python як Jev-подібна обгортка для LLM, включно з візійними моделями

У публікації від вересня 2026 року показано одну функцію Python, яка перетворює кілька LLM-провайдерів, включно з візійними моделями, на єдиний інтерфейс виклику та повертає відповіді з оцінкою ймовірності.

У публікації, опублікованій у вересні 2026 року, автор описує одну функцію Python, яка перетворює кілька LLM-провайдерів, включно з візійними моделями, на єдиний інтерфейс виклику. За його словами, ідея виникла зі знайомства з Jev і саморозгорнутими проєктами навколо нього, OpenJev та SemIf, що відкрило йому прийом читання ймовірностей токенів.

Що означає «на кшталт Jev»

Документований формат запиту Jev містить JSON-документ з текстовим станом і набором питань. Обгортка автора зберігає цю структуру, але додає власне поле attachments для зображень, якого офіційний формат не описує. Тобто «на кшталт Jev» тут стосується структури запиту й відповіді, а не самого проєкту.

Як працює обгортка

Кожне питання переписується як промпт із варіантами, позначеними літерами від A до T, і надсилається звичайним HTTP-запитом. Модель змушена згенерувати лише один токен, натомість API повертає літери разом з їхніми логарифмічними ймовірностями. Ці числа перетворюються на ймовірності, з яких виводиться відповідь: у питанні типу choice перемагає найімовірніший варіант, тип noul (так/ні) повертає ймовірність true, а score дає очікуваний рівень між критеріями. Кожне питання приймає від 2 до 20 варіантів; якщо провайдер пропускає варіант, яким не можна знехтувати, функція повертає помилку замість здогадки.

Провайдери, зображення і швидкість

Приклад за замовчуванням звертається до локального сервера llama.cpp, а за наявності ключа до OpenAI; ключ надсилається лише на api.openai.com. llama.cpp потребує Chat Completions для логістичних імовірностей, тоді як OpenAI потребує Responses, щоб показати достатньо альтернатив, і скрипт сам обробляє цю різницю. Зображення передаються як base64 data URL, тому ті самі питання можна ставити й до кадру вебкамери. У демо автор читає кадри через OpenCV, який використовується лише для доступу до камери, і друкує таблицю відповідей. Gemma 4 12B на RTX 3090 дає приблизно один кадр на секунду з трьома питаннями на кадр; gpt-6-luna через API близько 0,2 кадру на секунду.

Застереження автора

Автор прямо зазначає, що спеціалізовані моделі комп'ютерного зору значно ефективніші, а цінність його підходу в гнучкості: нову умову додають звичайним текстовим описом. Він також зауважує, що обробка вхідних даних усе одно займає час, спільний префікс стану кешується за підтримки бекенда, а наведені показники швидкості отримано з неоптимізованої конфігурації, де на кожне питання й кадр припадає окреме з'єднання.

SSiTech

SiTech — веброзробка з підтримкою AI

Створюємо швидкі та сучасні сайти й інтегруємо AI у бізнес-процеси. Маєте проєкт чи запитання? Із задоволенням допоможемо.