OpenJev запускає модель для ухвалення рішень просто у браузері
openjev.com — локальний експеримент, який ставить одній моделі те саме рішення двічі: читаючи логіти вибору напряму та генеруючи розподіл у JSON токен за токеном. Усі виміри виконуються на власному GPU відвідувача.
Сторінка openjev.com подає себе як живий локальний експеримент із назвою SemIf — «семантичні if із відкритих моделей, у вашому браузері». Тут немає реєстрації чи списку очікування: користувач вибирає розмір моделі, завантажує її на власний GPU й порівнює два способи отримати рішення з тих самих ваг. Нічого не надсилається на сервер, і сторінка прямо зазначає, що введені дані її не покидають.
Одне запитання — два шляхи
Експеримент ставить одне рішення — стан, запитання та перелік дозволених варіантів — одній локальній моделі, а тоді відповідає двома шляхами. Перший — пряме зчитування: код читає логіти вибору моделі й нормалізує їх лише за наданими варіантами, без етапу декодування. Другий — генерація: ту саму модель просять оцінити той самий розподіл і записати його у JSON, токен за токеном.
Обидва запуски відбуваються послідовно на одній завантаженій моделі, щоб не конкурувати за один GPU. Спершу виконується пряме зчитування, потім — генерація.
Кожен вимір — з машини відвідувача
Сайт вимірює завантаження, розігрів, підготовку запиту, пряме виконання, перший згенерований токен і завершення генерації через performance.now(). Сторінка зазначає, що заздалегідь підготовлених результатів немає: співвідношення на екрані отримано на власному обладнанні відвідувача.
Застереження, які чесно виписані
Опубліковані пояснення досить обережні. Оцінки прямого зчитування — це softmax лише за показаними токенами варіантів: це не калібрована впевненість і не покриття всіх відповідей, яким модель могла б надати перевагу. MiniCPM5 2B — типовий вибір для десктопа, 1,56 ГБ; для телефонів і слабших пристроїв радять Qwen3 0.6B, а варіант 4B потребує суттєво більше пам'яті. Жоден із них не заявлений як такий, що дорівнює опублікованим значенням Jev.
Ваги завантажуються з Hugging Face і залишаються в кеші браузера; використано зафіксовані збірки GGUF через wllama. Квантування може змінити і якість, і швидкість, а сторінка попереджає, що перше завантаження може тривати кілька хвилин залежно від моделі, мережі та GPU.
SiTech — веброзробка з підтримкою AI
Створюємо швидкі та сучасні сайти й інтегруємо AI у бізнес-процеси. Маєте проєкт чи запитання? Із задоволенням допоможемо.