
JevBench v1.4.1: відтворюваний бенчмарк для моделей типізованих рішень
Benchmark Heaven опублікувала JevBench v1.4.1 — відтворюваний бенчмарк для моделей рішень класу Jev. 82 системи оцінили на 534 публічних і 308 закритих рішеннях; лідирує Jev 1.13.0 із 63,3 бала.
Benchmark Heaven опублікувала JevBench v1.4.1 — відтворюваний бенчмарк для моделей рішень класу Jev. Такі моделі отримують стан і обмежений набір правил, а повертають типізовану відповідь. Оцінювання охопило 82 системи на 534 публічних і 308 закритих рішеннях, у рейтингу — 77 із них. Лідирує Jev 1.13.0 від TypeSafe AI з 63,3 бала, а відкрита альтернатива JevK5 v0.2.0 відстає лише на 1,3 бала.
Як рахується оцінка
JevBench поєднує чотири осі — інтелект, калібрування, швидкість і вартість — кожна від 0 до 100 — у рівновагове гармонійне середнє. Далі діють два запобіжники: оцінка нижче 50 за інтелектом, швидкістю чи вартістю квадратично знижує результат, а різниця точності між публічним і закритим наборами понад 25 процентних пунктів зменшує інтелект. Найновіше доповнення — закритий набір: 308 свіжих приватних рішень дають 20% оцінки за інтелект, а публікуються лише агрегати на рівні систем — тексти завдань, відповіді та поелементні результати лишаються приватними й змінюються між версіями. Імовірність випадкового вгадування на закритому наборі — 29,3%.
Рейтинг
Jev 1.13.0 має 63,3 бала (інтелект 53,1, калібрування 76,3, швидкість 83,3, вартість 52,0) за $0,040 на 1000 рішень. За ним ідуть JevK5 v0.2.0 (62,0, ~$0,022 за оцінкою), Hopper (59,4), Winnow-12B Q8 (55,6), reflex 4B (54,0) і djev (52,2, оголошена ціна $0,026). Найпотужніша загальна модель, GPT-6 Luna, має найвищий інтелект (97,4) і найкращу точність на закритому наборі (95,5%), але посідає лише 30-те місце: слабкі швидкість (72,6) і вартість (36,0) гармонійне середнє не компенсує.
Що це каже про моделі класу Jev
Публічний набір для лідерів майже насичений — Jev 1.13.0 відповідає правильно на 86,6% завдань — тоді як закритий значно складніший: 36,7%. Розриви у 48–57 пунктів у топових систем активують штраф за узагальнення. Самі автори бенчмарка називають 534 рішення пілотом, зазначають, що набір лише англійською, і попереджають: тексти закритих завдань усе одно надсилають оцінюваним сервісам. Харнес, публічні завдання та правила оцінювання — під ліцензією MIT. Сервіс classifier.dev, що працює на Jev, отримав 70,8 бала, але не в рейтингу — інакше та сама модель оцінювалася б двічі. Крім того, незалежний аналіз, опублікований того ж дня, твердить, що ймовірності моделі рішень не можуть лишатися відкаліброваними на довільних даних користувача, тож їх варто сприймати як оцінки, а не як імовірності.
SiTech — веброзробка з підтримкою AI
Створюємо швидкі та сучасні сайти й інтегруємо AI у бізнес-процеси. Маєте проєкт чи запитання? Із задоволенням допоможемо.