
JevBench v1.4.1: tipli qərar modelləri üçün yenidən istehsal edilə bilən bençmark
Benchmark Heaven Jev sinfi qərar modelləri üçün JevBench v1.4.1-i yayımladı. 82 sistem 534 açıq və 308 qapalı qərar üzərində qiymətləndirildi; TypeSafe AI-nin Jev 1.13.0-ı 63,3 balla liderdir.
Benchmark Heaven Jev sinfi qərar modelləri üçün nəzərdə tutulan JevBench-i v1.4.1 versiyasına yeniləyib; belə modellər vəziyyəti və məhdud qaydalar toplusunu götürüb tipli cavab qaytarır. 23 sentyabr 2026-cı il tarixində qiymətləndirilən versiya 82 sistemi 534 açıq və 308 qapalı qərar üzərində ölçür; onlardan 77-si reytinqdədir. Siyahıya 63,3 balla TypeSafe AI-nin Jev 1.13.0-ı başçılıq edir; açıq alternativ JevK5 v0.2.0 isə cəmi 1,3 bal geridədir.
Bal necə hesablanır
JevBench dörd oxu — İntellekt, Kalibrasiya, Sürət və Xərc — 0–100 aralığında qiymətləndirib bərabər çəkili harmonik ortalamasını götürür. Sonra iki məhdudlaşdırıcı işə düşür: İntellekt, Sürət və ya Xərc 50-dən aşağı olduqda nəticə kvadratik şəkildə azalır; açıq və qapalı dəstlər arasındakı dəqiqlik fərqi 25 faiz bəndini keçərsə, İntellekt balı enir. Ən yeni əlavə qapalı dəstdir: 308 yeni məxfi qərar İntellekt balının 20%-ini verir, açıq şəkildə yalnız sistem səviyyəsində cəmlənmiş nəticələr yayımlanır — sual mətnləri, cavablar və hər bənd üzrə nəticələr məxfi qalır və versiyalar arasında dəyişir. Qapalı dəstdə təsadüfi təxmin şansı 29,3%-dir.
Reytinq
Jev 1.13.0 63,3 bal toplayır (İntellekt 53,1, Kalibrasiya 76,3, Sürət 83,3, Xərc 52,0) və 1000 qərar üçün 0,040 dollar təşkil edir. Onun ardınca JevK5 v0.2.0 (62,0, təxmini ~0,022 dollar), Hopper (59,4), Winnow-12B Q8 (55,6), reflex 4B (54,0) və djev (52,2, elan olunmuş 0,026 dollar) gəlir. Sahədə ən güclü ümumi model olan GPT-6 Luna ən yüksək İntellektə (97,4) və ən yaxşı qapalı dəst dəqiqliyinə (95,5%) malikdir, lakin yalnız 30-cu yerdədir: aşağı Sürət (72,6) və Xərc (36,0) balları harmonik ortalamada kompensasiya olunmur.
Jev sinfi modellər haqqında nə deyir
Açıq suallar liderlər üçün demək olar doymuşdur — Jev 1.13.0 onların 86,6%-nə düzgün cavab verir — qapalı dəst isə qat-qat çətindir: 36,7%. Zirvədəki sistemlərdə təxminən 48–57 bal fərqi ümumiləşdirmə cəriməsini işə salır. Bençmarkın öz qeydləri 534 qərarlıq dəsti pilot adlandırır, onun yalnız ingilis dilində olduğunu bildirir və gizli sualların da qiymətləndirilən xidmətlərə göndərildiyini xəbərdar edir. Test altyapısı, açıq tapşırıqlar və qiymətləndirmə qaydaları MIT lisenziyası ilə yayımlanır. Jev üzərində işləyən classifier.dev xidməti 70,8 bal toplayıb, amma reytinqə düşmür, çünki bu, eyni modeli iki dəfə sıralamaq olardı. Həmin gün dərc olunan müstəqil təhlil isə qərar modelinin ehtimallarının ixtiyari istifadəçi məlumatlarında kalibrlənmiş qala bilməyəcəyini iddia edir; müəllifin fikrincə, onlara ehtimal deyil, bal kimi baxmaq lazımdır.
SiTech — AI ilə gücləndirilmiş veb hazırlanması
Sürətli və müasir saytlar qurur, AI-ı real biznes proseslərinə gətiririk. Layihəniz və ya sualınız var? Kömək etməyə hazırıq.