
JevBench v1.4.1: tipli karar modelleri için yeniden üretilebilir kıyaslama
Benchmark Heaven, Jev sınıfı karar modelleri için JevBench v1.4.1'i yayımladı. 82 sistem 534 açık ve 308 kapalı karar üzerinde değerlendirildi; TypeSafe AI'nin Jev 1.13.0'ı 63,3 puanla lider.
Benchmark Heaven, Jev sınıfı karar modelleri için hazırladığı JevBench'i v1.4.1 sürümüne güncelledi; bu modeller bir durumu ve sınırlı bir kural setini alıp tipli bir yanıt döndürüyor. 23 Eylül 2026'da puanlanan sürüm, 82 sistemi 534 açık ve 308 kapalı karar üzerinde ölçüyor; bunlardan 77'si sıralamaya giriyor. Listenin başında 63,3 puanla TypeSafe AI'nin Jev 1.13.0'ı var; açık alternatif JevK5 v0.2.0 ise yalnızca 1,3 puan geride.
Puan nasıl hesaplanıyor
JevBench dört ekseni — Zekâ, Kalibrasyon, Hız ve Maliyet — 0–100 aralığında puanlayıp eşit ağırlıklı harmonik ortalamasını alıyor. Ardından iki eşik dengesiz sistemleri cezalandırıyor: Zekâ, Hız veya Maliyet'in 50'nin altında olması puanı karesel olarak düşürüyor; açık ve kapalı setler arasındaki doğruluk farkının 25 puanı aşması ise Zekâ puanını azaltıyor. En yeni ekleme kapalı set: 308 yeni özel karar, Zekâ puanının %20'sini oluşturuyor; kamuya yalnızca sistem düzeyinde toplu sonuçlar açıklanıyor, soru metinleri, yanıtlar ve madde bazlı sonuçlar gizli kalıyor ve sürümler arasında değişiyor. Kapalı sette rastgele tahmin şansı %29,3.
Sıralama
Jev 1.13.0, 63,3 puan alıyor (Zekâ 53,1, Kalibrasyon 76,3, Hız 83,3, Maliyet 52,0) ve 1.000 karar başına 0,040 dolar maliyetle çalışıyor. Ardından JevK5 v0.2.0 (62,0, tahmini ~0,022 dolar), Hopper (59,4), Winnow-12B Q8 (55,6), reflex 4B (54,0) ve djev (52,2, açıklanan fiyat 0,026 dolar) geliyor. Alandaki en güçlü genel model GPT-6 Luna, en yüksek Zekâ puanına (97,4) ve en iyi kapalı set doğruluğuna (%95,5) sahip; ancak 30. sırada: düşük Hız (72,6) ve Maliyet (36,0) puanları harmonik ortalamada telafi edilemiyor.
Jev sınıfı modeller hakkında ne söylüyor
Açık sorular liderler için neredeyse doymuş durumda — Jev 1.13.0 bunların %86,6'sını doğru yanıtlıyor — kapalı set ise çok daha zor: %36,7. Zirvedeki sistemlerde yaklaşık 48–57 puanlık farklar genelleme cezasını devreye sokuyor. Kıyaslamanın kendi notları 534 kararlık seti bir pilot olarak tanımlıyor, setin yalnızca İngilizce olduğunu belirtiyor ve saklı maddelerin de değerlendirilen servislere gönderildiği uyarısını yapıyor. Test altyapısı, açık görevler ve puanlama kuralları MIT lisanslı. Jev üzerinde çalışan classifier.dev 70,8 puan aldı ama sıralamaya girmiyor, çünkü aynı model iki kez sıralanmış olurdu. Aynı gün yayımlanan bağımsız bir analiz ise karar modelinin olasılıklarının keyfi veri dağılımlarında kalibre kalamayacağını savunuyor; yazara göre bunlara olasılık değil puan olarak bakılmalı.
SiTech — AI destekli web geliştirme
Hızlı ve modern web siteleri kuruyor, AI'yı gerçek iş akışlarına taşıyoruz. Projeniz veya sorunuz mu var? Yardımcı olmaktan mutluluk duyarız.