Jev, yeni bir LLM biçimi: System One, diğer adıyla Decision Models
TypeSafe AI'ın Jev modeli metin çıktısından vazgeçiyor: sınıflandırma görevleri için olasılıklar, kategoriler ve güven skorları döndürüyor; girdi milyon token başına 0,042 dolar.
TypeSafe AI geçen hafta, şirketin "System One modelleri" adını verdiği yeni bir model kategorisinin ilk örneği olan Jev'i tanıttı. Simon Willison daha isabetli adın "decision models" (karar modelleri) olduğunu düşünüyor; tasarımcı Maggie Appleton da bu terimi kullanıyor.
Jev, sıradan bir büyük dil modeli gibi metin girdisi alıyor ama hiç metin döndürmüyor: çıktısı kategoriler, evet/hayır soruları ve puanlamalar için kayan noktalı sayılar ve güven skorları. TypeSafe bunu "sınır zekâsına yapılan bir fonksiyon çağrısı: yapılandırılmamış durum girer, tiplenmiş olasılıksal kararlar çıkar" diye tanımlıyor.
Jev nasıl çalışıyor
API'yi kullanmak bir "durum" (state) nesnesi oluşturmak demek: bir metin, metin dizisi ya da ad-değer çiftleri; bu bir makaleyi, müşteriyi veya başka bir kaydı tanımlayabilir. Nesne bir ya da daha fazla soruyla gönderiliyor ve her soru ayrı yanıt alıyor.
Üç tür soru var. Jev'in "Noul" dediği evet/hayır soruları (CEO, Hacker News'te adın Bernoulli dağılımından geldiğini doğruladı) ifadenin doğru olma güvenini 0 ile 1 arasında döndürüyor. Seçim soruları bir güven skoru ve sunulan seçenekler üzerinde olasılık dağılımı veriyor; puan soruları ise belgeyi açıklamalı bir sayısal aralığa yerleştiriyor.
Sorular paralel işlendiği için bir belgeye çok sayıda soru eklemek yaklaşık tek soru kadar sürüyor. Fiyatlandırma da sıra dışı: yalnızca girdi ücretlendiriliyor — milyon token başına 0,042 dolar, çıktı ücretsiz. Bu, OpenAI'ın GPT-5 Nano'sundan bile ucuz (milyon başına 0,05 dolar).
Kara kutular ve önyargı
Willison ürünün biçimini rahatsız edici buluyor: bu yaklaşım makine öğrenimini opak "kara kutu" sistemlere bir adım daha yaklaştırıyor. Sıradan bir LLM'den en azından kararını gerekçelendirmesi istenebilir; Jev yalnızca bir sayı döndürüyor, dolayısıyla hangi içerik sinyallerinin belgeyi o kategoriye ittiğini hiçbir şey açıklamıyor. Bu yüzden önyargı burada daha çok önem taşıyor — modelin iş başvurularını sıralamak için kullanılmamasını umuyor. Bir deneyde San Francisco Körfezi'ndeki tüm şehirleri "İyi şehir mi?" diye puanlamak Cupertino'yu ilk, East Palo Alto'yu son sıraya koydu.
Jev çok ucuz olduğu için yazar, değerlendirmelerin ve yapılandırılmış deneylerin normal LLM projelerinden bile daha önemli olduğunu savunuyor: yüzlerce veya binlerce deneme istemi yalnızca birkaç sent tutuyor.
Topluluk deneyleri
Günler içinde alışılmadık projeler çıktı: Kyle Pena'nın jevchat'i Jev'i kötü bir sohbet botuna çeviriyor, Fatih Kadir Akın'ın jev-leftpad'i left-pad'i boşluk sayısı sorusuyla uyguluyor, Andy Gayton'ın jev-2048'i ise 2048 bulmacasını oynuyor.
Açık ağırlıklı yeniden üretimler de geldi; Kev, Qwen 3.5 üzerinde 0,8B, 4B ve 9B modeller kuruyor ve JevBench kıyaslaması "Jev sınıfı karar modellerini" şimdiden karşılaştırıyor — bir haftalık olmayan bir sürüm için etkileyici bir hareketlilik.