Geri Dön
Microsoft'un ThinkingBox'ı AI Ajanlarını Veritabanında Bırakılan Kayıtlarla Değerlendiriyor
SiTech AI Team3 dk okuma

Microsoft'un ThinkingBox'ı AI Ajanlarını Veritabanında Bırakılan Kayıtlarla Değerlendiriyor

Microsoft ve Hugging Face'in ThinkingBox benchmark'i, AI ajanlarını 507 durumlu iş sürecinde 20 kez çalıştırır ve yalnızca nihai cevapları değil, son durumu ve yan etkileri de değerlendirir.

Durum, Kelimeler Değil

Microsoft ve Hugging Face'in ThinkingBox benchmark'i, AI ajanlarını yalnızca araç çağrıları veya nihai formülasyonlarla değil, arkada bırakılan kayıtlarla da değerlendirir. 507 durumlu bir iş sürecini kapsar ve her görevi temiz bir backend'den 20 kez çalıştırır. Tek bir örnekte, ajan gecikmiş $745 mutfak tekniği için dokuz araç çağrısı kullandı, ardından kurye bileti çözülmüş olarak işaretledi, oysa taşıyıcı eksikliği açıktı. Gerekli durum 'hold' idi ve bu, araç çağrılarını değerlendiren sistemin atlayacağı bir başarısızlığa yol açtı.

Her deneme, yeniden başlatılmış durumla izole bir MCP oturumunda gerçekleşir. Yan etki dedektörü değişiklikleri kaydeder, deterministik değerlendiriciler ise sonucu gerekli sonuçla karşılaştırır. Test çerçevesi ve veri seti Hugging Face'te mevcuttur, ThinkingBox-Bench ise OpenEnv aracılığıyla. 507 görevden 477'si yalnızca durumla puanlanır, 30'u ise temiz veritabanı bağlamında kurgulanamayacak gereksinimler için yanıt rubrikleri ekler.

Tutarlılık Ayrı Bir Sonuçtur

ThinkingBox, pass@1, pass@20 ve sabit 20/20 metriklerini sunar. Pass@1, başarılı tekil denemelerin oranını ölçer. Pass@20, 20 denemede en az bir kez çözülen görevleri ölçer, sabit 20/20 ise tüm denemelerde geçen görevleri sayar. Genel karşılaştırmada Claude Opus 5.5, pass@1'de %67,16 ile liderlik etti, ardından Claude Opus 5 %66,50 ve GPT-5.4 %65,36 geldi.

Tekrarlanabilirlik tabloyu değiştirdi. Kimi-K3, 507 görevden 476'sını en az bir kez çözdü, yani %93,89, ancak yalnızca 68 görev tüm 20 denemede geçti, yani %13,41. Claude Opus 5, tüm 20 denemede 241 görev geçti, Claude Opus 5.5 ile aynı sayı. 121.680 geçerli denemenin 12 model üzerindeki ablasyonunda, 79.853 deneme uygulanabilir doğrulamalarda başarısız oldu. Bu başarısızlıkların %67,24'ü temiz şekilde sona erdi, durumu değiştiren bir araç çağırdı ve son araçta bir hata olmadığını bildirdi. Doğrulamalar, %77,61'inde yanlış alan değerleri, %43,30'da fazladan etkiler ve %25,36'da atlanan gerekli etkiler tespit etti; bu veriler birbirini kapsar.

Araçlarla Çalışma ve Dağıtım

Başarısızlık damarlarında araç kullanımı %79,9 ile baskındı, ardından yanlış durum güncellemeleri %10,3, kullanıcının eksik kararları %7,0 ve durum değiştirici eylem yokluğu %2,9 geldi. Yazarlar bunu, her modelin oranları ve gözlemlenebilir damarlar için aşırı ortalama değil, benzersiz nedensel açıklamalar olarak tanımlıyor. Onlara göre, ajanlar sık sık iş sürecini başlatır ancak araç hatalarını, başarısız koşulları veya boş aramaları kurtarmada başarısız olurlar.

Dağıtım için yazarlar şunları önerir: teslimattan önce nihai durumu doğrulayın, araç ve sistem hatalarını sınıflandırın, araç yüzeyini azaltın ve geri dönüşü zor değişiklikler için insan onayı isteyin. Bu önlemlerin benchmark üzerindeki etkisini ölçmediler. ThinkingBox ayrıca güvenilir görev değerini de hesaplar; bu, 20'lik kampanya ve tüm 20 denemede geçen görev sayısına göre hesaplanır. En az bir sabit 20/20 görevi olan modeller arasında tablodaki en düşük değerler GPT-5.4 için $6,80, GPT-6 Astra için $7,45 ve Claude Opus 5.5 için $7,80 idi. Bunlar göreli değerlendirmelerdir, gerçek bulut maliyetleri değil. Açık benchmark'e göre, tüm görevler sentetik rekonstruksiyondur; iş süreçleri ve politikalar gerçek üretim ajanı modellerine modellenmiştir; kullanıcıları gerçek değildir.

SSiTech

SiTech — AI destekli web geliştirme

Hızlı ve modern web siteleri kuruyor, AI'yı gerçek iş akışlarına taşıyoruz. Projeniz veya sorunuz mu var? Yardımcı olmaktan mutluluk duyarız.