Geri qayıt
Microsoft-un ThinkingBox AI agentləri verilənlər bazasında qalan qeydlərlə qiymətləndirir
SiTech AI Team3 dəq oxu

Microsoft-un ThinkingBox AI agentləri verilənlər bazasında qalan qeydlərlə qiymətləndirir

Microsoft və Hugging Face-in ThinkingBox benchmark-i AI agentləri 507 vəziyyətə malik biznes iş prosesində 20 dəfə icra edir və yalnız son cavabları deil, son vəziyyəti və yan təsirləri qiymətləndirir.

Vəziyyət, sözlər deil

Microsoft və Hugging Face-in ThinkingBox benchmark-i AI agentləri yalnız alətlərin çağırılması və ya son ifadələrlə deil, geridə qalan qeydlərlə qiymətləndirir. O, 507 vəziyyətə malik biznes iş prosesini əhatə edir və hər tapşırığı təmiz backend-dən 20 dəfə icra edir. Bir fürsətə agent gecikmiş $745 mətbəx texnikası üçün doqquz alət çağırışı istifadə etmiş, sonra isə kuryer bileti həll edilmiş kimi qeyd etmiş, halda ki, daşıyıcının kənarı açıq qalmışdı. Lazımi vəziyyət hold idi, bu isə uğursuzluğa səbəb olur, ki, alət çağırışlarını qiymətləndirən bunu ötürür.

Hər cəhd yeni başlanmış vəziyyətlə izolyasiya edilmiş MCP sessiyasında icra olunur. Yan təsirləri aşkarlamaq dəyişiklikləri qeyd edir, deterministik qiymətləndirmələr isə nəticəni lazımi nəticə ilə müqayisə edir. Test çərçivəsi və verilənlər dəsti Hugging Face-də əlçatandır, ThinkingBox-Bench isə OpenEnv vasitəsilə. 507 tapşırıqdan 477 yalnız vəziyyətlə qiymətləndirilir, 30 isə təmiz verilənlər bazası mənasını verə bilməyən tələblər üçün cavab rubrikaları əlavə edir.

Davamlılıq ayrıca nəticədir

ThinkingBox pass@1, pass@20 və sabitlənmiş 20/20 göstərir. Pass@1 uğurlu tək cəhdlərin nisbətini ölçür. Pass@20 20 cəhddə ən azı bir dəfə keçən tapşırıqları ölçür, sabitlənmiş 20/20 isə bütün cəhdlərdə keçən tapşırıqları sayır. Ümumi müqayisədə Claude Opus 5.5 pass@1-də 67,16% ilə liderlik etmiş, onu Claude Opus 5 66,50% və GPT-5.4 65,36% izləmişdir.

Təkrarlanma şəkli dəyişdirdi. Kimi-K3 507 tapşırıqdan 476-nı ən azı bir dəfə həll etmiş, yəni 93,89%, lakin yalnız 68 tapşırıq bütün 20 cəhddə keçmiş, yəni 13,41%. Claude Opus 5 241 tapşırığı bütün 20 cəhddə keçmiş, eyni say ki, Claude Opus 5.5-in. 121 680 etibarlı cəhdin ablyasiyasında 12 modelə 79 853 cəhd icra oluna bilən yoxlamalara düşmüşdür. Bu uğursuzluklardan 67,24% tamamilə bitmiş, vəziyyəti dəyişən alət çağırılmış və son alətə xəta barədə məlumat verilməmişdir. Yoxlamalar səhv sahə dəyərlərini 77,61%-də, artıq təsirləri 43,30%-də və buraxılmış lazımi təsirləri 25,36%-də aşkar etmişdir; bu verilənlər bir-birinə üst-üstə düşür.

Alətlərlə iş və inteqrasiya

Uğursuzluq bayraqlarında alət istifadəsi 79,9% ilə dominasiya etmiş, onu səhv vəziyyət yeniləmələri 10,3%, istifadəçinin natəmam qərarları 7,0% və vəziyyəti dəyişən həyyətin olmaması 2,9% izləmişdir. Müəllifləri bunu hər modelin nisbətlərinə və gözlənilməz bayraqlara ağlasığmaz orta kimi təsvir edir, unikal səbəbiyyətli izahlar deil. Onların dediyinə görə, agentlər tez-tez iş prosesini başladır, lakin alət xətalarını, uğursuz şərtləri və ya boş axtarışları bərpa edə bilmirlər.

İnteqrasiya üçün müəlliflər tövsiyə verir: son vəziyyəti təhvil verilməzdən əvvəl yoxlamaq, alət və sistem xətalarını təsnifləşdirmək, alətlərin səthini azaltmaq və geri çəkilməsi çətin olan dəyişikliklər üçün insan təsdiqi tələb etmək. Onlar bu tədbirlərin benchmark-ə təsirini ölçməmişlər. ThinkingBox həmçinin etibarlı tapşırığın dəyərini qiymətləndirir, ki, bu 20 dəfəlik kampaniya və bütün 20 cəhddə keçən tapşırıqların sayına əsaslanaraq hesablanır. Modellər arasında, ən azı bir sabitlənmiş 20/20 tapşırığı olanlarda, cədvəlin ən aşağı qiymətləri $6,80 GPT-5.4 üçün, $7,45 GPT-6 Astra üçün və $7,80 Claude Opus 5.5 üçün idi. Bu nisbi qiymətləndirmələrdir, faktiki bulud xərcləri deil. İctimai benchmark-ə görə, bütün tapşırıqlar sintetik rekonstruksiyadır, iş prosesləri və siyasətlər real istehsal agent nümunələrinə əsaslanaraq modelləşdirilib; onun istifadəçiləri real deyil.

SSiTech

SiTech — AI ilə gücləndirilmiş veb hazırlanması

Sürətli və müasir saytlar qurur, AI-ı real biznes proseslərinə gətiririk. Layihəniz və ya sualınız var? Kömək etməyə hazırıq.