
Microsoft-ի ThinkingBox-ը գնահատում է AI գործակալներին տվյալների բազայում թողած գրառումներով
Microsoft-ի և Hugging Face-ի ThinkingBox բենչմարկը AI գործակալներին 507 վիճակ ունեցող բիզնես աշխատահոսքում 20 անգամ է անցկացնում և գնահատում վերջնական վիճակն ու կողմնակի էֆեկտները, ոչ միայն պատասխանները։
Վիճակ, ոչ բառեր
Microsoft-ի և Hugging Face-ի ThinkingBox բենչմարկը AI գործակալներին գնահատում է հետևում թողած գրառումներով, ոչ միայն գործիքների կանչերով կամ վերջնական ձևակերպմամբ։ Այն ընդգրկում է 507 վիճակով բիզնես աշխատահոսք և յուրաքանչյուր առաջադրանք 20 անգամ անցկացնում մաքուր backend-ից։ Մի մանրածախ դեպքում գործակալը ինը գործիք է կանչել $745 ուշացած խոհանոցային տեխնիկայի համար, ապա կուրիերի տոմսը նշել լուծված, մինչ փոխադրողի բացառությունը բաց էր մնում։ Պահանջվող վիճակը hold էր, ինչը բացահայտում է ձախողում, որը գործիքների կանչերի գնահատիչը բաց կթողներ։
Յուրաքանչյուր փորձ անցնում է մեկուսացված MCP սեսիայում՝ նոր սկզբնավորված վիճակով։ Կողմնակի էֆեկտների արդյունահանիչը գրանցում է փոփոխությունները, դետերմինիստական դատավորները արդյունքը համեմատում պահանջվողի հետ։ Փորձարկման շրջանակն ու տվյալների հավաքածուն հասանելի են Hugging Face-ում, ThinkingBox-Bench-ը՝ OpenEnv-ով։ 507 առաջադրանքից 477-ը գնահատվում է միայն վիճակով, 30-ը ավելացնում է պատասխանի չափանիշներ այն պահանջների համար, որոնք մաքուր տվյալների բազայի արժեքով հնարավոր չէ պատկերացնել։
Հետևողականությունը առանձին արդյունք է
ThinkingBox-ը հայտարարում է pass@1, pass@20 և գրանցված 20/20։ Pass@1-ը չափում է հաջող առանձին փորձերի մասը։ Pass@20-ը չափում է առաջադրանքները, որոնք 20 փորձից գոնե մեկ անգամ լուծվել են, իսկ 20/20-ը հաշվում է բոլոր փորձերում անցած առաջադրանքները։ Ընդհանուր համեմատությունում Claude Opus 5.5-ը առաջատար էր pass@1-ով՝ 67,16%, նրան հաջորդեցին Claude Opus 5՝ 66,50% և GPT-5.4՝ 65,36%։
Կրկնելիությունը փոխեց պատկերը։ Kimi-K3-ը 507 առաջադրանքից 476-ը լուծել է գոնե մեկ անգամ՝ 93,89%, բայց միայն 68-ն է անցել բոլոր 20 փորձերում՝ 13,41%։ Claude Opus 5-ը 241 առաջադրանք է անցել բոլոր 20 փորձերում՝ նույնը, ինչ Claude Opus 5.5-ը։ 12 մոդելի վրա 121 680 վավեր փորձի աբլյացիայում 79 853 փորձ ձախողվել է կատարման ստուգումներում։ Այս ձախողումներից 67,24%-ը մաքուր ավարտվել է, կանչել վիճակը փոխող գործիք և չի հայտնել վերջնական գործիքին սխալի մասին։ Ստուգումները գտել են սխալ դաշտերի արժեքներ 77,61%-ում, ավելորդ էֆեկտներ՝ 43,30%-ում և բացակայող պահանջվող էֆեկտներ՝ 25,36%-ում. այս տվյալները համընկնում են։
Գործիքների հետ աշխատանք և ներդրում
Ձախողումների պիտակներում գերակշռել է գործիքի օգտագործումը՝ 79,9%, ապա սխալ վիճակի թարմացումները՝ 10,3%, օգտվողի անավարտ լուծումները՝ 7,0% և վիճակը փոխող գործողության բացակայությունը՝ 2,9%։ Հեղինակները դա նկարագրում են որպես մոդելների մասնաբաժինների և դիտարկվող պիտակների չկշռված միջիններ, ոչ թե եզակի պատճառահետևանքային բացատրություններ։ Ըստ նրանց՝ գործակալները հաճախ սկսում են աշխատահոսքը, բայց չեն կարողանում վերականգնվել գործիքի սխալներից, ձախողված նախապայմաններից կամ դատարկ որոնումներից։
Ներդրման համար հեղինակները խորհուրդ են տալիս ստուգել վերջնական վիճակը, դասակարգել գործիքի և համակարգային սխալները, կրճատել գործիքների մակերեսը և մարդու հաստատում պահանջել դժվար հետարկվող փոփոխությունների համար։ Նրանք չեն չափել այս միջոցների ազդեցությունը բենչմարկի վրա։ ThinkingBox-ը նաև գնահատում է վստահելի առաջադրանքի արժեքը, որը հաշվարկվում է 20-անգամյա արշավի և բոլոր 20 փորձերն անցած առաջադրանքների քանակով։ Առնվազն մեկ 20/20 գրանցած մոդելներից ամենացածր գնահատականներն էին $6,80 GPT-5.4-ի, $7,45 GPT-6 Astra-ի և $7,80 Claude Opus 5.5-ի համար։ Սրանք համեմատական գնահատականներ են, ոչ թե փաստացի ամպային վճարներ։ Հանրային բենչմարկի համաձայն՝ բոլոր առաջադրանքները սինթետիկ վերակառուցում են, աշխատահոսքերն ու քաղաքականությունները մոդելավորված են իրական արտադրական գործակալի պաթերններով. դրա օգտվողները իրական չեն։
SiTech — AI-ով հզորացված վեբ մշակում
Ստեղծում ենք արագ ու ժամանակակից կայքեր և AI-ը ներդնում իրական բիզնես գործընթացներում։ Ունե՞ք նախագիծ կամ հարց։ Ուրախ կլինենք օգնել։