უკან დაბრუნება
Microsoft-ის ThinkingBox AI აგენტებს მონაცემთა ბაზაში დატოვებული ჩანაწერებით აფასებს
SiTech AI Team3 წთ. საკითხავი

Microsoft-ის ThinkingBox AI აგენტებს მონაცემთა ბაზაში დატოვებული ჩანაწერებით აფასებს

Microsoft-ისა და Hugging Face-ის ThinkingBox ბენჩმარკი AI აგენტებს 507 მდგომარეობის მქონე ბიზნეს სამუშაო პროცესში 20-ჯერ ატარებს და აფასებს საბოლოო მდგომარეობასა და გვერდით ეფექტებს და არა მხოლოდ საბოლოო პასუხებს.

მდგომარეობა და არა სიტყვები

Microsoft-ისა და Hugging Face-ის ThinkingBox ბენჩმარკი AI აგენტებს აფასებს უკან დატოვებული ჩანაწერებით და არა მხოლოდ ხელსაწყოების გამოძახებით ან საბოლოო ფორმულირებით. ის მოიცავს 507 მდგომარეობის მქონე ბიზნეს სამუშაო პროცესს და თითოეულ დავალებას 20-ჯერ ატარებს სუფთა backend-იდან. ერთ საცალო შემთხვევაში აგენტმა ცხრა ხელსაწყოს გამოძახება გამოიყენა დაგვიანებული $745 სამზარეულოს ტექნიკისთვის, შემდეგ კი კურიერის ტიკეტი მოგვარებულად მონიშნა, მაშინ როცა გადამზიდველის გამონაკლისი ღია რჩებოდა. საჭირო მდგომარეობა იყო hold, რაც ავლენს წარუმატებლობას, რომელსაც ხელსაწყოების გამოძახების შემფასებელი გამოტოვებდა.

თითოეული მცდელობა იზოლირებულ MCP სესიაში მიმდინარეობს ახლად ინიციალიზებული მდგომარეობით. გვერდითი ეფექტების ამომღები აღრიცხავს ცვლილებებს, დეტერმინისტული მსაჯები კი შედეგს საჭირო შედეგს ადარებენ. ტესტირების ჩარჩო და მონაცემთა ნაკრები ხელმისაწვდომია Hugging Face-ზე, ThinkingBox-Bench კი OpenEnv-ის მეშვეობით. 507 დავალებიდან 477 მხოლოდ მდგომარეობით ფასდება, 30 კი პასუხის რუბრიკებს ამატებს იმ მოთხოვნებისთვის, რომლებიც სუფთა მონაცემთა ბაზის მნიშვნელობით ვერ წარმოიდგინება.

თანმიმდევრულობა ცალკე შედეგია

ThinkingBox აცხადებს pass@1, pass@20 და დაფიქსირებულ 20/20-ს. Pass@1 ზომავს წარმატებული ცალკეული მცდელობების წილს. Pass@20 ზომავს დავალებებს, რომლებიც 20 მცდელობაში ერთხელ მაინც გადაწყდა, დაფიქსირებული 20/20 კი ითვლის დავალებებს, რომლებიც ყველა მცდელობაზე გადის. საერთო შედარებაში Claude Opus 5.5 ლიდერობდა pass@1-ში 67,16%-ით, მას მოჰყვა Claude Opus 5 66,50%-ით და GPT-5.4 65,36%-ით.

გამეორებადობამ სურათი შეცვალა. Kimi-K3-მა 507 დავალებიდან 476 ერთხელ მაინც გადაწყვიტა, ანუ 93,89%, მაგრამ მხოლოდ 68 დავალება გაიარა ყველა 20 მცდელობაზე, ანუ 13,41%. Claude Opus 5-მა 241 დავალება გაიარა ყველა 20 მცდელობაზე, იგივე რაოდენობა, რაც Claude Opus 5.5-მა. 121 680 ვალიდური ცდის აბლაციაში 12 მოდელზე, 79 853 მცდელობა ჩავარდა შესრულებადი შემოწმებებისას. ამ წარუმატებლობებიდან 67,24% სუფთად დასრულდა, გამოიძახა მდგომარეობის შემცვლელი ხელსაწყო და არ აცნობა საბოლოო ხელსაწყოს შეცდომის შესახებ. შემოწმებებმა აღმოაჩინა არასწორი ველების მნიშვნელობები 77,61%-ში, ზედმეტი ეფექტები 43,30%-ში და გამოტოვებული საჭირო ეფექტები 25,36%-ში; ეს მონაცემები ერთმანეთს ემთხვევა.

ხელსაწყოებთან მუშაობა და დანერგვა

წარუმატებლობის იარლიყებში დომინირებდა ხელსაწყოს გამოყენება 79,9%-ით, მას მოჰყვა არასწორი მდგომარეობის განახლებები 10,3%-ით, მომხმარებლის არასრული გადაწყვეტები 7,0%-ით და მდგომარეობის შემცვლელი მოქმედების არარსებობა 2,9%-ით. ავტორები ამას აღწერენ, როგორც თითო მოდელის წილებისა და დაკვირვებადი იარლიყების დაუწონავ საშუალოებს და არა უნიკალურ მიზეზობრივ ახსნებს. მათი თქმით, აგენტები ხშირად იწყებენ სამუშაო პროცესს, მაგრამ ვერ ახერხებენ ხელსაწყოს შეცდომების, წარუმატებელი წინაპირობების ან ცარიელი ძიებების აღდგენას.

დანერგვისთვის ავტორები რეკომენდაციას აძლევენ, შემოწმდეს საბოლოო მდგომარეობა ჩაბარებამდე, კლასიფიცირდეს ხელსაწყოსა და სისტემური შეცდომები, შემცირდეს ხელსაწყოების ზედაპირი და მოითხოვონ ადამიანის დადასტურება ცვლილებებზე, რომელთა უკუქცევა ძნელია. მათ ამ ზომების ბენჩმარკზე გავლენა არ გაზომეს. ThinkingBox ასევე აფასებს სანდო დავალების ღირებულებას, რომელიც გამოითვლება 20-ჯერადი კამპანიისა და ყველა 20 მცდელობაზე გავლილი დავალებების რაოდენობის მიხედვით. მოდელებს შორის, რომლებსაც მინიმუმ ერთი დაფიქსირებული 20/20 დავალება აქვთ, ცხრილის ყველაზე დაბალი შეფასებები იყო $6,80 GPT-5.4-ისთვის, $7,45 GPT-6 Astra-სთვის და $7,80 Claude Opus 5.5-ისთვის. ეს შედარებითი შეფასებებია და არა ფაქტობრივი ღრუბლოვანი გადასახადები. საჯარო ბენჩმარკის თანახმად, ყველა დავალება სინთეზური რეკონსტრუქციაა, სამუშაო პროცესები და პოლიტიკები რეალური საწარმოო აგენტის პატერნებზეა მოდელირებული; მისი მომხმარებლები რეალური არ არიან.

SSiTech

SiTech — AI-გაძლიერებული ვებ დეველოპმენტი

ვქმნით სწრაფ, თანამედროვე ვებსაიტებს და AI-ს ვაერთიანებთ ქართული ბიზნესებისთვის. გაქვთ პროექტი ან კითხვა? სიამოვნებით დაგეხმარებით.