← უკან დაბრუნება
SiTech Team⏱️ 3 წთ. საკითხავი

დიდი ბრიტანეთის AI უსაფრთხოების ინსტიტუტი: სტანდარტული ბენჩმარკები სისტემატურად არ აფასებენ AI აგენტების რეალურ შესაძლებლობებს

დიდი ბრიტანეთის AI უსაფრთხოების ინსტიტუტი: სტანდარტული ბენჩმარკები სისტემატურად არ აფასებენ AI აგენტების რეალურ შესაძლებლობებს

UK AISI-ს კვლევამ 7 ბენჩმარკზე აჩვენა, რომ ფიქსირებული compute ბიუჯეტი AI აგენტების რეალურ შესაძლებლობებს მნიშვნელოვნად არ აფასებს — ტოკენების ლიმიტის 10-ჯერ გაზრდამ წარმატების მაჩვენებელი 25%-ით გაზარდა.

🔍 რატომ ვერ ზომავს ბენჩმარკები AI აგენტების რეალურ ძალას?

დიდი ბრიტანეთის AI უსაფრთხოების ინსტიტუტმა (AISI) გამოაქვეყნა კვლევა, რომელიც AI შეფასების სფეროში ერთ-ერთ ყველაზე მნიშვნელოვან აღმოჩენად იქცა. ინსტიტუტმა შვიდ სხვადასხვა ბენჩმარკზე გამოსცადა წამყვანი AI მოდელები (frontier models) და დაადგინა, რომ სტანდარტული ტესტები AI აგენტების შესაძლებლობებს სისტემატურად არ აფასებენ.

მიზეზი მარტივია: ყველა ბენჩმარკს აქვს ფიქსირებული compute ბიუჯეტი — ტოკენების მაქსიმალური რაოდენობა, რომლის გამოყენებაც AI აგენტს შეუძლია. AISI-ს მკვლევარებმა დაამტკიცეს, რომ AI აგენტის მუშაობა არ არის ფიქსირებული წერტილი, არამედ მრუდი, რომელიც იზრდება test-time compute-ს პარალელურად. როდესაც ბიუჯეტს ვწყვეტთ მაშინ, როცა ეს მრუდი ჯერ კიდევ აღმავალია, მიღებული ქულა გვიჩვენებს მინიმუმს და არა მაქსიმუმს.

📊 Compute ბიუჯეტი — ფარული ცვლადი

წარმოიდგინეთ AI აგენტი, რომელიც ცდილობს რთული software engineering პრობლემის გადაჭრას. აგენტმა უნდა გაიაზროს პრობლემა, გენერიროს მრავალი მიდგომა, შეამოწმოს ისინი, გამოასწოროს შეცდომები. თითოეული ნაბიჯი ხარჯავს ოქენებს. AISI-ს კვლევამ აჩვენა, რომ compute ბიუჯეტის 10-ჯერ გაზრდის შემდეგ, software engineering-ის ტასკებში წარმატების მაჩვენებელი 25%-ით გაიზარდა. AISI-ს კვლევამ აჩვენა, რომ compute ბიუჯეტის 10-ჯერ გაზრდის შემდეგ, software engineering-ის ტასკებში წარმატების მაჩვენებელი 25%-ით გაიზარდა.

ეს ქმნის "ჭერის ეფექტს" — ბენჩმარკი ზომავს ტესტს და არა აგენტს. ისევე, როგორც გატეხილი წამზომით გაზომილი სპორტსმენი ყოველთვის ნელი ჩანს, AI აგენტებიც, რომლებსაც compute-ბიუჯეტი ზღუდავს, ნაკლებად ძლიერები გვეჩვენებიან, ვიდრე სინამდვილეში არიან.

🔬 HealthBench — როცა compute-ს გაზრდა არ გვეხმარება

AISI-მ აღმოაჩინა, რომ ყველა ბენჩმარკი ერთნაირად არ იქცევა. HealthBench-ზე (სამედიცინო ცოდნა) compute-ს გაზრდამ ქულები არ გააუმჯობესა. მიზეზი ისაა, რომ ზოგიერთი ტასკი "recognition"-ზეა დაფუძნებული — ან იცი ინფორმაცია ან არ იცი. მეტი ფიქრი ვერ დაგვეხმარება, თუ ის ინფორმაცია უბრალოდ არ არის მოდელის training data-ში.

ეს განსხვავება კრიტიკულია: ბენჩმარკები, რომლებიც წმინდა ცოდნას ზომავენ, სტაბილურ, სამართლიან შედეგებს იძლევიან. მაგრამ ბენჩმარკები, რომლებიც მსჯელობას, პრობლემების გადაჭრასა (reasoning) და agentic behavior-ს ზომავენ — SWE-bench, GAIA, CyberSecEval — რეალურად ხელოვნური ტოკენ-ლიმიტებით შეზღუდულ მოძრავ სამიზნეს ზომავენ.

📈 Human Time vs AI Tokens — Power Law Relationship

AISI-მ აღმოაჩინა, რომ compute-ბიუჯეტის ორჯერ გაზრდა 15%-იან გაუმჯობესებას იძლევა software engineering-სა და cybersecurity-ბენჩმარკებზე. ეს relationship თანმიმდევრულია სხვადასხვა model family-ებს შორის — OpenAI-ს GPT-დან Anthropic-ის Claude-მდე.

ეს ნიშნავს, რომ ნებისმიერი "ერთიანი ქულის" მომცემი ბენჩმარკი ფუნდამენტურად შეცდომაში შეგვყავს. ქულა ასახავს არა აგენტის რეალურ შესაძლებლობებს, არამედ ტესტის დიზაინერების მიერ დაწესებულ თვითნებურ ბიუჯეტს. AISI გვთავაზობს, რომ მკვლევარებმა ერთიანი ქულის ნაცვლად compute-performance curves უნდა გამოაქვეყნონ.

⚠️ AI უსაფრთხოებისთვის ეს რატომ არის მნიშვნელოვანი

ამ აღმოჩენას პირდაპირი გავლენა აქვს AI უსაფრთხოებაზე. თუ ინსტიტუტები (AI Safety Institutes) და მარეგულირებლები არსებულ ბენჩმარკებს ეყრდნობიან, ისინი რისკავს, რომ frontier AI მოდელების რეალური შესაძლებლობები — და რისკები — არ შეაფასონ. განსხვავება მოჩვენებით და რეალურ შედეგებს შორის ყველაზე დიდია იქ, სადაც AI უსაფრთხოებისთვის ყველაზე მნიშვნელოვანია: კიბერუსაფრთხოება, ავტონომიური reasoning, long-horizon planning.

ქართველი ბიზნესებისთვის და developers-ებისთვის ეს კვლევა მნიშვნელოვან გაკვეთილს შეიცავს: AI მოდელების შეფასებისას, არ დაეყრდნოთ მხოლოდ გამოქვეყნებულ benchmark-ქულებს. გამოსცადეთ მოდელი თქვენს კონკრეტულ use case-ზე და მიეცით საკმარისი compute-დრო. მოდელი, რომელიც ბენჩმარკზე დაბალ ქულას იღებს, შესაძლოა სხვებს აჯობებდეს, როცა საკმარის რესურსებს მიიღებს — განსაკუთრებით რეალური ბიზნეს-აპლიკაციებისთვის დამახასიათებელ რთულ, მრავალსაფეხურიან ტასკებში.

📖 წაიკითხეთ სრული სტატია The Decoder-ზე