უკან დაბრუნება
Kaggle-ის AGI ჰაკათონის შეფასება „უხეში შეუსაბამობების“ გამო გააპროტესტეს
SiTech AI Team2 წთ. საკითხავი

Kaggle-ის AGI ჰაკათონის შეფასება „უხეში შეუსაბამობების“ გამო გააპროტესტეს

Google DeepMind-ის Measuring Progress Toward AGI ჰაკათონის მონაწილემ საჯაროდ დააყენა კითხვა გრან-პრის შეფასების პროცესზე: სავალდებულო ბენჩმარკ-SDK-ის სუსტი გამოყენება, ურთიერთგამომრიცხავი დასკვნები და გაუმჟღავნებელი ქულები.

Kaggle-ზე გამართული Google DeepMind-ის ჰაკათონის „Measuring Progress Toward AGI — Cognitive Abilities“ გამარჯვებულები ივლისის შუა რიცხვებში გამოცხადდა. კონკურსზე 1000-ზე მეტმა გუნდმა წარადგინა ბენჩმარკები ხუთი კოგნიტური მიმართულებით. რამდენიმე დღეში ერთ-ერთმა მონაწილემ შედეგების განცხადების ქვეშ დეტალური საჯარო შენიშვნა გამოაქვეყნა.

საჩივარი

კომენტარში ავტორი ამბობს, რომ წარმოადგენს „მტკიცებულებებს უხეში შეუსაბამობების შესახებ“ შეფასების პროცესსა და გამარჯვებულთა შერჩევაში. პოსტი ძირითადად ეხება MEDLEY-BENCH-ს — ქცევითი მეტაკოგნიციის ბენჩმარკს, რომელმაც ოთხი 25 000-დოლარიანი გრან-პრიდან ერთი მიიღო.

კრიტიკოსის აზრით, ნამუშევარი სავალდებულო Kaggle Benchmarks SDK-ს იმდენად ზედაპირულად იყენებს, რომ მოდელების შედარების ხედში მხოლოდ ერთი ქულა ჩანს და მონაცემთა შეგროვების პროცესი გაუმჟღავნებელი რჩება; ამასთან, ტექსტი, მისი შეფასებით, „დაუსაბუთებელ მტკიცებებს“ შეიცავს. მთავარი მაგალითი: დასკვნა №1 ამბობს, რომ მასშტაბირება ზრდის „შეფასების“ მაჩვენებელს, „კონტროლი“ კი უცვლელი რჩება — მაშინ, როცა გრაფიკზე ორივე ხაზი ერთად მატულობს. კომენტარში აღნიშნულია, რომ გუნდის დამატებითი 20-გვერდიანი ნაშრომი თავად ადასტურებს საბაზისო მაჩვენებლების მაღალ კორელაციას (ρ = 0,79–0,94), ხოლო მოგვიანებით მოყვანილი დასკვნა წინა მთავარ მტკიცებას ეწინააღმდეგება. მისივე სიტყვებით, ნამუშევარი გადატვირთულია დამატებითი მასალით: ორი AI-ვიდეო, AI-პოდკასტი, ვებგვერდი და სტატია arXiv-ზე.

გამჭვირვალობის მოთხოვნა

სხვა მონაწილეებმა უფრო კონკრეტული კითხვები დასვეს. ერთმა ორგანიზატორებს სთხოვა გამოაქვეყნონ შეფასების ქულები — სასურველია სრული ლიდერბორდი, ან, სულ მცირე, გამარჯვებული ნამუშევრების ქულები მაინც. მისი არგუმენტით, ჰაკათონი, რომლის არსი კოგნიტური შესაძლებლობების გაზომვაა და არა მათი დეკლარირება, იგივე სტანდარტი უნდა გამოიყენოს საკუთარი შეფასების მიმართ. სხვა კომენტატორმა Learning Track-ის ბენჩმარკები იმით შეადარა, თუ რამდენჯერ გაუშვეს ორგანიზატორებმა მათზე საკუთარი მოდელები — და იკითხა, რომელი გამოქვეყნებული კრიტერიუმი ვერ დააკმაყოფილა მისმა ნამუშევარმა ATLAS-მა.

რამდენიმე კომენტატორმა აღნიშნა, რომ გრან-პრის ნამუშევრების გადამოწმება რთულია: GAUGE აცხადებს დაახლოებით 200 შემთხვევას, მაგრამ ინტერფეისში მხოლოდ ერთი გაშვება ჩანს, Metaproteus-იც მხოლოდ ერთ ქულას აჩვენებს. ცალკე შენიშვნა ეხებოდა არა ქულებს, არამედ კონკურსის მოცულობას: მოწვევა მოიცავდა მოდელებს, რომლებიც „მსჯელობენ, მოქმედებენ და აფასებენ“, თუმცა პრაქტიკული სტრუქტურა ხუთ კოგნიტურ მიმართულებასა და ძირითადად შეკითხვა-პასუხის ფორმატს შემოიფარგლა — ფიზიკურ ინტერაქციაზე დაფუძნებული ბენჩმარკებისთვის ადგილი აღარ დარჩა.

რატომ აქვს ამას მნიშვნელობა

ოთხი გრან-პრი 25 000 დოლარით MEDLEY-BENCH-ს, LearningBench-ს, GAUGE-სა და Metaproteus-ს გადაეცა, ხოლო ათმა მიმართულების პრიზმა 10 000 დოლარით აღმასრულებელი ფუნქციების, სწავლის, მეტაკოგნიციის, სოციალური შემეცნებისა და ყურადღების კატეგორიებში გაიმარჯვა. ორგანიზატორებმა მონაწილეებს მადლობა გადაუხადეს და აღნიშნეს, რომ ნამუშევრების ხარისხმა შეფასება „ძალიან რთული“ გახადა. ეს ისტორია კიდევ ერთხელ შეახსენებს, რომ ბენჩმარკის შედეგები და მათზე დაფუძნებული კონკურსები მხოლოდ იმდენად ღირებულია, რამდენად მყარია მათ უკან არსებული მტკიცებულებები.

SSiTech

SiTech — AI-გაძლიერებული ვებ დეველოპმენტი

ვქმნით სწრაფ, თანამედროვე ვებსაიტებს და AI-ს ვაერთიანებთ ქართული ბიზნესებისთვის. გაქვთ პროექტი ან კითხვა? სიამოვნებით დაგეხმარებით.