
Kaggle AGI hackathonunun qiymətləndirilməsinə “kobud uyğunsuzluq” etirazı
Google DeepMind-ın Measuring Progress Toward AGI hackathonunda bir iştirakçı əsas mükafatların verilməsi prosesini açıq şəkildə şübhə altına aldı: məcburi SDK-dan zəif istifadə, ziddiyyətli nəticələr və açıqlanmayan ballar.
Google DeepMind-ın Kaggle platformasında keçirdiyi Measuring Progress Toward AGI — Cognitive Abilities hackathonunun qalibləri iyulun ortalarında elan edildi. Yarışmaya 1000-dən çox komanda beş koqnitiv kateqoriyada benchmark təqdim etmişdi. Bir neçə gün sonra iştirakçılardan biri mükafatların verilmə qaydasına dair ətraflı açıq etiraz dərc etdi.
Etirazın məzmunu
Nəticələrin elanı altında yazılan şərhdə müəllif “qiymətləndirmə prosesində və qaliblərin seçimində kobud uyğunsuzluqlara dair sübutlar” təqdim etdiyini bildirir. Yazı əsasən 25 000 dollarlıq dörd baş mükafatdan birini qazanan davranış metakoqnisiyası benchmarkı MEDLEY-BENCH-ə həsr olunub.
Tənqidçinin fikrincə, iş yarışma üçün məcburi olan Kaggle Benchmarks SDK-dan o qədər səthi istifadə edir ki, modellərin müqayisəsi ekranında məlumatların toplanma prosesi barədə heç bir məlumat olmadan yalnız bir bal görünür; mətn isə “əsassız iddialar” ehtiva edir. Əsas nümunə: 1 nömrəli nəticə miqyas artdıqca “qiymətləndirmə” göstəricisinin yüksəldiyini, “nəzarət” göstəricisinin isə dəyişməz qaldığını bildirir, halbuki qrafikdə hər iki xətt birlikdə yüksəlir. Şərhdə qeyd olunur ki, komandanın 20 səhifəlik əlavə məqaləsi baza göstəriciləri arasında yüksək korrelyasiya bildirir (ρ = 0,79–0,94), sonrakı bir nəticə isə əvvəlki əsas iddiaya ziddir. Müəllifin sözlərinə görə, təqdimat həmçinin iki süni intellekt videosu, bir AI podkastı, veb-sayt və arXiv məqaləsi ilə şişirdilib.
Bal şəffaflığı tələbləri
Digər iştirakçılar daha konkret suallar verdilər. Biri təşkilatçılardan qiymətləndirmə ballarının açıqlanmasını istədi — üstünlük bütün işləri əhatə edən tam cədvələ, mümkün olmadıqda isə qalib işlərin ballarına. Onun arqumenti belə idi: koqnitiv bacarıqları bəyan etmək deyil, ölçmək üzərində qurulmuş hackathon eyni standartı öz hakimliyinə də tətbiq etməlidir. Başqa bir iştirakçı Learning kateqoriyasındakı benchmarkları təşkilatçıların öz modelləri ilə neçə dəfə işə saldığını sayaraq müqayisə etdi və öz işi ATLAS-ın elan olunmuş meyarlardan hansını qarşılamadığını soruşdu.
Bir neçə şərhçi baş mükafat qazanan işlərin yoxlanılmasının çətin olduğunu qeyd etdi: GAUGE təxminən 200 tapşırıq bildirir, amma interfeysdə yalnız bir işə salma görünür; Metaproteus da tək bal göstərir. Ayrı bir etiraz ballara deyil, yarışmanın əhatə dairəsinə aid idi: dəvət “düşünən, fəaliyyət göstərən və mühakimə yürüdən” modelləri əhatə edirdi, lakin praktiki struktur beş koqnitiv kateqoriya və əsasən sual-cavab formatı ilə məhdudlaşdı; fiziki qarşılıqlı təsirə əsaslanan benchmarklar üçün yer qalmadı.
Nə üçün vacibdir
25 000 dollarlıq dörd baş mükafat MEDLEY-BENCH, LearningBench, GAUGE və Metaproteus-a verildi; icra funksiyaları, öyrənmə, metakoqnisiya, sosial idrak və diqqət kateqoriyalarında on mükafat isə 10 000 dollar həcmində paylandı. Təşkilatçılar iştirakçılara təşəkkür etdi və işlərin keyfiyyətinin qiymətləndirməni “son dərəcə çətin” etdiyini söylədi. Bu hadisə benchmark nəticələrinin və onları mükafatlandıran yarışmaların yalnız arxalarındakı sübutlar qədər dəyərli olduğunu xatırladır.
SiTech — AI ilə gücləndirilmiş veb hazırlanması
Sürətli və müasir saytlar qurur, AI-ı real biznes proseslərinə gətiririk. Layihəniz və ya sualınız var? Kömək etməyə hazırıq.