
Kaggle-ի AGI հաքաթոնի գնահատականը վիճարկվել է «կոպիտ անհամապատասխանությունների» պատճառով
Google DeepMind-ի Measuring Progress Toward AGI հաքաթոնի մասնակիցը հրապարակայնորեն կասկածի տակ դրեց գլխավոր մրցանակների շնորհումը՝ պարտադիր SDK-ի մակերեսային կիրառում, հակասական եզրակացություններ և չհրապարակված միավորներ։
Kaggle հարթակում Google DeepMind-ի անցկացրած Measuring Progress Toward AGI — Cognitive Abilities հաքաթոնի հաղթողները հայտարարվեցին հուլիսի կեսերին։ Մրցույթին 1000-ից ավելի թիմեր ներկայացրին բենչմարքներ հինգ ուղղություններով։ Մի քանի օր անց մասնակիցներից մեկը հրապարակեց մանրամասն առարկություն մրցանակների շնորհման կարգին։
Բողոքը
Արդյունքների հայտարարության տակ տեղադրված մեկնաբանության մեջ հեղինակը նշում է, որ ներկայացնում է «գնահատման գործընթացում և հաղթողների ընտրության հարցում կոպիտ անհամապատասխանությունների ապացույցներ»։ Գրառումը հիմնականում վերաբերում է MEDLEY-BENCH-ին՝ վարքային մետաճանաչողության բենչմարքին, որը ստացել է 25 000-ական դոլարի չորս գլխավոր մրցանակներից մեկը։
Քննադատի կարծիքով՝ աշխատանքը պարտադիր Kaggle Benchmarks SDK-ն օգտագործում է այնքան մակերեսային, որ մոդելների համեմատման էկրանին միայն մեկ միավոր է երևում՝ առանց տվյալների հավաքագրման գործընթացի որևէ պատկերացման, իսկ տեքստը պարունակում է «չհիմնավորված պնդումներ»։ Հիմնական օրինակը՝ թիվ 1 եզրակացությունը պնդում է, որ մասշտաբավորումը բարձրացնում է «գնահատման» ցուցանիշը, մինչդեռ «վերահսկիչ» ցուցանիշը մնում է անփոփոխ, թեև գրաֆիկում երկու գծերն էլ միասին աճում են։ Մեկնաբանության մեջ նշվում է, որ թիմի լրացուցիչ 20-էջանոց աշխատությունը ինքն է հաղորդում բազային ցուցանիշների բարձր փոխկապակցվածության մասին (ρ = 0,79–0,94), իսկ ավելի ուշ եզրակացությունը հակասում է նախորդ հիմնական պնդմանը։ Ըստ հեղինակի՝ հայտը ուռճացված է նաև լրացուցիչ նյութերով՝ երկու AI տեսանյութ, փոդքաստ, կայք և arXiv հոդված։
Միավորների թափանցիկության պահանջ
Մյուս մասնակիցներն ավելի կոնկրետ հարցեր բարձրացրին։ Մեկը կազմակերպիչներից պահանջեց հրապարակել գնահատման միավորները՝ ցանկալի է բոլոր հայտերի ամբողջական աղյուսակը, իսկ դրա բացակայության դեպքում՝ գոնե հաղթող աշխատանքների միավորները։ Նրա փաստարկն այն էր, որ ճանաչողական կարողությունները չափելու վրա հիմնված հաքաթոնը նույն չափանիշը պետք է կիրառի նաև սեփական դատողության նկատմամբ։ Մեկ ուրիշը համեմատեց Learning ուղղության բենչմարքները՝ հաշվելով, թե քանի անգամ են կազմակերպիչներն իրենց մոդելներով աշխատեցրել դրանք, և հարցրեց, թե հրապարակված չափանիշներից որին չի համապատասխանել իր ATLAS-ը։
Մի քանի մեկնաբան նշեցին, որ մրցանակակիր աշխատանքները դժվար է ստուգել՝ GAUGE-ը հայտարարում է մոտ 200 առաջադրանք, սակայն ինտերֆեյսում միայն մեկ աշխատարկում է երևում, իսկ Metaproteus-ը ցույց է տալիս մեկ միավոր։ Առանձին առարկությունը վերաբերում էր ոչ թե միավորներին, այլ մրցույթի շրջանակին. հրավերը ներառում էր մոդելներ, որոնք «տրամաբանում են, գործում և դատում», սակայն գործնական կառուցվածքը սահմանափակվեց հինգ ճանաչողական ուղղությամբ և հիմնականում հարցում-պատասխան ձևաչափով, և տեղ չմնաց ֆիզիկական փոխազդեցության վրա հիմնված բենչմարքների համար։
Ինչու է սա կարևոր
25 000-ական դոլարի չորս գլխավոր մրցանակները տրվեցին MEDLEY-BENCH-ին, LearningBench-ին, GAUGE-ին և Metaproteus-ին, իսկ 10 000-ական դոլարի տասը մրցանակ՝ գործադիր ֆունկցիաների, ուսուցման, մետաճանաչողության, սոցիալական ճանաչողության և ուշադրության անվանակարգերում։ Կազմակերպիչները շնորհակալություն հայտնեցին մասնակիցներին և նշեցին, որ աշխատանքների որակը դատելը դարձրել է «չափազանց դժվար»։ Այս պատմությունը հիշեցնում է, որ բենչմարքների արդյունքները և դրանք պարգևատրող մրցույթները արժեքավոր են այնքանով, որքանով ամուր են դրանց հետևի ապացույցները։
SiTech — AI-ով հզորացված վեբ մշակում
Ստեղծում ենք արագ ու ժամանակակից կայքեր և AI-ը ներդնում իրական բիզնես գործընթացներում։ Ունե՞ք նախագիծ կամ հարց։ Ուրախ կլինենք օգնել։