חזרה
ביקורת פומבית על שיפוט ההאקתון של Kaggle: “אי-עקביות חמורה”
SiTech AI Team2 წთ. საკითხავი

ביקורת פומבית על שיפוט ההאקתון של Kaggle: “אי-עקביות חמורה”

משתתף בהאקתון Measuring Progress Toward AGI של Google DeepMind העלה תלונה פומבית על בחירת הזוכים: שימוש רופף ב-SDK החובה, ממצאים סותרים והיעדר שקיפות לגבי הניקוד.

הזוכים בהאקתון Measuring Progress Toward AGI — Cognitive Abilities, תחרות מובלטת של Google DeepMind שנערכה בפלטפורמת Kaggle, הוכרזו באמצע יולי. יותר מ-1,000 צוותים הגישו בנצ׳מרקים בחמישה מסלולים קוגניטיביים. בתוך ימים אחד המשתתפים פרסם התנגדות פומבית מפורטת לאופן שבו הוענקו הפרסים.

התלונה

בתגובה שפורסמה מתחת להודעת התוצאות כתב המשתתף כי הוא מציג “ראיות לאי-עקביות חמורה בתהליך ההערכה ובבחירת הזוכים”. הפוסט מתמקד ב-MEDLEY-BENCH, בנצ׳מרק למטקוגניציה התנהגותית שזכה באחד מארבעת הפרסים הגדולים בסך 25,000 דולר.

המבקר טוען כי ההגשה השתמשה ב-SDK של Kaggle Benchmarks — שימוש שהיה חובה בתחרות — באופן כה רופף, עד שמסך השוואת המודלים מציג ציון אחד בלבד בלי שום תובנה על אופן איסוף הנתונים, וכי המסמך מכיל “טענות בלתי מבוססות”. הדוגמה המרכזית: ממצא מס׳ 1 קובע שהסקייל מעלה את מדד ה“הערכה” בעוד מדד ה“ביקורת” נותר קבוע, אף שבגרף שני הקווים עולים יחד. במאמר משלים בן 20 עמודים של אותו צוות, מציין הכותב, מדווח הצוות עצמו כי מדדי הבסיס שלו מתואמים מאוד (ρ = 0.79–0.94), ותובנה מאוחרת סותרת את הטענה המרכזית המוקדמת. עוד נטען כי ההגשה מנופחת בחומרי לוואי: שני סרטונים שנוצרו ב-AI, פודקאסט ב-AI, אתר אינטרנט ומאמר ב-arXiv.

דרישות לשקיפות בניקוד

משתתפים אחרים העלו שאלות ממוקדות יותר. אחד ביקש מהמארגנים לפרסם את ציוני ההערכה — רצוי לוח תוצאות מלא, ולחלופין לפחות את ציוני ההגשות הזוכות — בטענה שהאקתון שכל עיקרו מדידת יכולות קוגניטיביות ולא הצהרה עליהן צריך להחיל את אותו סטנדרט גם על השיפוט שלו עצמו. אחר השווה בין הבנצ׳מרקים במסלול הלמידה באמצעות ספירת ההרצות שביצעו המארגנים עם מודלים פנימיים, כמדד עקיף לתשומת הלב שקיבלו, ושאל איזה קריטריון מפורסם לא עמדה בו ההגשה שלו, ATLAS.

כמה מגיבים ציינו שקשה לאמת את ההגשות הזוכות: GAUGE מדווח על כ-200 פריטים אך מציג הרצה אחת בלבד בממשק הבנצ׳מרק, ו-Metaproteus מציג אף הוא ציון אחד. התנגדות נפרדת נגעה להיקף ולא לניקוד: ההזמנה לתחרות דיברה על מודלים ש“מנמקים, פועלים ושופטים”, אך המבנה המעשי הוגבל לחמישה מסלולים קוגניטיביים ולמסגרת של שאלה-תשובה בעיקרה, בלי מקום לבנצ׳מרקים המבוססים על אינטראקציה פיזית.

מדוע זה חשוב

ארבעה פרסים גדולים של 25,000 דולר הוענקו ל-MEDLEY-BENCH, LearningBench, GAUGE ו-Metaproteus, ועשרה פרסי מסלול של 10,000 דולר הוענקו בתחומי התפקודים הניהוליים, הלמידה, המטקוגניציה, הקוגניציה החברתית והקשב. המארגנים הודו למשתתפים ואמרו שאיכות ההגשות הפכה את השיפוט ל“קשה עד מאוד”. הפרשה מזכירה שתוצאות בנצ׳מרק, והתחרויות שמעניקות להן פרסים, שוות בדיוק כמו הראיות שעומדות מאחוריהן.

SSiTech

SiTech — פיתוח אתרים בכוח ה-AI

אנחנו בונים אתרים מהירים ומודרניים ומשלבים AI בתהליכי עבודה אמיתיים. יש לכם פרויקט או שאלה? נשמח לעזור.