
Оцінювання хакатону AGI від Kaggle оскаржили через «грубі невідповідності»
Учасник хакатону Measuring Progress Toward AGI від Google DeepMind публічно оспорив присудження гран-прі: поверхове використання обов’язкового SDK, суперечливі висновки та закриті оцінки.
Переможців хакатону Measuring Progress Toward AGI — Cognitive Abilities, який Google DeepMind провів на платформі Kaggle, оголосили в середині липня. Понад 1000 команд подали бенчмарки за п’ятьма когнітивними напрямами. За кілька днів один з учасників опублікував докладне публічне заперечення щодо того, як було присуджено нагороди.
Суть скарги
У коментарі під оголошенням результатів автор заявив, що наводить «докази грубих невідповідностей у процесі оцінювання та відбору переможців». Допис зосереджений на MEDLEY-BENCH — бенчмарку поведінкової метакогніції, який отримав один із чотирьох гран-прі по 25 000 доларів.
Критик стверджує, що робота використовує обов’язковий для конкурсу Kaggle Benchmarks SDK настільки поверхово, що в режимі порівняння моделей видно лише одну оцінку без жодного уявлення про те, як збирали дані, а текст містить «необґрунтовані твердження». Головний приклад: висновок №1 стверджує, що масштабування підвищує показник «оцінювання», тоді як «контроль» залишається незмінним, хоча на графіку обидві лінії зростають разом. У коментарі зазначено, що додаткова 20-сторінкова праця тієї ж команди повідомляє про високу кореляцію базових показників (ρ = 0,79–0,94), а пізніший висновок суперечить попередньому ключовому твердженню. До того ж, за словами автора, роботу роздуто додатковими матеріалами: двома AI-відео, AI-подкастом, вебсайтом і статтею на arXiv.
Вимоги прозорості оцінок
Інші учасники ставили вужчі питання. Один попросив організаторів оприлюднити оцінки — бажано повний рейтинг усіх робіт, а як мінімум бали переможців. Його аргумент: хакатон, суть якого — вимірювати когнітивні здібності, а не декларувати їх, має застосовувати той самий стандарт і до власного суддівства. Інший порівняв бенчмарки напряму Learning, порахувавши, як часто організатори запускали на них власні моделі, й запитав, якому з опублікованих критеріїв не відповіла його робота ATLAS.
Кілька коментаторів зауважили, що роботи-переможці гран-прі важко перевірити: GAUGE заявляє близько 200 завдань, але в інтерфейсі видно лише один запуск, а Metaproteus так само показує одну оцінку. Окреме заперечення стосувалося не балів, а меж конкурсу: запрошення охоплювало моделі, які «міркують, діють і судять», проте практична структура обмежилася п’ятьма когнітивними напрямами переважно у форматі «запит — відповідь», тож бенчмаркам, заснованим на фізичній взаємодії, місця не знайшлося.
Чому це важливо
Чотири гран-прі по 25 000 доларів отримали MEDLEY-BENCH, LearningBench, GAUGE та Metaproteus, а десять призів за напрямами по 10 000 доларів охопили виконавчі функції, навчання, метакогніцію, соціальне пізнання та увагу. Організатори подякували учасникам і зазначили, що через якість робіт суддівство було «надзвичайно складним». Ця історія нагадує: результати бенчмарків і конкурси, що їх нагороджують, корисні рівно настільки, наскільки міцні докази за ними.
SiTech — веброзробка з підтримкою AI
Створюємо швидкі та сучасні сайти й інтегруємо AI у бізнес-процеси. Маєте проєкт чи запитання? Із задоволенням допоможемо.