Назад
Оцінювання хакатону AGI від Kaggle оскаржили через «грубі невідповідності»
SiTech AI Team2 წთ. საკითხავი

Оцінювання хакатону AGI від Kaggle оскаржили через «грубі невідповідності»

Учасник хакатону Measuring Progress Toward AGI від Google DeepMind публічно оспорив присудження гран-прі: поверхове використання обов’язкового SDK, суперечливі висновки та закриті оцінки.

Переможців хакатону Measuring Progress Toward AGI — Cognitive Abilities, який Google DeepMind провів на платформі Kaggle, оголосили в середині липня. Понад 1000 команд подали бенчмарки за п’ятьма когнітивними напрямами. За кілька днів один з учасників опублікував докладне публічне заперечення щодо того, як було присуджено нагороди.

Суть скарги

У коментарі під оголошенням результатів автор заявив, що наводить «докази грубих невідповідностей у процесі оцінювання та відбору переможців». Допис зосереджений на MEDLEY-BENCH — бенчмарку поведінкової метакогніції, який отримав один із чотирьох гран-прі по 25 000 доларів.

Критик стверджує, що робота використовує обов’язковий для конкурсу Kaggle Benchmarks SDK настільки поверхово, що в режимі порівняння моделей видно лише одну оцінку без жодного уявлення про те, як збирали дані, а текст містить «необґрунтовані твердження». Головний приклад: висновок №1 стверджує, що масштабування підвищує показник «оцінювання», тоді як «контроль» залишається незмінним, хоча на графіку обидві лінії зростають разом. У коментарі зазначено, що додаткова 20-сторінкова праця тієї ж команди повідомляє про високу кореляцію базових показників (ρ = 0,79–0,94), а пізніший висновок суперечить попередньому ключовому твердженню. До того ж, за словами автора, роботу роздуто додатковими матеріалами: двома AI-відео, AI-подкастом, вебсайтом і статтею на arXiv.

Вимоги прозорості оцінок

Інші учасники ставили вужчі питання. Один попросив організаторів оприлюднити оцінки — бажано повний рейтинг усіх робіт, а як мінімум бали переможців. Його аргумент: хакатон, суть якого — вимірювати когнітивні здібності, а не декларувати їх, має застосовувати той самий стандарт і до власного суддівства. Інший порівняв бенчмарки напряму Learning, порахувавши, як часто організатори запускали на них власні моделі, й запитав, якому з опублікованих критеріїв не відповіла його робота ATLAS.

Кілька коментаторів зауважили, що роботи-переможці гран-прі важко перевірити: GAUGE заявляє близько 200 завдань, але в інтерфейсі видно лише один запуск, а Metaproteus так само показує одну оцінку. Окреме заперечення стосувалося не балів, а меж конкурсу: запрошення охоплювало моделі, які «міркують, діють і судять», проте практична структура обмежилася п’ятьма когнітивними напрямами переважно у форматі «запит — відповідь», тож бенчмаркам, заснованим на фізичній взаємодії, місця не знайшлося.

Чому це важливо

Чотири гран-прі по 25 000 доларів отримали MEDLEY-BENCH, LearningBench, GAUGE та Metaproteus, а десять призів за напрямами по 10 000 доларів охопили виконавчі функції, навчання, метакогніцію, соціальне пізнання та увагу. Організатори подякували учасникам і зазначили, що через якість робіт суддівство було «надзвичайно складним». Ця історія нагадує: результати бенчмарків і конкурси, що їх нагороджують, корисні рівно настільки, наскільки міцні докази за ними.

SSiTech

SiTech — веброзробка з підтримкою AI

Створюємо швидкі та сучасні сайти й інтегруємо AI у бізнес-процеси. Маєте проєкт чи запитання? Із задоволенням допоможемо.