
Kaggle AGI hackathon’unun değerlendirmesine “büyük tutarsızlık” itirazı
Google DeepMind’ın Measuring Progress Toward AGI hackathon’unda bir katılımcı, büyük ödüllerin verilme sürecini kamuya açık biçimde sorguladı: zorunlu SDK’nın zayıf kullanımı, çelişkili bulgular ve açıklanmayan puanlar.
Google DeepMind’ın Kaggle üzerinde düzenlediği Measuring Progress Toward AGI — Cognitive Abilities hackathonunun kazananları temmuz ortasında açıklandı. Yarışmaya 1.000’den fazla takım beş bilişsel kategoride benchmark sundu. Birkaç gün içinde bir katılımcı, ödüllerin nasıl verildiğine dair ayrıntılı bir kamuoyu itirazı yayımladı.
İtirazın içeriği
Sonuç duyurusunun altına yazılan yorumda katılımcı, “değerlendirme süreci ve kazananların seçiminde büyük tutarsızlıklara ilişkin kanıtlar” sunduğunu belirtti. Yazı esas olarak 25.000 dolarlık dört büyük ödülden birini kazanan davranışsal üstbiliş benchmarkı MEDLEY-BENCH’e odaklanıyor.
Eleştirmene göre çalışma, yarışmada zorunlu olan Kaggle Benchmarks SDK’sını o kadar yüzeysel kullanıyor ki model karşılaştırma ekranında veri toplama sürecine dair hiçbir ipucu olmadan tek bir puan görünüyor; metin de “desteklenmemiş iddialar” içeriyor. Ana örnek: 1. bulgu, ölçek büyüdükçe “değerlendirme” ölçütünün arttığını, “kontrol” ölçütünün ise sabit kaldığını söylüyor, oysa grafikte iki çizgi de birlikte yükseliyor. Yorumda, ekibin kendi 20 sayfalık ek makalesinin temel ölçütler arasında yüksek korelasyon bildirdiği (ρ = 0,79–0,94) ve sonraki bir çıkarımın önceki temel iddiayla çeliştiği belirtiliyor. Yazara göre başvuru ayrıca iki yapay zekâ videosu, bir yapay zekâ podcast’i, bir web sitesi ve arXiv makalesiyle şişirilmiş.
Puan şeffaflığı talepleri
Diğer katılımcılar daha dar sorular sordu. Biri organizatörlerden değerlendirme puanlarının açıklanmasını istedi: tercihen tüm başvuruları kapsayan tam bir sıralama, olmazsa kazanan başvuruların puanları. Gerekçesi, bilişsel yeteneklerin beyan edilmesi değil ölçülmesi üzerine kurulu bir hackathonun aynı standardı kendi değerlendirmesine de uygulaması gerektiğiydi. Bir başka katılımcı, Learning kategorisindeki benchmarkları organizatörlerin kendi modelleriyle kaç kez çalıştırdığını sayarak karşılaştırdı ve kendi çalışması ATLAS’ın yayımlanan kriterlerden hangisini karşılayamadığını sordu.
Birkaç yorumcu büyük ödül sahibi çalışmaların doğrulanmasının zor olduğunu belirtti: GAUGE yaklaşık 200 madde bildiriyor ama arayüzde tek bir çalıştırma görünüyor; Metaproteus da tek bir puan gösteriyor. Ayrı bir itiraz puanlara değil kapsama yönelikti: yarışma daveti “akıl yürüten, eyleyen ve yargılayan” modelleri kapsıyordu, ancak pratik yapı beş bilişsel kategori ve ağırlıklı olarak soru-cevap formatıyla sınırlı kaldı; fiziksel etkileşime dayanan benchmarklara yer kalmadı.
Neden önemli
25.000 dolarlık dört büyük ödül MEDLEY-BENCH, LearningBench, GAUGE ve Metaproteus’a gitti; yürütücü işlevler, öğrenme, üstbiliş, sosyal biliş ve dikkat kategorilerindeki on kategori ödülü ise 10.000 dolar olarak dağıtıldı. Organizatörler katılımcılara teşekkür etti ve başvuruların kalitesinin değerlendirmeyi “son derece zor” hale getirdiğini söyledi. Bu olay, benchmark sonuçlarının ve onları ödüllendiren yarışmaların ancak arkalarındaki kanıt kadar değerli olduğunu hatırlatıyor.
SiTech — AI destekli web geliştirme
Hızlı ve modern web siteleri kuruyor, AI'yı gerçek iş akışlarına taşıyoruz. Projeniz veya sorunuz mu var? Yardımcı olmaktan mutluluk duyarız.