
67 sente ARC-AGI-1'de %44: 1,5 saatte eğitilen küçük transformer
Mithil Vakde tek bir RTX 5090'da sıfırdan küçük bir transformer eğitti; model ARC-AGI-1 kamu değerlendirmesinde %44 alıyor. Toplam hesaplama maliyeti 67 sent.
Araştırmacı Mithil Vakde, ARC-AGI üzerine yazdığı serinin üçüncü yazısını yayımladı. Bu kez sıfırdan eğittiği küçük bir transformer, ARC-AGI-1 kamu değerlendirme setinde %44, ARC-AGI-2'de ise %7 skor elde ediyor. Yazarın verdiği bilgiye göre tüm yaşam döngüsü boyunca hesaplama maliyeti — başlangıçtan itibaren eğitim artı tüm görevlerde çıkarım — 67 sente denk geliyor.
Çalıştırma tek bir RTX 5090 kartında yaklaşık 1,5 saat sürüyor ve sonuç, artık karşılaştırma yaptığı TRM ve HRM modellerinin bildirilen skorlarıyla aynı seviyede. Vakde artık yalnızca benzer biçimde test anında eğitim kullanan yaklaşımlarla kıyaslama yaptığını belirtiyor. Kod açık kaynak.
Yaklaşım nasıl çalışıyor
Bulmacadaki her girdi-çıktı çifti bir token dizisine dönüştürülüyor; küçük transformer bu diziler üzerinde sıfırdan, test anında otoregresif olarak eğitiliyor — test çıktıları gizli tutularak. Görevler arası öğrenmeyi sağlamak için her bulmacaya kendi öğrenilmiş toplamsal gömülmesi veriliyor, konum bilgisi ise 3D RoPE gömülmeleriyle işleniyor; çünkü her dizi iki adet iki boyutlu ızgara içeriyor.
Eğitim verisi renk ve dihedral permütasyonlarla zenginleştiriliyor. Çıkarımda test girdileri de aynı şekilde artırılıyor, üretilen çıktılara ters dönüşüm uygulanıyor ve en sık görülen iki yanıt gönderiliyor.
Önceki sürüme göre neler değişti
Skordaki en büyük artışı modernleştirilmiş mimari getirdi: GELU yerine SwiGLU, LayerNorm yerine RMSNorm, daha çeşitli ve daha iyi karıştırılmış veri ile 4 katmandan 8 katmana çıkılması. Maliyet düşüşü ise çok daha az artırma kullanılmasından, optimizasyonun yalnızca AdamW'den yardımcı AdamW'li NorMuon'a geçmesinden ve değişken uzunlukta paketlenmiş dizilerde flash attention'a geçilmesinden geldi.
Neden önemli
Vakde, örnek verimliliğini (sample efficiency) yapay zekânın en önemli çözülmemiş problemi olarak tanımlıyor; ARC'yi de bunu sınamak için uygun bir zemin sayıyor: yaklaşık 1000 bulmaca, her birinin kendi kuralı ve çok az ön bilgi gereksinimi. Açıkladığı hedef, bugünkü derin öğrenme yöntemlerinin sınırlarını bulmak ve yineleme maliyetini dünyada herkesin bu problem üzerinde çalışabileceği kadar düşürmek.
Ablasyon analizi, artırmalar ve sentetik veri olmadan da performansın önemli bir bölümünün korunduğunu gösterdi; birkaç çalıştırmanın birleşiminde çözülen görevler %55'e ulaşıyor. Yazar artık %65'in sade transformer çerçevesi içinde ulaşılabilir olduğunu düşünüyor ve elle yazılmış GPU çekirdekleriyle maliyette bir 10 kat daha düşüş görebiliyor.
SiTech — AI destekli web geliştirme
Hızlı ve modern web siteleri kuruyor, AI'yı gerçek iş akışlarına taşıyoruz. Projeniz veya sorunuz mu var? Yardımcı olmaktan mutluluk duyarız.