Birleşik Krallık AI Güvenlik Enstitüsü: Standart Benchmark'lar AI Ajanlarının Gerçek Yeteneklerini Sistematik Olarak Eksik Değerlendiriyor
UK AISI'nin 7 benchmark üzerindeki çalışması: sabit hesaplama bütçeleri, AI ajanlarının gerçek yeteneklerini sistematik olarak eksik raporluyor — token limitini 10 kat artırmak başarı oranlarını ~%25 yükseltti.
🔍 Standart Benchmark'lar Neden AI Ajanlarının Gerçek Gücünü Ölçemiyor?
Birleşik Krallık AI Güvenlik Enstitüsü (UK AISI), AI değerlendirme alanındaki en önemli bulgulardan biri haline gelen bir çalışma yayınladı. Enstitü, lider AI modellerini yedi farklı benchmark'ta test etti ve standart testlerin AI ajanlarının yeteneklerini sistematik olarak eksik değerlendirdiğini tespit etti.
Sebep basit: her benchmark'ın sabit bir hesaplama bütçesi vardır — bir AI ajanının kullanabileceği maksimum token sayısı. AISI araştırmacıları, bir AI ajanının performansının sabit bir nokta değil, test hesaplamasıyla birlikte artan bir eğri olduğunu kanıtladı. Bütçeyi bu eğri hala yükselirken kestiğimizde, sonuç minimumu gösterir, maksimumu değil.
📊 Hesaplama Bütçesi — Gizli Değişken
Karmaşık bir yazılım mühendisliği görevini çözmeye çalışan bir AI ajanı düşünün. Ajan problemi düşünmeli, birden çok yaklaşım oluşturmalı, test etmeli, hata ayıklamalı ve iyileştirmelidir. Her adım token tüketir. AISI'nin araştırması, hesaplama bütçesi on kat artırıldığında, yazılım mühendisliği görevlerinde başarı oranlarının yaklaşık %25 arttığını gösteriyor.