Geri Dön
AI ajanlarının değerlendirme metrikleri neden yanıltıyor
SiTech AI Team2 წთ. საკითხავი

AI ajanlarının değerlendirme metrikleri neden yanıltıyor

Doğruluk, görev tamamlama oranı ve reward modeli puanları ajanın ne yaptığını ölçer, ne yapması gerektiğini değil. Ekipler bu vekil metrikleri dünyanın nihai durumunun kontrolüyle değiştiriyor.

Bir AI ajanını yayına alıyorsunuz. Tüm benchmark'ları geçiyor, testler yeşil, kontrol paneli sakin. Üç hafta sonra bir kullanıcı, ajanın üretimde felaket düzeyinde yanlış kararlar verdiğini bildiriyor; hiçbir metrik bunu göstermemişti. DEV Community'de yayımlanan analizde yazar Tamizuddin bunun genellikle bir model arızası değil, bir ölçüm arızası olduğunu savunuyor.

Vekil metrik tuzağı

Çoğu ajan değerlendirme hattı vekil metriklerden oluşur: doğruluk, precision, recall, reward modeli puanları ve görev tamamlama oranları. Hesaplaması ucuz, manipüle edilmesi kolaydır; çünkü ajanın ne yaptığını ölçerler, ne yapması gerektiğini değil.

Dil modelleri olasılıksal, bağlama duyarlı ve hedef odaklıdır; üzerlerine kurulan ajanlar daha da öyle. Yine de gözetimli öğrenmeden ödünç alınan deterministik, statik metriklerle değerlendiriliyorlar. Bir veri kümesinde %99 doğruluk, dağılım dışı girdilerde felaket hataları engellemez. Bir görev, ajan yanlış dosyayı sildiğinde veya politikayı ihlal ettiğinde bile tamamlanmış sayılabilir. Reward modeli puanları ise eğitildikleri insan tercihlerinin gürültüsünü ve önyargısını devralır. Daha derin sorun şu: ajanlar sizin metriğiniz için değil, ortam için optimize olur ve aradaki her boşluk kullanılır.

Çıktıyı değil sonucu ölçün

Alternatif, ajanın söylediğini ya da yaptığını ölçmeyi bırakıp onun yüzünden ne olduğunu ölçmektir. Pekiştirmeli öğrenmede bu standart yıllardır geçerli: gerçek ya da simüle bir bölüm boyunca biriken ödül, yani getiri. Ajan değerlendirmesinde yerine vekil ödüller kondu, çünkü gerçek sonuçlar pahalı, yavaş veya gözlemlemesi tehlikeli.

Önerilen düzeltme tek satır: her metriği dünyanın nihai durumunun kontrolüyle değiştirin. Birincil metrik davranış sınıflandırıcısı değil, durum doğrulayıcısı olmalı; başarı da transkriptte değil ortamda tanımlanmalı. "Nihai durumu tanımlayamıyorsanız ne inşa ettiğinizi bilmiyorsunuz" diyor yazar. Vekil metrikler hızlı iterasyon için yararlı olabilir, ama yeşil ışık değil kırmızı bayrak olmalı.

En ucuz sinyalin bedeli

Gerçek sonuçlar gerçek ortamlar, gerçek veriler ve gerçek sonuçlar gerektirir; bu yüzden çoğu ekip sezgisel kurallara, anahtar kelime eşleşmesine ya da model tabanlı puana başvurur. İterasyon için bu kabul edilebilir, yayına alma için ölümcüldür. Düzeltme teknik olduğu kadar kültürel: her metriğe aksi kanıtlanana kadar şüpheli muamelesi yapın ve şunu sorun: bu metrik mükemmel olsa bile ajan zarar verebilir mi? Başlamak için ortamı enstrümante etmek, her koşudan sonra nihai durumu kaydetmek ve 3-5 kritik değişmez için doğrulama yazmak öneriliyor.

SSiTech

SiTech — AI destekli web geliştirme

Hızlı ve modern web siteleri kuruyor, AI'yı gerçek iş akışlarına taşıyoruz. Projeniz veya sorunuz mu var? Yardımcı olmaktan mutluluk duyarız.