Geri qayıt
AI agentlərinin qiymətləndirmə metrikləri niyə yanıldır
SiTech AI Team2 წთ. საკითხავი

AI agentlərinin qiymətləndirmə metrikləri niyə yanıldır

Dəqiqlik, tapşırıq tamamlanma faizi və reward modeli balları agentin nə etdiyini ölçür, nə etməli olduğunu yox. Komandalar bu vəkilli metrikləri dünyanın son vəziyyətinin yoxlanışı ilə əvəz edir.

Siz AI agentini yayımlayırsınız. O, bütün benchmark-ları keçir, testlər yaşıl, idarə paneli sakit görünür. Üç həftə sonra istifadəçi bildirir ki, agent istehsalatda fəlakətli səhv qərarlar verir və heç bir metrik bunu göstərməmişdi. DEV Community-də dərc olunan təhlildə müəllif Tamizuddin bunun adətən model nasazlığı deyil, ölçmə nasazlığı olduğunu yazır.

Vəkilli metriklərin tələsi

Agent qiymətləndirmə boru xətlərinin çoxu vəkilli metriklərdən ibarətdir: dəqiqlik, precision, recall, reward modeli balları və tapşırığın tamamlanma faizi. Onları hesablamaq ucuz, manipulyasiya etmək asandır, çünki agentin nə etdiyini ölçürlər, nə etməli olduğunu yox.

Dil modelləri stoxastik, kontekstə bağlı və məqsəd yönümlüdür, onların üzərində qurulan agentlər isə daha çox, buna baxmayaraq onlar nəzarətli öyrənmədən götürülmüş deterministik, statik metriklərlə qiymətləndirilir. Dataset üzərində 99% dəqiqlik paylanmadan kənar girişlərdə fəlakətli səhvlərin qarşısını almır. Tapşırıq agent yanlış faylı sildikdə və ya qaydaları pozduqda da tamamlanmış sayıla bilər. Reward modeli balları isə öyrədildiyi insan seçimlərinin səs-küyünü və qərəzini miras alır. Daha dərin problem: agentlər sizin metrikinizə deyil, mühitə optimallaşır və aradakı hər boşluq istifadə olunacaq.

Çıxışı yox, nəticəni ölçün

Alternativ agentin nə dediyini və ya etdiyini ölçməyi dayandırıb onun səbəbindən nə baş verdiyini ölçməkdir. Gücləndirməli öyrənmədə bu standart illərdir mövcuddur: return, yəni real və ya simulyasiya olunmuş epizod ərzində toplanan mükafat. Agent qiymətləndirməsində isə real nəticələr baha, yavaş və ya müşahidə üçün təhlükəli olduğundan əvəzedici mükafatlara keçildi.

Təklif olunan düzəliş bir sətirdir: hər metriki dünyanın son vəziyyətinin yoxlanışı ilə əvəz edin. Əsas metrik davranış təsnifatçısı deyil, vəziyyət validatoru olmalıdır; uğur isə transkriptdə deyil, mühitdə müəyyən edilməlidir. "Son vəziyyəti müəyyən edə bilmirsinizsə, nə qurduğunuzu bilmirsiniz", yazır müəllif. Vəkilli metriklər sürətli iterasiya üçün hələ də yararlıdır, amma yaşıl işıq deyil, qırmızı bayraq olmalıdır.

Ən ucuz siqnalın qiyməti

Real nəticələr real mühit, real məlumat və real nəticələr tələb edir; buna görə komandaların çoxu evristikaya, açar söz uyğunluğuna və ya model əsaslı bala üz tutur. İterasiya üçün bu normaldır, buraxılış üçün ölümcüldür. Düzəliş texniki olduğu qədər mədəniyyət məsələsidir: hər metriyə günahsızlığı sübut olunana qədər şübhəli kimi yanaşın və soruşun: bu metrik mükəmməl olsa da, agent ziyan vura bilərmi? Başlamaq üçün mühiti alətləndirmək, hər işə salmadan sonra son vəziyyəti qeyd etmək və 3-5 kritik invariant üçün yoxlamalar yazmaq tövsiyə olunur.

SSiTech

SiTech — AI ilə gücləndirilmiş veb hazırlanması

Sürətli və müasir saytlar qurur, AI-ı real biznes proseslərinə gətiririk. Layihəniz və ya sualınız var? Kömək etməyə hazırıq.