
AI agentləri aşkar tapşırıqlarda uğursuz olur: problem düşünmə deyil, axtarışdır — 49% və 67%
Developer Lars Winstand yazır ki, "agent axmaqdır" xətalarının çoxu düşünmə deyil, axtarış uğursuzluğudur. Anthropic-ə görə uğursuz axtarışlar 49%, reranking ilə 67% azalır.
Uzun PDF-i xülasə edə bilən, API-ni düzgün çağıran və çoxaddımlı iş axınını icra edən agent yenə də siyasət sənədində basdırılmış geri qaytarma müddətini qaçırır, yanlış məhsul SKU-su seçir və ya on saniyə əvvəl aldığı alət nəticəsini unudur. DEV Community-də dərc olunan yazıda developer Lars Winstand iddia edir ki, "agent axmaqdır" xətalarının çoxu düşünmə deyil, uğursuz axtarışdır — bu isə sazlamağa haradan başlamağı dəyişir.
Uğursuzluq düşünmə kimi görünür, amma deyil
Winstandın təsvir etdiyi nümunə dəstək botlarından və daxili köməkçilərdən tanışdır: agent çətin hissələrin öhdəsindən gəlir, sonra bir aşkar addımı buraxır. Bu, pis düşünmə kimi hiss olunur, halbuki adətən bir dəqiq fakt bir dəqiq anda yox idi. "Bu düşünmə uğursuzluğu deyil. Bu uğursuz axtarışdır", yazır o.
Anthropic-in rəqəmləri: 49% və 67%
Arqument Anthropic-in Contextual Retrieval araşdırmasına əsaslanır: parçalar kontekstləşdirilib semantik axtarış və Contextual BM25 ilə birləşdirildikdə uğursuz axtarışların sayı 49% azalır. Üstünə reranking əlavə edildikdə bu göstərici 67%-ə çatır. Standart RAG — sadə parçalama və təmiz semantik axtarış — müqayisə edilə bilən rəqəm təqdim etmir.
Uzun kontekst və vektor axtarışı kifayət etmir
İki geniş yayılmış fərziyyə dağılır. Birincisi, bütün sənədləri modelə vermək düzgün parçadan istifadə edəcəyinə zəmanət vermir: "Lost in the Middle" effektinə görə modellər vacib fakt uzun promptun ortasında olduqda çox vaxt daha pis işləyir. İkincisi, təmiz embedding axtarışı dəqiq uyğunluq tələb olunan yerlərdə uduzur — sifariş ID-ləri, siyasət başlıqları, məhsul SKU-ları, iş axını adları, xəta kodları və bilet ID-ləri. Hibrid axtarış — açar söz, semantik axtarış və reranking birlikdə — real sistemlərdə daha etibarlıdır.
Əvvəlcə axtarış qatını sazlayın
Winstandın yoxlama siyahısı agentin gördüyü dəqiq kontekstin qeydə alınması ilə başlayır: tapılan parçalar, əvvəlki mesajlar, alət nəticələri, sistem promptu və əlavə edilmiş yaddaş. "Son prompt vəziyyətini yoxlaya bilmirsinizsə, kor-koranə sazlayırsınız." Sonra sessiya yaddaşını, davamlı yaddaşı və axtarışı ayırmaq lazımdır — bunlar üç fərqli hadisədir. Hərfi terminlər üçün açar söz axtarışı əlavə edin, modeli dəyişməzdən əvvəl reranking tətbiq edin və kritik faktın promptda harada yerləşdiyini yoxlayın.
Sonuncu bənd arxitekturaya aiddir: bilik bazası kontekstə rahat sığırsa — təxminən 200 000 tokenə qədər — Anthropic RAG-dən tamamilə imtina etməyi məsləhət görür; həmin mətnə görə prompt keşləmə gecikməni iki dəfədən çox, xərci isə 90%-ə qədər azalda bilər. Onun qaydası budur: agent aşkar tapşırıqda uğursuz olduqda soruşun — axtarış nə qaytardı, fakt kontekstdə harada göründü, dəqiq uyğunluq axtarışı varmıydı, reranking işlədimi və agent düzgün şeyi istifadə edilə bilən formada gördümü.
SiTech — AI ilə gücləndirilmiş veb hazırlanması
Sürətli və müasir saytlar qurur, AI-ı real biznes proseslərinə gətiririk. Layihəniz və ya sualınız var? Kömək etməyə hazırıq.