
Ajanlar bariz görevlerde neden başarısız: sorun muhakeme değil, erişim — %49 ve %67
Geliştirici Lars Winstand, "ajan aptal" hatalarının çoğunun muhakeme değil erişim hatası olduğunu yazıyor. Anthropic'e göre başarısız erişimler %49, yeniden sıralamayla %67 azalıyor.
Uzun bir PDF'yi özetleyebilen, API'yi doğru çağırabilen ve çok adımlı bir akışı izleyebilen bir ajan yine de politika belgesine gömülü iade süresini kaçırır, yanlış ürün kodunu seçer ya da on saniye önce aldığı araç sonucunu unutur. DEV Community'de yayımlanan yazısında geliştirici Lars Winstand, "ajan aptal" diye anılan hataların çoğunun muhakeme değil erişim (retrieval) hatası olduğunu savunuyor; bu da hata ayıklamaya nereden başlanacağını değiştiriyor.
Hata muhakeme gibi görünüyor, ama değil
Winstand'ın tarif ettiği örüntü destek botlarından ve şirket içi yardımcılardan tanıdık: ajan zor kısımların üstesinden gelir, sonra gözle görülür tek bir adımı atlar. Bu kötü muhakeme gibi hissettirir; oysa genellikle tek bir kesin bilgi, tek bir anda eksiktir. "Bu bir muhakeme hatası değil. Bu başarısız bir getirme işlemi," diye yazıyor.
Anthropic'in rakamları: %49 ve %67
Tartışma Anthropic'in Contextual Retrieval araştırmasına dayanıyor: parçalar bağlamlandırılıp semantik arama ve Contextual BM25 ile birleştirildiğinde başarısız erişim sayısı %49 azalıyor. Üzerine yeniden sıralama eklendiğinde bu oran %67'ye çıkıyor. Standart RAG — temel parçalama ve saf semantik arama — benzer bir rakam sunmuyor.
Uzun bağlam ve vektör araması yetmiyor
İki yaygın varsayım çöküyor. Birincisi, tüm dokümantasyonu modele vermek doğru pasajı kullanacağını garanti etmez: "Lost in the Middle" etkisi nedeniyle modeller, ilgili bilgi uzun bir istemin ortasında kaldığında çoğu zaman daha kötü performans gösterir. İkincisi, saf embedding araması birebir eşleşme gereken yerlerde kaybediyor — sipariş kimlikleri, politika başlıkları, ürün kodları, iş akışı adları, hata kodları ve destek kaydı numaraları. Karma arama — anahtar kelime, semantik arama ve yeniden sıralama birlikte — gerçek sistemlerde daha güvenilir.
Önce erişim katmanını ayıklayın
Winstand'ın kontrol listesi, ajanın gördüğü bağlamı tam olarak kaydetmekle başlıyor: getirilen parçalar, önceki mesajlar, araç çıktıları, sistem istemi ve eklenen bellek. "Son istem durumunu inceleyemiyorsanız körlemesine hata ayıklıyorsunuz." Ardından oturum belleğini, kalıcı belleği ve erişimi birbirinden ayırmak gerekiyor; bunlar üç farklı olaydır. Birebir terimler için anahtar kelime araması ekleyin, modeli değiştirmeden önce yeniden sıralamayı deneyin ve kritik bilginin istemde nerede durduğunu test edin.
Son madde mimariyle ilgili: bilgi tabanı bağlama rahatça sığıyorsa — kabaca 200.000 tokenın altında — Anthropic RAG'i tamamen atlamayı öneriyor; aynı metne göre istem önbellekleme gecikmeyi iki kattan fazla, maliyeti ise %90'a kadar düşürebiliyor. Winstand'ın kuralı şu: ajan bariz bir görevi başaramadığında erişimin ne döndürdüğünü, bilginin bağlamda nerede göründüğünü, birebir eşleşme aramasının olup olmadığını, yeniden sıralamanın çalışıp çalışmadığını ve ajanın doğru şeyi kullanılabilir biçimde görüp görmediğini sorun.
SiTech — AI destekli web geliştirme
Hızlı ve modern web siteleri kuruyor, AI'yı gerçek iş akışlarına taşıyoruz. Projeniz veya sorunuz mu var? Yardımcı olmaktan mutluluk duyarız.