
RAG göründüyündən sadədir: artıq mürəkkəblikdən qaçmağın altı yolu
Lighthouse Newsletter müəllifinə görə RAG sistemlərinin çoxu lazımsız yerə mürəkkəbləşdirilir: embedding-lərə və vektor bazalarına keçməzdən əvvəl adi tam mətn axtarışı ilə başlamaq kifayət edir.
Axtarış nə üçün lazımsız yerə mürəkkəbləşdirilir
Retrieval-augmented generation (RAG) sistemləri quran komandaların çoxu dərhal embedding-lərə, vektor verilənlər bazalarına və yenidən sıralama mərhələlərinə keçir; halbuki istifadəçilər sadəcə parolun necə sıfırlanacağını izah edən sənədi tapmaq istəyir. Mühəndislikdə hər məsələnin öz aləti var, yazır Lighthouse Newsletter, axtarış sistemləri də istisna deyil.
Arxitektura seçməzdən əvvəl beş amili ölçüb-biçmək tövsiyə olunur: məlumatların nə qədər təzə olması, korpusun həcmi və dəyişkənliyi, gələn sorğuların növü, gözlənilən sorğu həcmi və komandanın maşın öyrənməsi təcrübəsi.
Sadədən mürəkkəbə altı resept
Birinci resept adi tam mətn axtarışıdır: BM25, Elasticsearch və ya PostgreSQL-in daxili axtarışı. Sorğu heç nəyə başa gəlmir, nəticə on millisaniyədən tez gəlir, modelin köhnəlməsi onu poza bilmir və nə parçalama strategiyası, nə qiymətləndirmə dəsti tələb olunur. Əvəzində sinonimləri tutmur və söhbət üslubunda olan suallara cavab vermir.
İkinci resept agent əsaslı sorğu yenidən yazılmasıdır: dil modeli qarışıq sualı təmiz açar sözlərə çevirir, köməkçi sözləri atır, sinonimlər əlavə edir və mürəkkəb istəkləri hissələrə bölür. Kiçik modellə bir sorğunun qiyməti təqribən 0,001 dollar göstərilir; yaxşılaşdırma isə bütün korpusu yenidən yerləşdirmək yerinə promptu redaktə etmək deməkdir.
Sonra hibrid axtarış gəlir: BM25 əlli-yüz arası namizəd seçir, embedding modeli onları ona qədər yenidən sıralayır. text-embedding-3-small qiyməti ilə (milyon token üçün 0,02 dollar) təxminən 500 tokenlik 50 sənədi yerləşdirmək sorğu başına 0,0005 dollar, gündə min sorğuda isə ayda təxminən 15 dollar edir. Əsl xərc gecikmədir: hər sorğuya 200–500 millisaniyə əlavə olunur.
Qalan üç resept tez dəyişən korpuslar üçün axın daxilində yerləşdirmə, yalnız trafikin 80 faizini alan sənədlərin 20 faizini əvvəlcədən yerləşdirən isti/soyuq qat bölgüsü və çox böyük, sabit korpuslar üçün tam əvvəlcədən yerləşdirmədir. Bir milyon sənədi əvvəlcədən yerləşdirmək bir dəfəyə təxminən 10 dollar, saxlama isə ayda 10–30 dollar edir; lakin modeli sonradan dəyişmək hər şey əvvəlcədən yerləşdirilibsə 10 000 dollar, isti qatda 2 000 dollar, axın daxilində isə sıfırdır.
Bir neçə niyyətli suallar
Real istifadəçilər mürəkkəb suallar verir: CSV faylını oxumaq, çatışmayan dəyərləri təmizləmək və nəticəni qrafikə çevirmək — bunlar üç ayrı niyyətdir. Perplexity kimi sistemlər onları hissələrə ayırır, hər alt sorğunu kifayət edən ən ucuz üsula yönləndirir və tək cavabda birləşdirir. Nəşrin hesablamasına görə bu, sorğu başına 0,002 dollar, parçalama olmadan isə 0,03 dollardır.
Yekun
Tövsiyə olunan praktik qayda belədir: sistemlərin təxminən 60 faizi tam mətn axtarışı və sorğunun yenidən yazılmasında dayanmalıdır, 25 faizinə axın daxilində və ya isti/soyuq qatlı hibrid lazımdır və yalnız 10 faizi tam əvvəlcədən yerləşdirməni əsaslandırır. Ən sadədən başlayın, öz axtarışınızı iki-dörd həftə ölçün və siyahıda aşağı yalnız məlumatlar bunu tələb edəndə irəliləyin.
SiTech — AI ilə gücləndirilmiş veb hazırlanması
Sürətli və müasir saytlar qurur, AI-ı real biznes proseslərinə gətiririk. Layihəniz və ya sualınız var? Kömək etməyə hazırıq.