Geri Dön
RAG sandığınızdan daha basit: Aşırı mühendislikten kaçınmanın altı yolu
SiTech AI Team3 წთ. საკითხავი

RAG sandığınızdan daha basit: Aşırı mühendislikten kaçınmanın altı yolu

Lighthouse Newsletter yazarına göre çoğu RAG sistemi gereğinden fazla karmaşık: embedding'lere ve vektör veritabanlarına atlamadan önce sade tam metin aramayla başlamak çoğu durumda yeterli.

Aramın neden gereğinden fazla karmaşıklaştığı

Retrieval-augmented generation (RAG) sistemleri kuran ekiplerin çoğu doğrudan embedding'lere, vektör veritabanlarına ve yeniden sıralama hattına geçiyor; oysa kullanıcılar yalnızca parolanın nasıl sıfırlanacağını anlatan belgeyi bulmak istiyor. Mühendislikte her sorunun kendi aracı olduğunu yazan Lighthouse Newsletter, arama sistemlerinin de bunun dışında olmadığını belirtiyor.

Mimari seçilmeden önce beş etkenin tartılması öneriliyor: verinin ne kadar taze olması gerektiği, derlemin büyüklüğü ve değişkenliği, gelen sorguların türü, beklenen sorgu hacmi ve ekibin makine öğrenmesi deneyimi.

En basitten en ayrıntılıya altı tarif

İlk tarif sade tam metin arama: BM25, Elasticsearch veya PostgreSQL'in yerleşik araması. Sorgu maliyeti yok, sonuçlar on milisaniyenin altında geliyor, model eskimesi onu bozamıyor ve ne parçalama stratejisi ne de değerlendirme kümesi gerekiyor. Buna karşılık eş anlamlıları kaçırıyor ve sohbet üslubundaki soruları yanıtlamıyor.

İkinci tarif ajan tabanlı sorgu yeniden yazımı: bir dil modeli dağınık soruyu temiz anahtar kelimelere çeviriyor, dolgu sözcüklerini atıyor, eş anlamlı ekliyor ve karmaşık istekleri bölüyor. Küçük bir modelle sorgu başına maliyet yaklaşık 0,001 dolar olarak veriliyor; iyileştirme ise tüm derlemi yeniden gömmek yerine istemi düzenlemek anlamına geliyor.

Ardından hibrit arama geliyor: BM25 elli ile yüz arasında aday seçiyor, embedding modeli bunları ona indiriyor. text-embedding-3-small fiyatıyla (milyon token başına 0,02 dolar) yaklaşık 500 token'lık 50 belgeyi gömmek sorgu başına yaklaşık 0,0005 dolar, günde bin sorguda ayda yaklaşık 15 dolar ediyor. Asıl maliyet gecikme: sorgu başına 200-500 milisaniye ekleniyor.

Kalan üç tarif, hızlı değişen derlemler için akış içinde gömme, yalnızca trafiğin yüzde 80'ini alan belgelerin yüzde 20'sini önceden gömen sıcak/soğuk katman ayrımı ve çok büyük, durağan derlemler için tam ön gömme. Bir milyon belgeyi önceden gömmek tek seferde yaklaşık 10 dolar, depolama da ayda 10-30 dolar; ancak model değiştirmek her şey önceden gömülüyse 10.000 dolar, sıcak katmanda 2.000 dolar, akış içinde ise hiçbir şey.

Birden çok niyet taşıyan sorular

Gerçek kullanıcılar bileşik sorular soruyor: CSV dosyasını okumak, eksik değerleri temizlemek ve sonucu grafiklemek — bu üç ayrı niyet. Perplexity gibi sistemler bunları parçalara ayırıyor, her alt sorguyu yeterli olan en ucuz yönteme yönlendiriyor ve tek bir yanıt üretiyor. Bültenin hesabına göre bu, sorgu başına 0,002 dolar; parçalama olmadan ise 0,03 dolar.

Sonuç

Önerilen pratik kural şu: sistemlerin yaklaşık yüzde 60'ı tam metin arama ve sorgu yeniden yazımında durmalı, yüzde 25'i akış içinde veya sıcak/soğuk katmanlı hibrit yaklaşıma ihtiyaç duyuyor ve yalnızca yüzde 10'u tam ön gömmeyi haklı çıkarıyor. En basitiyle başlayın, kendi aramanızı iki ila dört hafta ölçün ve listede ancak veriler zorladığında aşağı inin.

SSiTech

SiTech — AI destekli web geliştirme

Hızlı ve modern web siteleri kuruyor, AI'yı gerçek iş akışlarına taşıyoruz. Projeniz veya sorunuz mu var? Yardımcı olmaktan mutluluk duyarız.