Назад
RAG простіший, ніж здається: шість архітектур без зайвого ускладнення
SiTech AI Team3 წთ. საკითხავი

RAG простіший, ніж здається: шість архітектур без зайвого ускладнення

Автор Lighthouse Newsletter радить не стрибати одразу до embeddings і векторних баз: у більшості випадків достатньо повнотекстового пошуку з переформулюванням запитів, який майже нічого не коштує.

Чому пошук ускладнюють надмірно

Більшість команд, які будують системи retrieval-augmented generation (RAG), одразу переходять до embeddings, векторних баз даних і пайплайнів reranking, тоді як користувачам потрібен лише документ із поясненням, як змінити пароль. В інженерії для кожної задачі є свій інструмент, пише автор Lighthouse Newsletter, і системи пошуку не виняток.

Перед вибором архітектури варто зважити п'ять чинників: наскільки свіжими мають бути дані, який розмір і мінливість корпусу, які запити надходять, який обсяг запитів очікується і який досвід команди в машинному навчанні.

Шість рецептів — від мінімального до складного

Перший рецепт — звичайний повнотекстовий пошук: BM25, Elasticsearch або вбудований пошук PostgreSQL. Запит нічого не коштує, результати повертаються швидше ніж за десять мілісекунд, застарівання моделі його не зламає, і не потрібні ні стратегія чанкінгу, ні набір для оцінювання. Натомість він не ловить синоніми й не відповідає на розмовні запитання.

Другий рецепт — агентне переформулювання запиту: мовна модель перетворює неохайне питання на чисті ключові слова, прибирає службові слова, додає синоніми й розбиває складні запити. Заявлена вартість — близько $0,001 за запит із малою моделлю, а покращення означає редагування промпту, а не повторне занурення всього корпусу.

Далі йде гібридний пошук: BM25 відбирає від 50 до 100 кандидатів, які embedding-модель переранжує до десяти. За ціною text-embedding-3-small ($0,02 за мільйон токенів) занурення 50 документів приблизно по 500 токенів коштує близько $0,0005 за запит — приблизно $15 на місяць за тисячу запитів на день. Справжня ціна — затримка: плюс 200–500 мілісекунд на запит.

Решта три рецепти — це занурення «на льоту» для дуже мінливих даних, поділ на гарячий і холодний рівні, де заздалегідь занурюють лише 20 відсотків документів, що отримують 80 відсотків трафіку, і повне попереднє занурення для великих стабільних корпусів. Попереднє занурення мільйона документів коштує близько $10 одноразово плюс $10–30 на місяць за зберігання, але зміна моделі пізніше коштує $10 000 за повного занурення, $2 000 для гарячого рівня і нічого — за підходу «на льоту».

Запити з кількома намірами

Реальні користувачі ставлять складені запитання: прочитати CSV-файл, очистити пропущені значення й побудувати графік — це три окремі наміри. Системи на кшталт Perplexity розкладають їх на частини, спрямовують кожен підзапит до найдешевшого достатнього методу й синтезують одну відповідь. За підрахунками автора, це $0,002 за запит проти $0,03 без декомпозиції.

Підсумок

Практичне правило: близько 60 відсотків систем мають зупинитися на повнотекстовому пошуку з переформулюванням запитів, 25 відсоткам потрібен гібрид із зануренням «на льоту» або гарячим рівнем, і лише 10 відсотків виправдовують повне попереднє занурення. Починайте з найпростішого, два-чотири тижні вимірюйте якість власного пошуку й рухайтеся далі списком лише тоді, коли цього вимагають дані.

SSiTech

SiTech — веброзробка з підтримкою AI

Створюємо швидкі та сучасні сайти й інтегруємо AI у бізнес-процеси. Маєте проєкт чи запитання? Із задоволенням допоможемо.