العودة
RAG أبسط مما تظن: ست معماريات لتجنّب التعقيد غير الضروري
SiTech AI Team3 წთ. საკითხავი

RAG أبسط مما تظن: ست معماريات لتجنّب التعقيد غير الضروري

يرى كاتب نشرة Lighthouse أن معظم أنظمة RAG مبالغ في تعقيدها: قبل الانتقال إلى التضمينات وقواعد البيانات المتجهية يكفي غالباً البدء بالبحث النصي الكامل الذي لا يكلّف شيئاً تقريباً.

لماذا يُفرَط في تعقيد البحث

تقفز معظم الفرق التي تبني أنظمة التوليد المعزز بالاستدعاء (RAG) مباشرة إلى التضمينات وقواعد البيانات المتجهية ومراحل إعادة الترتيب، في حين يريد المستخدمون فقط العثور على المستند الذي يشرح كيفية إعادة تعيين كلمة المرور. في الهندسة لكل مشكلة أداتها المناسبة، كما تكتب نشرة Lighthouse Newsletter، وأنظمة البحث ليست استثناء.

قبل اختيار البنية، يقترح المقال موازنة خمسة عوامل: مدى حداثة البيانات المطلوبة، وحجم المجموعة ومدى تقلبها، وطبيعة الاستعلامات الواردة، والحجم المتوقع للاستعلامات، وخبرة الفريق في تعلم الآلة.

ست وصفات من الأبسط إلى الأكثر تعقيداً

الوصفة الأولى بحث نصي كامل بسيط: BM25 أو Elasticsearch أو البحث المدمج في PostgreSQL. لا يكلّف الاستعلام شيئاً، وتصل النتائج في أقل من عشر ملي ثوانٍ، ولا يفسده تقادم أي نموذج، ولا يحتاج إلى استراتيجية تقسيم ولا إلى مجموعة تقييم. لكنه يفوّت المترادفات ولا يجيب عن أسئلة بصيغة المحادثة.

الوصفة الثانية هي إعادة صياغة الاستعلام بوكيل ذكي: يحوّل نموذج لغوي سؤالاً مرتبكاً إلى كلمات مفتاحية نظيفة، ويحذف كلمات الحشو، ويضيف المترادفات، ويقسّم الطلبات المعقدة. التكلفة المذكورة نحو 0,001 دولار للاستعلام بنموذج صغير، والتحسين يعني تعديل التوجيه بدلاً من إعادة تضمين المجموعة كاملة.

ثم يأتي البحث الهجين: يختار BM25 ما بين 50 و100 مرشح، ويعيد نموذج التضمين ترتيبها إلى عشرة. بسعر text-embedding-3-small البالغ 0,02 دولار لكل مليون رمز، يكلّف تضمين 50 مستنداً بمعدل 500 رمز لكل منها نحو 0,0005 دولار للاستعلام، أي نحو 15 دولاراً شهرياً عند ألف استعلام يومياً. أما التكلفة الحقيقية فهي زمن الاستجابة: من 200 إلى 500 ملي ثانية تُضاف لكل استعلام.

الوصفات الثلاث الباقية هي التضمين الفوري للمجموعات سريعة التغير، وتقسيم الطبقة الساخنة والباردة الذي يضمّن مسبقاً فقط 20 بالمئة من المستندات التي تستقبل 80 بالمئة من الحركة، والتضمين المسبق الكامل للمجموعات الكبيرة المستقرة. يكلّف التضمين المسبق لمليون مستند نحو 10 دولارات مرة واحدة، مع 10 إلى 30 دولاراً شهرياً للتخزين، لكن تغيير نموذج التضمين لاحقاً يكلّف 10,000 دولار إذا كان كل شيء مضمنّاً مسبقاً، و2,000 دولار للطبقة الساخنة، ولا شيء على الإطلاق في التضمين الفوري.

أسئلة بعدة نوايا

يطرح المستخدمون أسئلة مركّبة: قراءة ملف CSV وتنظيف القيم الناقصة ورسم النتيجة بيانياً، وهي ثلاث نوايا منفصلة. تفكك أنظمة مثل Perplexity هذه الأسئلة، وتوجّه كل استعلام فرعي إلى أرخص طريقة كافية، ثم تجمع إجابة واحدة. وبحسب حسابات النشرة تبلغ التكلفة 0,002 دولار للاستعلام مقابل 0,03 دولار دون تفكيك.

الخلاصة

القاعدة العملية المقترحة: ينبغي لنحو 60 بالمئة من الأنظمة أن تتوقف عند البحث النصي الكامل مع إعادة صياغة الاستعلام، و25 بالمئة تحتاج إلى نهج هجين بالتضمين الفوري أو الطبقة الساخنة، و10 بالمئة فقط تبرّر التضمين المسبق الكامل. ابدأ بالأبسط، وقِس جودة بحثك أسبوعين إلى أربعة، وانزل في القائمة فقط حين تفرض البيانات ذلك.

SSiTech

SiTech — تطوير ويب مدعوم بالذكاء الاصطناعي

نبني مواقع سريعة وعصرية وندمج الذكاء الاصطناعي في سير عمل الشركات. لديك مشروع أو سؤال؟ يسعدنا مساعدتك.