
RAG-ը ավելի պարզ է, քան թվում է. վեց ճարտարապետություն առանց ավելորդ բարդության
Lighthouse Newsletter-ի հեղինակի կարծիքով RAG համակարգերի մեծ մասը չափազանց բարդացված է. embeddings-ին ու վեկտորային բազաներին անցնելուց առաջ արժե սկսել ամբողջատեքստային որոնումից։
Ինչու որոնումը չափից դուրս բարդացնում են
Retrieval-augmented generation (RAG) համակարգեր կառուցող թիմերի մեծ մասը անմիջապես անցնում է embeddings-ներին, վեկտորային տվյալների բազաներին և reranking-ի փուլերին, մինչդեռ օգտատերերը պարզապես ուզում են գտնել այն փաստաթուղթը, որտեղ գրված է, թե ինչպես փոխել գաղտնաբառը։ Ինժեներիայում յուրաքանչյուր խնդրի համար կա իր գործիքը, գրում է Lighthouse Newsletter-ը, և որոնողական համակարգերը բացառություն չեն։
Ճարտարապետություն ընտրելուց առաջ հարկավոր է կշռել հինգ գործոն՝ որքան թարմ պետք է լինեն տվյալները, ինչ չափի և որքան փոփոխական է կորպուսը, ինչպիսի հարցումներ են գալիս, ինչ ծավալ է սպասվում և ինչ փորձ ունի թիմը մեքենայական ուսուցման մեջ։
Վեց բաղադրատոմս՝ նվազագույնից բարդին
Առաջին բաղադրատոմսը սովորական ամբողջատեքստային որոնումն է՝ BM25, Elasticsearch կամ PostgreSQL-ի ներկառուցված որոնումը։ Հարցումը ոչինչ չարժե, պատասխանը գալիս է տասը միլիվայրկյանից արագ, մոդելի հնացումը ոչինչ չի փչացնի, և ոչ chunking-ի ռազմավարություն է պետք, ոչ գնահատման հավաքածու։ Փոխարենը այն բաց է թողնում հոմանիշները և չի պատասխանում զրույցային հարցերին։
Երկրորդը գործակալային վերաձևակերպումն է՝ լեզվական մոդելը խառն հարցը դարձնում է մաքուր հիմնաբառեր, հեռացնում է ավելորդ բառերը, ավելացնում հոմանիշներ և բարդ հարցումը բաժանում մասերի։ Փոքր մոդելով մեկ հարցման արժեքը մոտ 0,001 դոլար է, իսկ լավացումը նշանակում է prompt-ի խմբագրում, ոչ թե ամբողջ կորպուսի վերստին embedding։
Հետո գալիս է հիբրիդային որոնումը՝ BM25-ը ընտրում է 50–100 թեկնածու, որոնք embedding մոդելը վերադասավորում է մինչև տասը։ text-embedding-3-small-ի գնով (0,02 դոլար միլիոն token-ի համար) մոտ 500 token-անոց 50 փաստաթղթի embedding-ը մեկ հարցման համար կազմում է մոտ 0,0005 դոլար՝ ամսական մոտ 15 դոլար օրական հազար հարցման դեպքում։ Իսկական ծախսը ուշացումն է՝ յուրաքանչյուր հարցմանը ավելանում է 200–500 միլիվայրկյան։
Մնացած երեք բաղադրատոմսերն են՝ embedding «թռիչքի ընթացքում» հաճախ փոփոխվող տվյալների համար, տաք և սառը շերտերի բաժանում, որտեղ նախապես embedding են ստանում միայն այն 20 տոկոսը, որ ստանում է երթևեկության 80 տոկոսը, և ամբողջական նախնական embedding մեծ ու կայուն կորպուսների համար։ Միլիոն փաստաթղթի ամբողջական embedding-ը մոտ 10 դոլար է մեկ անգամ, պահոցը՝ ամսական 10–30 դոլար, սակայն մոդելը փոխելը հետագայում արժե 10 000 դոլար, եթե ամեն ինչ նախապես embedding-ված է, 2 000 դոլար՝ տաք շերտի դեպքում և ոչինչ՝ «թռիչքի ընթացքում» մոտեցմամբ։
Մի քանի մտադրությամբ հարցեր
Իրական օգտատերերը բաղադրյալ հարցեր են տալիս՝ կարդալ CSV ֆայլը, մաքրել բացակայող արժեքները և գրաֆիկ կառուցել. դրանք երեք առանձին մտադրություններ են։ Perplexity-ի նման համակարգերը դրանք բաժանում են մասերի, ուղղորդում յուրաքանչյուր ենթահարցում ամենաէժան բավարար մեթոդին և միավորում մեկ պատասխանում։ Հոդվածի հաշվարկով դա մեկ հարցման համար 0,002 դոլար է, առանց տրոհման՝ 0,03 դոլար։
Ամփոփում
Հեղինակի գործնական կանոնը՝ համակարգերի մոտ 60 տոկոսը պետք է կանգ առնի ամբողջատեքստային որոնման և հարցումների վերաձևակերպման վրա, 25 տոկոսին պետք է հիբրիդային մոտեցում, և միայն 10 տոկոսն է արդարացնում ամբողջական նախնական embedding։ Սկսեք ամենապարզից, երկուսից չորս շաբաթ չափեք ձեր որոնման որակը և ցանկով ներքև իջեք միայն այն ժամանակ, երբ տվյալները դա պահանջում են։
SiTech — AI-ով հզորացված վեբ մշակում
Ստեղծում ենք արագ ու ժամանակակից կայքեր և AI-ը ներդնում իրական բիզնես գործընթացներում։ Ունե՞ք նախագիծ կամ հարց։ Ուրախ կլինենք օգնել։