
AI գործակալները ձախողվում են ակնհայտ առաջադրանքներում. խնդիրը որոնումն է, ոչ դատողությունը՝ 49% և 67%
Ծրագրավորող Լարս Վինսթանդը պնդում է, որ «գործակալը հիմար է» բագերի մեծ մասը որոնման ձախողում է, ոչ դատողության։ Anthropic-ի տվյալներով ձախողված որոնումները նվազում են 49%-ով, reranking-ով՝ 67%-ով։
Գործակալը, որը կարող է ամփոփել երկար PDF, ճիշտ կանչել API և կատարել բազմաքայլ աշխատահոսք, այնուամենայնիվ բաց է թողնում քաղաքականության փաստաթղթում թաղված վերադարձի ժամկետը, ընտրում է սխալ SKU կամ մոռանում է տասը վայրկյան առաջ ստացած գործիքի արդյունքը։ DEV Community-ում հրապարակված գրառման մեջ ծրագրավորող Լարս Վինսթանդը պնդում է, որ «գործակալը հիմար է» բագերի մեծ մասը դատողության ձախողում չէ, այլ ձախողված որոնում, և դա փոխում է այն, թե որտեղից պետք է սկսել վրիպազերծումը։
Ձախողումը դատողության տեսք ունի, բայց այդպիսին չէ
Վինսթանդի նկարագրած օրինաչափությունը ծանոթ է աջակցության բոտերից և ներքին համագործակալներից. գործակալը հաղթահարում է բարդ մասերը, հետո բաց է թողնում մեկ ակնհայտ քայլ։ Դա ընկալվում է որպես վատ դատողություն, սակայն սովորաբար մեկ կոնկրետ փաստ բացակայում էր մեկ կոնկրետ պահի։ «Սա դատողության ձախողում չէ։ Սա ձախողված որոնում է», գրում է նա։
Anthropic-ի թվերը՝ 49% և 67%
Փաստարկը հիմնվում է Anthropic-ի Contextual Retrieval հետազոտության վրա. երբ հատվածները համատեքստայինացվում են և միավորվում սեմանտիկ որոնման ու Contextual BM25-ի հետ, ձախողված որոնումների թիվը նվազում է 49%-ով։ Վերադասավորման ավելացումը ցուցանիշը բարձրացնում է մինչև 67%։ Ստանդարտ RAG-ը՝ սովորական բաժանում և մաքուր սեմանտիկ որոնում, համադրելի թիվ չի ներկայացնում։
Երկար համատեքստն ու վեկտորային որոնումը բավարար չեն
Երկու տարածված ենթադրություն չի դիմանում։ Առաջին՝ ամբողջ փաստաթղթաշարը մոդելին տալը չի երաշխավորում, որ այն կօգտագործի ճիշտ հատվածը. «Lost in the Middle» էֆեկտի պատճառով մոդելները հաճախ ավելի վատ են աշխատում, երբ կարևոր փաստը երկար հուշման մեջտեղում է։ Երկրորդ՝ մաքուր embedding որոնումը պարտվում է ճշգրիտ համընկնումների դեպքում՝ պատվերի ID-ներ, քաղաքականության վերնագրեր, ապրանքի SKU-ներ, աշխատահոսքի անուններ, սխալի կոդեր և տոմսերի համարներ։ Հիբրիդ որոնումը՝ հիմնաբառ, սեմանտիկ և վերադասավորում միասին, ավելի հուսալի է իրական համակարգերում։
Նախ վրիպազերծեք որոնման շերտը
Վինսթանդի ստուգաթերթը սկսվում է գործակալի տեսած ճշգրիտ համատեքստի գրանցումից՝ ստացված հատվածներ, նախորդ հաղորդագրություններ, գործիքների արդյունքներ, համակարգային հուշում և ներարկված հիշողություն։ «Եթե չեք կարող ստուգել վերջնական հուշման վիճակը, վրիպազերծում եք կույր»։ Այնուհետև պետք է տարանջատել սեսիայի հիշողությունը, մշտական հիշողությունը և որոնումը. դրանք երեք տարբեր դեպքեր են։ Ավելացրեք հիմնաբառային որոնում բառացի տերմինների համար, կիրառեք վերադասավորում մոդելը փոխելուց առաջ և ստուգեք, թե որտեղ է կրիտիկական փաստը հուշման մեջ։
Վերջին կետը ճարտարապետական է՝ եթե գիտելիքների բազան հարմար տեղավորվում է համատեքստում՝ մոտավորապես մինչև 200 000 տոկեն, Anthropic-ը խորհուրդ է տալիս ընդհանրապես հրաժարվել RAG-ից, իսկ հուշումների քեշավորումը կարող է ավելի քան կրկնակի նվազեցնել ուշացումը և մինչև 90%՝ ծախսերը։ Նրա կանոնը՝ երբ գործակալը ձախողում է ակնհայտ առաջադրանքը, հարցրեք, թե ինչ վերադարձրեց որոնումը, որտեղ հայտնվեց փաստը, կար արդյոք ճշգրիտ համընկնման որոնում, աշխատե՞ց վերադասավորումը և տեսա՞վ գործակալը ճիշտը օգտագործելի ձևով։
SiTech — AI-ով հզորացված վեբ մշակում
Ստեղծում ենք արագ ու ժամանակակից կայքեր և AI-ը ներդնում իրական բիզնես գործընթացներում։ Ունե՞ք նախագիծ կամ հարց։ Ուրախ կլինենք օգնել։