Վերադառնալ
LLM մատակարարները հաճախ 32K կոնտեքստ են տալիս՝ անկախ մոդելի քարտից
SiTech AI Team2 წთ. საკითხავი

LLM մատակարարները հաճախ 32K կոնտեքստ են տալիս՝ անկախ մոդելի քարտից

Բաց կշիռներով մոդելների վրա հոսթինգային չաթի և կոդի գործակալ աշխատեցնող մշակողը հայտնում է, որ ստուգած endpoint-ների մեծ մասը տալիս է մոտ 32K token՝ անկախ հայտարարված կոնտեքստի պատուհանից, և կտրումը տեղի է ունենում լուռ, առանց սխալի։

dev.to-ում սեպտեմբերի 26-ին հրապարակված գրառմամբ բաց կշիռներով մոդելների վրա աշխատող գործակալի հեղինակը զգուշացնում է. մոդելի քարտի կոնտեքստի պատուհանը հազվադեպ է համընկնում endpoint-ի իրական պատուհանի հետ։

Քարտի վրա գրված թիվը ստացած թիվը չէ

Քարտի պատուհանը կշիռների հատկություն է, իսկ օգտատիրոջ ստացած պատուհանը կախված է նրանից, թե ով է հոսթինգ անում դրանք։ Հեղինակի ստուգած endpoint-ների մեծ մասը տալիս է մոտ 32K token՝ անկախ քարտի պնդումից, մի քանիսը հասնում են 256K-ի, իսկ 1M ցուցանիշը դեռ ոչ մի endpoint-ում չի հանդիպել։

Օպերատորն ունի պատճառ. առավելագույն երկարությունը KV-cache-ի բյուջե է՝ կապված զուգահեռ հարցումների հետ, և միլիոն token ամեն հարցման չափազանց թանկ կնստեր։ Փոխզիջումը երբեք չի փաստաթղթավորվում և ձախողվում է լուռ։

Ոչ մի սխալ չի վերադառնում

Ոչ 413, ոչ էլ նախազգուշացում։ Հարցումը սպասարկվում է ամենացածր առաստաղով, և կոնտեքստի սկիզբը պարզապես անհետանում է։ Չաթում դա գրեթե աննկատ է. զրույցը ժամանակի հետ մի փոքր անհեթեթանում է։

Գործակալային սցենարներում սա որոշիչ սահմանափակումն է. երկար build-ը հասնում է առաստաղին, միանում է compaction-ը, նպատակի նկարագրությունը դառնում է անորոշ, և մոդելը, չիմանալով, թե ինչ էր անում, լուռ սկսում է պլանը նորից։ Դրսից դա վատ աշխատող մոդելի տպավորություն է թողնում, սակայն պատճառը հոսթինգի կարգավորումն է։

Ինչպես գտնել իրական առաստաղը

Ուղարկեք դիտավորյալ չափազանց մեծ հարցում և կարդացեք սխալը. մատակարարները սովորաբար սխալի տեքստում բացահայտում են իրական առավելագույնը, ուստի 1M խոստացող endpoint-ին 500K token ուղարկելը ցույց կտա իրական պատասխանը։ Երկրորդ եղանակը կոպիտ է. գտեք այն պահը, երբ ամենավաղ բովանդակությունը դադարում է ազդել պատասխանի վրա, և հետ հաշվեք։

Ըստ հեղինակի՝ ոչ փաստաթղթերը, ոչ քարտը վստահելի չեն եղել։

Երեք հետևանք, որոնք արժե յուրացնել

Benchmark-ի միավորը գնահատական է կոնտեքստի մեկ կոնկրետ երկարությամբ, ոչ թե մոդելի բնութագիր. նույն կշիռները 32K-ում և 200K-ում նույն գործակալը չեն։ Մատակարարներին token-ի գնով համեմատելը առանց իրական առաստաղը ֆիքսելու սխալ պատկեր է տալիս։

fallback-ներով gateway-ում առաստաղը կարող է փոխվել սեսիայի կեսին. 200K-ից 32K-ի անցած աշխատանքը սխալ չի վերադարձնում, այլ կտրում է կոնտեքստը։ Սա ճշգրտության, ոչ թե արտադրողականության խնդիր է։

RAG-ում սա լուռ չեղարկում է որոնման կարգավորումները. chunk-ի չափը, top-k-ն և reranking-ը կարգավորվում են քարտից վերցված բյուջեի համար։ 32K ստացող, 128K-ի համար լարված համակարգը չափից շատ է քաշում, վերադասավորված chunk-ները կտրվում են, և պատասխանը վերադառնում է ինքնավստահ ու սխալ. թիմն այնուհետև կարգավորում է embedding-ի մոդելը, որը խնդիրը չէր։

Հեղինակի ցանկությունը կարճ է. հնարավորություն կարդալու յուրաքանչյուր հարցման գործող կոնտեքստը՝ մոդելի մետատվյալներում կամ պատասխանի header-ում։ Նա ստեղծում է Grunz-ը՝ չաթի և կոդի գործակալ բաց կշիռներով մոդելների վրա։

SSiTech

SiTech — AI-ով հզորացված վեբ մշակում

Ստեղծում ենք արագ ու ժամանակակից կայքեր և AI-ը ներդնում իրական բիզնես գործընթացներում։ Ունե՞ք նախագիծ կամ հարց։ Ուրախ կլինենք օգնել։