
LLM մատակարարները հաճախ 32K կոնտեքստ են տալիս՝ անկախ մոդելի քարտից
Բաց կշիռներով մոդելների վրա հոսթինգային չաթի և կոդի գործակալ աշխատեցնող մշակողը հայտնում է, որ ստուգած endpoint-ների մեծ մասը տալիս է մոտ 32K token՝ անկախ հայտարարված կոնտեքստի պատուհանից, և կտրումը տեղի է ունենում լուռ, առանց սխալի։
dev.to-ում սեպտեմբերի 26-ին հրապարակված գրառմամբ բաց կշիռներով մոդելների վրա աշխատող գործակալի հեղինակը զգուշացնում է. մոդելի քարտի կոնտեքստի պատուհանը հազվադեպ է համընկնում endpoint-ի իրական պատուհանի հետ։
Քարտի վրա գրված թիվը ստացած թիվը չէ
Քարտի պատուհանը կշիռների հատկություն է, իսկ օգտատիրոջ ստացած պատուհանը կախված է նրանից, թե ով է հոսթինգ անում դրանք։ Հեղինակի ստուգած endpoint-ների մեծ մասը տալիս է մոտ 32K token՝ անկախ քարտի պնդումից, մի քանիսը հասնում են 256K-ի, իսկ 1M ցուցանիշը դեռ ոչ մի endpoint-ում չի հանդիպել։
Օպերատորն ունի պատճառ. առավելագույն երկարությունը KV-cache-ի բյուջե է՝ կապված զուգահեռ հարցումների հետ, և միլիոն token ամեն հարցման չափազանց թանկ կնստեր։ Փոխզիջումը երբեք չի փաստաթղթավորվում և ձախողվում է լուռ։
Ոչ մի սխալ չի վերադառնում
Ոչ 413, ոչ էլ նախազգուշացում։ Հարցումը սպասարկվում է ամենացածր առաստաղով, և կոնտեքստի սկիզբը պարզապես անհետանում է։ Չաթում դա գրեթե աննկատ է. զրույցը ժամանակի հետ մի փոքր անհեթեթանում է։
Գործակալային սցենարներում սա որոշիչ սահմանափակումն է. երկար build-ը հասնում է առաստաղին, միանում է compaction-ը, նպատակի նկարագրությունը դառնում է անորոշ, և մոդելը, չիմանալով, թե ինչ էր անում, լուռ սկսում է պլանը նորից։ Դրսից դա վատ աշխատող մոդելի տպավորություն է թողնում, սակայն պատճառը հոսթինգի կարգավորումն է։
Ինչպես գտնել իրական առաստաղը
Ուղարկեք դիտավորյալ չափազանց մեծ հարցում և կարդացեք սխալը. մատակարարները սովորաբար սխալի տեքստում բացահայտում են իրական առավելագույնը, ուստի 1M խոստացող endpoint-ին 500K token ուղարկելը ցույց կտա իրական պատասխանը։ Երկրորդ եղանակը կոպիտ է. գտեք այն պահը, երբ ամենավաղ բովանդակությունը դադարում է ազդել պատասխանի վրա, և հետ հաշվեք։
Ըստ հեղինակի՝ ոչ փաստաթղթերը, ոչ քարտը վստահելի չեն եղել։
Երեք հետևանք, որոնք արժե յուրացնել
Benchmark-ի միավորը գնահատական է կոնտեքստի մեկ կոնկրետ երկարությամբ, ոչ թե մոդելի բնութագիր. նույն կշիռները 32K-ում և 200K-ում նույն գործակալը չեն։ Մատակարարներին token-ի գնով համեմատելը առանց իրական առաստաղը ֆիքսելու սխալ պատկեր է տալիս։
fallback-ներով gateway-ում առաստաղը կարող է փոխվել սեսիայի կեսին. 200K-ից 32K-ի անցած աշխատանքը սխալ չի վերադարձնում, այլ կտրում է կոնտեքստը։ Սա ճշգրտության, ոչ թե արտադրողականության խնդիր է։
RAG-ում սա լուռ չեղարկում է որոնման կարգավորումները. chunk-ի չափը, top-k-ն և reranking-ը կարգավորվում են քարտից վերցված բյուջեի համար։ 32K ստացող, 128K-ի համար լարված համակարգը չափից շատ է քաշում, վերադասավորված chunk-ները կտրվում են, և պատասխանը վերադառնում է ինքնավստահ ու սխալ. թիմն այնուհետև կարգավորում է embedding-ի մոդելը, որը խնդիրը չէր։
Հեղինակի ցանկությունը կարճ է. հնարավորություն կարդալու յուրաքանչյուր հարցման գործող կոնտեքստը՝ մոդելի մետատվյալներում կամ պատասխանի header-ում։ Նա ստեղծում է Grunz-ը՝ չաթի և կոդի գործակալ բաց կշիռներով մոդելների վրա։
SiTech — AI-ով հզորացված վեբ մշակում
Ստեղծում ենք արագ ու ժամանակակից կայքեր և AI-ը ներդնում իրական բիզնես գործընթացներում։ Ունե՞ք նախագիծ կամ հարց։ Ուրախ կլինենք օգնել։