
GPT-6 Astra-ի 272K թոքենի հավելավճարը թանկացնում է ամբողջ հարցումը, ոչ միայն ավելցուկը
OpenAI-ի GPT-6 Astra-ն 272 000-ից ավելի մուտքային թոքենի հարցումները հաշվում է ամբողջությամբ կրկնակի մուտքային և 1,5 անգամ ելքային սակագնով, ինչը 5 000 թոքենի ավելցուկը մեկ կանչի համար մեծացնում է մոտ 3 դոլարով։
272K-ի շեմը
OpenAI-ն GPT-6 Astra-ն թողարկել է 2026 թվականի սեպտեմբերի 3-ին, իսկ հաջորդ օրերին աստիճանաբար տարածել է ChatGPT-ի սակագներում, API-ում և AWS Bedrock-ում։ Մոդելն ունի մոտ 1,05 միլիոն տոկենի կոնտեքստի պատուհան, գործիքների ավելի լավ օգտագործում և հրահանգների ավելի ճշգրիտ պահպանում; գինը 10 դոլար է միլիոն մուտքային տոկենի համար, 50 դոլար՝ միլիոն ելքային տոկենի համար և 1 դոլար՝ միլիոն քեշավորված մուտքային ընթերցման համար։ Գնային փաստաթղթերում թաքնված կանոնը փոխում է մաթեմատիկան. հարցումները, որտեղ մուտքային prompt-ը գերազանցում է 272 000 տոկենը, ամբողջ հարցումը հաշվարկվում է կրկնակի մուտքային և քեշի սակագներով, ինչպես նաև 1,5 անգամ ելքային սակագնով, և ոչ միայն գերազանցող մասի վրա։
Մաթեմատիկան
270 000 տոկեն մուտքային և 10 000 ելքային տոկեն ստանդարտ սակագներով արժե 3,20 դոլար։ Եթե մուտքայինը մեծացնեք մինչև 275 000 տոկեն, նույն հարցումը կարժենա 6,25 դոլար։ 5 000 տոկենի ավելացումը հաշիվը մեծացնում է 3,05 դոլարով, քանի որ շեմից առաջ եղած յուրաքանչյուր տոկեն հետադարձորեն վերահաշվարկվում է։ Եթե օրական 10 000 հարցումից 5%-ը գերազանցի շեմը, հավելավճարը օրական ավելացնում է մոտ 1 500 դոլար, տարեկան՝ ավելի քան կես միլիոն դոլար, և դա ամբողջությամբ պայմանավորված է այն prompt-երով, որոնք հայտնվել են սխալ կատեգորիայում։
Ինչու է մնում հեռաչափության տեսադաշտից դուրս
Երեք գործոն դժվարացնում է այս շեմը նկատելը արտադրությունում։ Տոկենների քանակը անհայտ է այնքան ժամանակ, քանի դեռ prompt-ը չի թոքենիզացվել, իսկ նշանների քանակով գնահատումը կոնտենտից կախված սխալվում է 10%-ից մինչև 20%։ API-ի պատասխանը վերադարձնում է ստանդարտ usage դաշտերը՝ առանց փաստաթղթավորված հավելավճարի դրոշի, ուստի թիմերը պետք է իրենք համեմատեն մուտքային տոկենները 272 000-ի հետ, յուրաքանչյուր հարցումում, իրենց մետրիկայի pipeline-ում։ Եվ քանի որ հավելավճարը վերաբերում է ամբողջ հարցումին, 275 000 տոկենի prompt-ը գրեթե նույնքան արժե, որքան 500 000 տոկենինը, մինչդեռ 270 000 տոկենի prompt-ը մոտ կիսով չափ արժե 275 000 տոկենի համեմատ։ Ամենախոցելի ծանրաբեռնվածություններն են երկար կոնտեքստի RAG pipeline-երը, գործակալի հետքը, որը կուտակում է գործիքների կանչեր և կրկնափորձեր, և կոդի վերանայումը մեծ diff-երի վրա։
Հայտնաբերումը և պաշտպանությունը
Առաջարկվող լուծումը տոկենի բյուջեի պահապանն է. ուղարկելուց առաջ հաշվեք prompt-ի տոկենները tiktoken-ով, 272 000-ից ցածր անվտանգության շեմով, և ահազանգեք, եթե p95 մուտքային տոկենները գերազանցում են 260 000-ը, որպեսզի շեմին մոտենալը նախապես բռնեք։ RAG pipeline-երի համար ընթերցված հատվածները տեղավորեք տոկենի բյուջեի մեջ, այլ ոչ թե ֆիքսված top-K քանակի վրա։ Գործակալների համար կրճատեք հաղորդագրությունների պատմությունը, հենց որ այն գերազանցի մոտ 200 000 տոկենը։ Իսկապես երկար ծանրաբեռնվածությունների համար prompt-ի քեշավորումը նույնիսկ շեմից վեր պահպանում է 10 անգամ ավելի էժան սակագին, մինչդեռ batch կամ flex սակագները լատենտության նկատմամբ հանդուրժող աշխատանքների համար գնանշվում են ստանդարտ սակագների 50%-ով։ Fast ռեժիմը, որը ստանդարտ սակագների կրկնապատիկն է, ավելանում է հավելավճարին և դրա հետ միասին չպետք է օգտագործվի։
Աղբյուրներ: Hackernoon
SiTech — AI-ով հզորացված վեբ մշակում
Ստեղծում ենք արագ ու ժամանակակից կայքեր և AI-ը ներդնում իրական բիզնես գործընթացներում։ Ունե՞ք նախագիծ կամ հարց։ Ուրախ կլինենք օգնել։