Վերադառնալ
Qwen 3.8 27B-ը Cerebras-ի հանրային վերջնակետերում՝ ~1850 տոկեն վայրկյանում
SiTech AI Team2 წთ. საკითხავი

Qwen 3.8 27B-ը Cerebras-ի հանրային վերջնակետերում՝ ~1850 տոկեն վայրկյանում

Cerebras-ը կատալոգում ավելացրել է Alibaba-ի 27B մուլտիմոդալ Qwen 3.8 27B մոդելը՝ 64K/128K կոնտեքստ, 0,99 դոլար մեկ միլիոն մուտքային տոկենի համար և ~1850 տոկեն վայրկյանում հանրային վերջնակետերում։

Cerebras-ն այժմ Qwen 3.8 27B-ն նշում է իր հանրային ինֆերենս վերջնակետերում մատուցվող մոդելների շարքում։ Alibaba-ի 27 միլիարդ պարամետր ունեցող մոդելը ընկերության մոդելների կատալոգում կանգնած է OpenAI-ի gpt-oss-120b-ի կողքին և նշված է վայրկյանում մոտ 1850 տոկեն արագությամբ։

Ինչ է նշված կատալոգում

Մոդելի նույնացուցիչը qwen-3.8-27b է։ Cerebras-ը նկարագրում է այն որպես Alibaba-ի 27B խիտ (dense) մուլտիմոդալ մոդել՝ գործակալային կոդավորման, գործիքների օգտագործման, հետազոտության և երկարատև աշխատանքային հոսքերի համար. այն ընդունում է տեքստ և պատկերներ և աջակցում է կարգավորվող դատողություն։ Կոնտեքստի պատուհանը 64 հազար տոկեն է (65 536) անվճար փորձնական սակագնում և 128 հազար (131 072) վճարովի սակագներում, առավելագույն ելքը՝ 32 հազար (32 768) և 40 հազար (40 960) տոկեն։ Գինը՝ 0,99 դոլար մեկ միլիոն մուտքային տոկենի համար և 1,49 դոլար մեկ միլիոն ելքային տոկենի համար։ Համեմատության համար նույն կատալոգում gpt-oss-120b-ը նշված է 120 միլիարդ պարամետրով, 65k/131k կոնտեքստով և վայրկյանում մոտ 3000 տոկենով։

Սահմանափակումներ և հնարավորություններ

Անվճար փորձնական սակագնում սահմանաչափերն են՝ 5 հարցում րոպեում, 30 հազար մուտքային տոկեն րոպեում, 90 հազար տոկեն րոպեում ընդհանուր, 1 միլիոն տոկեն օրական և մինչև 2 պատկեր մեկ հարցման համար։ Developer սակագինը թույլ է տալիս րոպեում 300 հարցում, 150 հազար մուտքային և 450 հազար ընդհանուր տոկեն րոպեում, մինչև 10 պատկեր մեկ հարցման համար՝ առանց օրական նշված սահմանի։ Աջակցվող հնարավորություններն են՝ պատկերների մուտք, դատողություն, սթրիմինգ, ընտրանքի պարամետրեր, կառուցվածքային ելք, գործիքների կանչ, զուգահեռ գործիքների կանչ և հուշումների քեշավորում։ Հասանելի են երկու վերջնակետ՝ Chat Completions և Completions։

Սահմանափակումներ, որոնք արժե իմանալ

Դատողությունը լռելյայն միացված է «high» մակարդակում. այն կարելի է անջատել reasoning_effort=none դնելով։ Պատկերների մուտքը աշխատում է միայն Chat Completions-ի միջոցով և միայն base64 կոդավորված PNG կամ JPEG տեսքով. արտաքին պատկերների հղումները, մանրամասնության կառավարումը, պատկերների գեներացումը, տեսանյութը և ձայնը չեն աջակցվում։ Completions վերջնակետը վերադարձնում է միայն տեքստ և չի աջակցում պատկերներ, դատողության կառավարում, կառուցվածքային հաղորդագրություններ կամ գործիքներ։

Չկտրված մոդելներ և սեղմում

Փաստաթղթերը նշում են, որ հանրային վերջնակետերի բոլոր մոդելները բնօրինակ, չկտրված տարբերակներ են։ Կշիռների քվանտացումը ընտրողական է և կիրառվում է միայն պահման համար՝ 16, 8 և 4 բիթ միջակայքում. զգայուն շերտերը պահվում են լրիվ ճշգրտությամբ, իսկ ապաքվանտացումը կատարվում է ընթացքում, մինչդեռ ակտիվացիաները, ուշադրության մեխանիզմը և KV քեշը մնում են ամբողջովին չքվանտացված։ REAP-ով կտրված մոդելները, որոնք ընկերության հետազոտության արդյունքն են, հրապարակված են Hugging Face-ում, բայց API-ով չեն մատուցվում։ Cerebras-ը հայտարարում է, որ առանց ծանուցման չի փոխի գործող մոդելների ճարտարապետությունը, իսկ ապագա կտրումները կառաջարկվեն որպես առանձին, հստակ անվանված վերջնակետեր։

SSiTech

SiTech — AI-ով հզորացված վեբ մշակում

Ստեղծում ենք արագ ու ժամանակակից կայքեր և AI-ը ներդնում իրական բիզնես գործընթացներում։ Ունե՞ք նախագիծ կամ հարց։ Ուրախ կլինենք օգնել։