OpenJev-ը որոշման մոդելը աշխատեցնում է անմիջապես բրաուզերում
openjev.com-ը տեղական փորձարկում է, որտեղ միևնույն մոդելին նույն որոշումը տրվում է երկու եղանակով՝ ընտրության լոգիտների ուղիղ ընթերցում և բաշխման JSON գեներացիա թոքեն առ թոքեն։ Բոլոր չափումները կատարվում են օգտվողի GPU-ում։
openjev.com կայքն իրեն ներկայացնում է որպես կենդանի, տեղական փորձարկում SemIf անվանումով՝ «սեմանտիկ if-եր բաց մոդելներից, ձեր բրաուզերում»։ Այստեղ գրանցում կամ սպասման ցուցակ չկա. օգտվողն ընտրում է մոդելի չափը, բեռնում այն իր GPU-ում և համեմատում միևնույն կշիռներից որոշում ստանալու երկու եղանակ։ Ոչինչ սերվեր չի ուղարկվում, և էջը հստակ նշում է, որ մուտքային տվյալները չեն լքում այն։
Մեկ հարց՝ երկու ուղի
Փորձարկումը մեկ որոշում՝ վիճակ, հարց և թույլատրված տարբերակների ցանկ, տալիս է մեկ տեղական մոդելի և պատասխանում երկու ուղիով։ Առաջինն ուղիղ ընթերցումն է. կոդը կարդում է մոդելի ընտրության լոգիտները և նորմալացնում դրանք միայն տրված տարբերակների շրջանակում՝ առանց վերծանման փուլի։ Երկրորդը գեներացիան է. նույն մոդելին խնդրում են գնահատել նույն բաշխումը և գրել այն JSON-ով՝ թոքեն առ թոքեն։
Երկու աշխատանքներն էլ հաջորդականությամբ կատարվում են նույն բեռնված մոդելի վրա, որպեսզի չմրցեն մեկ GPU-ի համար. սկզբում ուղիղ ընթերցումն է, ապա՝ գեներացիան։
Չափումները կատարվում են օգտվողի սարքում
Էջը performance.now()-ի միջոցով չափում է բեռնումը, տաքացումը, հարցման պատրաստումը, ուղիղ կատարումը, առաջին գեներացված թոքենը և գեներացիայի ավարտը։ Կայքը նշում է, որ նախապես պատրաստված արդյունքներ չկան. էկրանին երևացող հարաբերակցությունը հենց օգտվողի սարքավորումով ստացված արդյունքն է։
Ինչ չեն նշանակում այս թվերը
Հրապարակված բացատրությունները բավական զգույշ են. ուղիղ ընթերցման միավորները softmax են միայն էկրանին ցուցադրված տարբերակների թոքենների վրա. դա չափորոշված վստահություն չէ և չի ընդգրկում բոլոր պատասխանները, որոնք մոդելը կարող էր նախընտրել։ Desktop-ի կանխադրված մոդելը MiniCPM5 2B-ն է (1,56 ԳԲ). հեռախոսների և թույլ սարքերի համար խորհուրդ է տրվում Qwen3 0.6B, իսկ 4B տարբերակը զգալիորեն ավելի շատ հիշողություն է պահանջում։ Դրանցից ոչ մեկը չի հայտարարվում որպես Jev-ի հրապարակված արժեքներին հավասար։
Կշիռները ներբեռնվում են Hugging Face-ից և մնում բրաուզերի քեշում. օգտագործվում են wllama-ի միջոցով ամրագրված GGUF կառուցվածքներ։ Քվանտացումը կարող է փոխել և՛ որակը, և՛ արագությունը, իսկ էջը զգուշացնում է, որ առաջին բեռնումը կարող է տևել մի քանի րոպե՝ կախված մոդելից, ցանցից և GPU-ից։
SiTech — AI-ով հզորացված վեբ մշակում
Ստեղծում ենք արագ ու ժամանակակից կայքեր և AI-ը ներդնում իրական բիզնես գործընթացներում։ Ունե՞ք նախագիծ կամ հարց։ Ուրախ կլինենք օգնել։