
Jeff. Jev-ի հետ համատեղելի 0,8B որոշումների մոդելներ՝ մարզված մեկ տեղական GPU-ով
Բաց կոդով Jeff նախագիծը Qwen3.5-ը և Gemma 4-ը դարձնում է փոքր zero-shot դասակարգիչներ, որոնք մեկ ուղիղ անցումով վերադարձնում են յուրաքանչյուր տարբերակի կալիբրացված հավանականությունը։
GitHub-ում հրապարակվել է Jeff բաց կոդով նախագիծը. այն Qwen3.5-ի և Gemma 4-ի փոքր՝ 0,8B և 2B մոդելները վերածում է դասակարգիչների, որոնք օգտագործում են Jev-ի նույն հարցման ձևաչափը։ Օգտվողը բառերով նկարագրում է իրավիճակը և տարբերակները, իսկ մոդելը մեկ ուղիղ անցումով վերադարձնում է յուրաքանչյուր տարբերակի կալիբրացված հավանականությունը։ Տեքստ չի գեներացվում, ուստի պատասխանը վերլուծել պետք չէ։ Որոշումը տևում է մոտ 22 միլիվայրկյան NVIDIA RTX PRO 6000-ում և 28 միլիվայրկյան Apple M4 Max-ում՝ MLX-ի միջոցով։
Ինչ է Jeff-ը
zero-shot եղանակում տարբերակները կարող են լինել ցանկացած բան՝ աջակցության հերթեր, օգտվողի մտադրություններ, մոդերացիայի պիտակներ կամ խաղաքայլեր։ Ուսուցման տվյալներում դրանք պարտադիր չէ, որ լինեն, քանի որ նկարագրվում են հարցման մեջ։ Hugging Face-ում հրապարակվել է երեք մոդել՝ Jeff-Qwen3.5-0.8B, Jeff-Qwen3.5-2B և Jeff-Gemma4-E2B։ Մեկ հարցումը կարող է պարունակել մի քանի անկախ հարց։
Բենչմարքների արդյունքները
Մոդելները ստուգվել են հինգ հանրային բենչմարքի 4 599 հարցերում, իսկ JevBench-ի բարդ մակարդակը՝ առանձին՝ 105 միավորում։ Ընդհանուր միավորով Jeff-Qwen3.5-2B հասնում է 83,1-ի, Jeff-Gemma4-E2B՝ 81,6-ի, Jeff-Qwen3.5-0.8B՝ 79,1-ի, մինչդեռ Jev-ի հրապարակված ցուցանիշը 83,0 է։ Financial PhraseBank-ում փոքր մոդելները բարձրանում են մինչև 96,4՝ 77,0-ի դիմաց, իսկ մտածողություն պահանջող թեստերում հետ են մնում՝ BBH-ում 64,0՝ 94,3-ի դիմաց։ Հեղինակները գրում են, որ ընդհանուր միավորը գալիս է դասակարգման առաջադրանքներից, որտեղ փոքր մոդելները չեն զիջում մեծերին։

Ուսուցումը տեղական սարքավորանքով
Նախագիծը ստեղծվել է տեղական սարքավորանքով. 0,8B մոդելը մարզվում է մոտ երկու ժամում մեկ RTX PRO 6000 աշխատանքային կայանի GPU-ում, իսկ 2B-ը՝ երեքուկես ժամում։ Սինթետիկ ուսուցման տվյալները գրել է բաց մոդել Qwen3.8-Flash-Next-ը երկու DGX Spark-ում, թեստավորումը կատարվել է MacBook-ում։ Ամպային GPU չի օգտագործվել, և ուսուցման տվյալների մեջ չի հայտնվել փակ մոդելի արդյունք։ Jeff-ը անկախ նախագիծ է և կապված չէ TypeSafe-ի հետ, որը ստեղծել է Jev-ը։ Կոդը տարածվում է MIT, իսկ կշիռները՝ Apache 2.0 լիցենզիայով։
Խաղերը և սահմանափակումները
zero-shot ունակությունը ստուգելու համար Jeff-ը խաղացել է երեք խաղ. Doom-ում՝ 6,55 սպանություն, նույնը, ինչ ձեռքով գրված կանոնների բոտը, Frogger-ում՝ 10,3 անցում՝ չմարզված մոդելի 1,0-ի դիմաց, Pac-Man-ում՝ 98-ից 57,0 գնդիկ՝ 25,8-ի դիմաց, M4 Max-ում՝ 29-49 միլիվայրկյան մեկ քայլի համար։ Հեղինակները թվարկում են նաև սահմանափակումները. մոդելները չեն մտածում, աշխատում են միայն անգլերեն տեքստի հետ, իսկ 2B-ը խաղերում ավելի թույլ է։ Սեփական օրինակներով կարճ նուրբ լարումը շատ բան է փոխում. ձայնային նավիգացիայի տարբերակը մոտ 11 հազար օրինակով ճշգրտությունը 31,7%-ից բարձրացրել է մինչև 95,8%՝ կես ժամից քիչ ժամանակում։
SiTech — AI-ով հզորացված վեբ մշակում
Ստեղծում ենք արագ ու ժամանակակից կայքեր և AI-ը ներդնում իրական բիզնես գործընթացներում։ Ունե՞ք նախագիծ կամ հարց։ Ուրախ կլինենք օգնել։