
MicroLLM Lab-ը յոթ փոքր LLM է աշխատեցնում բրաուզերում
MicroLLM Lab բրաուզերային փորձը WebGPU-ի միջոցով ուղիղ սարքի վրա հնարավորություն է տալիս գործարկել, փորձարկել և համեմատել 26-360 միլիոն պարամետր ունեցող յոթ փոքր լեզվական մոդել՝ առանց սերվերի ու գրանցման։
Բրաուզերում աշխատող լաբորատորիա
stateofutopia.com/experiments/microllmlab հասցեում հրապարակված MicroLLM Lab-ը բրաուզերային փորձ է, որը փոքր լեզվական մոդելների (SLM) գործարկումը, փորձարկումը և համեմատությունը հնարավոր է դարձնում ուղիղ օգտվողի սարքում։ Բանաձևը հակիրճ է՝ WebGPU, առանց սերվերի, Q4 քվանտացում։ Հաշվարկը ոչ մի տեղ չի ուղարկվում, գրանցում պետք չէ։ Ծրագիրը WebGPU պորտ է, Q4 փաթեթավորիչ և բազմամոդելային շրջանակ, որի ոգեշնչումը yangqi0-ի PetitGPT հետազոտությունն է։
Էջը պնդում է, որ GPT-4-ի կամ Claude-ի նման մոդելների սպասարկումը միլիոններ է արժենում և ավելացնում ցանցային ուշացում, իսկ 25-360 միլիոն պարամետր ունեցող կոմպակտ մոդելները արագ եզրային շերտ են՝ հարցումների դասակարգում և մտադրության արդյունահանում միլիվայրկյաններում։ Քանի որ հաշվարկը կատարվում է հաճախորդի GPU-ում, զուգահեռությունը API-ի հաշիվ չի առաջացնում, իսկ առաջին թոքենի ուշացումը 10 միլիվայրկյանից պակաս է։
Յոթ մոդել, բոլորը Q4-ում
Կատալոգում յոթ չեկփոյնթ կա։ PetitGPT research-v1-ը (124,6 միլիոն պարամետր, Apache-2.0, հեղինակ՝ yangqi0) հենանիշ մոդելն է, որը մարզվել է մեկ RTX 4090-ում մոտավորապես 13 միլիարդ թոքենով։ SmolLM2 135M Instruct-ը և SmolLM2 360M Instruct-ը Hugging Face-ի Smol Models Research-ից են և մոտավորապես 2 տրիլիոն թոքենով նախամարզումից հետո ճշգրտվել են հրահանգներով։ L20-Edu 135M-ը (AliceYin) օգտագործում է նույն Llama ոճի բաղադրատոմսը, սակայն մարզվել է մեկ NVIDIA L20-ում մոտավորապես 13 միլիարդ թոքենով։ Հավաքածուն լրացնում են jingyaogong-ի երկու MiniMind մոդելները (104M և 26M) և nanoGPT ձևի GPT-2 124M-ը։
Բոլոր ֆայլերը Q4 քվանտացված են. կշիռները 16-բիթանոց լողացող թվերից սեղմվում են մինչև 4 բիթ մեկ պարամետրի հաշվով, ինչը հիշողության օգտագործումը նվազեցնում է մոտավորապես 75%-ով։ Սարքում կշիռները զբաղեցնում են 26M MiniMind2-Small-ի համար մոտ 16 ՄԲ-ից մինչև 360M SmolLM2-ի համար մոտ 226 ՄԲ, իսկ 100 միլիոնից ավել պարամետր ունեցող մոդելները տեղավորվում են բրաուզերի 50-84 ՄԲ հիշողության մեջ։ Աշխատանքը կատարում է WebGPU-ն՝ W3C ստանդարտը, որը compute shader-ները գործարկում է Apple Metal, DirectX 12 կամ Vulkan-ի վրա, WASM-ի ու JavaScript-ի անցումով։ Մոդելի բեռնումը այն պահում է բրաուզերի մասնավոր IndexedDB-ում։
Թեստեր և վկայական
Benchmarks ռեժիմը օբյեկտիվ ստուգումներ է գործարկում. կանոնավոր արտահայտություններ և ճշգրիտ թոքենային թեստեր, ոչ թե գրավոր որակի գնահատականներ։ 135 միլիոն պարամետր ունեցող մոդելին ձախողվել թույլատրվում է, նշում է էջը, քանի որ հենց դա է չափումը։ Հավաքածուն կարելի է գործարկել ակտիվ կամ բոլոր բեռնված մոդելների վրա, նաև 256 թոքենի թեստ։
Compare & Certificate ներդիրը այդ թվերը վերածում է կիսվող PNG վկայականի՝ սարքի ապարատային տվյալներով։ Custom eval վահանակը թույլ է տալիս սեփական թեստը JavaScript-ով գրել. կոդը eval-վում է էջի origin-ում։ Runtime վահանակը ցուցադրում է backend-ը, թոքեն/վրկ-ն, JS heap-ը, GPU բուֆերները և IndexedDB-ի օգտագործումը։ Ծրագիրը հասանելի է նաև 589 ՄԲ zip-ով, սակայն պետք է մատուցվի HTTP-ով։
SiTech — AI-ով հզորացված վեբ մշակում
Ստեղծում ենք արագ ու ժամանակակից կայքեր և AI-ը ներդնում իրական բիզնես գործընթացներում։ Ունե՞ք նախագիծ կամ հարց։ Ուրախ կլինենք օգնել։