
FUTO-ն թողարկել է Swipe-ը՝ բաց մոդելներ սահեցնելով գրելու համար
FUTO-ն հրապարակել է Swipe-ը՝ բաց մոդելների ընտանիք և C++ գրադարան սահեցնելով գրելու համար, որը մարզվել է MIT լիցենզիայով հրապարակված մեկ միլիոն սահեցումների տվյալների վրա։
Բաց մոդելներ փակ խնդրի համար
FUTO-ն՝ անցանց Android ստեղնաշար FUTO Keyboard-ի մշակողը, հրապարակել է Swipe-ը՝ բաց մոդելների և ալգորիթմների ընտանիք սահեցնելով գրելու համար։ Նախագծի նպատակն է հաղթահարել վաղուց գոյություն ունեցող արգելքը. հեռախոսներում լավ սահեցնելով գրելը փակված էր գաղտնիությունը խախտող ստեղնաշարային հավելվածներում կամ չլիցենզավորված մասնավոր գրադարաններում։ Մոդելները տարածվում են FUTO Model License-ով, որը թույլ է տալիս օգտագործումը հղումով, իսկ ինֆերենսի գրադարանը բաց կոդով է։
Համակարգն արդեն աշխատում է. այն հասանելի է FUTO Keyboard-ի 0.1.29 և ավելի նոր տարբերակներում։ Մշակողները, ովքեր ուզում են սեփական արտադրանք ստեղծել, կարող են ներբեռնել մոդելները և օգտվել գրադարանից։ Նախագծի կայքում ցուցադրությունը աշխատում է սերվերի կողմում, որ էջը փոքր մնա. իրական օգտագործման ժամանակ, ըստ FUTO-ի, մոդելները աշխատում են սարքի վրա՝ շատ ավելի ցածր ուշացումով։
Երեք մոդել և ճառագայթային որոնում
Ճարտարապետությունը միավորում է երեք տեսակի մոդելներ։ Կոդավորիչը կապված չէ դասավորության կամ լեզվի հետ և զբաղվում է ընդհանուր կանխատեսումներով, սակայն ինքնուրույն չի հասնում լավագույն ճշգրտության։ Փոքր ContextLM մոդելը մարզված է մեկ լեզվի համար և նախադասության նախորդ բառերի հաշվառմամբ հեռացնում է անիմաստ բառերը. նրա մարզման համար բավարար են միայն տեքստային տվյալները։ Վերծանիչը մարզվում է կոնկրետ լեզվի և ստեղնաշարի դասավորության համար, սովորում է դասավորության առանձնահատկությունները և հասնում առաջատար ճշգրտության։ Առայժմ FUTO-ն մարզել է միայն QWERTY անգլերեն վերծանիչ։
Միայն կանխատեսումները բավարար չեն. սահեցման հետագիծը բառերի վերածելու համար անհրաժեշտ է բառարանով սահմանափակված ճառագայթային որոնում։ FUTO-ն թողարկել է swipe-library-ն՝ C++ գրադարան, որը կատարում է ինֆերենսը, վերծանումը և ճառագայթային որոնումը։
Միլիոն սահեցում և թվերը
Մարզման տվյալները եկան հանրությունից. 2024 թվականի օգոստոսին FUTO-ն swipe.futo.org կայքում սկսեց հավաքել QWERTY անգլերեն սահեցումներ, որտեղ կամավորներին տալիս էին հիմնականում Վիքիպեդիայից վերցված նախադասություններ և խնդրում բառ առ բառ սահեցնել դրանք։ Այս աշխատանքը բերեց ավելի քան մեկ միլիոն սահեցում. ցածր որակի գրառումները զտելուց հետո, 2025 թվականի մարտին FUTO-ն MIT լիցենզիայով հրապարակեց մեկ միլիոն սահեցումների տվյալների հավաքածուն, որը հասանելի է HuggingFace-ում։ Ընկերության խոսքով՝ տվյալները օգտագործվել են և՛ մոդելների մարզման, և՛ մրցակից համակարգերի գնահատման համար։
FUTO-ի թեստային հավաքածուում երեք մոդելները միասին 300 լայնության ճառագայթով աշխատելիս առաջին չորս առաջարկներում ձախողման մակարդակը մոտ 4 տոկոս է. բառարանից դուրս դեպքերը չհաշված՝ սխալների մակարդակը 1 տոկոսից ցածր է։ FUTO-ն զգուշացնում է, որ նման թվերը մեծապես կախված են թեստից և իրական արդյունքները կարող են տարբերվել, սակայն պնդում է, որ համակարգը մրցում է խոշոր տեխնոլոգիական ընկերությունների ստեղնաշարերի հետ։ Մոդելները փոքր են. կոդավորիչը՝ 635 140 պարամետր, վերծանիչը՝ 304 155, ContextLM-ը՝ 1,5 միլիոն, որից 1,1 միլիոնը ներկայացուցչություններ են. ընդհանուր 2 494 767 պարամետրից ակտիվ են 1 364 271-ը։ Տեխնիկական զեկույցը arXiv-ում է, մոդելները՝ HuggingFace-ում, գրադարանը՝ GitLab-ում։
SiTech — AI-ով հզորացված վեբ մշակում
Ստեղծում ենք արագ ու ժամանակակից կայքեր և AI-ը ներդնում իրական բիզնես գործընթացներում։ Ունե՞ք նախագիծ կամ հարց։ Ուրախ կլինենք օգնել։