Վերադառնալ
BTU-ն հրապարակել է գրուզերեն լեզվի բաց տվյալների հավաքածուն AI-ի ուսուցման համար
SiTech AI Team2 წთ. საკითხავი

BTU-ն հրապարակել է գրուզերեն լեզվի բաց տվյալների հավաքածուն AI-ի ուսուցման համար

Բիզնեսի և տեխնոլոգիաների համալսարանը (BTU) GitHub-ում հրապարակել է գրուզերեն լեզվի բաց ռեսուրսը AI համակարգերի ուսուցման և գնահատման համար։ Palitra Media-ի աջակցությամբ պատրաստված հավաքածուն պարունակում է 645 555 կառուցվածքային գրառում՝ շուրջ 12 միլիոն թոքեն։

Բիզնեսի և տեխնոլոգիաների համալսարանը (BTU) ստեղծել է գրուզերեն լեզվի բաց ռեսուրս AI համակարգերի ուսուցման և գնահատման համար և հրապարակել է այն GitHub-ում։ Palitra Media-ի աջակցությամբ պատրաստված հրապարակումը պարունակում է 645 555 կառուցվածքային գրառում՝ մոտ 12 միլիոն լեզվական մոդելի թոքեն, ինչպես նկարագրում է համալսարանը։

Ինչու գրուզերենին անհրաժեշտ են սեփական տվյալներ

BTU-ի փոխանցմամբ՝ լեզվի ապագան AI-ի դարաշրջանում կախված է նրանից, թե որքան լավ է այն ներկայացված թվային տարածքում։ Եթե մոդելը լեզուն իմանում է միայն ցրված տեքստերից, այն կարող է անբնական նախադասություններ կազմել, սխալ մեկնաբանել համատեքստը և դժվարանալ քերականության, դարձվածքների ու մասնագիտական տերմինաբանության հարցում։ Գրուզերենը հատկապես պահանջկոտ է։ իմաստի մեծ մասը փոխանցվում է բայի ձևերով, հոլովներով ու համատեքստով, իսկ բառերի կարգը ճկուն է։

Այդ պատճառով ռեսուրսը տեքստերի պատահական հավաքածու չէ, այլ կառուցվածքային համակարգ, որն ընդգրկում է լեզվի տասներկու ուղղություն՝ բառաձևեր, բայեր, նախադասություններ, հոլովներ, դարձվածքներ, մասնագիտական տերմինաբանություն, քանակական տվյալներ, մեջբերումներ, հասկացություններ, պաշտոնական տվյալներ, մեդիայի վերնագրեր և AI-ի բնորոշ սխալների օրինակներ։

Ինչ է ներառում հրապարակումը

Palitra Media-ն տրամադրել է ժամանակակից գրուզերեն լայն նյութեր, իսկ BTU-ն դրանք վերածել է բաց ֆորմատի, որը հարմար է հետազոտության և տեխնոլոգիական զարգացման համար։ Համալսարանի խոսքով՝ ռեսուրսը կարող է աջակցել գրուզերեն չաթբոթերին, թարգմանությանը, որոնմանը, կրթական գործիքներին և թվային ծառայություններին, ինչը կհանգեցնի ավելի բնական հաճախորդների սպասարկման և ավելի հասկանալի հանրային ծառայությունների։

Բաց հրապարակումը և դրա սահմանները

GitHub-ում հրապարակումը հետազոտողներին, համալսարաններին և մշակողներին Վրաստանում և արտերկրում ազատ հասանելիություն է տալիս ռեսուրսին և մեծացնում է հավանականությունը, որ գրուզերենը կհայտնվի նոր ուսումնասիրություններում, մոդելների հարմարեցման նախագծերում և գնահատման առաջադրանքներում։ BTU-ն նշում է, որ հրապարակումն ինքնին չի նշանակում, թե ChatGPT-ը, Gemini-ն կամ Claude-ը ավտոմատ կերպով կսովորեն այս տվյալներից։ անհրաժեշտ են նպատակային ուսուցում, ինտեգրում և փորձարկում։

Ինչ է սպասվում հաջորդիվ

Համալսարանը նախագիծը դիտարկում է որպես թվային լեզվական ինքնիշխանության հարց՝ երկրի կարողությունը ինքնուրույն նկարագրել ու զարգացնել սեփական լեզուն գլոբալ համակարգերում։ BTU-ի հետազոտողների խոսքով՝ հիմնական արժեքը թոքենների թիվը չէ, այլ այն, որ գրուզերենն այժմ ունի ընդհանուր թվային հիմք։ Սա պատրաստի ազգային AI մոդել չէ։ հաջորդ փուլը փորձագիտական ստուգումն է, տարբեր մոդելներում փորձարկումը և բարելավման չափելի ապացույցները։

SSiTech

SiTech — AI-ով հզորացված վեբ մշակում

Ստեղծում ենք արագ ու ժամանակակից կայքեր և AI-ը ներդնում իրական բիզնես գործընթացներում։ Ունե՞ք նախագիծ կամ հարց։ Ուրախ կլինենք օգնել։