
Ո՞վ է իրականում տիրապետում վրացերենին։ 22 AI մոդելի մեծ թեստ
Փորձարկեցինք 22 առաջատար արհեստական բանականության մոդել վրացերենով՝ ձևաբանություն, էրգատիվ կառուցվածքներ, դարձվածքներ ու գրական ոճ։ Մոդելների 90%-ը սխալվում է էրգատիվի վրա։ Հաղթողը DeepSeek V4.1 Flash-ն է (92/100)։
«გიორგი მივიდა» թե՞ «გიორგიმ მივიდა»։ Վրացու համար պատասխանը պարզ է՝ ճիշտ է առաջինը, քանի որ «მივიდა» բայը անանցողական է և անցյալ ժամանակում ենթակայից պահանջում է ուղղական հոլով։ Սակայն երբ այս հարցը տվեցինք 22 առաջատար արհեստական բանականության մոդելի, նրանց մեծ մասը՝ շուրջ 90%-ը, հենց այստեղ սխալվեց։
Անցկացրինք վրացերենի ամենամասշտաբային AI բենչմարկներից մեկը՝ 22 մոդել, չորս դիսցիպլինա, 100-բալանոց համակարգ։ Արդյունքները ցույց են տալիս, որ վրացերենը դեռևս լուրջ փորձություն է ժամանակակից տեխնոլոգիայի համար, սակայն կան մոդելներ, որոնք իսկապես տիրապետում են դրան։
Ինչո՞ւ է վրացերենը հատուկ փորձություն AI-ի համար
Մոդելների մեծ մասը մարզվում է անգլերեն և չինարեն տվյալների վրա, իսկ վրացերենը պատկանում է ցածր ռեսուրսային լեզուների թվին։ Քարթվելյան լեզվաընտանիքը մեկուսացված է, իսկ քերականությունը պարունակում է այնպիսի առանձնահատկություններ, որոնց վրա ունիվերսալ մոդելները հաճախ տապալվում են։
Առաջինը՝ ագլյուտինացիա և բայի բազմադեմություն. վրացերեն բայը միաժամանակ արտահայտում է և՛ ենթակա, և՛ խնդիր («დაგვახვედრეს», «გამომიგზავნეს»)։ Երկրորդը՝ պառակտված էրգատիվություն. անցյալ ժամանակում անցողական բայի ենթական ընդունում է պատմողական հոլովը (-մա), իսկ անանցողականինը՝ ուղականը (-ի)։ Երրորդը՝ օտարալեզու կալկաներ («იქნა მიღებული», «ჩემს მიერ»), որոնցով լցված է համացանցի վրացերեն տեքստերի մեծ մասը և որոնք մոդելները սովորում են որպես «ճիշտ» ձևեր։
Թեստը՝ չորս դիսցիպլինա
Յուրաքանչյուր մոդել գնահատվեց չորս ոլորտում՝ միասնական API-ի, նույնական պրոմպտների և նվազագույն ջերմաստիճանի պայմաններում.
1. Ձևաբանություն և էրգատիվ կառուցվածքներ (25 միավոր)։ Երեք նախադասություն հոլովների տեղադրմամբ, այդ թվում՝ «გუშინ ______ (გიორგი) სკოლაში დროზე მივიდა»։ Ճիշտ է «გიორგი», քանի որ բայը անանցողական է։
2. Սխալների հայտնաբերում և խմբագրում (35 միավոր)։ Հինգ թաքնված թերություն պարունակող տեքստ՝ ռուսական պասիվ կալկա «იქნა მიღებული», բառային սխալ «რამოდენიმე», տավտոլոգիա «ყველაზე საუკეთესო», թվային համաձայնեցում «ათი სტუდენტები» և բաց թողնված ստորակետ։
3. Դարձվածքներ և ֆրազեոլոգիզմներ (20 միավոր)։ «კოვზი ნაცარში ჩაუვარდა», «წყალი შეუყენა», «თვალში ნაცრის შეყრა» — փոխաբերական իմաստի ընկալում և համատեքստային օրինակներ։
4. Գրական ոճ (20 միավոր)։ Ազատ պատում «ენა, როგორც ერის მეხსიერება» թեմայով՝ առանց կալկաների, բարձր ոճով։
Դրամա. ինչպես մոդելները «խրվեցին» մտածելիս
Առաջին փուլում 22 մոդելներից 14-ը վերադարձրին դատարկ պատասխան՝ չնայած այն բանին, որ կարգավիճակը 200 OK էր։ Պատճառը ներքին դատողության շղթան էր. անգլերենով պարզ խնդիրը պահանջում է 100-200 «մտքի» տոկեն, իսկ վրացերենով այդ ցուցանիշը մոդելների մոտ բարձրացավ մինչև 1,200-2,400 տոկեն։ 1,000 տոկենանոց բյուջեով նրանք ամբողջ սահմանաչափը ծախսեցին մտածելու վրա և պատասխանին այդպես էլ չհասան։
2,500 տոկենանոց սահմանաչափով պատկերը փոխվեց. DeepSeek V4.1 Flash-ը մտածելու վրա ծախսեց 1,242 տոկեն և հետո գրեց անթերի վրացերեն պատասխան, իսկ Qwen3.8-Max-ին պահանջվեց 1,443 տոկեն։ Առանձնահատուկ դեպք է GLM-5.3-flash-ը, որը հայտնվեց անվերջ դատողության հանգույցում՝ ծախսեց 2,494 տոկեն և պատասխանին այդպես էլ չհասավ։
Հաղթողները
Լավագույն արդյունքը՝ 92/100, ցույց տվեց DeepSeek V4.1 Flash-ը. էրգատիվի թեստում՝ 100% ճշգրտություն, անսխալ խմբագրում (գտավ բոլոր թերությունները՝ ներառյալ ռուսական կալկան) և միջինը՝ ընդամենը 6.4 վայրկյան պատասխանի համար։ Երկրորդ տեղում Qwen3.8-Max-ն է (89/100)՝ ամենաուժեղ տրամաբանական մտածողությամբ, սակայն 28.5 վայրկյան ուշացումով. երրորդը՝ Qwen3.8-Flash (87/100)։
Հետաքրքիր է MiniMax-M3-ը. ընդհանուր միավորով՝ չորրորդը (81/100), սակայն գրական թեստում բացարձակ արդյունք՝ 20/20։ Նրա գրած տեքստն այնքան բնական է, որ դժվար է մարդու գրածից տարբերել. «Լեզուն ի վերջո ծնվում է ոչ միայն որպես բառերի ձև, այլ դարերով կուտակված կյանքի փորձի, ցավի ու ուրախության հոգևոր հետքի է վերածվում»։
Ամենաարագը, սակայն, NVIDIA Nemotron-3-Ultra-550B-ն էր՝ 4.5 վայրկյան, թեև նրա տեքստ սողոսկել էր ռուսերեն կիրիլիցայով բառ («генеτიკური»), ինչը բազմալեզու մարզման ընթացքում լեզուների «արտահոսքի» դասական օրինակ է. նա նաև կանոնը բացատրելիս հորինեց գոյություն չունեցող քերականական կանոն։
Ամբողջական լիդերբորդը (թոփ-10)
1. DeepSeek V4.1 Flash — 92/100 (6.4 վրկ)
2. Qwen3.8-Max — 89/100 (28.5 վրկ)
3. Qwen3.8-Flash — 87/100 (22.1 վրկ)
4. MiniMax-M3 — 81/100 (12.6 վրկ)
5. NVIDIA Nemotron-3-Ultra-550B — 79/100 (4.5 վրկ)
6. Qwen3.8-Max-0902 — 78/100
7. Xiaomi MiMo v2.5 — 54/100
8. StepFun Step-3.7-Flash — 44/100
9. StepFun Step-3.5-Flash — 40/100
10. Ling 3.0 Flash — 36/100
Ընդհանուր պատկերը պարզ է. առաջատար հնգյակի և մնացածների միջև անդունդը հսկայական է՝ 79 միավորից անկում մինչև 54։ Երեք մոդել չհասավ թեստավորմանը (երկուսը՝ փաթեթի սահմանափակման պատճառով, մեկը՝ ժամանակավորապես անհասանելի էր)։
Ո՞ր մոդելը՝ ինչի համար
Ամենօրյա աշխատանքի համար՝ տեքստեր գրել, խմբագրել, հարց ու պատասխան՝ լավագույն ընտրությունը DeepSeek V4.1 Flash-ն է. արագության, գնի և որակի լավագույն հարաբերակցությունը։ Բարդ վերլուծության ու իրավաբանական տեքստերի համար ավելի խորը Qwen3.8-Max-ն է, իսկ մարքեթինգային և ստեղծարար նյութերի համար՝ MiniMax-M3-ը, որի վրացերենն ամենա«կենդանին» է։
Հիմնական եզրակացությունը պարզ է. վրացերենի համար մոդելը պետք է ընտրել ոչ թե բրենդով կամ չափով, այլ իրական թեստավորման արդյունքներով։ Հենց այս պատճառով հրապարակեցինք ամբողջական արդյունքներն ու մեթոդաբանությունը, որ վրացերեն տեքստերի հետ աշխատող յուրաքանչյուր ոք պատրաստ պատասխան ունենա։
SiTech — AI-ով հզորացված վեբ մշակում
Ստեղծում ենք արագ ու ժամանակակից կայքեր և AI-ը ներդնում իրական բիզնես գործընթացներում։ Ունե՞ք նախագիծ կամ հարց։ Ուրախ կլինենք օգնել։