Geri qayıt
Gürcü dilini əslində kim bilir? 22 AI modelinin böyük testi
SiTech AI Team4 წთ. საკითხავი

Gürcü dilini əslində kim bilir? 22 AI modelinin böyük testi

22 aparıcı süni intellekt modelini gürcü dili üzrə yoxladıq: morfologiya, ergativ konstruksiyalar, idiomlar və ədəbi üslub. Modellərin 90%-i ergativdə səhv edir — qalib DeepSeek V4.1 Flash-dır (92/100).

„Giorgi getdi" yoxsa „Giorgim getdi"? Gürcü üçün cavab aydındır — düzgün olan birincisidir, çünki „getdi" feli keçişsizdir və keçmiş qəti zamanda mübtəda adlıq hal tələb edir. Amma bu sualı 22 aparıcı süni intellekt modelinə verdikdə onların əksəriyyəti — təxminən 90%-i — məhz burada səhv etdi.

Gürcü dili üzrə ən genişmiqyaslı AI benchmarklarından birini keçirdik: 22 model, dörd fənn, 100 ballıq sistem. Nəticələr göstərir ki, gürcü dili müasir texnologiya üçün hələ də ciddi sınaqdır — amma onu həqiqətən mənimsəyən modellər var.

Niyə gürcü dili AI üçün xüsusi sınaqdır

Modellərin əksəriyyəti ingilis və çin dilli məlumatlar üzərində öyrədilir, gürcü dili isə azresurslu dillər sırasına aiddir. Gürcü dilləri ailəsi təcrid olunmuşdur, qrammatikasında isə universal modellərin tez-tez ilişdiyi xüsusiyyətlər var.

Birinci — aqlütinasiya və feldə çoxşəxslik: gürcü feli eyni zamanda həm mübtədanı, həm də obyekti ifadə edir („დაგვახვედრეს", „გამომიგზავნეს"). İkinci — parçalanmış ergativlik: keçmiş qəti zamanda keçidli felin mübtədası hekayət halını (-მა), keçişsiz felinki isə adlıq halı (-ი) alır. Üçüncü — xarici dillərdən kalkalar („იქნა მიღებული", „ჩემს მიერ"), internetdəki gürcü mətnlərinin böyük hissəsi məhz bunlarla doludur və modellər onları „düzgün" formalar kimi öyrənir.

Test: dörd fənn

Hər bir model vahid API, eyni promptlar və minimal temperatur şəraitində dörd sahə üzrə qiymətləndirildi:

1. Morfologiya və ergativ konstruksiyalar (25 bal). Halların yerinə qoyulması ilə üç cümlə — o cümlədən „Dünən ______ (Giorgi) məktəbə vaxtında getdi". Düzgün variant „Giorgi"dir, çünki fel keçişsizdir.

2. Səhvlərin tapılması və redaktə (35 bal). Beş gizli qüsur olan mətn: rus passiv kalkası „იქნა მიღებული", leksik səhv „რამოდენიმე", tavtologiya „ყველაზე საუკეთესო", say uyğunluğu „ათი სტუდენტები" və buraxılmış vergül.

3. İdiomlar və frazeologizmlər (20 bal). „კოვზი ნაცარში ჩაუვარდა", „წყალი შეუყენა", „თვალში ნაცრის შეყრა" — məcazi mənanın dərk edilməsi və kontekstual nümunələr.

4. Ədəbi üslub (20 bal). „Dil — xalqın yaddaşı" mövzusunda sərbəst hekayə — kalkalar olmadan, yüksək üslubda.

Dram: modellər necə „düşüncəyə" ilişib qaldılar

Birinci raundda 22 modeldən 14-ü boş cavab qaytardı — baxmayaraq ki, status 200 OK idi. Səbəb daxili mülahizə zənciri oldu: ingilis dilində sadə tapşırıq 100-200 „düşünmə" tokeni tələb edir, gürcü dilində isə bu göstərici modellərdə 1,200-2,400 tokenə qədər partladı. 1,000 tokenlik büdcə ilə bütün limiti düşünməyə xərclədilər və cavaba çata bilmədilər.

2,500 tokenlik limitlə mənzərə dəyişdi: DeepSeek V4.1 Flash düşünməyə 1,242 token sərf etdi və sonra qüsursuz gürcü dilində cavab yazdı; Qwen3.8-Max-a isə 1,443 token lazım oldu. Xüsusi hal GLM-5.3-flash oldu — sonsuz mülahizə dövrəsinə düşdü, 2,494 token xərclədi və yenə də cavaba çatmadı.

Qaliblər

Ən yaxşı nəticəni — 92/100 — DeepSeek V4.1 Flash göstərdi: ergativ testində 100% dəqiqlik, qüsursuz redaktə (rus kalkası da daxil olmaqla bütün qüsurları tapdı) və cavab başına orta hesabla cəmi 6.4 saniyə. İkinci yerdə Qwen3.8-Max (89/100) dayanır — ən güclü məntiqi düşünmə ilə, lakin 28.5 saniyəlik gecikmə ilə; üçüncü — Qwen3.8-Flash (87/100).

Maraqlıdır MiniMax-M3: ümumi balla dördüncü (81/100), lakin ədəbi testdə mütləq nəticə — 20/20. Onun yazdığı mətn o qədər təbiidir ki, insan yazısından çətin seçilir: „Dil axı təkcə sözlərin forması kimi doğulmur, o, əsrlər boyu yığılmış həyat təcrübəsinin, ağrının və sevincin mənəvi izinə çevrilir".

Ən sürətli isə NVIDIA Nemotron-3-Ultra-550B oldu — 4.5 saniyə — amma onun mətninə rus kiril sözü („генеτიკური") sızıb ki, bu da çoxdilli öyrətmə zamanı dillərin „sızması"nın klassik nümunəsidir; həm də qaydanı izah edərkən mövcud olmayan qrammatik qayda uydurdu.

Tam lider cədvəli (Top-10)

1. DeepSeek V4.1 Flash — 92/100 (6.4 san)
2. Qwen3.8-Max — 89/100 (28.5 san)
3. Qwen3.8-Flash — 87/100 (22.1 san)
4. MiniMax-M3 — 81/100 (12.6 san)
5. NVIDIA Nemotron-3-Ultra-550B — 79/100 (4.5 san)
6. Qwen3.8-Max-0902 — 78/100
7. Xiaomi MiMo v2.5 — 54/100
8. StepFun Step-3.7-Flash — 44/100
9. StepFun Step-3.5-Flash — 40/100
10. Ling 3.0 Flash — 36/100

Ümumi mənzərə aydındır: ilk beşliklə qalanlar arasındakı uçurum nəhəngdir — 79 baldan 54-ə düşmə. Üç model testə çata bilmədi (ikisi paket məhdudiyyətinə görə, biri isə müvəqqəti əlçatmaz idi).

Hansı model nə üçün

Gündəlik iş üçün — mətn yazmaq, redaktə etmək, sual-cavab — ən yaxşı seçim DeepSeek V4.1 Flash-dır: sürət, qiymət və keyfiyyətin ən yaxşı nisbəti. Mürəkkəb analiz və hüquqi mətnlər üçün daha dərini Qwen3.8-Max, marketinq və yaradıcı materiallar üçün isə MiniMax-M3-dür — onun gürcü dili ən „canlı"dır.

Əsas nəticə sadədir: gürcü dili üçün model brendə və ya ölçüyə görə deyil, real testlərin nəticələrinə görə seçilməlidir. Məhz buna görə tam nəticələri və metodologiyanı dərc etdik — gürcü mətnləri üzərində işləyən hər kəsin hazır cavabı olsun.

SSiTech

SiTech — AI ilə gücləndirilmiş veb hazırlanması

Sürətli və müasir saytlar qurur, AI-ı real biznes proseslərinə gətiririk. Layihəniz və ya sualınız var? Kömək etməyə hazırıq.