חזרה
מי באמת יודע גאורגית? המבחן הגדול של 22 מודלי AI
SiTech AI Team4 წთ. საკითხავი

מי באמת יודע גאורגית? המבחן הגדול של 22 מודלי AI

בדקנו 22 מודלי AI מובילים בשפה הגאורגית: מורפולוגיה, מבנים ארגטיביים, ניבים וסגנון ספרותי. כ-90% מהמודלים נכשלים בארגטיביות — והמנצח הוא DeepSeek V4.1 Flash עם 92/100 וזמן תגובה מהיר במיוחד.

„გიორგი მივიდა“ או „გიორგიმ მივიდა“? עבור גאורגי התשובה ברורה — הנכון הוא הראשון, משום שהפועל „მივიდა“ הוא פועל בלתי-עובר ובזמן עבר דורש מהנושא יחסת נומינטיב. אבל כשהצגנו את השאלה הזו ל-22 מודלי AI מובילים, רובם — כ-90% — דווקא כאן טעו. ערכנו את אחד הבנצ'מרקים הגדולים שנעשו אי-פעם לשפה הגאורגית: 22 מודלים, ארבעה תחומים, שיטת ניקוד של 100 נקודות. התוצאות מראות שגאורגית היא עדיין מבחן רציני עבור הטכנולוגיה המודרנית — אך יש מודלים שבאמת שולטים בה.

למה גאורגית היא מבחן מיוחד עבור AI

רוב המודלים מאומנים על נתונים באנגלית ובסינית, ואילו הגאורגית נמנית עם השפות דלות-המשאבים. משפחת השפות הכרתווליאניות מבודדת מבחינה לשונית, והדקדוק שלה כולל מאפיינים שמודלים אוניברסליים נכשלים בהם לעתים קרובות.

הראשון — אגלוטינציה וריבוי-גופים של הפועל: הפועל הגאורגי מבטא בו-זמנית גם את הנושא וגם את המושא („დაგვახვედრეს“, „გამომიგზავნეს“). השני — ארגטיביות מפוצלת: בזמן עבר נושא של פועל עובר מקבל יחסת ארגטיב (-მა), ואילו של פועל בלתי-עובר — יחסת נומינטיב (-ი). השלישי — תרגומי-שאילה זרים („იქნა მიღებული“, „ჩემს მიერ“), שמהם מלא חלק ניכר מהטקסטים הגאורגיים באינטרנט, והמודלים לומדים אותם כצורות „נכונות“.

המבחן: ארבעה תחומים

כל מודל הוערך בארבעה תחומים: מורפולוגיה ומבנים ארגטיביים (25 נקודות), איתור שגיאות ועריכה (35 נקודות), ניבים גאורגיים (20 נקודות) וסגנון ספרותי (20 נקודות). כל המודלים נבדקו דרך API אחיד, עם פרומפטים זהים וטמפרטורה מינימלית:

1. מורפולוגיה ומבנים ארגטיביים (25 נקודות). שלושה משפטים עם השלמת יחסות — ביניהם „אתמול ______ (גיאורגי) הגיע לבית הספר בזמן“. הנכון הוא „გიორგი“, משום שהפועל בלתי-עובר.

2. איתור שגיאות ועריכה (35 נקודות). טקסט עם חמישה פגמים מוסתרים: תרגום-שאילה פסיבי רוסי „იქნა მიღებული“, שגיאה לקסיקלית „რამოდენიმე“, טאוטולוגיה „ყველაზე საუკეთესო“, אי-התאמה במספר „ათი სტუდენტები“ ופסיק חסר.

3. ניבים וצירופים כבולים (20 נקודות). „კოვზი ნაცარში ჩაუვარდა“, „წყალი შეუყენა“, „თვალში ნაცრის შეყრა“ — הבנת המשמעות המטאפורית ודוגמאות בהקשר.

4. סגנון ספרותי (20 נקודות). כתיבה חופשית על הנושא „השפה כזיכרון האומה“ — בלי תרגומי-שאילה ובסגנון גבוה.

הדרמה: איך המודלים „נתקעו“ בחשיבה

בסיבוב הראשון 14 מתוך 22 מודלים החזירו תשובה ריקה — למרות שהסטטוס היה 200 OK. הסיבה התבררה כשרשרת החשיבה הפנימית: משימה פשוטה באנגלית דורשת 100-200 טוקני „חשיבה“, ואילו בגאורגית המספר הזה התפוצץ במודלים עד 1,200-2,400 טוקנים. עם תקציב של 1,000 טוקנים הם שרפו את כל המכסה על חשיבה ולא הגיעו לתשובה.

עם מגבלה של 2,500 טוקנים התמונה השתנתה: DeepSeek V4.1 Flash השקיע 1,242 טוקנים בחשיבה ואז כתב תשובה גאורגית ללא רבב, ול-Qwen3.8-Max נדרשו 1,443 טוקנים. מקרה מיוחד הוא GLM-5.3-flash, שנפל ללולאת חשיבה אינסופית — השקיע 2,494 טוקנים ובכל זאת לא הגיע לתשובה.

המנצחים

התוצאה הטובה ביותר — 92/100 — הייתה של DeepSeek V4.1 Flash: דיוק של 100% במבחן הארגטיביות, עריכה ללא שגיאות (מצא את כל הפגמים, כולל תרגום-השאילה הרוסי) ובממוצע 6.4 שניות בלבד לתשובה. במקום השני Qwen3.8-Max (89/100) — עם החשיבה הלוגית החזקה ביותר, אך בהשהיה של 28.5 שניות; במקום השלישי — Qwen3.8-Flash (87/100).

מעניין במיוחד MiniMax-M3: במקום הרביעי בציון הכולל (81/100), אך עם תוצאה מושלמת במבחן הספרותי — 20/20. הגאורגית שלו כל כך טבעית, עד שכמעט אינה ניתנת להבחנה מטקסט שנכתב בידי אדם: „הרי השפה אינה נולדת רק כצורה של מילים, אלא הופכת לשביל רוחני של ניסיון חיים, כאב ושמחה שנצברו במשך דורות“.

המהיר מכולם היה NVIDIA Nemotron-3-Ultra-550B — 4.5 שניות — אבל לטקסט שלו התגנבה מילה קירילית רוסית („генеτიკური“), מה שהוא דוגמה קלאסית ל„דליפת“ שפות במהלך אימון רב-לשוני; הוא גם המציא כלל דקדוק שאינו קיים כשהסביר את הכלל.

לוח התוצאות המלא (טופ-10)

1. DeepSeek V4.1 Flash — 92/100 (6.4 שנ')
2. Qwen3.8-Max — 89/100 (28.5 שנ')
3. Qwen3.8-Flash — 87/100 (22.1 שנ')
4. MiniMax-M3 — 81/100 (12.6 שנ')
5. NVIDIA Nemotron-3-Ultra-550B — 79/100 (4.5 שנ')
6. Qwen3.8-Max-0902 — 78/100
7. Xiaomi MiMo v2.5 — 54/100
8. StepFun Step-3.7-Flash — 44/100
9. StepFun Step-3.5-Flash — 40/100
10. Ling 3.0 Flash — 36/100

התמונה הכוללת ברורה: הפער בין החמישייה הראשונה לשאר ענק — נפילה מ-79 נקודות ל-54. שלושה מודלים בכלל לא הגיעו לשלב הבדיקה (שניים בגלל מגבלות חבילה, ואחד היה זמנית לא זמין).

איזה מודל מתאים למה

לעבודה יומיומית — כתיבת טקסטים, עריכה, שאלות ותשובות — הבחירה הטובה ביותר היא DeepSeek V4.1 Flash: היחס הטוב ביותר בין מהירות, מחיר ואיכות. לניתוח מורכב ולטקסטים משפטיים מתאים יותר Qwen3.8-Max, ולחומרים שיווקיים ויצירתיים — MiniMax-M3, שהגאורגית שלו היא ה„חיה“ ביותר. המסקנה המרכזית פשוטה: עבור השפה הגאורגית כדאי לבחור מודל לא לפי מותג או גודל, אלא לפי בדיקה אמיתית.

בדיוק משום כך פרסמנו את התוצאות המלאות ואת המתודולוגיה — כדי שלכל מי שעובד עם טקסטים בגאורגית יהיה פתרון מוכן.

SSiTech

SiTech — פיתוח אתרים בכוח ה-AI

אנחנו בונים אתרים מהירים ומודרניים ומשלבים AI בתהליכי עבודה אמיתיים. יש לכם פרויקט או שאלה? נשמח לעזור.