
מי באמת יודע גאורגית? המבחן הגדול של 22 מודלי AI
בדקנו 22 מודלי AI מובילים בשפה הגאורגית: מורפולוגיה, מבנים ארגטיביים, ניבים וסגנון ספרותי. כ-90% מהמודלים נכשלים בארגטיביות — והמנצח הוא DeepSeek V4.1 Flash עם 92/100 וזמן תגובה מהיר במיוחד.
„გიორგი მივიდა“ או „გიორგიმ მივიდა“? עבור גאורגי התשובה ברורה — הנכון הוא הראשון, משום שהפועל „მივიდა“ הוא פועל בלתי-עובר ובזמן עבר דורש מהנושא יחסת נומינטיב. אבל כשהצגנו את השאלה הזו ל-22 מודלי AI מובילים, רובם — כ-90% — דווקא כאן טעו. ערכנו את אחד הבנצ'מרקים הגדולים שנעשו אי-פעם לשפה הגאורגית: 22 מודלים, ארבעה תחומים, שיטת ניקוד של 100 נקודות. התוצאות מראות שגאורגית היא עדיין מבחן רציני עבור הטכנולוגיה המודרנית — אך יש מודלים שבאמת שולטים בה.
למה גאורגית היא מבחן מיוחד עבור AI
רוב המודלים מאומנים על נתונים באנגלית ובסינית, ואילו הגאורגית נמנית עם השפות דלות-המשאבים. משפחת השפות הכרתווליאניות מבודדת מבחינה לשונית, והדקדוק שלה כולל מאפיינים שמודלים אוניברסליים נכשלים בהם לעתים קרובות.
הראשון — אגלוטינציה וריבוי-גופים של הפועל: הפועל הגאורגי מבטא בו-זמנית גם את הנושא וגם את המושא („დაგვახვედრეს“, „გამომიგზავნეს“). השני — ארגטיביות מפוצלת: בזמן עבר נושא של פועל עובר מקבל יחסת ארגטיב (-მა), ואילו של פועל בלתי-עובר — יחסת נומינטיב (-ი). השלישי — תרגומי-שאילה זרים („იქნა მიღებული“, „ჩემს მიერ“), שמהם מלא חלק ניכר מהטקסטים הגאורגיים באינטרנט, והמודלים לומדים אותם כצורות „נכונות“.
המבחן: ארבעה תחומים
כל מודל הוערך בארבעה תחומים: מורפולוגיה ומבנים ארגטיביים (25 נקודות), איתור שגיאות ועריכה (35 נקודות), ניבים גאורגיים (20 נקודות) וסגנון ספרותי (20 נקודות). כל המודלים נבדקו דרך API אחיד, עם פרומפטים זהים וטמפרטורה מינימלית:
1. מורפולוגיה ומבנים ארגטיביים (25 נקודות). שלושה משפטים עם השלמת יחסות — ביניהם „אתמול ______ (גיאורגי) הגיע לבית הספר בזמן“. הנכון הוא „გიორგი“, משום שהפועל בלתי-עובר.
2. איתור שגיאות ועריכה (35 נקודות). טקסט עם חמישה פגמים מוסתרים: תרגום-שאילה פסיבי רוסי „იქნა მიღებული“, שגיאה לקסיקלית „რამოდენიმე“, טאוטולוגיה „ყველაზე საუკეთესო“, אי-התאמה במספר „ათი სტუდენტები“ ופסיק חסר.
3. ניבים וצירופים כבולים (20 נקודות). „კოვზი ნაცარში ჩაუვარდა“, „წყალი შეუყენა“, „თვალში ნაცრის შეყრა“ — הבנת המשמעות המטאפורית ודוגמאות בהקשר.
4. סגנון ספרותי (20 נקודות). כתיבה חופשית על הנושא „השפה כזיכרון האומה“ — בלי תרגומי-שאילה ובסגנון גבוה.
הדרמה: איך המודלים „נתקעו“ בחשיבה
בסיבוב הראשון 14 מתוך 22 מודלים החזירו תשובה ריקה — למרות שהסטטוס היה 200 OK. הסיבה התבררה כשרשרת החשיבה הפנימית: משימה פשוטה באנגלית דורשת 100-200 טוקני „חשיבה“, ואילו בגאורגית המספר הזה התפוצץ במודלים עד 1,200-2,400 טוקנים. עם תקציב של 1,000 טוקנים הם שרפו את כל המכסה על חשיבה ולא הגיעו לתשובה.
עם מגבלה של 2,500 טוקנים התמונה השתנתה: DeepSeek V4.1 Flash השקיע 1,242 טוקנים בחשיבה ואז כתב תשובה גאורגית ללא רבב, ול-Qwen3.8-Max נדרשו 1,443 טוקנים. מקרה מיוחד הוא GLM-5.3-flash, שנפל ללולאת חשיבה אינסופית — השקיע 2,494 טוקנים ובכל זאת לא הגיע לתשובה.
המנצחים
התוצאה הטובה ביותר — 92/100 — הייתה של DeepSeek V4.1 Flash: דיוק של 100% במבחן הארגטיביות, עריכה ללא שגיאות (מצא את כל הפגמים, כולל תרגום-השאילה הרוסי) ובממוצע 6.4 שניות בלבד לתשובה. במקום השני Qwen3.8-Max (89/100) — עם החשיבה הלוגית החזקה ביותר, אך בהשהיה של 28.5 שניות; במקום השלישי — Qwen3.8-Flash (87/100).
מעניין במיוחד MiniMax-M3: במקום הרביעי בציון הכולל (81/100), אך עם תוצאה מושלמת במבחן הספרותי — 20/20. הגאורגית שלו כל כך טבעית, עד שכמעט אינה ניתנת להבחנה מטקסט שנכתב בידי אדם: „הרי השפה אינה נולדת רק כצורה של מילים, אלא הופכת לשביל רוחני של ניסיון חיים, כאב ושמחה שנצברו במשך דורות“.
המהיר מכולם היה NVIDIA Nemotron-3-Ultra-550B — 4.5 שניות — אבל לטקסט שלו התגנבה מילה קירילית רוסית („генеτიკური“), מה שהוא דוגמה קלאסית ל„דליפת“ שפות במהלך אימון רב-לשוני; הוא גם המציא כלל דקדוק שאינו קיים כשהסביר את הכלל.
לוח התוצאות המלא (טופ-10)
1. DeepSeek V4.1 Flash — 92/100 (6.4 שנ')
2. Qwen3.8-Max — 89/100 (28.5 שנ')
3. Qwen3.8-Flash — 87/100 (22.1 שנ')
4. MiniMax-M3 — 81/100 (12.6 שנ')
5. NVIDIA Nemotron-3-Ultra-550B — 79/100 (4.5 שנ')
6. Qwen3.8-Max-0902 — 78/100
7. Xiaomi MiMo v2.5 — 54/100
8. StepFun Step-3.7-Flash — 44/100
9. StepFun Step-3.5-Flash — 40/100
10. Ling 3.0 Flash — 36/100
התמונה הכוללת ברורה: הפער בין החמישייה הראשונה לשאר ענק — נפילה מ-79 נקודות ל-54. שלושה מודלים בכלל לא הגיעו לשלב הבדיקה (שניים בגלל מגבלות חבילה, ואחד היה זמנית לא זמין).
איזה מודל מתאים למה
לעבודה יומיומית — כתיבת טקסטים, עריכה, שאלות ותשובות — הבחירה הטובה ביותר היא DeepSeek V4.1 Flash: היחס הטוב ביותר בין מהירות, מחיר ואיכות. לניתוח מורכב ולטקסטים משפטיים מתאים יותר Qwen3.8-Max, ולחומרים שיווקיים ויצירתיים — MiniMax-M3, שהגאורגית שלו היא ה„חיה“ ביותר. המסקנה המרכזית פשוטה: עבור השפה הגאורגית כדאי לבחור מודל לא לפי מותג או גודל, אלא לפי בדיקה אמיתית.
בדיוק משום כך פרסמנו את התוצאות המלאות ואת המתודולוגיה — כדי שלכל מי שעובד עם טקסטים בגאורגית יהיה פתרון מוכן.
SiTech — פיתוח אתרים בכוח ה-AI
אנחנו בונים אתרים מהירים ומודרניים ומשלבים AI בתהליכי עבודה אמיתיים. יש לכם פרויקט או שאלה? נשמח לעזור.