العودة
من يعرف الجورجية حقاً؟ الاختبار الكبير لـ22 نموذج ذكاء اصطناعي
SiTech AI Team4 წთ. საკითხავი

من يعرف الجورجية حقاً؟ الاختبار الكبير لـ22 نموذج ذكاء اصطناعي

اختبرنا 22 نموذجاً رائداً من نماذج الذكاء الاصطناعي على اللغة الجورجية: الصرف، والتراكيب الإرغاتيفية، والتعابير الاصطلاحية، والأسلوب الأدبي. و90% من النماذج تخطئ في الإرغاتيف — والفائز هو DeepSeek V4.1 Flash (92/100).

«გიორგი მივიდა» أم «გიორგიმ მივიდა»؟ الجواب واضح لكل جورجي: الصيغة الأولى هي الصحيحة، لأن الفعل «მივიდა» فعل لازم، ويتطلب في صيغة الماضي التام أن يأتي الفاعل في حالة الرفع. لكن حين طرحنا السؤال على 22 نموذجاً رائداً من نماذج الذكاء الاصطناعي، أخطأ معظمها — نحو 90% — هنا تحديداً.

أجرينا واحداً من أوسع اختبارات الأداء للذكاء الاصطناعي في الجورجية: 22 نموذجاً، وأربعة تخصصات، ونظام تقييم من 100 نقطة. وتُظهر النتائج أن الجورجية لا تزال اختباراً عسيراً على التقنية الحديثة — لكن هناك نماذج تتقنها حقاً.

لماذا الجورجية اختبار استثنائي للذكاء الاصطناعي

تتلقى معظم النماذج تدريبها على بيانات بالإنجليزية والصينية، فيما تنتمي الجورجية إلى اللغات قليلة الموارد. وعائلة اللغات الكارتفيلية معزولة، وتحمل قواعدها خصائص تفشل فيها النماذج الشاملة: الإلصاق وتعدد الأشخاص في الفعل («დაგვახვედრეს»، «გამომიგზავნეს»)، والإرغاتيفية المنقسمة والتراكيب المستنسخة من لغات أجنبية («იქნა მიღებული»، «ჩემს მიერ»)، وهي صيغ تمتلئ بها نصوص جورجية كثيرة على الإنترنت، فتتعلمها النماذج بوصفها صيغاً «صحيحة».

الاختبار: أربعة تخصصات

قُيّم كل نموذج في أربعة مجالات، عبر واجهة برمجية (API) موحدة، وبمطالبات متطابقة ودرجة حرارة دنيا:

1. الصرف والتراكيب الإرغاتيفية (25 نقطة). ثلاث جمل مع إدخال الحالات الإعرابية — من بينها «გუშინ ______ (გიორგი) სკოლაში დროზე მივიდა». الصحيح «გიორგი»، لأن الفعل لازم.

2. اكتشاف الأخطاء وتحريرها (35 نقطة). نص يحوي خمسة عيوب خفية: صيغة مجهولة مستنسخة من الروسية «იქნა მიღებული»، وخطأ معجمي «რამოდენიმე»، وحشو «ყველაზე საუკეთესო»، وعدم مطابقة في العدد «ათი სტუდენტები»، وفاصلة ساقطة.

3. التعابير الاصطلاحية والعبارات الجاهزة (20 نقطة). «კოვზი ნაცარში ჩაუვარდა»، «წყალი შეუყენა»، «თვალში ნაცრის შეყრა» — إدراك المعنى المجازي وأمثلة سياقية.

4. الأسلوب الأدبي (20 نقطة). سرد حرّ حول موضوع «ენა, როგორც ერის მეხსიერება» — بلا تراكيب مستنسخة، وبأسلوب رفيع.

الدراما: كيف «علق» النماذج في التفكير

في الجولة الأولى، أعاد 14 نموذجاً من أصل 22 إجابة فارغة، رغم أن حالة الاستجابة كانت 200 OK. وتبين أن السبب هو سلسلة الاستدلال الداخلية: فمهمة بسيطة بالإنجليزية تحتاج إلى 100-200 «رمز تفكير»، بينما انفجر هذا الرقم مع الجورجية إلى 1,200-2,400 رمز. ومع ميزانية من 1,000 رمز، استنفدت النماذج الحد كله في التفكير ولم تصل إلى الإجابة.

ومع حد أقصى من 2,500 رمز تغيرت الصورة: استهلك DeepSeek V4.1 Flash 1,242 رمزاً في التفكير، ثم كتب إجابة جورجية بلا أخطاء، واحتاج Qwen3.8-Max إلى 1,443 رمزاً. أما الحالة الاستثنائية فهي GLM-5.3-flash الذي وقع في حلقة استدلال لا نهائية: استهلك 2,494 رمزاً ولم يصل إلى الإجابة مع ذلك.

الفائزون

سجل DeepSeek V4.1 Flash أفضل نتيجة — 92/100: دقة 100% في اختبار الإرغاتيف، وتحرير بلا أخطاء (وجد كل العيوب، بما فيها الصيغة المستنسخة من الروسية)، ومتوسط زمن استجابة لم يتجاوز 6.4 ثانية. وفي المركز الثاني جاء Qwen3.8-Max (89/100) بأقوى استدلال منطقي، لكن بتأخير بلغ 28.5 ثانية؛ وفي الثالث Qwen3.8-Flash (87/100).

والملفت أن MiniMax-M3 حل رابعاً في المجموع العام (81/100)، لكنه حقق نتيجة مطلقة في الاختبار الأدبي — 20/20؛ فالنص الذي كتبه طبيعي إلى حد يصعب معه تمييزه عن كتابة إنسان. وهو يقول في نصه: «اللغة لا تُولد مجرّد قالبٍ للكلمات، بل تصير أثراً روحياً لتجربة حياة ووجعٍ وفرح تراكمت على مرّ القرون».

أما أسرع النماذج فكان NVIDIA Nemotron-3-Ultra-550B — 4.5 ثانية — غير أن كلمة روسية بالحروف الكيريلية («генеτიკური») تسللت إلى نصه، وهو نموذج كلاسيكي لـ«تسرب» اللغات أثناء التدريب متعدد اللغات؛ كما اختلق، وهو يشرح القاعدة، قاعدة نحوية غير موجودة.

لوحة الصدارة الكاملة (أفضل 10)

1. DeepSeek V4.1 Flash — 92/100 (6.4 ثانية)
2. Qwen3.8-Max — 89/100 (28.5 ثانية)
3. Qwen3.8-Flash — 87/100 (22.1 ثانية)
4. MiniMax-M3 — 81/100 (12.6 ثانية)
5. NVIDIA Nemotron-3-Ultra-550B — 79/100 (4.5 ثانية)
6. Qwen3.8-Max-0902 — 78/100
7. Xiaomi MiMo v2.5 — 54/100
8. StepFun Step-3.7-Flash — 44/100
9. StepFun Step-3.5-Flash — 40/100
10. Ling 3.0 Flash — 36/100

والصورة العامة واضحة: الفجوة بين الخمسة الأوائل وبقية القائمة هائلة — هبوط من 79 نقطة إلى 54. ولم يصل ثلاثة نماذج إلى مرحلة الاختبار (اثنان بسبب قيود الحزمة، وواحد كان غير متاح مؤقتاً).

أي نموذج لأي مهمة

للعمل اليومي — كتابة النصوص وتحريرها والأسئلة والأجوبة — يبقى DeepSeek V4.1 Flash الخيار الأفضل: أفضل توازن بين السرعة والسعر والجودة. وللتحليل المعقد والنصوص القانونية يقدم Qwen3.8-Max عمقاً أكبر، أما للمواد التسويقية والإبداعية فـ MiniMax-M3، الأكثر حيوية في النصوص الجورجية.

والخلاصة بسيطة: اختيار النموذج المناسب للجورجية يجب أن يستند إلى اختبار حقيقي، لا إلى العلامة التجارية أو حجم النموذج. ولهذا بالضبط نشرنا النتائج الكاملة والمنهجية — ليكون الجواب جاهزاً لكل من يعمل على النصوص الجورجية.

SSiTech

SiTech — تطوير ويب مدعوم بالذكاء الاصطناعي

نبني مواقع سريعة وعصرية وندمج الذكاء الاصطناعي في سير عمل الشركات. لديك مشروع أو سؤال؟ يسعدنا مساعدتك.