العودة
جامعة BTU تنشر مجموعة بيانات جورجية مفتوحة لتدريب الذكاء الاصطناعي
SiTech AI Team2 წთ. საკითხავი

جامعة BTU تنشر مجموعة بيانات جورجية مفتوحة لتدريب الذكاء الاصطناعي

نشرت جامعة الأعمال والتكنولوجيا (BTU) على GitHub مورداً مفتوحاً للغة الجورجية لتدريب أنظمة الذكاء الاصطناعي وتقييمها. ويضم الإصدار، المُعدّ بدعم من Palitra Media، نحو 645,555 سجلاً منظماً — أي ما يعادل تقريباً 12 مليون رمز لنماذج اللغة.

أنشأت جامعة الأعمال والتكنولوجيا (BTU) مورداً مفتوحاً للغة الجورجية لتدريب أنظمة الذكاء الاصطناعي وتقييمها، ونشرته على GitHub. وتضم النسخة المنشورة، التي أُعدّت بدعم من Palitra Media، نحو 645,555 سجلاً منظماً — وهو حجم تصفه الجامعة بما يعادل نحو 12 مليون رمز (token) لنماذج اللغة.

لماذا تحتاج الجورجية إلى بياناتها الخاصة

بحسب BTU، يعتمد مستقبل أي لغة في عصر الذكاء الاصطناعي على مدى جودة تمثيلها رقمياً. وإذا عرفت النماذج اللغة من نصوص متناثرة فقط، فقد تنتج جملاً غير طبيعية، وتسيء فهم السياق، وتتعثر في القواعد والتعابير الاصطلاحية والمصطلحات المهنية. والجورجية لغة متطلبة بشكل خاص: فجزء كبير من المعنى يُنقل عبر صيغ الفعل والحالات الإعرابية والسياق، بينما يبقى ترتيب الكلمات مرناً.

ولذلك ليس المورد مجموعة نصوص عشوائية، بل نظام منظم يغطي اثني عشر مجالاً: صيغ الكلمات، والأفعال، والجمل، والحالات، والتعابير، والمصطلحات المهنية، والكميات، والاقتباسات، والمفاهيم، والبيانات الرسمية، وعناوين الإعلام، وأمثلة على الأخطاء النمطية للذكاء الاصطناعي.

ماذا تتضمن النسخة المنشورة

وفّرت Palitra Media مادة جورجية معاصرة واسعة، حوّلتها BTU إلى صيغة مفتوحة مناسبة للبحث والتطوير التقني. وتقول الجامعة إن المورد يمكن أن يدعم روبوتات المحادثة بالجورجية والترجمة والبحث والأدوات التعليمية والخدمات الرقمية، ما يؤدي إلى دعم عملاء أكثر طبيعية وخدمات عامة أوضح.

النشر المفتوح وحدوده

يتيح النشر على GitHub للباحثين والجامعات والمطورين في جورجيا وخارجها وصولاً حراً إلى المورد، ويزيد احتمال ظهور الجورجية في دراسات جديدة ومشاريع تكييف النماذج ومهام التقييم. وتشير BTU إلى أن النشر وحده لا يعني أن أنظمة تجارية مثل ChatGPT أو Gemini أو Claude ستتعلم من البيانات تلقائياً: فلا يزال التدريب المقصود والتكامل والاختبار ضرورية.

ما الخطوة التالية

تطرح الجامعة المشروع في إطار السيادة اللغوية الرقمية — قدرة الدولة على وصف لغتها وتطويرها تقنياً داخل الأنظمة العالمية. ويقول باحثو BTU إن القيمة الأساسية ليست عدد الرموز، بل أن الجورجية أصبحت تملك أساساً رقمياً مشتركاً. وهذا ليس نموذجاً وطنياً مكتملاً للذكاء الاصطناعي؛ فالمرحلة التالية هي مراجعة الخبراء والاختبار عبر نماذج مختلفة وأدلة قابلة للقياس على التحسن.

SSiTech

SiTech — تطوير ويب مدعوم بالذكاء الاصطناعي

نبني مواقع سريعة وعصرية وندمج الذكاء الاصطناعي في سير عمل الشركات. لديك مشروع أو سؤال؟ يسعدنا مساعدتك.