Geri Dön
BTU, AI eğitimi için açık Gürcüce veri setini yayımladı
SiTech AI Team2 წთ. საკითხავი

BTU, AI eğitimi için açık Gürcüce veri setini yayımladı

İş ve Teknoloji Üniversitesi (BTU), AI sistemleri için açık Gürcüce dil kaynağını GitHub'da yayımladı. Palitra Media desteğiyle hazırlanan veri seti 645.555 yapılandırılmış kayıt ve yaklaşık 12 milyon token içeriyor.

İş ve Teknoloji Üniversitesi (BTU), AI sistemlerini eğitmek ve değerlendirmek için açık bir Gürcüce dil kaynağı oluşturdu ve GitHub'da yayımladı. Palitra Media'nın desteğiyle hazırlanan sürüm, 645.555 yapılandırılmış kayıt içeriyor — üniversite bu hacmi yaklaşık 12 milyon dil modeli token'ı olarak tanımlıyor.

Gürcüce neden kendi verisine ihtiyaç duyuyor

BTU'ya göre bir dilin AI çağındaki geleceği, dijital olarak ne kadar iyi temsil edildiğine bağlı. Bir model bir dili yalnızca dağınık metinlerden öğrendiğinde garip cümleler kurabilir, bağlamı yanlış anlayabilir, dil bilgisi, deyimler ve mesleki terminolojide zorlanabilir. Gürcüce özellikle zorlayıcı: anlamın büyük bölümü fiil biçimleri, hâl ekleri ve bağlamla aktarılır; sözcük sırası ise esnektir.

Bu nedenle kaynak, rastgele bir metin toplamı değil, dilin on iki alanını kapsayan yapılandırılmış bir sistem: sözcük biçimleri, fiiller, cümleler, hâller, deyimler, mesleki terminoloji, nicelikler, alıntılar, kavramlar, resmî veriler, medya başlıkları ve tipik AI hatalarına dair örnekler.

Sürüm neleri içeriyor

Palitra Media geniş çağdaş Gürcüce materyal sağladı; BTU da bunu araştırma ve teknoloji geliştirmeye uygun açık bir formata dönüştürdü. Üniversiteye göre kaynak Gürcüce sohbet botlarını, çeviriyi, aramayı, eğitim araçlarını ve dijital hizmetleri destekleyebilir; bu da daha doğal müşteri desteği ve daha anlaşılır kamu hizmetleri anlamına gelir.

Açık yayın ve sınırları

GitHub'da yayımlamak, Gürcistan'daki ve yurt dışındaki araştırmacılara, üniversitelere ve geliştiricilere kaynağa serbest erişim sağlıyor; Gürcücenin yeni çalışmalarda, model uyarlama projelerinde ve değerlendirme görevlerinde yer alma olasılığını artırıyor. BTU, yayımlamanın tek başına ChatGPT, Gemini veya Claude gibi ticari sistemlerin veriden otomatik olarak öğreneceği anlamına gelmediğini vurguluyor: bilinçli eğitim, entegrasyon ve test hâlâ gerekiyor.

Bundan sonra ne var

Üniversite projeyi dijital dil egemenliği meselesi olarak çerçeveliyor: Gürcüceyi küresel sistemler içinde teknolojik olarak tanımlama ve geliştirme kapasitesi. BTU araştırmacılarına göre asıl değer token sayısı değil, Gürcücenin artık ortak bir dijital temele sahip olması. Bu tamamlanmış bir ulusal AI modeli değil; sıradaki aşama uzman incelemesi, farklı modellerde testler ve iyileşmenin ölçülebilir kanıtları.

SSiTech

SiTech — AI destekli web geliştirme

Hızlı ve modern web siteleri kuruyor, AI'yı gerçek iş akışlarına taşıyoruz. Projeniz veya sorunuz mu var? Yardımcı olmaktan mutluluk duyarız.