უკან დაბრუნება
BTU-მ AI-ის წვრთნისთვის ქართული ენის ღია მონაცემთა ნაკრები გამოაქვეყნა
SiTech AI Team2 წთ. საკითხავი

BTU-მ AI-ის წვრთნისთვის ქართული ენის ღია მონაცემთა ნაკრები გამოაქვეყნა

ბიზნესისა და ტექნოლოგიების უნივერსიტეტმა Palitra Media-ს მხარდაჭერით ქართული ენის ღია რესურსი შექმნა და GitHub-ზე გამოაქვეყნა. ნაკრები 645 555 სტრუქტურირებულ ჩანაწერსა და დაახლოებით 12 მილიონ ტოკენს მოიცავს.

ბიზნესისა და ტექნოლოგიების უნივერსიტეტმა (BTU) ქართული ენის ღია რესურსი შექმნა და GitHub-ზე გამოაქვეყნა. Palitra Media-ს მხარდაჭერით მომზადებული ნაკრები 645 555 სტრუქტურირებულ ჩანაწერს მოიცავს — უნივერსიტეტის განმარტებით, ეს დაახლოებით 12 მილიონი ტოკენია.

რატომ სჭირდება ქართულს საკუთარი მონაცემები

BTU-ის აზრით, ენის მომავალი AI-ის ეპოქაში იმაზეა დამოკიდებული, რამდენად კარგად არის ის ციფრულად წარმოდგენილი. თუ მოდელი ენას მხოლოდ გაფანტული ტექსტებიდან იცნობს, მას უხერხული წინადადებები გამოუვა, კონტექსტს ვერ გაიგებს და გრამატიკასთან, იდიომებთან და პროფესიულ ტერმინოლოგიასთან გაუჭირდება. ქართული განსაკუთრებით მომთხოვნია: მნიშვნელობის დიდი ნაწილი ზმნის ფორმებით, ბრუნვებითა და კონტექსტით გადაიცემა, სიტყვათა წყობა კი თავისუფალია.

სწორედ ამიტომ რესურსი ტექსტების შემთხვევითი კრებული არ არის — ის ენის თორმეტ მიმართულებას აერთიანებს: სიტყვის ფორმები, ზმნები, წინადადებები, ბრუნვები, იდიომები, პროფესიული ტერმინოლოგია, რაოდენობები, ციტატები, ცნებები, ოფიციალური მონაცემები, მედიის სათაურები და AI-ისთვის დამახასიათებელი შეცდომების მაგალითები.

რას მოიცავს ნაკრები

Palitra Media-მ თანამედროვე ქართული მასალის ფართო არჩევანი მოამზადა, BTU-მ კი ის ღია ფორმატში გადაიტანა — კვლევისა და ტექნოლოგიური განვითარებისთვის მოსახერხებელ სახეში. უნივერსიტეტის თქმით, რესურსი დაეხმარება ქართულენოვან ჩატბოტებს, მანქანურ თარგმანს, ძიებას, საგანმანათლებლო ხელსაწყოებსა და ციფრულ სერვისებს. ეს კი უფრო ბუნებრივ მომხმარებელთა მხარდაჭერასა და გასაგებ საჯარო სერვისებს უნდა მოჰყვეს.

ღია გამოქვეყნება და მისი ფარგლები

GitHub-ზე გამოქვეყნება მკვლევრებს, უნივერსიტეტებსა და დეველოპერებს — როგორც საქართველოში, ისე მის ფარგლებს გარეთ — რესურსზე თავისუფალ წვდომას აძლევს და ზრდის ალბათობას, რომ ქართული ახალ კვლევებში, მოდელების ადაპტაციის პროექტებსა და შეფასების ამოცანებში გამოჩნდეს. თუმცა, BTU-ის განცხადებით, გამოქვეყნება თავისთავად არ ნიშნავს, რომ კომერციული სისტემები — ChatGPT, Gemini ან Claude — ამ მონაცემებს ავტომატურად ისწავლიან: საჭიროა მიზანმიმართული წვრთნა, ინტეგრაცია და ტესტირება.

შემდეგი ნაბიჯები

უნივერსიტეტი პროექტს ციფრული ენობრივი სუვერენიტეტის საკითხად განიხილავს — ქვეყნის უნარს, საკუთარი ენა გლობალურ სისტემებში ტექნოლოგიურად აღწეროს და განავითაროს. BTU-ის მკვლევრების შეფასებით, მთავარი მნიშვნელობა ტოკენების რაოდენობა არ არის — ქართულს საერთო ციფრული საფუძველი გაუჩნდა, რომელზეც სხვადასხვა ტექნოლოგია აშენდება. ეს მზა ეროვნული AI მოდელი არ არის; შემდეგი ეტაპი ექსპერტული გადამოწმება, მოდელებზე ტესტირება და გაუმჯობესების გაზომვადი მტკიცებულებების შეგროვებაა.

SSiTech

SiTech — AI-გაძლიერებული ვებ დეველოპმენტი

ვქმნით სწრაფ, თანამედროვე ვებსაიტებს და AI-ს ვაერთიანებთ ქართული ბიზნესებისთვის. გაქვთ პროექტი ან კითხვა? სიამოვნებით დაგეხმარებით.