Назад
BTU опублікував відкритий набір даних грузинської мови для навчання AI
SiTech AI Team2 წთ. საკითხავი

BTU опублікував відкритий набір даних грузинської мови для навчання AI

Бізнес-технологічний університет опублікував на GitHub відкритий ресурс грузинської мови для навчання AI. За підтримки Palitra Media набір містить 645 555 структурованих записів — приблизно 12 мільйонів токенів.

Бізнес-технологічний університет (BTU) створив відкритий ресурс грузинської мови для навчання й оцінювання AI-систем і опублікував його на GitHub. Випуск, підготовлений за підтримки Palitra Media, містить 645 555 структурованих записів — обсяг, який в університеті описують як приблизно 12 мільйонів токенів мовної моделі.

Чому грузинській мові потрібні власні дані

За словами BTU, майбутнє мови в епоху AI залежить від того, наскільки добре вона представлена в цифровому світі. Якщо модель знає мову лише з розрізнених текстів, вона може створювати неприродні речення, хибно розуміти контекст і плутатися в граматиці, ідіомах та фаховій термінології. Грузинська особливо вимоглива: значну частину смислу передають форми дієслів, відмінки та контекст, а порядок слів залишається вільним.

Тож ресурс — не випадковий набір текстів, а структурована система з дванадцяти напрямів: словоформи, дієслова, речення, відмінки, ідіоми, фахова термінологія, кількісні дані, цитати, поняття, офіційні дані, медійні заголовки та приклади типових помилок AI.

Що містить випуск

Palitra Media надала широкий масив сучасних грузинських матеріалів, а BTU перевела його у відкритий формат, придатний для досліджень і розробки технологій. В університеті кажуть, що ресурс підтримає грузиномовні чатботи, переклад, пошук, освітні інструменти та цифрові сервіси, а це має дати природнішу підтримку клієнтів і зрозуміліші публічні послуги.

Відкрита публікація та її межі

Публікація на GitHub дає дослідникам, університетам і розробникам у Грузії та за кордоном вільний доступ до ресурсу та підвищує шанс, що грузинська з'явиться в нових дослідженнях, проєктах адаптації моделей і задачах оцінювання. В BTU зазначають: сама публікація не означає, що комерційні системи як-от ChatGPT, Gemini чи Claude автоматично навчаться на цих даних — потрібні цілеспрямоване навчання, інтеграція й тестування.

Що далі

В університеті розглядають проєкт крізь призму цифрового мовного суверенітету — здатності описувати й розвивати грузинську мову технологічно всередині глобальних систем. Дослідники BTU кажуть, що головна цінність не в кількості токенів, а в тому, що грузинська тепер має спільну цифрову основу. Це не готовий національний AI-модель; наступний етап — експертна перевірка, тестування на різних моделях та вимірювані докази покращення.

SSiTech

SiTech — веброзробка з підтримкою AI

Створюємо швидкі та сучасні сайти й інтегруємо AI у бізнес-процеси. Маєте проєкт чи запитання? Із задоволенням допоможемо.