Geri qayıt
NVIDIA cədvəl proqnozlaşdırması üçün açıq Kumo Tabular modelini buraxdı
SiTech AI Team2 წთ. საკითხავი

NVIDIA cədvəl proqnozlaşdırması üçün açıq Kumo Tabular modelini buraxdı

NVIDIA Kumo Tabular-ı buraxdı: yeni sətirlərin etiketlərini təlim və xüsusiyyət hazırlığı olmadan bir irəli keçidlə proqnozlaşdıran açıq baza modeli dörd benchmarkda birinci yerdədir.

NVIDIA sentyabrın 29-da Kumo Tabular-ı buraxdı. Bu, cədvəl məlumatları üçün açıq baza modelidir və NVIDIA Kumo Structured kolleksiyasına daxildir. Çəkilər Hugging Face-də, kod isə şirkətin açıq kitabxanasındadır (structured-data-models). Model kommersiya istifadəsinə icazə verən OpenMDW-1.1 lisenziyası ilə yayılır.

Kumo Tabular სიზუსტე-ეფექტურობის პარეტოს ფრონტზე

Modelə etiketli sətirlərdən ibarət cədvəl verilir və o, yeni sətirlərin etiketlərini bir irəli keçidlə qaytarır: təlim, incə tənzimləmə və xüsusiyyət hazırlığı olmadan, həm təsnifat, həm də reqressiya üçün. Model 28 milyondan 215 milyon parametrə qədər üç ölçüdədir və yalnız süni cədvəllərdə öyrədilib.

Necə işləyir

Kumo Tabular cədvəl strukturuna söykənən transformer-dir: TabICL və TabPFN yanaşmasına bənzər şəkildə sütun, sətir və kontekst diqqətindən istifadə edir. Hər bir dəyər öz sütununun paylanmasında qiymətləndirilir, sətir daxilində xüsusiyyətlərin qarşılıqlı təsiri qeyd olunur, məlum etiketləri olan sətirlər isə yeni sətirlərə bağlanır. Kontekst sorğulara heç vaxt baxmır, buna görə də onun açarları bir dəfə hesablanır və sonrakı proqnozlar üçün dəfələrlə istifadə olunur. Rəqəmsal və kateqoriyalı məlumatlar Fourier xüsusiyyətlərindən keçir, çatışmayan dəyərlər isə doldurulma tələb etmir. Diqqət temperaturu açarların sayının loqarifmi ilə birlikdə artır ki, daha böyük cədvəllərdə kəskin qalsın.

Süni məlumatlarda təlim

სავარჯიშო ცხრილების გენერატორის სქემა

Hər təlim cədvəli Struktur Səbəbiyyət Modelindən (Structural Causal Model) yaradılır və sonra emal olunur: sütun qrupları bir-biri ilə kəsişir, kənar dəyərlər kəsilir, cədvələ çatışmayan məlumatlar süni şəkildə əlavə edilir, tree-ensemble yoxlaması isə qanunauyğunluqdan məhrum qalan cədvəlləri kənar edir. Təlim üç mərhələdə aparıldı: 1 024 sətirli və 100 sütuna qədər cədvəllərdən 400–10 240 sətirli kontekstə, sonda isə 60 000 sətirə qədər. Small, Medium və Large versiyaları təxminən 35, 71 və 137 milyon süni cədvəl gördü. Təsnifat və reqressiya ayrı-ayrı modellər kimi öyrədilir.

Nəticələr

TabArena-da Kumo Tabular 1950 ELO ilə birinci yerdədir və NVIDIA-nın açıqlamasına görə, bir RTX 6000 Pro şəraitində LimiX-2-dən 17 dəfə daha sürətli işləyir. BeyondArena-da model 1418 ELO və 7,78% Improvability qiyməti aldı və yenə birincidir. TALENT-də o, ümumi reytinqdə təsnifat dəqiqliyi, log-loss və reqressiya RMSE-si ilə birincidir; orta reytinqlər 6,67; 3,98 və 4,22-dir. ScoringBench-də Kumo Tabular-Large və Medium orta reytinqlə birinci və ikinci yerlərdədirlər.

Məhdudiyyətlər

SSiTech

SiTech — AI ilə gücləndirilmiş veb hazırlanması

Sürətli və müasir saytlar qurur, AI-ı real biznes proseslərinə gətiririk. Layihəniz və ya sualınız var? Kömək etməyə hazırıq.