Назад
NVIDIA випустила відкриту модель Kumo Tabular для табличного прогнозування
SiTech AI Team2 წთ. საკითხავი

NVIDIA випустила відкриту модель Kumo Tabular для табличного прогнозування

NVIDIA випустила Kumo Tabular — відкриту базову модель, яка прогнозує підписи нових рядків одним проходом вперед без навчання й підготовки ознак та посідає перше місце на чотирьох бенчмарках у табличних задачах.

NVIDIA 29 вересня випустила Kumo Tabular. Це відкрита базова модель для табличних даних, що входить до колекції NVIDIA Kumo Structured. Ваги доступні на Hugging Face, а код — у відкритій бібліотеці компанії (structured-data-models). Модель поширюється за ліцензією OpenMDW-1.1, що дозволяє комерційне використання.

Kumo Tabular სიზუსტე-ეფექტურობის პარეტოს ფრონტზე

Моделі подають таблицю з підписаними рядками, і вона повертає підписи нових рядків одним проходом вперед: без навчання, донавчання й підготовки ознак, як для класифікації, так і для регресії. Модель існує у трьох розмірах — від 28 мільйонів до 215 мільйонів параметрів — і тренувалася лише на штучних таблицях.

Як це працює

Kumo Tabular — це трансформер, побудований навколо структури таблиці: він використовує увагу до стовпців, рядків і контексту, подібно до підходу TabICL і TabPFN. Кожне значення оцінюється в розподілі свого стовпця, взаємодія ознак усередині рядка фіксується, а рядки з відомими підписами зв’язуються з новими рядками. Контекст ніколи не дивиться на запити, тому його ключі обчислюються один раз і багаторазово використовуються для подальших прогнозів. Числові та категоріальні дані проходять через ознаки Fourier, а пропущені значення не потребують заповнення. Температура уваги зростає разом із логарифмом кількості ключів, щоб залишатися різкою на більших таблицях.

Навчання на штучних даних

სავარჯიშო ცხრილების გენერატორის სქემა

Кожна тренувальна таблиця генерується з моделі структурної причинності (Structural Causal Model) і потім обробляється: групи стовпців перетинаються між собою, крайні значення обрізаються, пропущені дані штучно додаються до таблиці, а перевірка tree-ensemble відкидає таблиці, що залишилися без закономірності. Навчання відбувалося у три етапи: від таблиць із 1 024 рядками та до 100 стовпців до контексту з 400–10 240 рядків, а зрештою — до 60 000 рядків. Версії Small, Medium і Large побачили приблизно 35, 71 і 137 мільйонів штучних таблиць. Класифікація та регресія тренуються як окремі моделі.

Результати

На TabArena Kumo Tabular посідає перше місце з 1950 ELO і, за заявою NVIDIA, в умовах однієї RTX 6000 Pro працює у 17 разів швидше за LimiX-2. На BeyondArena модель отримала 1418 ELO та оцінку Improvability 7,78% і знову перша. На TALENT вона перша в загальному ранжуванні за точністю класифікації, log-loss і RMSE регресії; середні ранги — 6,67; 3,98 і 4,22. На ScoringBench Kumo Tabular-Large і Medium посідають перше та друге місця за середнім рангом.

Обмеження

SSiTech

SiTech — веброзробка з підтримкою AI

Створюємо швидкі та сучасні сайти й інтегруємо AI у бізнес-процеси. Маєте проєкт чи запитання? Із задоволенням допоможемо.