
NVIDIA تطلق نموذج Kumo Tabular المفتوح للتنبؤ الجدولي
أطلقت NVIDIA نموذج Kumo Tabular، وهو نموذج أساسي مفتوح يتوقع تسميات الصفوف الجديدة بتمريرة أمامية واحدة دون تدريب أو هندسة ميزات، ويتصدر أربعة معايير تقييم في مهام البيانات الجدولية.
أطلقت NVIDIA في 29 سبتمبر نموذج Kumo Tabular. هذا نموذج أساسي مفتوح للبيانات الجدولية، وينتمي إلى مجموعة NVIDIA Kumo Structured. الأوزان متاحة على Hugging Face، والكود في مكتبة الشركة المفتوحة (structured-data-models). يُوزَّع النموذج بموجب ترخيص OpenMDW-1.1، الذي يسمح بالاستخدام التجاري.

يُعطى النموذج جدولاً بصفوف مُعلَّمة، فيعيد تسميات الصفوف الجديدة بتمريرة أمامية واحدة: دون تدريب أو ضبط دقيق أو هندسة ميزات، سواء للتصنيف أو للانحدار. يتوفر النموذج بثلاثة أحجام، من 28 مليوناً إلى 215 مليون معامل، ودُرِّب فقط على جداول اصطناعية.
كيف يعمل
Kumo Tabular هو محوّل (transformer) مبني حول بنية الجدول: يستخدم انتباه الأعمدة والصفوف والسياق، على غرار نهج TabICL وTabPFN. تُقيَّم كل قيمة داخل توزيع عمودها، ويُلتقط تفاعل الميزات داخل الصف، وتُربط الصفوف ذات التسميات المعروفة بالصفوف الجديدة. لا ينظر السياق أبداً إلى الاستعلامات، لذلك تُحسب مفاتيحه مرة واحدة وتُستخدم مراراً للتنبؤات اللاحقة. تمر البيانات الرقمية والفئوية عبر ميزات Fourier، بينما لا تحتاج القيم المفقودة إلى تعبئة. ترتفع حرارة الانتباه مع لوغاريتم عدد المفاتيح لتبقى حادة على الجداول الأكبر.
التدريب على بيانات اصطناعية

يُولَّد كل جدول تدريبي من نموذج السببية البنيوي (Structural Causal Model) ثم يُعالَج: تتداخل مجموعات الأعمدة مع بعضها، وتُقص القيم الطرفية، وتُضاف البيانات المفقودة إلى الجدول اصطناعياً، ويرفض فحص tree-ensemble الجداول التي تبقى دون انتظام. جرى التدريب على ثلاث مراحل: من جداول بـ1,024 صفاً وحتى 100 عمود إلى سياق من 400–10,240 صفاً، وأخيراً حتى 60,000 صف. رأت إصدارات Small وMedium وLarge حوالي 35 و71 و137 مليون جدول اصطناعي. يُدرَّب التصنيف والانحدار كنموذجين منفصلين.
النتائج
على TabArena يحتل Kumo Tabular المركز الأول بـ1950 ELO، ووفقاً لـNVIDIA فإنه يعمل أسرع 17 مرة من LimiX-2 في ظروف RTX 6000 Pro واحد. على BeyondArena حصل النموذج على 1418 ELO وتقييم Improvability بنسبة 7.78% وهو أول مجدداً. على TALENT هو الأول في الترتيب العام من حيث دقة التصنيف وlog-loss وRMSE للانحدار؛ ومتوسطات الترتيب هي 6.67 و3.98 و4.22. على ScoringBench يحتل Kumo Tabular-Large وMedium المركزين الأول والثاني بمتوسط الترتيب.
القيود
SiTech — تطوير ويب مدعوم بالذكاء الاصطناعي
نبني مواقع سريعة وعصرية وندمج الذكاء الاصطناعي في سير عمل الشركات. لديك مشروع أو سؤال؟ يسعدنا مساعدتك.