Xiaomi MiMo 2.6 RL təlimi üçün canlı panel açdı
Xiaomi-nin MiMo komandası mimo-v2.6-pro və mimo-v2.6-flash modellərinin reinforcement learning göstəricilərini, benchmark nəticələrini və insident jurnalını təlimçinin loglarından canlı yayımlayan panel açdı.
Xiaomi-nin MiMo komandası sentyabrın 17-də mimo-v2.6-pro və mimo-v2.6-flash modellərinin reinforcement learning göstəricilərini birbaşa təlimçinin loglarından canlı yayımlayan açıq panel açdı. Panel üç bölmədən ibarətdir — ümumi baxış, metrikalar və «about» — və bildiriş lenti, ayrı-ayrı metrikaların qrafikləri, benchmark cədvəli ilə hər təlim addımının batch tərkibini əhatə edir.
Panel nə göstərir
Ən qeyri-adi hissə bildiriş lentidir: laboratoriyaların adətən açıqlamadığı nasazlıqlar burada açıq şəkildə sadalanır. pro yürüşü ekspert yükü balanssızlığından yaranan GPU yaddaşının tükənməsi (OOM) səbəbindən 17-ci addımdan yenidən başladıldı; komanda təlimin paralelləşdirmə strategiyasını dəyişdi.
Başqa bir qeyd pro təlim klasteri ilə grader yerləşdirməsi arasındakı şəbəkə bağlantısı problemini təsvir edir. Yürüş yenidən başladıldı və cyber verilənlər toplusu rollout loglarında pis nümunələr göründüyü üçün növbəti pro yürüşündən çıxarıldı. flash yürüşü isə bir verilənlər toplusundakı infrastruktur xətasının təxminən üç saat ərzində aşkarlanmaması səbəbindən 15-ci addımdan yenidən başladıldı. Hər iki yürüş 30-cu addımda dayandı: pro 20 sentyabrda 5 gün 7 saat işlədikdən sonra, flash isə 19 sentyabrda.
Rəqəmlər və benchmarklar
Panel benchmark nəticələrini də avg@3 formatında yayımlayır. mini-swe-agent ilə DeepSWE v1.1-də pro 72.57, flash 65.68 xal toplayır; daxili Coding Bench-də — 65.43 və 62.87; AutomationBench v1.0.6-da isə 53.10 və 52.70.
Təlim metrikaları arasında dynsam/avg@n pro üçün 0.633 (+0.011), flash üçün 0.644 (−0.019) təşkil edir. Kontekstin orta uzunluğu pro üçün 137 min, flash üçün 148 min tokendir; bir addımda emal olunan token sayı 3.43 və 3.7 milyarda çatır, bir addımın müddəti isə uyğun olaraq 6 saat 26 dəqiqə və 3 saat 27 dəqiqədir. Yayımlanan son məlumatlara görə pro 1,568 hədəfə qarşı 664 nümunə qəbul etdi (pass 0.606), flash isə 2,704.
Niyə vacibdir
RL təlimi zamanı model minlərlə verilənlər toplusu üzərində işləyir — panel code, cyber, visual, general və chat kateqoriyalarında 25 mənbəni izləyir. Bu cür əməliyyat detalları adətən açıqlanmır. MiMo paneli göstərir ki, müasir modelin təlimi uzun və nasazlıqlarla dolu prosesdir: yenidən başlatmalar və təkrar sazlama istisna deyil, normadır.
SiTech — AI ilə gücləndirilmiş veb hazırlanması
Sürətli və müasir saytlar qurur, AI-ı real biznes proseslərinə gətiririk. Layihəniz və ya sualınız var? Kömək etməyə hazırıq.