Geri Dön
SiTech
Xiaomi MiMo 2.6, RL eğitimi için canlı panel açtı
SiTech AI Team2 წთ. საკითხავი

Xiaomi MiMo 2.6, RL eğitimi için canlı panel açtı

Xiaomi'nin MiMo ekibi, mimo-v2.6-pro ve mimo-v2.6-flash modellerinin reinforcement learning metriklerini, benchmark sonuçlarını ve olay kayıtlarını doğrudan eğitici loglarından canlı yayınlayan bir panel yayımladı.

Xiaomi'nin MiMo ekibi 17 Eylül'de, mimo-v2.6-pro ve mimo-v2.6-flash modellerinin reinforcement learning metriklerini eğitici loglarından canlı olarak gösteren genel bir panel açtı. Panel üç bölümden oluşuyor — genel bakış, metrikler ve "about" — ve içinde bir bildirim akışı, metrik bazlı grafikler, bir benchmark tablosu ile her eğitim adımının batch bileşimi yer alıyor.

Panel ne gösteriyor

En sıra dışı bölüm bildirim akışı: laboratuvarların genellikle açıklamadığı arızalar burada açıkça listeleniyor. pro çalışması, uzman yükü dengesizliğinden kaynaklanan bir GPU bellek yetersizliği (OOM) nedeniyle 17. adımdan yeniden başlatıldı; ekip eğitim paralelleştirme stratejisini değiştirdi.

Başka bir kayıt, pro eğitim kümesi ile grader dağıtımı arasındaki ağ bağlantısı sorununu anlatıyor. Çalışma yeniden başlatıldı ve cyber veri kümesi, rollout loglarında kötü örüntüler görüldüğü için sonraki pro çalışmasından çıkarıldı. flash çalışması ise bir veri kümesindeki altyapı hatasının yaklaşık üç saat boyunca fark edilmemesi nedeniyle 15. adımdan yeniden başlatıldı. İki çalışma da 30. adımda durdu: pro 20 Eylül'de 5 gün 7 saatlik çalışmanın ardından, flash ise 19 Eylül'de.

Rakamlar ve benchmarklar

Panel benchmark sonuçlarını avg@3 ölçeğinde yayımlıyor. mini-swe-agent ile DeepSWE v1.1'de pro 72.57, flash 65.68 puan alıyor; şirket içi Coding Bench'te 65.43 ve 62.87; AutomationBench v1.0.6'da ise 53.10 ve 52.70.

Eğitim metriklerinde dynsam/avg@n pro için 0.633 (+0.011), flash için 0.644 (−0.019) seviyesinde. Ortalama bağlam uzunluğu pro'da 137 bin, flash'ta 148 bin token; adım başına işlenen token sayısı 3,43 ve 3,7 milyara ulaşıyor, tek bir adım ise sırasıyla 6 saat 26 dakika ve 3 saat 27 dakika sürüyor. Yayımlanan son verilere göre pro, 1.568 hedefe karşılık 664 örnek kabul etti (pass 0.606), flash ise 2.704 örnek.

Neden önemli

RL eğitimi binlerce veri kümesine dayanıyor — panel code, cyber, visual, general ve chat kategorilerinde 25 kaynağı takip ediyor. Bu tür operasyonel ayrıntılar nadiren kamuya açılır. MiMo paneli, sınır modellerinin eğitiminin uzun ve arızalara açık bir süreç olduğunu gösteriyor: yeniden başlatmalar ve tekrarlanan hata ayıklama istisna değil, kural.

SSiTech

SiTech — AI destekli web geliştirme

Hızlı ve modern web siteleri kuruyor, AI'yı gerçek iş akışlarına taşıyoruz. Projeniz veya sorunuz mu var? Yardımcı olmaktan mutluluk duyarız.