Назад
SiTech
Xiaomi MiMo 2.6 відкрила живу панель навчання RL-моделей
SiTech AI Team2 წთ. საკითხავი

Xiaomi MiMo 2.6 відкрила живу панель навчання RL-моделей

Команда MiMo від Xiaomi опублікувала відкриту панель, яка в реальному часі показує метрики reinforcement learning, результати бенчмарків і журнал інцидентів для mimo-v2.6-pro та mimo-v2.6-flash.

17 вересня команда MiMo від Xiaomi відкрила публічну панель, яка показує метрики reinforcement learning для моделей mimo-v2.6-pro і mimo-v2.6-flash у реальному часі — дані надходять безпосередньо з логів тренера. Панель має три розділи: огляд, метрики та «about». На ній є стрічка повідомлень, графіки окремих метрик, таблиця бенчмарків і склад батча для кожного кроку навчання.

Що показує панель

Найнезвичніша частина — стрічка повідомлень, де відкрито описано збої, про які лабораторії зазвичай не розповідають. Запуск pro перезапустили з 17-го кроку через вичерпання пам'яті GPU, спричинене дисбалансом навантаження експертів; команда змінила стратегію паралелізації навчання.

В іншому записі йдеться про проблему з мережевим з'єднанням між навчальним кластером pro і розгортанням grader. Запуск перезапустили, а набір даних cyber прибрали з наступного запуску pro, бо в логах rollout з'явилися погані шаблони. Запуск flash перезапустили з 15-го кроку: інфраструктурну помилку в одному з наборів даних не виявляли приблизно три години. Обидва запуски зупинилися на 30-му кроці — pro 20 вересня після 5 днів і 7 годин роботи, flash 19 вересня.

Цифри та бенчмарки

Панель також публікує результати бенчмарків у режимі avg@3. У DeepSWE v1.1 з mini-swe-agent pro набирає 72.57, flash — 65.68; у внутрішньому Coding Bench — 65.43 і 62.87; в AutomationBench v1.0.6 — 53.10 і 52.70.

Серед метрик навчання dynsam/avg@n становить 0.633 для pro (+0.011) і 0.644 для flash (−0.019). Середня довжина контексту — 137 тис. токенів у pro і 148 тис. у flash; за один крок обробляються 3.43 та 3.7 млрд токенів, а сам крок триває 6 годин 26 хвилин і 3 години 27 хвилин відповідно. За останніми опублікованими даними pro прийняла 664 зразки із 1568 цільових (pass 0.606), а flash — 2704.

Чому це важливо

Під час RL-навчання модель працює з тисячами наборів даних — панель відстежує 25 джерел у категоріях code, cyber, visual, general і chat. Зазвичай такі операційні деталі не оприлюднюють. Панель MiMo показує, що навчання сучасної моделі — тривалий процес, сповнений збоїв, де перезапуски та повторне налагодження є нормою, а не винятком.

SSiTech

SiTech — веброзробка з підтримкою AI

Створюємо швидкі та сучасні сайти й інтегруємо AI у бізнес-процеси. Маєте проєкт чи запитання? Із задоволенням допоможемо.