უკან დაბრუნება
SiTech
Xiaomi-ის MiMo 2.6-მა ღია RL სწავლების დაფა გამოაქვეყნა
SiTech AI Team2 წთ. საკითხავი

Xiaomi-ის MiMo 2.6-მა ღია RL სწავლების დაფა გამოაქვეყნა

Xiaomi-ის MiMo გუნდმა გახსნა საჯარო დაფა, რომელიც mimo-v2.6-pro და mimo-v2.6-flash მოდელების reinforcement learning სწავლების მეტრიკებს, ბენჩმარკებსა და ინციდენტების ლოგს ტრენერიდან რეალურ დროში აჩვენებს.

Xiaomi-ის MiMo გუნდმა 17 სექტემბერს გახსნა საჯარო დაფა, რომელიც mimo-v2.6-pro და mimo-v2.6-flash მოდელების reinforcement learning სწავლების მეტრიკებს ტრენერის ლოგებიდან რეალურ დროში აჩვენებს. დაფაზე სამი განყოფილებაა — მიმოხილვა, მეტრიკები და „about" — და მასში შედის შეტყობინებების ლენტა, ცალკეული მეტრიკის გრაფიკები, ბენჩმარკების ცხრილი და ყოველი ნაბიჯის batch-ის შემადგენლობა.

რას აჩვენებს დაფა

ყველაზე უჩვეულო ნაწილი შეტყობინებების ლენტაა: მასში ღიად იწერება ის ხარვეზები, რომლებსაც ლაბორატორიები ჩვეულებრივ არ აქვეყნებენ. pro მოდელის სწავლა მე-17 ნაბიჯიდან ხელახლა დაიწყო — მიზეზი GPU-ის მეხსიერების ამოწურვა იყო, რომელიც ექსპერტების დატვირთვის დისბალანსმა გამოიწვია; გუნდმა პარალელიზაციის სტრატეგია შეცვალა.

დაფაზე ასევე აღწერილია ქსელური კავშირის გაწყვეტა pro-ს სასწავლო კლასტერსა და grader-ის განლაგებას შორის; ამის შემდეგ გაშვება განაახლეს, cyber მონაცემთა ნაკრები კი მომავალი გაშვებიდან ამოიღეს, რადგან rollout-ლოგებში ცუდი ნიმუშები შენიშნეს. flash მოდელი მე-15 ნაბიჯიდან გადატვირთეს, რადგან ერთ-ერთ მონაცემთა ნაკრებში ინფრასტრუქტურული შეცდომა დაახლოებით სამი საათის განმავლობაში ვერ დაფიქსირდა. ორივე გაშვება 30-ე ნაბიჯზე გაჩერდა: pro — 20 სექტემბერს, 5 დღე და 7 საათი მუშაობის შემდეგ, flash — 19 სექტემბერს.

რიცხვები და ბენჩმარკები

დაფა აქვეყნებს ბენჩმარკების შედეგებსაც (avg@3). DeepSWE v1.1-ში (mini-swe-agent) pro აღწევს 72.57 ქულას, flash — 65.68; შიდა Coding Bench-ზე — 65.43 და 62.87; AutomationBench v1.0.6-ზე — 53.10 და 52.70.

სასწავლო მეტრიკებში pro-ს dynsam/avg@n 0.633-ია (+0.011), flash-ის — 0.644 (−0.019). კონტექსტის საშუალო სიგრძე pro-სთვის 137 ათასი, flash-ისთვის — 148 ათასი ტოკენია; ერთ ნაბიჯზე შემუშავებული ტოკენების რაოდენობა 3.43 და 3.7 მილიარდს აღწევს, ხოლო ერთი ნაბიჯის ხანგრძლივობა — 6 საათი 26 წუთი და 3 საათი 27 წუთი. ბოლო ხელმისაწვდომი მონაცემებით pro-მ 1,568 სამიზნიდან 664 ნიმუში მიიღო (pass 0.606), flash-მა — 2,704.

რატომ აქვს მნიშვნელობა

RL სწავლისას მოდელი ათასობით მონაცემთა ნაკრებზე ვარჯიშობს — დაფაზე 25 წყაროა code, cyber, visual, general და chat კატეგორიებიდან. ჩვეულებრივ ასეთი დეტალები საჯარო არ ხდება. MiMo-ს დაფა აჩვენებს, რომ თანამედროვე მოდელის გაწვრთნა ხანგრძლივი და ხარვეზებით სავსე პროცესია, სადაც წარუმატებელი გაშვებები და მეორე ცდა ნორმაა, არა გამონაკლისი.

SSiTech

SiTech — AI-გაძლიერებული ვებ დეველოპმენტი

ვქმნით სწრაფ, თანამედროვე ვებსაიტებს და AI-ს ვაერთიანებთ ქართული ბიზნესებისთვის. გაქვთ პროექტი ან კითხვა? სიამოვნებით დაგეხმარებით.