Վերադառնալ
SiTech
Xiaomi-ի MiMo 2.6-ը հրապարակել է RL ուսուցման կենդանի վահանակ
SiTech AI Team2 წთ. საკითხავი

Xiaomi-ի MiMo 2.6-ը հրապարակել է RL ուսուցման կենդանի վահանակ

Xiaomi-ի MiMo թիմը բացել է հանրային վահանակ, որը իրական ժամանակում ցույց է տալիս mimo-v2.6-pro և mimo-v2.6-flash մոդելների reinforcement learning չափանիշները, բենչմարքներն ու միջադեպերի մատյանը։

Xiaomi-ի MiMo թիմը սեպտեմբերի 17-ին բացել է հանրային վահանակ, որը իրական ժամանակում ցույց է տալիս mimo-v2.6-pro և mimo-v2.6-flash մոդելների reinforcement learning ուսուցման չափանիշները՝ ուղղակիորեն ուսուցիչի log-երից։ Վահանակը բաժանված է երեք բաժնի՝ ընդհանուր ակնարկ, չափանիշներ և «about», և ներառում է ծանուցումների հոսք, առանձին չափանիշների գրաֆիկներ, բենչմարքների աղյուսակ և յուրաքանչյուր քայլի batch-ի կազմությունը։

Ինչ է ցույց տալիս վահանակը

Ամենաանսովոր մասը ծանուցումների հոսքն է, որտեղ բացահայտ թվարկվում են այն խափանումները, որոնք լաբորատորիաները սովորաբար չեն հրապարակում։ pro մոդելի ուսուցումը վերսկսվել է 17-րդ քայլից՝ GPU-ի հիշողության սպառման պատճառով, որն առաջացել էր փորձագետների բեռնվածության անհավասարակշռությունից. թիմը փոխել է ուսուցման զուգահեռացման ռազմավարությունը։

Մեկ այլ գրառում նկարագրում է ցանցային կապի խնդիր pro-ի ուսուցման կլաստերի և grader-ի տեղակայման միջև։ Ուսուցումը վերսկսվեց, իսկ cyber տվյալների հավաքածուն հանվեց հաջորդ pro ուսուցումից, քանի որ rollout log-երում վատ օրինաչափություններ նկատվեցին։ flash մոդելը վերսկսվել է 15-րդ քայլից, քանի որ տվյալների հավաքածուներից մեկում ենթակառուցվածքային սխալը մոտ երեք ժամ չի հայտնաբերվել։ Երկու ուսուցումներն էլ կանգնեցվել են 30-րդ քայլում. pro-ն՝ սեպտեմբերի 20-ին 5 օր 7 ժամ աշխատանքից հետո, flash-ը՝ սեպտեմբերի 19-ին։

Թվեր և բենչմարքներ

Վահանակը հրապարակում է նաև բենչմարքների արդյունքները avg@3 ձևաչափով։ mini-swe-agent-ով DeepSWE v1.1-ում pro-ն ստանում է 72.57 միավոր, flash-ը՝ 65.68; ներքին Coding Bench-ում՝ 65.43 և 62.87; AutomationBench v1.0.6-ում՝ 53.10 և 52.70։

Ուսուցման չափանիշներից dynsam/avg@n-ը pro-ի համար 0.633 է (+0.011), flash-ի համար՝ 0.644 (−0.019)։ Համատեքստի միջին երկարությունը pro-ի դեպքում 137 հազար է, flash-ի դեպքում՝ 148 հազար token. մեկ քայլում մշակվող token-ների քանակը հասնում է 3.43 և 3.7 միլիարդի, իսկ մեկ քայլի տևողությունը՝ համապատասխանաբար 6 ժամ 26 րոպե և 3 ժամ 27 րոպե։ Հրապարակված վերջին տվյալներով pro-ն ընդունել է 664 նմուշ՝ 1,568 թիրախի դիմաց (pass 0.606), իսկ flash-ը՝ 2,704։

Ինչու է սա կարևոր

RL ուսուցման ընթացքում մոդելը աշխատում է հազարավոր տվյալների հավաքածուներով. վահանակը հետևում է 25 աղբյուրի՝ code, cyber, visual, general և chat կատեգորիաներում։ Սովորաբար նման գործառնական մանրամասներ չեն հրապարակվում։ MiMo-ի վահանակը ցույց է տալիս, որ ժամանակակից մոդելի ուսուցումը երկար և խափանումներով լի գործընթաց է, որտեղ վերսկսումները և կրկնվող վրիպազերծումը նորմ են, ոչ թե բացառություն։

SSiTech

SiTech — AI-ով հզորացված վեբ մշակում

Ստեղծում ենք արագ ու ժամանակակից կայքեր և AI-ը ներդնում իրական բիզնես գործընթացներում։ Ունե՞ք նախագիծ կամ հարց։ Ուրախ կլինենք օգնել։