Վերադառնալ
MiMo-V2.5-Pro-UltraSpeed՝ 1T մոդել՝ վայրկյանում 1000+ տոկենով
SiTech AI Team2 წთ. საკითხავი

MiMo-V2.5-Pro-UltraSpeed՝ 1T մոդել՝ վայրկյանում 1000+ տոկենով

Xiaomi-ն և TileRT-ն թողարկել են MiMo-V2.5-Pro-UltraSpeed-ը՝ տրիլիոն պարամետր ունեցող մոդել, որը վայրկյանում արտադրում է ավելի քան 1000 տոկեն։ Հասանելիությունը հայտով է՝ հունիսի 9-23-ը։

Xiaomi-ի MiMo թիմը թողարկել է MiMo-V2.5-Pro-UltraSpeed-ը՝ կոնֆիգուրացիա, որը ստեղծվել է TileRT սիստեմային ընկերության հետ համատեղ և, թիմի պնդմամբ, առաջին անգամ գերազանցում է վայրկյանում 1000 տոկենի գեներացման արագությունը տրիլիոն պարամետր ունեցող մոդելի վրա։

Սահմանափակ պատուհան և գին

Հասանելիությունը բաց չէ, այլ տրվում է հայտի հիման վրա։ API-ն առաջարկվում է ժամանակավոր ակցիոն գնով՝ MiMo-V2.5-Pro-ի եռակի արժեքով, բայց մոտ տասնապատիկ գեներացման արագությամբ. ընկերությունը դա ձևակերպում է որպես «3x գին, 10x արդյունք»։ Առաջարկը գործում է 2026 թվականի հունիսի 9-ից 23-ը՝ Պեկինի ժամանակով մինչև 23:59 (08:59 PDT), և միայն API-ի համար է. Token Plan-ը չի աջակցվում։

Հայտերն ընդունվում են platform.xiaomimimo.com/ultraspeed հասցեով։ Տեղերը սահմանափակ են, հայտ ներկայացնելը չի երաշխավորում հաստատում, իսկ առաջնահերթությունը տրվում է ընկերություններին և պրոֆեսիոնալ ծրագրավորողներին։ Հաստատված օգտատերերը երկու շաբաթվա ընթացքում անվճար Chat հասանելիություն են ստանում ultraspeed.xiaomimimo.com հասցեով. յուրաքանչյուր հաշիվ օրական կարող է հերթագրվել մինչև տասը անգամ, սեսիան սահմանափակվում է 30 րոպեով, իսկ հինգ րոպեից ավելի անգործ սեսիան ինքնաշխատ ազատվում է։

Որտեղից է գալիս արագությունը

Սա նոր ճարտարապետություն չէ, այլ մոդելի թիմի և TileRT-ի ինֆերենս համակարգի համատեղ աշխատանքի արդյունք։ Xiaomi-ն նշում է, որ ոլորտում նման ծայրահեղ արագությունները սովորաբար հենվում են մասնագիտացված սարքավորման վրա՝ Cerebras-ի wafer-scale ինտեգրացիայի կամ Groq-ի չիպի վրա գտնվող SRAM ճարտարապետության վրա, մինչդեռ այս արդյունքը ստացվել է սովորական GPU-ների վրա՝ ավելի քան 1000 տոկեն վայրկյանում 1T մոդելից մեկ ստանդարտ 8-GPU հանգույցում։

Բեռի մեծ մասը կրում են մոդելի կողմի երկու որոշումներ։ FP4 քվանտացումը (MXFP4) կիրառվում է միայն MoE փորձագետների վրա, որոնք պարունակում են պարամետրերի մեծ մասը և լավագույնս են դիմանում քվանտացմանը, քվանտացումը հաշվի առնող ուսուցմամբ, իսկ մոդելի մնացած մասը պահպանում է սկզբնական ճշգրտությունը։ DFlash սպեկուլյատիվ ապակոդավորումը մեկ անցումով կանխատեսում է մասկավորված տոկենների ամբողջ բլոկ՝ ավտոռեգրեսիվ սևագծի փոխարեն. նրա սևագծի մոդելը օգտագործում է սահող պատուհանի ուշադրություն, իսկ բլոկի չափը սահմանափակված է ութով, որպեսզի ստուգումը մնա էժան։

Չափված ընդունման երկարություն և բաց կշիռներ

Ընդունման երկարությունը՝ քանի սևագծային տոկեն է հաստատում մեծ մոդելը մեկ ստուգման փուլում, կոդի սցենարներում 6.30 է (առավելագույնը՝ 7.14), մաթեմատիկայում և դատողություններում՝ 5.56, իսկ գործակալային առաջադրանքներում՝ 4.29։ Թիմի խոսքով՝ ազատ զրույցում ցուցանիշը դեռ ցածր է, և աշխատանքն այդ ուղղությամբ շարունակվում է։

Համակարգի կողմից TileRT-ն ավելացնում է մշտական միջուկ, որը հաշվողական խողովակաշարը պահում է GPU-ի վրա՝ օպերատորները մեկ առ մեկ չգործարկելով, ինչպես նաև warp մասնագիտացում, որը հաղորդակցությունը, տվյալների տեղաշարժը և տենզորային հաշվարկները բաշխում է թելքավոր խմբերի միջև։ Ստացված checkpoint-ը՝ MiMo-V2.5-Pro-FP4-DFlash-ը, բաց կոդով հրապարակված է Hugging Face-ում, իսկ MiMo-V2.5-ի UltraSpeed աջակցությունը նախատեսված է որպես հաջորդ քայլ։

SSiTech

SiTech — AI-ով հզորացված վեբ մշակում

Ստեղծում ենք արագ ու ժամանակակից կայքեր և AI-ը ներդնում իրական բիզնես գործընթացներում։ Ունե՞ք նախագիծ կամ հարց։ Ուրախ կլինենք օգնել։