
MiMo-V2.5-Pro-UltraSpeed: saniyədə 1000-dən çox token verən 1T model
Xiaomi və TileRT trilyon parametrli MiMo-V2.5-Pro-UltraSpeed-i təqdim etdi: model saniyədə 1000-dən çox token istehsal edir. Giriş 9–23 iyun tarixlərində müraciətlə və üçqat qiymətlə verilir.
Xiaomi-nin MiMo komandası, sistem şirkəti TileRT ilə birlikdə hazırladığı MiMo-V2.5-Pro-UltraSpeed-i təqdim etdi. Komandanın iddiasına görə, bu konfiqurasiya trilyon parametrli modeldə saniyədə 1000 token generasiya sürətini ilk dəfə keçir.
Məhdud pəncərə və qiymət
Giriş açıq deyil, müraciət əsasındadır. API müvəqqəti aksiya qiyməti ilə təklif olunur: MiMo-V2.5-Pro-nun üç qatı xərc, lakin təxminən on qat generasiya sürəti. Şirkət bunu "3 qat qiymət, 10 qat nəticə" kimi ifadə edir. Təklif 9–23 iyun 2026 tarixlərində, Pekin vaxtı ilə 23:59-a (08:59 PDT) qədər qüvvədədir və yalnız API üçündür: Token Plan dəstəklənmir.
Müraciətlər platform.xiaomimimo.com/ultraspeed ünvanından qəbul edilir. Yerlər məhduddur, müraciətin göndərilməsi təsdiq zəmanəti vermir, üstünlük isə müəssisələrə və peşəkar developerlərə verilir. Təsdiqlənmiş istifadəçilər iki həftə ərzində ultraspeed.xiaomimimo.com ünvanında pulsuz Chat girişi də alır: hər hesab gündə on dəfəyə qədər növbəyə girə bilər, sessiyalar 30 dəqiqə ilə məhdudlaşır, beş dəqiqədən çox boş qalan sessiya avtomatik buraxılır.
Sürət haradan gəlir
Bu yeni arxitektura deyil, model komandası ilə TileRT-nin inference sisteminin birgə işinin nəticəsidir. Xiaomi qeyd edir ki, sənayedə oxşar ekstremal sürətlər adətən xüsusi avadanlığa söykənir — Cerebras-ın wafer miqyaslı inteqrasiyası və ya Groq-un çip üzərindəki SRAM arxitekturası — bu nəticə isə adi GPU-larda əldə edilib: bir standart 8 GPU-luq node üzərində 1T modeldən saniyədə 1000-dən çox token.
Yükün böyük hissəsini model tərəfindəki iki qərar daşıyır. FP4 kvantlaşdırması (MXFP4) yalnız parametrlərin böyük hissəsini təşkil edən və kvantlaşdırmaya ən davamlı olan MoE ekspertlərinə tətbiq edilir; kvantlaşdırma nəzərə alınmaqla öyrətmə aparılır, modelin qalan hissəsi ilkin dəqiqliyini saxlayır. DFlash spekulyativ dekodlaması isə avtoreqressiv qaralama yerinə bir irəli keçiddə maskalanmış tokenlərin bütöv blokunu proqnozlaşdırır; onun qaralama modeli sürüşən pəncərə diqqətindən istifadə edir, yoxlamanı ucuz saxlamaq üçün blok ölçüsü səkkizlə məhdudlaşdırılır.
Ölçülmüş qəbul uzunluğu və açıq çəkilər
Qəbul uzunluğu — böyük modelin hər yoxlama mərhələsində təsdiqlədiyi qaralama tokenlərinin sayı — kod ssenarilərində 6.30 (maksimum 7.14), riyaziyyat və düşünmədə 5.56, agent tapşırıqlarında isə 4.29-dur. Komandanın sözlərinə görə, sərbəst söhbətdə göstərici hələ də aşağıdır və bu istiqamətdə iş davam edir.
Sistem tərəfində TileRT operatorları bir-bir işə salmaq əvəzinə hesablama xəttini GPU üzərində daimi saxlayan qalıcı nüvə, həmçinin rabitəni, məlumat hərəkətini və tensor hesablamalarını sap qrupları arasında bölən warp ixtisaslaşması əlavə edir. Nəticədə yaranan checkpoint — MiMo-V2.5-Pro-FP4-DFlash — Hugging Face-də açıq kod kimi yerləşdirilib, MiMo-V2.5 üçün UltraSpeed dəstəyinin növbəti addım olacağı bildirilir.
SiTech — AI ilə gücləndirilmiş veb hazırlanması
Sürətli və müasir saytlar qurur, AI-ı real biznes proseslərinə gətiririk. Layihəniz və ya sualınız var? Kömək etməyə hazırıq.