Geri Dön
MiMo-V2.5-Pro-UltraSpeed: saniyede 1000'den fazla token üreten 1T model
SiTech AI Team2 წთ. საკითხავი

MiMo-V2.5-Pro-UltraSpeed: saniyede 1000'den fazla token üreten 1T model

Xiaomi ve TileRT, saniyede 1000'den fazla token üreten trilyon parametreli MiMo-V2.5-Pro-UltraSpeed'i duyurdu. Erişim 9–23 Haziran arasında başvuruyla ve MiMo-V2.5-Pro'nun üç katı fiyatla.

Xiaomi'nin MiMo ekibi, sistem şirketi TileRT ile birlikte geliştirdiği MiMo-V2.5-Pro-UltraSpeed'i duyurdu. Ekibe göre bu yapılandırma, bir trilyon parametreli modelde saniyede 1000 token'lık üretim hızını ilk kez aşıyor.

Sınırlı pencere ve fiyatlandırma

Erişim açık değil, başvuruya bağlı. API, sınırlı süreli tanıtım fiyatıyla sunuluyor: MiMo-V2.5-Pro'nun üç katı maliyet, ancak yaklaşık on kat üretim hızı. Şirket bunu "3 kat fiyat, 10 kat çıktı deneyimi" diye özetliyor. Teklif 9–23 Haziran 2026 tarihleri arasında, Pekin saatiyle 23:59'a (08:59 PDT) kadar geçerli ve yalnızca API için: Token Plan desteklenmiyor.

Başvurular platform.xiaomimimo.com/ultraspeed üzerinden alınıyor. Kontenjan sınırlı, başvuru onay garantisi vermiyor ve öncelik kurumlara ve profesyonel geliştiricilere tanınıyor. Onaylanan kullanıcılar iki hafta boyunca ultraspeed.xiaomimimo.com adresinde ücretsiz Chat erişimi de alıyor: her hesap günde en fazla on kez sıraya girebiliyor, oturumlar 30 dakikayla sınırlı ve beş dakikadan uzun süre boş kalan oturumlar otomatik olarak serbest bırakılıyor.

Hız nereden geliyor

Bu bir yeni mimari değil, model ekibiyle TileRT'nin çıkarım sisteminin ortak çalışmasının ürünü. Xiaomi, sektördeki benzer uç hızların genellikle özel donanıma dayandığını — Cerebras'ın wafer ölçekli entegrasyonu ya da Groq'un çip üstü SRAM mimarisi — bu sonucun ise standart GPU'larda elde edildiğini vurguluyor: tek bir standart 8 GPU'lu düğümde 1T modelden saniyede 1000'den fazla token.

Yükün büyük kısmını model tarafındaki iki karar taşıyor. FP4 nicelemesi (MXFP4) yalnızca parametrelerin çoğunu barındıran ve nicelemeye en dayanıklı olan MoE uzmanlarına uygulanıyor; niceleme farkındalıklı eğitimle desteklenirken modelin geri kalanı özgün hassasiyetini koruyor. DFlash spekülatif kod çözme ise otoregresif taslak yerine tek bir ileri geçişte maskelenmiş token'lardan oluşan bütün bir bloğu tahmin ediyor; taslak modeli kayan pencere dikkatini kullanıyor ve doğrulamayı ucuz tutmak için blok boyutu sekizle sınırlanıyor.

Ölçülen kabul uzunluğu ve açık ağırlıklar

Kabul uzunluğu — büyük modelin her doğrulama turunda onayladığı taslak token sayısı — kod senaryolarında 6.30 (en yüksek 7.14), matematik ve akıl yürütmede 5.56, ajan görevlerinde 4.29. Ekibe göre serbest sohbette oran hâlâ düşük ve bu alanda çalışmalar sürüyor.

Sistem tarafında TileRT, operatörleri tek tek başlatmak yerine hesaplama hattını GPU üzerinde sürekli tutan kalıcı bir çekirdek ve iletişim, veri hareketi ile tensör hesaplamasını iş parçacığı gruplarına bölen warp uzmanlaşması ekliyor. Ortaya çıkan kontrol noktası MiMo-V2.5-Pro-FP4-DFlash Hugging Face'te açık kaynak olarak yayımlandı; MiMo-V2.5 için UltraSpeed desteğinin sıradaki adım olduğu belirtiliyor.

SSiTech

SiTech — AI destekli web geliştirme

Hızlı ve modern web siteleri kuruyor, AI'yı gerçek iş akışlarına taşıyoruz. Projeniz veya sorunuz mu var? Yardımcı olmaktan mutluluk duyarız.