
Xiaomi-ს MiMo-V2.5-Pro-UltraSpeed: ტრილიონპარამეტრიანი მოდელი 1000 ტოკენი/წმ-ზე
Xiaomi-მ TileRT-თან ერთად გამოუშვა MiMo-V2.5-Pro-UltraSpeed — ტრილიონპარამეტრიანი მოდელი, რომელიც წამში 1000 ტოკენზე მეტს აგენერირებს. წვდომა განაცხადითაა შესაძლებელი 9–23 ივნისს, სამმაგ ფასად.
Xiaomi-ს MiMo-გუნდმა გამოუშვა MiMo-V2.5-Pro-UltraSpeed — კონფიგურაცია, რომელიც სისტემურ კომპანია TileRT-თან ერთად შეიქმნა და, გუნდის მტკიცებით, პირველად აჭარბებს წამში 1000 ტოკენის გენერაციის სიჩქარეს ტრილიონპარამეტრიან მოდელზე.
შეზღუდული ფანჯარა და ფასი
წვდომა ღია არ არის — საჭიროა განაცხადი. API დროებით შეღავათიან ფასად გაიცემა: MiMo-V2.5-Pro-ის ღირებულების სამმაგი სანაცვლოდ, მაგრამ დაახლოებით ათმაგი გენერაციის სიჩქარით, რასაც კომპანია ასე აღწერს: „3x ფასი, 10x გამოცდილება“. შეთავაზება მოქმედებს 2026 წლის 9-დან 23 ივნისამდე, პეკინის დროით 23:59-მდე (08:59 PDT), და მხოლოდ API-ზე ვრცელდება — Token Plan არ იხურება.
განაცხადები მიიღება platform.xiaomimimo.com/ultraspeed-ზე. ადგილები შეზღუდულია, განაცხადის გაგზავნა თანხმობას არ ნიშნავს, ხოლო უპირატესობა კომპანიებსა და პროფესიონალ დეველოპერებს ენიჭება. დამტკიცებული მომხმარებლები ორი კვირის განმავლობაში უფასო Chat-წვდომასაც იღებენ ultraspeed.xiaomimimo.com-ზე: თითო ანგარიშს დღეში ათამდე ჯერ რიგში დგომა შეუძლია, სესია 30 წუთით შემოიფარგლება, ხოლო ხუთ წუთზე მეტი უმოქმედობისას სესია ავტომატურად თავისუფლდება.
საიდან მოდის სიჩქარე
ეს ახალი არქიტექტურა არ არის, არამედ მოდელის გუნდისა და TileRT-ის ინფერენს-სისტემის ერთობლივი მუშაობის შედეგი. Xiaomi აღნიშნავს, რომ მსგავსი ექსტრემალური სიჩქარე ინდუსტრიაში ჩვეულებრივ სპეციალიზებულ ტექნიკას ეყრდნობა — Cerebras-ის wafer-scale ინტეგრაციას ან Groq-ის ჩიპზე განთავსებულ SRAM-არქიტექტურას — მაშინ როცა ეს შედეგი ჩვეულებრივ GPU-ებზეა მიღწეული: 1000-ზე მეტი ტოკენი წამში 1T მოდელიდან ერთ სტანდარტულ 8-GPU კვანძზე.
წონის უმეტესი ნაწილი მოდელის მხრიდან ორ გადაწყვეტილებაზე მოდის. FP4 კვანტიზაცია (MXFP4) გამოიყენება მხოლოდ MoE-ექსპერტებზე, რომლებიც პარამეტრების ძირითად ნაწილს შეადგენენ და კვანტიზაციას ყველაზე კარგად უძლებენ, კვანტიზაციის გათვალისწინებით სწავლების მეთოდით, დანარჩენი მოდული კი საწყის სიზუსტეს ინარჩუნებს. DFlash-ის სპეკულაციური დეკოდირება კი ერთი გავლისას მასკირებული ტოკენების მთელ ბლოკს პროგნოზირებს ავტორეგრესიული მონახაზის ნაცვლად; მისი სამონახაზო მოდელი მოცურავე ფანჯრის ყურადღებას იყენებს, ბლოკის ზომა კი რვით შემოიფარგლება, რათა შემოწმება იაფი დარჩეს.
გაზომილი მიღების სიგრძე და ღია წონები
მიღების სიგრძე — რამდენ ტოკენს ადასტურებს დიდი მოდელი ერთი შემოწმების ციკლზე — კოდის სცენარებში 6.30-ია (მაქსიმუმ 7.14), მათემატიკასა და მსჯელობაში 5.56, აგენტურ ამოცანებში კი 4.29. გუნდის თქმით, თავისუფალ საუბარში მიღების მაჩვენებელი ჯერ კიდევ დაბალია და ამ მიმართულებით მუშაობა გრძელდება.
სისტემის მხრიდან TileRT ამატებს მუდმივად მოქმედ ბირთვს, რომელიც გამოთვლით კონვეიერს GPU-ზე ტოვებს და ოპერატორებს სათითაოდ აღარ უშვებს, ასევე warp-სპეციალიზაციას, რომელიც კომუნიკაციას, მონაცემთა გადაადგილებასა და ტენზორულ გამოთვლებს ნაკადებს შორის ანაწილებს. მიღებული checkpoint — MiMo-V2.5-Pro-FP4-DFlash — Hugging Face-ზე ღია კოდით არის გამოქვეყნებული, ხოლო MiMo-V2.5-ის UltraSpeed-მხარდაჭერა შემდეგ ეტაპად იგეგმება.
SiTech — AI-გაძლიერებული ვებ დეველოპმენტი
ვქმნით სწრაფ, თანამედროვე ვებსაიტებს და AI-ს ვაერთიანებთ ქართული ბიზნესებისთვის. გაქვთ პროექტი ან კითხვა? სიამოვნებით დაგეხმარებით.