
MiMo-V2.5-Pro-UltraSpeed: модель на 1T параметрів зі швидкістю понад 1000 токенів/с
Xiaomi і TileRT представили MiMo-V2.5-Pro-UltraSpeed — модель на трильйон параметрів, що видає понад 1000 токенів на секунду. Доступ за заявкою діє з 9 по 23 червня за потрійною ціною MiMo-V2.5-Pro.
Команда MiMo від Xiaomi випустила MiMo-V2.5-Pro-UltraSpeed — конфігурацію, створену разом із системною компанією TileRT, яка, за словами команди, вперше долає швидкість 1000 токенів на секунду під час генерації на моделі з трильйоном параметрів.
Обмежене вікно та ціна
Доступ надається за заявкою, а не відкрито. API пропонують за тимчасовою промоційною ціною: втричі дорожче за MiMo-V2.5-Pro, але приблизно вдесятеро швидша генерація — компанія формулює це як «3x ціна, 10x досвід». Пропозиція діє з 9 по 23 червня 2026 року до 23:59 за пекінським часом (08:59 PDT) і стосується лише API — Token Plan не підтримується.
Заявки приймають на platform.xiaomimimo.com/ultraspeed. Кількість місць обмежена, подання заявки не гарантує схвалення, а пріоритет мають підприємства та професійні розробники. Схвалені користувачі також отримують безкоштовний доступ до Chat на два тижні за адресою ultraspeed.xiaomimimo.com: кожен акаунт може стати в чергу до десяти разів на день, сесія обмежена 30 хвилинами, а після п'яти хвилин бездіяльності сесію звільняють автоматично.
Звідки береться швидкість
Це не нова архітектура, а спільна робота команди моделі та системи інференсу TileRT. Xiaomi зазначає, що подібні екстремальні швидкості в галузі зазвичай спираються на спеціалізоване обладнання — wafer-scale інтеграцію Cerebras або архітектуру Groq з SRAM на чипі — тоді як цей результат отримано на звичайних GPU: понад 1000 токенів на секунду від моделі на 1T параметрів на одному стандартному вузлі з 8 GPU.
Основну вагу несуть два рішення з боку моделі. Квантизацію FP4 (MXFP4) застосовано лише до експертів MoE, які містять більшість параметрів і найкраще переносять квантизацію, з навчанням із урахуванням квантизації, тоді як решта модулів зберігає початкову точність. Спекулятивне декодування DFlash передбачає цілий блок замаскованих токенів за один прохід замість авторегресійного чернеткування; його чернеткова модель використовує увагу з ковзним вікном, а розмір блоку обмежено вісьмома, щоб перевірка залишалася дешевою.
Виміряна довжина приймання та відкриті ваги
Довжина приймання — скільки чернеткових токенів велика модель підтверджує за один цикл перевірки — становить 6.30 у сценаріях кодування (максимум 7.14), 5.56 у математиці та міркуваннях і 4.29 в агентних задачах. За словами команди, у відкритих розмовах показник усе ще низький, і робота в цьому напрямі триває.
Із системного боку TileRT додає постійно резидентне ядро, яке утримує обчислювальний конвеєр на GPU замість запуску операторів по одному, а також спеціалізацію warp, що розподіляє комунікацію, переміщення даних і тензорні обчислення між групами потоків. Отриманий чекпойнт MiMo-V2.5-Pro-FP4-DFlash опубліковано у відкритому доступі на Hugging Face, а підтримку UltraSpeed для MiMo-V2.5 обіцяють наступним кроком.
SiTech — веброзробка з підтримкою AI
Створюємо швидкі та сучасні сайти й інтегруємо AI у бізнес-процеси. Маєте проєкт чи запитання? Із задоволенням допоможемо.