Xiaomi Robotics-1: Більше даних перемагає більші моделі — як Xiaomi змінює навчання роботів
Xiaomi Robotics-1 доводить, що масштабування тренувальних даних, а не параметрів моделі, є ключем до продуктивності роботів. Навчений на понад 100 000 годин рухових даних, модель підвищила рівень успіху з 25% до 75% у незнайомому середовищі.
Проблема даних у робототехнічному AI
Великі мовні моделі мають легкий доступ до даних — вони тренуються на трильйонах слів із публічного інтернету: статті, книги, форуми, код. Робототехнічний AI стикається з зовсім іншою реальністю. Корисні дані про рух роботів — як схопити, підняти, повернути та розмістити об'єкти — є дефіцитними та дорогими у виробництві. Традиційний підхід вимагає, щоб людина дистанційно керувала фізичним роботом через кожен рух — повільний, дорогий процес, який часто дає одноманітні дані з однакових завдань в ідентичних умовах.
Нова модель Xiaomi-Robotics-1 від Xiaomi має на меті подолати це вузьке місце. Модель слідує парадигмі масштабування, подібній до великих мовних моделей: її продуктивність покращується зі збільшенням обсягу тренувальних даних. Але на відміну від LLM, які можуть черпати з усього письмового інтернету, Xiaomi довелося створити власний набір даних з нуля — і спосіб, яким вони це зробили, є, мабуть, найцікавішою частиною дослідження.
Ручний маніпулятор замінює дорогих роботів
Щоб обійти вузьке місце збору даних, Xiaomi значною мірою відмовилася від фізичних роботів на етапі збору даних. Натомість команда розробила портативні ручні маніпулятори, оснащені камерами — простий пристрій, який людина бере в руки та керує вручну. Це налаштування дозволяє записувати маніпуляційні завдання на кухнях, в офісах, магазинах, на виробничих майданчиках і відкритих просторах без присутності робота.
Результатом стало понад 100 000 годин записів рухів у більш ніж 1 700 різних середовищах — безпрецедентний масштаб для тренувальних даних роботів. Такий масштаб створює власний виклик: кожен запис потребує текстового опису, з якого модель може навчатися. Ручне маркування було непрактичним, тому Xiaomi використала іншу AI-модель для опису кожного сегменту руху текстом. Команда повідомляє, що весь набір даних було розмічено приблизно за два тижні.
Цей підхід має значення за межами лабораторій Xiaomi. Для країн і регіонів, де дослідження робототехніки ще зароджуються — включаючи Україну та ширший регіон Східної Європи — здатність збирати високоякісні тренувальні дані за допомогою недорогих портативних інструментів різко знижує бар'єр входу. Дослідницькі групи більше не потребують мільйонних парків роботів, щоб зробити значний внесок у розвиток робототехнічного AI.
Чому більше даних важливіше за розмір моделі
Центральний висновок дослідження Xiaomi-Robotics-1 є чітким і вагомим: хоча збільшення розміру моделі покращує продуктивність, додавання більшої кількості тренувальних даних дає значно більший приріст, ніж додавання обчислювальної потужності. Дослідники однозначно стверджують, що прогрес у робототехнічному AI залежатиме насамперед від збору більших і різноманітніших наборів даних.
Цей висновок узгоджується з тим, що дослідники продемонстрували для візуальних даних на початку березня 2026 року. Для мовних моделей встановлений закон масштабування диктує, що розмір моделі та обсяг даних повинні зростати приблизно однаковими темпами для оптимального використання фіксованого обчислювального бюджету. Цей баланс змінюється, коли модель має обробляти зображення, а не лише текст — у візуально-мовних доменах додавання даних допомагає набагато більше, ніж збільшення розміру моделі. Xiaomi поширює цей принцип на робототехніку.
Результати з фізичними роботами вражають. Зі збільшенням обсягу тренувальних даних рівень успіху моделі в незнайомому середовищі зріс приблизно з 25% до 75%. Дослідники зазначають, що вони ще не досягли точки, де більше даних перестає покращувати продуктивність — крива масштабування не показує ознак плато. Це свідчить про те, що потенціал покращення робототехнічного AI через дані залишається величезним і значною мірою невикористаним.
На стандартних бенчмарках робототехнічного AI Xiaomi-Robotics-1 показав найкращі результати на сьогодні. У лідерборді RoboCasa365 він лідирує зі значним відривом, особливо в небачених раніше композиційних завданнях. На бенчмарку RoboDojo він набрав приблизно на 58% більше балів, ніж другий учасник, хоча абсолютні показники успіху залишаються помірними.
Адаптація до нових завдань із мінімальними даними
Справжня цінність фундаментальної моделі полягає в її здатності швидко адаптуватися до нових завдань. Xiaomi протестувала Xiaomi-Robotics-1 на чотирьох небачених завданнях: пакування телефону, завантаження білизни в пральну машину, подача паперу в принтер і пакування предметів у коробку.
Менш ніж за десять годин тренувальних даних на завдання модель досягла середнього рівня успіху 75%. Для порівняння, конкуруюча модель від Physical Intelligence показала лише 40% на тому ж бенчмарку. Xiaomi повідомляє, що їхня модель особливо добре працювала з м'якими деформованими матеріалами, такими як папір, і завданнями, що вимагають переміщення по кімнаті — саме ті виклики, які історично були складними для жорстких, заскриптованих роботизованих систем.
Ця здатність до адаптації з кількома прикладами особливо актуальна для практичних сценаріїв розгортання. У реальних застосуваннях — чи то на українському складі, в готелі чи на виробництві — роботам потрібно швидко навчатися новим завданням із мінімальною кількістю демонстраційних даних. Продуктивність Xiaomi-Robotics-1 свідчить про те, що це бачення стає дедалі досяжнішим.
Ландшафт досліджень робототехнічного AI
Підхід Xiaomi є однією з кількох конкуруючих стратегій у швидко змінюваному ландшафті робототехнічного AI. Травневий огляд World Action Models, який розглянув приблизно 100 досліджень, показав, що дані телеоперації — традиційний підхід — є точними, але дорогими та обмеженими небагатьма умовами. Ручні маніпулятори Xiaomi безпосередньо вирішують ці обмеження.
Nvidia, Університет Карнегі-Меллона та UC Berkeley пішли іншим шляхом з проектом ENPIRE, використовуючи AI-агентів кодування для автономного навчання флоту з восьми роботів захопленню об'єктів. Nvidia також досліджує генерацію синтетичних тренувальних даних, намагаючись перетворити проблему даних у робототехніці на обчислювальну проблему.
Китайський дослідницький інститут BAAI досліджує ще один напрямок. Їхня світова модель Orca навчається на 125 000 годин відео без жодних міток дій і все одно відповідає спеціалізованій моделі pi0.5 у п'яти маніпуляційних завданнях. Там, де Xiaomi автоматизує маркування та застосовує його в масштабі, Orca намагається повністю усунути мітки — більш радикальний підхід, який може виявитися цінним, якщо масштабуватиметься.
Physical Intelligence слугує орієнтиром для обох таборів. Компанія зазнала критики у квітні після випуску pi0.7, коли стверджувала, що модель може узагальнювати, хоча вона могла просто згадувати подібні тренувальні дані. Висновок Xiaomi про те, що обсяг даних важливіший за обчислювальну потужність, робить це питання ще складнішим для вирішення.
Що це означає для України та технологічних екосистем, що розвиваються
Для України та ширшої технологічної спільноти дослідження Xiaomi має кілька важливих наслідків. По-перше, демократизація збору даних — використання простих ручних інструментів замість дорогих роботів — означає, що менші команди та стартапи можуть брати участь у розробці робототехнічного AI. Українські стартапи теоретично можуть збирати маніпуляційні дані в місцевих умовах, роблячи внесок у глобальні набори даних робототехніки або будуючи спеціалізовані моделі для локальних застосувань.
По-друге, висновок \"дані над обчисленнями\" є обладійливим для екосистем з обмеженим доступом до масивних GPU-кластерів. Якщо якість і кількість даних можуть частково компенсувати обчислювальні обмеження, команди в технологічних хабах, що розвиваються, можуть конкурувати на основі інновацій, а не витрат на інфраструктуру.
По-третє, зобов'язання Xiaomi щодо відкритого коду — модель і код будуть випущені на GitHub і Hugging Face — означає негайний доступ для дослідників і розробників по всьому світу. Українські університети, AI-лабораторії та незалежні розробники можуть експериментувати з цими моделями, будувати на їх основі та потенційно вносити покращення назад у спільноту.
Погляд у майбутнє
Xiaomi-Robotics-1 є значним кроком уперед, але він також підкреслює, скільки ще потрібно зробити. Абсолютні показники успіху на бенчмарках, хоча й лідируючі, все ще нижчі за необхідні для надійного комерційного розгортання в неструктурованих середовищах. Сильні сторони моделі — робота з деформованими об'єктами, навігація кімнатами, адаптація до нових завдань — реальні, але прогалини залишаються.
Дослідження також вписується в ширшу стратегічну картину Xiaomi. Коли компанія представила свої моделі MiMo-V2 у березні, вона заявила, що ці AI-агенти зможуть з часом керувати роботами. Xiaomi-Robotics-1 є ключовою частиною цього бачення — мостом між AI-агентами, здатними до мови, та фізичними роботизованими системами, які можуть діяти в реальному світі.
Мабуть, найглибший висновок полягає в наступному: ера робототехнічного AI більше не є переважно інженерною проблемою побудови більших моделей. Це все більше проблема даних — збору, маркування та масштабування різноманітних даних реальної взаємодії. Xiaomi показала, що завдяки творчості у зборі даних і відданості масштабуванню навіть фізичні обмеження робототехніки можна вирішити через дата-центричний AI. Для дослідників, стартапів і технологічних спільнот у всьому світі — включаючи Україну — це відкриває двері, які багато хто вважав наглухо зачиненими.