Xiaomi розробила модель ШІ з 4,7 мільярда параметрів, що поєднує візуальне сприйняття, мовлення та управління для роботів.
Xiaomi виходить на ринок робототехніки
Китайський гігант мобільних пристроїв і смарт‑дому, відомий як Xiaomi, оголосив про новий крок: розробку власної моделі штучного інтелекту для роботів. Компанія представила Xiaomi‑Robotics‑0, систему з відкритим кодом, що об’єднує візуальне розпізнавання, розуміння мови та контроль дій у реальному часі. Модель має 4,7 млрд параметрів і вже встановила кілька рекордів як у симуляціях, так і на практиці.
Як працює модель
Робот зазвичай проходить цикл «сприйняття → рішення → дія». Xiaomi‑Robotics‑0 балансуватиме між широким розумінням ситуації та точним управлінням моторикою завдяки архітектурі Mixture‑of‑Transformers (MoT).
1. Візуально‑мовна модель (VLM) – «мозок» системи.
* Навчена інтерпретувати команди, навіть розмиті (“будь ласка, склади рушник”).
* Розуміє просторові відносини на основі високоякісних зображень.
* Завдання: виявлення об’єктів, відповіді на візуальні запитання та логічне роздуми.
2. Експерт дій (Action Expert) – генератор рухів.
* Заснований на дифузійному трансформері (DiT).
* Не генерує одну дію за раз; формує послідовність дій через зіставлення потоків, що забезпечує плавність і точність.
Навчання без втрати розуміння
Звичайні VLM втрачають частину своїх навичок сприйняття під час навчання фізичних задач. Xiaomi вирішила цю проблему одночасно навчаючи модель мультимодальними даними (зображення + текст) і даними про дії. Процес навчання складається з кількох етапів:
1. Пропозиція дій – VLM передбачає можливі розподіли дій за зображеннями, синхронізуючи внутрішнє представлення з реальними операціями.
2. Після цього VLM «вимикається», і DiT проходить окреме навчання генерації точних послідовностей зі шуму, опираючись на ключові ознаки, а не на токени мови.
Мінімізація затримок
Для усунення пауз між прогнозами моделі та реальними рухами робота використано асинхронну видачу: обчислення ШІ і дії робота розділені. Це дозволяє роботам рухатися безперервно навіть при необхідності додаткових розрахунків.
* Clean Action Prefix – метод повернення раніше передбаченої дії, забезпечуючи плавність без рывків.
* Маска уваги фокусується на поточному візуальному ряді, ігноруючи попередні стани, що робить робота більш реагуючим на раптові зміни оточення.
Результати
У симуляційних середовищах LIBERO, CALVIN та SimplerEnv Xiaomi‑Robotics‑0 перевершив близько 30 конкурентів. На реальному роботі з двома маніпуляторами модель успішно справилася зі складними завданнями: складання рушників, розбирання конструктора. Робот демонстрував стійку координацію рук і очей, однаково ефективно маніпулюючи об’єктами в різних сценаріях.
Таким чином, Xiaomi не лише розширила свій портфель продуктів, а й заклала фундамент для подальших досліджень у галузі «фізичного інтелекту» роботів.
Коментарі (0)
Поділіться своєю думкою — будь ласка, будьте ввічливі та по темі.
Увійдіть, щоб коментувати