Сегодня 07 сентября 2026
18+
MWC 2018 2018 Computex IFA 2018
реклама
Новости Software

Xiaomi создала «интеллект» для роботов: ИИ-модель с 4,7 млрд параметров объединяет зрение, язык и действия

Китайская Xiaomi, известная в первую очередь как производитель мобильных устройств, оборудования умного дома, а теперь и электромобилей, заявила о себе в новом качестве. Она решила занять место в исследованиях в области робототехники.

 Источник изображений: xiaomi-robotics-0.github.io

Источник изображений: xiaomi-robotics-0.github.io

Компания представила Xiaomi-Robotics-0 — модель искусственного интеллекта с открытым исходным кодом, сочетающую в себе визуальный, языковой компоненты и компонент действия; у неё 4,7 млрд параметров. В модели объединяются распознавание визуальных образов, понимание языка и способность производить действия в реальном времени, что, как отметили в Xiaomi, составляет ядро «физического интеллекта». Она уже установила несколько рекордов как в симуляциях, так и в реальных испытаниях.

ИИ-модели для роботов обычно действуют в замкнутом цикле: восприятие, принятие решения и выполнение операции. Робот видит объекты окружающего мира, понимает, что от него требуется, составляет план действий и реализует его — Xiaomi-Robotics-0 создавалась, чтобы сбалансировать широкое понимание с точным управлением моторикой. Для этого здесь использована архитектура «смеси трансформеров» (Mixture-of-Transformers — MoT), которая помогает распределять обязанности между двумя основными компонентами.

Первый компонент — визуально-языковая модель (VLM), выполняющая функцию «мозга». Она обучена интерпретировать отдаваемые человеком команды, в том числе расплывчатые, такие как «пожалуйста, сложи полотенце», а также понимать пространственные отношения на основе визуальных сигналов высокого разрешения. Задачи этой части — обнаружение объектов, ответы на вопросы в визуальной области и логические рассуждения. Второй компонент в Xiaomi называют экспертом по действиям (Action Expert). Эта часть модели имеет архитектуру диффузионного трансформера (Diffusion Transformer — DiT). Она не предполагает выполнения одного действия за раз, а генерирует последовательность действий, используя методы сопоставления потоков, что обеспечивает точность и плавность движения.

Слабой стороной VLM является то, что при обучении выполнению физических операций они, как правило, теряют часть заложенных ранее способностей к пониманию. Инженерам Xiaomi удалось избежать этой проблемы, обучая модель одновременно на мультимодальных данных и данных о действиях. В теории это означает, что такая система может одновременно рассуждать об объектах окружающего мира и учиться в нём передвигаться. Процесс обучения включает несколько этапов. Сначала механизм «предложения действий» заставляет VLM предсказывать возможные распределения действий при интерпретации изображений — это помогает согласовывать внутреннее представление модели о том, что она видит, с тем, как выполняются операции. После этого работа компонента VLM приостанавливается, и DiT проходит отдельное обучение для генерации точных последовательностей из шума на основе ключевых признаков, а не дискретных языковых токенов.

Xiaomi удалось решить проблему задержки вывода — паузы между выдаваемыми моделью прогнозами и физическим движением робота. Для этого реализовали асинхронный вывод, разделив вычисления модели и действия робота: движения остаются непрерывными, даже если модели требуется дополнительное время на обдумывание. Для повышения стабильности используется техника Clean Action Prefix, предполагающая возврат в модель предсказанного ранее действия, что обеспечивает плавное движение без рывков во времени. Маска внимания направляет модель на актуальный визуальный ряд, понижая приоритет прошлых состояний, в результате чего робот оказывается отзывчивым к внезапным изменениям окружающей среды.

В симуляциях LIBERO, CALVIN и SimplerEnv модель Xiaomi-Robotics-0 превзошла около 30 других, сообщил разработчик. В реальных экспериментах она проверялась на роботе с двумя манипуляторами: в задачах с последовательностями действий, таких как складывание полотенец и разборка блоков конструктора, робот демонстрировал стабильную координацию рук и глаз, одинаково эффективно манипулируя как жёсткими, так и мягкими объектами. Модели действительно удалось сохранить сильные визуальные и языковые возможности, особенно в задачах, связанных с физическим взаимодействием.

Было интересно? Скажите об этом Google, чтобы чаще получать ссылки на наши новости про искусственный интеллект

Источник:

Если вы заметили ошибку — выделите ее мышью и нажмите CTRL+ENTER.
Материалы по теме

window-new
Soft
Hard
Тренды 🔥
Хакеры взломали Liquid Network и похитили биткоины на $320 млн 16 мин.
Инсайдеры раскрыли, чего ждать от загадочного шутера Blizzard по StarCraft 36 мин.
Моддер поразил фанатов демонстрацией кооператива и вида от третьего лица для классического стелс-экшена Metal Gear Solid 3 ч.
«Погибнут многие храбрые рыцари»: многострадальная MMO по League of Legends превратилась для Riot Games в поход за Святым Граалем 4 ч.
Новый трейлер подтвердил дату выхода Airframe Ultra — ретрофутуристического гоночного боевика, который выглядит как дитя Road Rash и «Акиры» 6 ч.
«Базис» приобрёл 70 % разработчика ИИ-платформы наблюдаемости Proto Observability 8 ч.
Рост облачного рынка России резко замедлился — не хватает «железа» и «дешёвых» денег 9 ч.
OpenAI призвала замедлить развитие ИИ из-за риска выхода агентов из-под контроля 11 ч.
Первая за 20 лет новая Onimusha не разочаровала Capcom продажами — миллион копий Onimusha: Way of the Sword за один день 11 ч.
Valheim 2 не будет — разработчики продолжат расширять оригинальную Valheim 11 ч.
Xiaomi обновила 27-дюймовый монитор Redmi A27U — разрешение 4K, частота 240 Гц и 90-Вт зарядка USB-C 14 мин.
SK hynix успешно расширяет производство памяти DRAM по передовому техпроцессу 1c 2 ч.
Анонсирован флагманский 3-дюймовый планшет Xiaomi Pad 9 Pro Max с чипом Xring O3 и памятью LPDDR6 3 ч.
Xiaomi бросила вызов складному iPhone: представлен широкоформатный Xiaomi 18 Fold с чипом Xring O3, LPDDR6 и 200-Мп камерой 6 ч.
LG представила 14" ноутбук Gram Book AI 2026 с чипом Intel Wildcat Lake и автономностью до 30 часов 6 ч.
Производители памяти не успевают за спросом — зато их выручка взлетела на 60 % во втором квартале 6 ч.
Репортаж со стенда Acer на IFA 2026: гибрид консоли и ноутбука DualPlay Mini, сверхлёгкий Swift, мини-ПК на Nvidia и другие новинки 8 ч.
Перед анонсом складного iPhone Huawei представила трёхстворчатый Mate XT 2 с чипом Kirin 9050 Pro и 10,2" экраном 8 ч.
NVIDIA инвестировала в разработчика оптических коммутаторов iPronics 8 ч.
Huawei представила широкоформатный, но не складной смартфон Pura X View 9 ч.