Microduck от Hugging Face: открытый двуногий робот за $399 с обучением движений через RL

Pollen Robotics, робототехническая команда Hugging Face из Бордо, открыла предзаказ на Microduck — 25-сантиметрового двуногого робота за $399. В отличие от большинства запусков, которые просят поверить демо-видео, здесь открыт весь цикл обучения: среда, функции вознаграждения, настройки domain randomization и рецепт переноса из симуляции в реальность опубликованы на GitHub.

Каждое движение робота — ходьба, сидение, удар ногой, катание на роликах, подъём после падения — это нейрополитика, обученная в физическом симуляторе и экспортированная в железо. Microduck продолжает линию Reachy Mini, которых продано более 10 000 единиц, но меняет концепцию: Reachy Mini создан для стола и взаимодействия, Microduck — чтобы покинуть стол, падать и вставать.

Характеристики и железо

Робот 25 см в высоту, 14 см в ширину, весит менее 800 г. В нём 15 моторов: ноги, шея и голова, плюс шарнирный клюв, который поднимает предметы с пола. Вычисления — Rockchip RK3566 с AI-ускорителем, 1 ГБ оперативной памяти и 32 ГБ хранилища.

Набор сенсоров для такой цены необычно полный:

  • фронтальная камера с отдельным индикатором работы;
  • два IMU — в корпусе и в голове;
  • компактный LiDAR и матрица time-of-flight 8×8;
  • микрофоны и динамик;
  • две NFC-антенны, Wi-Fi и Bluetooth;
  • съёмный аккумулятор NP-F550 на 2600 мА·ч — примерно час работы.

В коробке семь обученных движений, управляются штатным геймпадом до того, как вы начнёте писать код: ходьба, сидение и вставание, удар, захват, ролики и самовосстановление. Робот не говорит: при первом включении каждое устройство генерирует собственный звуковой идентификатор и навсегда сохраняет этот голос.

Как обучаются поведения

Политики тренируются в репозитории microduck_rl, построенном на mjlab (MuJoCo Warp) с PPO. По данным Pollen, на CUDA GPU с 4096 параллельными средами на походку уходит примерно один-два часа. Если локальной GPU нет, аргумент --hf-jobs запускает ту же команду в Hugging Face Jobs. Подход к обучению с подкреплением здесь тот же, что и в платформе для агентного RL AgentENV, но сфокусированный на физическом симуляторе MuJoCo.

Ключ к переносу симуляции в реальность — модель привода. Каждый сервопривод использует модель BAM M6 от Dynamixel XL330: закон управления напряжением, противо-ЭДС, кулоновское, стрибековское и зависящее от нагрузки трение — вместо идеального PD-контроллера. Рандомизация среды включает напряжение батареи, просадку напряжения под нагрузкой, задержку команд и величину трения. Варианты люфта тренируются против ±1° зубчатой передачи, всего 2°, последовательно с каждым из 14 сервоприводов в RL-конфигурации. Поскольку реальный энкодер находится на выходной стороне люфта, наблюдения считываются через него.

Обученные политики экспортируются в ONNX с нормализатором наблюдений, встроенным в граф. Pollen предупреждает: не стоит разворачивать вручную сконвертированные чекпоинты именно по этой причине.

На самом роботе Rust-рантайм управляет 50-герцовым циклом управления и шиной моторов. Все политики используют общее 61-мерное наблюдение актора: 48 измерений проприоцепции плюс команды twist (3), позы головы (4) и позы тела (6). Этот общий контракт позволяет горячо подменять политики ходьбы, восстановления и трюков на лету. Среды, игнорирующие слот команды, дополняют его нулями, а не отбрасывают.

Опубликованный реестр покрывает 13 задач: отслеживание скорости, подъём, сидение-стояние, подъём с земли, удар по мячу (70 мм, 15 г, актор без зрения на мяч), кувырок и пять сред для катания на роликах.

Лицензии и поставки

Программное обеспечение распространяется под Apache-2.0; файлы механического и электронного дизайна не открыты. Предзаказы открыты с 27 августа 2026 года, поставки планируются до Рождества.

Для системного администратора и владельца бизнеса Microduck интересен не как игрушка, а как доступная платформа для экспериментов с обучением с подкреплением. Полный стек — от симуляции до реального железа — стоит $399, что на порядок дешевле типичных исследовательских платформ. Это делает RL-робототехнику доступной для малых команд и даже отдельных разработчиков. Как и Gemini Robotics 2 от Google DeepMind, Microduck показывает сдвиг в сторону физического ИИ, но с принципиально иной ценовой точкой и открытым кодом.

Частые вопросы

Что входит в комплект Microduck?

Сам робот с 15 моторами, камерой, LiDAR, двумя IMU, NFC, Wi-Fi и Bluetooth, съёмный аккумулятор NP-F550 и геймпад для управления семью предобученными движениями. Тренировочные среды и рантайм открыты на GitHub.

Нужна ли мощная видеокарта для обучения?

Для локального обучения походки нужен CUDA GPU: по данным Pollen, один-два часа на 4096 параллельных средах. Без GPU можно запустить ту же команду в облаке Hugging Face Jobs с флагом --hf-jobs.

Какие движения уже обучены?

В коробке семь движений: ходьба, сидение и вставание, удар, захват, катание на роликах и самовосстановление. Всего опубликованный реестр покрывает 13 задач, включая кувырок и пять роликовых сред.

Можно ли обучить собственное движение?

Да, весь цикл открыт: среды, функции вознаграждения, настройки рандомизации и рецепт sim-to-real опубликованы. Обученные политики экспортируются в ONNX с встроенным нормализатором наблюдений.

Почему нельзя разворачивать вручную сконвертированные чекпоинты?

Нормализатор наблюдений должен быть встроен в граф ONNX. При ручной конвертации он теряется, и политика работает некорректно на реальном железе.

Открыты ли чертежи корпуса и схемы?

Нет. Программное обеспечение — Apache-2.0, но механические и электронные файлы дизайна не публикуются.

Чем Microduck отличается от Reachy Mini?

Reachy Mini создан для стола и взаимодействия с людьми, Microduck — для падений и подъёмов. Это другая философия: робот покидает стол и учится справляться с реальной динамикой.

Когда начнутся поставки?

Предзаказы открыты с 27 августа 2026 года, поставки планируются до Рождества.

Источник: marktechpost.com