Google DeepMind выпустила Gemini Robotics 2: управление всем телом робота и тонкая моторика

Google DeepMind выпустила Gemini Robotics 2 — «интеллектуальный слой» для роботов следующего поколения. Релиз выводит стек за пределы манипуляций на столе: заявлены управление всем телом, моторика пятипалой кисти и совместная работа нескольких роботов. Вместе выходят три модели с разными уровнями доступа.

Три модели

Gemini Robotics 2 — это vision-language-action (VLA) модель: преобразует зрение и язык в команды моторам. Она управляет полноразмерными гуманоидами «от стоп до кончиков пальцев», двухрукими роботами, а также ловкими манипуляциями многосуставными кистями и параллельными схватами.

Gemini Robotics ER 2 — модель воплощённого рассуждения (embodied reasoning, ER): «верхний мозг», который общается с человеком, понимает физический мир и планирует многошаговые задачи длительностью в несколько минут. Согласно карточке модели, ER 2 построена на базе Gemini 3.5 Flash, принимает перемежающиеся текст, изображения, видео и аудио, контекст — до 128 тысяч токенов, вывод текста — до 64 тысяч токенов.

Gemini Robotics On-Device 2 — эффективная VLA для запуска прямо на роботе. По карточке модели, она основана на технологии Gemini Robotics 1.5 и on-device моделях Gemma. Входы — текст, изображения и проприоцепция в виде чисел, выходы — действия робота в виде чисел.

Разделение труда важно для проектирования систем: ER 2 планирует и контролирует задачу, а исполнение моторики передаёт VLA, объявленной как инструмент. Разработчики регистрируют низкоуровневые интерфейсы управления — VLA-модели, API навигации — как вызываемые инструменты и стримят в модель мультимодальные видео, аудио и текст. ER 2 доступна в публичном превью; VLA и on-device модели остаются ограниченными.

Что умеет и чего пока не умеет

Пример целостного управления телом — Apptronik Apollo 2. По команде «поставь лейку в зелёный контейнер на нижней полке» робот подходит к столу, берёт лейку, делает несколько шагов к полкам и ставит объект на место. DeepMind прямо признаёт: скорости движения роботам ещё не хватает.

Моторика: пятипалая кисть SharpaWave с 22 степенями свободы на Apollo 2 — завязывание узлов, запечатывание zip-пакета; и стандартные двухпальцевые параллельные схваты на Franka Duo — плотная укладка. Успешность одной контрольной точки на трёх воплощениях: подъём с полки 76,3%, со стола 68,4%, с пола 45,7%; открутить лампочку 92%, завязать мусорный пакет 44%, запечатать zip-пакет 40%, вкрутить лампочку 36%, убрать совком 32%; у схвата — точная вставка 89,6%, комплектация инструментами 78,9%, подъём и перенос 74,2%. Авторы называют многосуставную моторику слабым местом: разброс от 32% до 92%.

Временной интеллект и безопасность

ER 2 отдельно тестировали на задачах, которые редко попадают в бенчмарки. Классификация прогресса: каждый кадр видео относится к одному из пяти уровней — от 0–20% до 80–100%. Точность 57,4%, что, по данным DeepMind, лучше предшественников и конкурирующих frontier-моделей. Поиск момента: определение точного кадра ключевого события, например момента, когда остановить наливание кофе — точность 91,3% при средней абсолютной ошибке 0,96 секунды.

Вместе с моделями выпущен бенчмарк безопасности ASIMOV-Agentic — он размещён на Hugging Face под лицензией CC-BY-4.0.

Источник: marktechpost.com