Компания Generalist AI представила GEN-1.5 — фундаментальную модель для роботов, которая обучается новой физической задаче по одному демонстрационному примеру. Достаточно поместить 3–12 секунд сенсомоторных данных в её 30-секундное контекстное окно, и робот выполняет задачу. Никаких обновлений градиента, тонкой настройки или специального программирования не требуется.
Как работает physical prompting
GEN-1.5 — это большая мультимодальная модель, которая принимает видео, данные сенсоров, язык и проприоцептивные сигналы, хранит 30 секунд памяти и выдаёт траектории действий с частотой 100 Гц. Модель непрерывно обучалась более восьми месяцев на данных физического взаимодействия, собранных в домах, на складах и фабриках.
Основной механизм — physical prompting. Сенсомоторный пример (потоки данных сенсоров плюс траектория действий) вставляется в 30-секундное контекстное окно через интерфейс drag-and-drop. Остальная часть окна содержит текущие наблюдения. После этого модель немедленно выполняет задачу — с нулевым числом шагов градиента и без тонкой настройки.
Важно: ничего из этого не было спроектировано заранее. По заявлению Generalist, не вносилось архитектурных изменений для улучшения обучения в контексте, не использовался цикл мета-обучения и не добавлялись вспомогательные цели. Способность возникла из масштаба предобучения — тем же путём, каким одношотовое промптирование появилось в GPT-3.
Результаты тестов
На 10 разнообразных задачах манипуляции одношотовое промптирование в контексте показало в среднем 59% успеха (стандартное отклонение ±10%) на предобученной модели без какого-либо обучения. Десять шагов градиента на пяти минутах данных на задачу — примерно 50 демонстраций — подняли результат до 83% (±9%). В крайнем случае один шаг градиента на одной минуте данных достиг 66,5% на отложенной задаче без подбора гиперпараметров.
Самая интересная часть — вычислительные затраты. Адаптация роботизированных политик обычно требует десятков тысяч шагов градиента. Здесь десять шагов изменяют веса модели на отложенных задачах менее чем на 0,15%, что позволяет предположить: тонкая настройка перенастраивает уже имеющиеся знания, а не строит новые представления. Generalist описывает это как test-time training в режиме чрезвычайно малого объёма данных.
Три результата переноса
Композиционная генерализация. Два независимо записанных промпта, помещённые в контекст, объединяются в одно непрерывное поведение. Модель сама создаёт связующие движения — перепозиционирование, перехват, восстановление после ошибок, — которых нет ни в одной из демонстраций.
Zero-shot sim-to-real. Демонстрация, записанная полностью в симуляции, работает как промпт для реального робота, хотя в предобучении не было данных симуляции — ни отрендеренного видео, ни смоделированной динамики. Для некоторых задач демонстрации больше не нужно собирать физически.
Имитация человек-робот. В некоторых случаях человек демонстрирует действие своими руками перед камерами робота, и модель воспроизводит его руками робота.
Генерализация проявляется и после лёгкой тонкой настройки. После обучения на пяти минутах зачистки блока в миску модель использовала банан как импровизированную щётку и совок, чтобы поднять и высыпать блок — совершенно иную последовательность контактов. Она также убрала лист бумаги, накрывавший миску, и работала обеими руками, хотя демонстрации были односторонними.
Когда ждать в продакшене
Пока это исследовательский релиз. Открытых весов, API, страницы с ценами и самостоятельного продукта нет. Generalist AI запускает GEN-1.5 на собственном парке роботов и движке данных. Тем, кому модель нужна сегодня, придётся заключать прямое партнёрство.
Авторы прямо признают: задачи простые и короткого горизонта. Но это первая известная команде модель, где одношотовое обучение физическим навыкам возникло в масштабе. Стоит воспринимать GEN-1.5 как исследовательский сигнал о возможностях масштабирования, а не как готовую к развёртыванию систему.
Похожий тренд — рост возможностей моделей без переобучения базовой архитектуры — виден и в других свежих релизах: GLM-5.3 без переобучения базовой модели и Muse Glimmer от Meta. А подход с малым числом параметров для конкретной задачи демонстрирует Needle 2.
Частые вопросы
Какие данные принимает GEN-1.5?
Модель принимает видео, данные сенсоров, язык и проприоцептивные сигналы, удерживает 30 секунд памяти и выдаёт траектории действий с частотой 100 Гц.
Что такое physical prompting?
Это механизм, при котором сенсомоторный пример — потоки данных сенсоров плюс траектория действий — вставляется в контекстное окно через drag-and-drop. Модель выполняет задачу сразу, без обновления градиента.
Насколько успешна модель без дообучения?
На 10 задачах одношотовое промптирование показало в среднем 59% успеха (±10%). После десяти шагов градиента на пяти минутах данных результат вырос до 83% (±9%).
Что такое test-time training в контексте GEN-1.5?
Это адаптация модели на очень малом объёме данных: десять шагов градиента изменяют веса менее чем на 0,15%, что говорит о перенастройке уже существующих знаний, а не о создании новых представлений.
Можно ли использовать демонстрации из симуляции?
Да. Демонстрация, записанная в симуляции, работает как промпт для реального робота, хотя предобучение не содержало данных симуляции.
Доступны ли веса или API?
Нет. Это исследовательский релиз без открытых весов, API и коммерческого продукта. Доступ возможен только через прямое партнёрство с Generalist AI.
Какие ограничения у модели?
Задачи простые и короткого горизонта, о чём авторы заявляют прямо. Модель не готова к развёртыванию в продакшене.
Источник: marktechpost.com