Подразделение Robbyant, отвечающее за воплощённый ИИ внутри Ant Group, представило LingBot-VA 2.0 — модель, которую авторы называют первой «изначально воплощённой» базовой моделью для задач манипуляции роботами. Проще говоря, это не виртуальный ассистент, а модель, которая смотрит на сцену через камеру и сразу выдаёт действия робота, а не адаптирует под это готовые системы генерации видео.
Что нового под капотом
Ключевых идей несколько:
- Семантический визуально-экшн токенизатор. Вместо стандартного сжатия VAE он подтягивает визуальные латенты к перцептивному энкодеру и вытаскивает переменные, отвечающие именно за переход между кадрами — то, что важно для действия.
- Каузальный DiT с нуля. Версия 2.0 не дообучает чужую модель, а с нуля предобучает каузальный диффузионный трансформер: около 15,3 млрд параметров суммарно, из которых примерно 2,5 млрд активны на токен во время инференса.
- Разреженная MoE. Видео-эксперт использует 128 маршрутизируемых SwiGLU-экспертов с выбором top-8, а экшн-эксперт остаётся плотным.
- Упреждающее рассуждение. Пока робот выполняет текущее действие, модель асинхронно «представляет» исход следующего блока — предсказание идёт внахлёст с исполнением.
Цифры
На бенчмарке RoboTwin 2.0 (50 задач) модель показала 93,8% успеха на чистых демонстрациях и 93,4% на рандомизированных. Но самое заметное — скорость: время на блок сократилось с 927 мс до 142 мс, а частота управления выросла с 35 до 225 Гц. Для реактивного управления это принципиально.
Что она умеет на практике
LingBot-VA 2.0 адаптируется по 10–20 демонстрациям, обучается «в контексте» по видео с показом задачи и справляется с динамикой — вроде аэрохоккея или движущейся конвейерной ленты. Отдельно авторы отмечают совместное обучение человека и робота на 65,4 тыс. эпизодов от первого лица. В сумме заявка серьёзная: не узкий навык под конкретный стенд, а универсальное управление, которое переносится между задачами.