CUA-Lite от UC Berkeley: песочницы OSWorld без VM, в Docker на 0,9 ГБ

Исследователи из Калифорнийского университета в Беркли выпустили CUA-Lite — открытую платформу для создания, обучения и оценки компьютерных агентов (CUA). Её главная идея — инфраструктурная, а не модельная: чтобы обучать и бенчмаркать агента, нужны четыре компонента — сами агенты, окружения, трассы действий и фреймворк для их оценки. Сейчас всё это разбросано по отдельным репозиториям с несовместимыми интерфейсами. CUA-Lite объединяет их под одним пространством действий, одной схемой данных и одной командой для desktop, браузера и мобильных устройств.

Платформа устанавливается командой uv sync --all-extras на Python 3.12. Лёгкие песочницы работают на любом Docker-хосте без /dev/kvm, поэтому подходят облачные инстансы, CI-раннеры и вложенные контейнеры.

Lite.OSWorld: задачи OSWorld без налога на виртуализацию

Самое конкретное нововведение — окружение Lite.OSWorld. Оригинальный OSWorld даёт полноценный Ubuntu desktop, но поставляется как полная QEMU/KVM-виртуальная машина на каждую задачу, что требует вложенной виртуализации, которой нет на большинстве управляемой инфраструктуры. CUA-Lite воспроизводит тот же набор задач и те же оценщики на GNOME-десктопе внутри обычного Docker-контейнера.

Параметр OSWorld Lite.OSWorld
Среда выполнения QEMU/KVM VM Docker-контейнер
Требования к хосту /dev/kvm, вложенная виртуализация Любой Docker-хост
Память 4,1 ГБ 0,9 ГБ
Холодный старт 29,9 с 23,8 с
Параллелизм базовая линия ~4,6× больше инстансов
Набор задач OSWorld Идентичный

Главный вопрос при замене VM на контейнер — точность воспроизведения. Авторы утверждают, что на 13 моделях результаты Lite.OSWorld совпадают с результатами VM OSWorld, поэтому оценки и обучающие сигналы, полученные в контейнере, переносятся на настоящий бенчмарк. На той же базе построено семейство песочниц: Lite.ScaleCUA, Lite.CUAGym и Lite.CUAWorld, причём последняя охватывает около 40 приложений, включая Blender, QGIS и VS Code. Всего платформа заявляет более 30 000 проверяемых задач.

Единая схема данных и адаптеры моделей

Второй слой CUA-Lite — LiteSample, единая схема для обучения с учителем, общая для всех окружений, агентов и типов задач. Данные хранятся как обычные parquet-файлы с изображениями. Более десяти существующих датасетов CUA уже предобработаны в этот формат и опубликованы бесплатно на Hugging Face, среди них Aguvis, OpenCUA, ScaleCUA, GUI-360, GUIOdyssey и Multimodal-Mind2Web. Вместе с ними опубликованы свежие rollout-датасеты, сгенерированные прогоном frontier-моделей через песочницы, — для дистилляции в более компактные ученические модели.

Поскольку разные семейства моделей ожидают разную обвязку, фреймворк включает адаптер для каждой модели, упаковывающий унифицированный LiteSample в собственный формат обучения, включая схлопывание истории, чтобы несколько шагов занимали один прямой проход.

Оценка, SFT и RL одной командой

Агенты и окружения встречаются в lite.gym: скриншоты наверх, действия вниз, одно пространство действий на платформу. Встроено более 10 агентов — GPT, Claude, Gemini, Qwen3-VL, UI-TARS, Fara-7B, MAI-UI и другие — и более 15 бенчмарков: grounding (ScreenSpot-Pro, OSWorld-G), desktop (OSWorld, OSWorld-2, WindowsAgentArena, CUABench), браузер (WebArena, VisualWebArena, MiniWoB, WebVoyager, Online-Mind2Web, WebGym) и мобильные (AndroidWorld, AndroidLab, MobileWorld, MobileGym). Весь интерфейс — замена --model-id и --env-id в scripts/rollout.py.

Тот же цикл служит для обучения. Для SFT в README описан fine-tuning Qwen3-VL-2B-Instruct на desktop-траекториях Lite.ScaleCUA: средний эпизодический возврат вырос с 0,138 до 0,237 на eval-сплите из 332 задач lite.osworld (единичная опубликованная конфигурация на двух GPU, а не независимо воспроизведённый результат). Для RL роллауты, оценённые в среде, управляют GRPO-обновлениями поверх Slime, с готовым примером MobileGym на 416 мобильных задач в 28 приложениях.

Ключевые особенности

  • Единое пространство действий и схема LiteSample для агентов, окружений, трасс и обучения.
  • Lite.OSWorld запускает задачи OSWorld без VM в Docker на 0,9 ГБ против 4,1 ГБ, давая примерно в 4,6 раза больше параллельных десктопов.
  • Результаты в контейнере совпадают с VM OSWorld на 13 моделях.
  • Более 30 000 задач, 15+ бенчмарков, 10+ агентов и 20+ датасетов бесплатно на Hugging Face.
  • Работает на любом Docker-хосте, но в репозитории пока нет явной лицензии — перед коммерческим использованием проверьте условия.

Частые вопросы

Что такое компьютерный агент (CUA)?

Это ИИ-агент, который работает с компьютером как человек: видит скриншоты, двигает курсор, кликает, печатает текст и выполняет действия в приложениях и браузере.

Чем CUA-Lite отличается от OSWorld?

OSWorld — это бенчмарк с виртуальными машинами QEMU/KVM для каждой задачи. CUA-Lite воспроизводит те же задачи в Docker-контейнере с GNOME, что требует в 4,5 раза меньше памяти и работает без вложенной виртуализации.

Насколько точны результаты в контейнере по сравнению с VM?

По заявлению авторов, на 13 моделях оценки Lite.OSWorld совпадают с оценками оригинальной VM OSWorld, поэтому обучающий сигнал переносится на настоящий бенчмарк.

Какие модели и бенчмарки поддерживаются?

Встроено более 10 агентов (GPT, Claude, Gemini, Qwen3-VL, UI-TARS и другие) и более 15 бенчмарков для desktop, браузера и мобильных платформ.

Где взять данные для обучения?

Более 20 датасетов в формате LiteSample опубликованы бесплатно на Hugging Face, включая Aguvis, OpenCUA, ScaleCUA и другие.

Можно ли использовать CUA-Lite в коммерческих целях?

В репозитории пока нет явной лицензии, поэтому перед коммерческим использованием необходимо проверить условия и связаться с авторами.

Какие требования к оборудованию?

Нужен Python 3.12 и любой Docker-хост — без /dev/kvm и вложенной виртуализации. Песочница Lite.OSWorld потребляет 0,9 ГБ памяти, а холодный старт занимает около 24 секунд.

С проектом можно ознакомиться на странице проекта, в GitHub-репозитории и в датасетах на Hugging Face.

Источник: marktechpost.com