Исследователи из Калифорнийского университета в Беркли выпустили CUA-Lite — открытую платформу для создания, обучения и оценки компьютерных агентов (CUA). Её главная идея — инфраструктурная, а не модельная: чтобы обучать и бенчмаркать агента, нужны четыре компонента — сами агенты, окружения, трассы действий и фреймворк для их оценки. Сейчас всё это разбросано по отдельным репозиториям с несовместимыми интерфейсами. CUA-Lite объединяет их под одним пространством действий, одной схемой данных и одной командой для desktop, браузера и мобильных устройств.
Платформа устанавливается командой uv sync --all-extras на Python 3.12. Лёгкие песочницы работают на любом Docker-хосте без /dev/kvm, поэтому подходят облачные инстансы, CI-раннеры и вложенные контейнеры.
Lite.OSWorld: задачи OSWorld без налога на виртуализацию
Самое конкретное нововведение — окружение Lite.OSWorld. Оригинальный OSWorld даёт полноценный Ubuntu desktop, но поставляется как полная QEMU/KVM-виртуальная машина на каждую задачу, что требует вложенной виртуализации, которой нет на большинстве управляемой инфраструктуры. CUA-Lite воспроизводит тот же набор задач и те же оценщики на GNOME-десктопе внутри обычного Docker-контейнера.
| Параметр | OSWorld | Lite.OSWorld |
|---|---|---|
| Среда выполнения | QEMU/KVM VM | Docker-контейнер |
| Требования к хосту | /dev/kvm, вложенная виртуализация |
Любой Docker-хост |
| Память | 4,1 ГБ | 0,9 ГБ |
| Холодный старт | 29,9 с | 23,8 с |
| Параллелизм | базовая линия | ~4,6× больше инстансов |
| Набор задач | OSWorld | Идентичный |
Главный вопрос при замене VM на контейнер — точность воспроизведения. Авторы утверждают, что на 13 моделях результаты Lite.OSWorld совпадают с результатами VM OSWorld, поэтому оценки и обучающие сигналы, полученные в контейнере, переносятся на настоящий бенчмарк. На той же базе построено семейство песочниц: Lite.ScaleCUA, Lite.CUAGym и Lite.CUAWorld, причём последняя охватывает около 40 приложений, включая Blender, QGIS и VS Code. Всего платформа заявляет более 30 000 проверяемых задач.
Единая схема данных и адаптеры моделей
Второй слой CUA-Lite — LiteSample, единая схема для обучения с учителем, общая для всех окружений, агентов и типов задач. Данные хранятся как обычные parquet-файлы с изображениями. Более десяти существующих датасетов CUA уже предобработаны в этот формат и опубликованы бесплатно на Hugging Face, среди них Aguvis, OpenCUA, ScaleCUA, GUI-360, GUIOdyssey и Multimodal-Mind2Web. Вместе с ними опубликованы свежие rollout-датасеты, сгенерированные прогоном frontier-моделей через песочницы, — для дистилляции в более компактные ученические модели.
Поскольку разные семейства моделей ожидают разную обвязку, фреймворк включает адаптер для каждой модели, упаковывающий унифицированный LiteSample в собственный формат обучения, включая схлопывание истории, чтобы несколько шагов занимали один прямой проход.
Оценка, SFT и RL одной командой
Агенты и окружения встречаются в lite.gym: скриншоты наверх, действия вниз, одно пространство действий на платформу. Встроено более 10 агентов — GPT, Claude, Gemini, Qwen3-VL, UI-TARS, Fara-7B, MAI-UI и другие — и более 15 бенчмарков: grounding (ScreenSpot-Pro, OSWorld-G), desktop (OSWorld, OSWorld-2, WindowsAgentArena, CUABench), браузер (WebArena, VisualWebArena, MiniWoB, WebVoyager, Online-Mind2Web, WebGym) и мобильные (AndroidWorld, AndroidLab, MobileWorld, MobileGym). Весь интерфейс — замена --model-id и --env-id в scripts/rollout.py.
Тот же цикл служит для обучения. Для SFT в README описан fine-tuning Qwen3-VL-2B-Instruct на desktop-траекториях Lite.ScaleCUA: средний эпизодический возврат вырос с 0,138 до 0,237 на eval-сплите из 332 задач lite.osworld (единичная опубликованная конфигурация на двух GPU, а не независимо воспроизведённый результат). Для RL роллауты, оценённые в среде, управляют GRPO-обновлениями поверх Slime, с готовым примером MobileGym на 416 мобильных задач в 28 приложениях.
Ключевые особенности
- Единое пространство действий и схема LiteSample для агентов, окружений, трасс и обучения.
- Lite.OSWorld запускает задачи OSWorld без VM в Docker на 0,9 ГБ против 4,1 ГБ, давая примерно в 4,6 раза больше параллельных десктопов.
- Результаты в контейнере совпадают с VM OSWorld на 13 моделях.
- Более 30 000 задач, 15+ бенчмарков, 10+ агентов и 20+ датасетов бесплатно на Hugging Face.
- Работает на любом Docker-хосте, но в репозитории пока нет явной лицензии — перед коммерческим использованием проверьте условия.
Частые вопросы
Что такое компьютерный агент (CUA)?
Это ИИ-агент, который работает с компьютером как человек: видит скриншоты, двигает курсор, кликает, печатает текст и выполняет действия в приложениях и браузере.
Чем CUA-Lite отличается от OSWorld?
OSWorld — это бенчмарк с виртуальными машинами QEMU/KVM для каждой задачи. CUA-Lite воспроизводит те же задачи в Docker-контейнере с GNOME, что требует в 4,5 раза меньше памяти и работает без вложенной виртуализации.
Насколько точны результаты в контейнере по сравнению с VM?
По заявлению авторов, на 13 моделях оценки Lite.OSWorld совпадают с оценками оригинальной VM OSWorld, поэтому обучающий сигнал переносится на настоящий бенчмарк.
Какие модели и бенчмарки поддерживаются?
Встроено более 10 агентов (GPT, Claude, Gemini, Qwen3-VL, UI-TARS и другие) и более 15 бенчмарков для desktop, браузера и мобильных платформ.
Где взять данные для обучения?
Более 20 датасетов в формате LiteSample опубликованы бесплатно на Hugging Face, включая Aguvis, OpenCUA, ScaleCUA и другие.
Можно ли использовать CUA-Lite в коммерческих целях?
В репозитории пока нет явной лицензии, поэтому перед коммерческим использованием необходимо проверить условия и связаться с авторами.
Какие требования к оборудованию?
Нужен Python 3.12 и любой Docker-хост — без /dev/kvm и вложенной виртуализации. Песочница Lite.OSWorld потребляет 0,9 ГБ памяти, а холодный старт занимает около 24 секунд.
С проектом можно ознакомиться на странице проекта, в GitHub-репозитории и в датасетах на Hugging Face.
Источник: marktechpost.com