Команда Kimi AI (Moonshot AI) совместно с kvcache-ai опубликовала в открытом доступе AgentENV (AENV) — распределённую платформу для запуска сред обучения агентов. Код опубликован под лицензией MIT.
AgentENV используется в обучении с подкреплением (RL) модели Kimi K3 — MoE-модели Moonshot AI объёмом 2,8 триллиона параметров.
Зачем это нужно
Агентное RL отличается от обычного обучения языковых моделей тем, что модель не просто генерирует текст — она действует внутри реального компьютера. Каждый шаг обучения требует изолированной среды Linux с файловой системой, сетевым стеком и работающими процессами.
Здесь возникает техническое противоречие: контейнеры запускаются быстро, но разделяют ядро хоста, что ослабляет изоляцию при выполнении сгенерированного моделью кода. Полноценные виртуальные машины изолируют надёжно, но загружаются медленно и удерживают память в простое. AgentENV нацелен именно на этот разрыв.
Архитектура AgentENV
Каждая песочница — это Firecracker microVM с собственным ядром Linux, файловой системой и сетевым пространством имён. HTTP-запросы поступают на Axum API, который передаёт их оркестратору, управляющему жизненным циклом microVM.
Система хранения реализована через ublk — блочное устройство в userspace, работающее поверх overlaybd. Базовые слои только для чтения разделяются между всеми песочницами, каждая записывает изменения в свой собственный верхний слой.
Внутри каждой гостевой VM работает демон envd — он обрабатывает выполнение команд, файловые операции и отправляет отчёты о состоянии на порт 49983. Обратный прокси направляет HTTP- и WebSocket-трафик от клиентов к сервисам внутри VM.
Оптимизация памяти построена на двух механизмах: page cache хоста разделяется между хранилищем и снимками памяти (memory snapshot), а механизм memory ballooning позволяет эффективно перераспределять память между активными и простаивающими VM.
Для кого это
AgentENV интересен в первую очередь разработчикам и исследователям, которые строят агентные системы и ищут альтернативу как чистым контейнерам (слабая изоляция), так и полновесным VM (медленный запуск). Firecracker, разработанный Amazon для AWS Lambda, обеспечивает близкую к контейнерной скорость запуска при аппаратном уровне изоляции.
Проект опубликован на GitHub, установка и запуск описываются в репозитории.
Почему Firecracker
Выбор Firecracker не случаен. Это microVM от Amazon, разработанная специально для AWS Lambda и AWS Fargate. Она запускается за миллисекунды (а не минуты, как полноценные гипервизоры), потребляет минимум памяти, но предоставляет аппаратный уровень изоляции — каждое окружение получает собственное ядро Linux. Это принципиально отличает AgentENV от решений на Docker-контейнерах, где разделяемое ядро хоста создаёт риск при выполнении потенциально вредоносного кода, сгенерированного моделью.
Практическое применение
AgentENV не ограничен обучением одной модели Kimi K3. Поскольку платформа опубликована под лицензией MIT, любой разработчик может развернуть её для своих задач: от тестирования агентных систем до организации изолированных сред для выполнения AI-сгенерированного кода. Особый интерес платформа представляет для исследователей, работающих над agentic AI — моделями, которые не просто генерируют текст, а выполняют действия в компьютерном окружении.
Архитектура с разделяемыми read-only слоями образов через overlaybd позволяет эффективно использовать дисковое пространство: базовая операционная система и инструментарий загружаются один раз и разделяются между всеми песочницами, а каждая VM сохраняет только свои изменения.
Источник: marktechpost.com