NVIDIA AVO: 100% на ARC-AGI-3 — архитектура агента, а не модель, решает

NVIDIA представила результаты исследовательского проекта Agentic Variation Operators (AVO) — архитектуры для автономных ИИ-агентов. Ключевой результат: система, построенная вокруг модели Claude Opus 5, достигла 100% на бенчмарке ARC-AGI-3, решив все 183 уровня в 25 средах. Это наглядная демонстрация того, что в долгих многошаговых задачах решает не только модель, но и окружающая её инфраструктура — harness.

Что такое AVO и почему это не просто очередная модель

AVO — это не отдельная языковая модель, а общая архитектура агента, разработанная в NVIDIA. Она включает в себя несколько ключевых компонентов, которые позволяют модели работать автономно в течение длительного времени:

  • Постоянная память: сохраняет предыдущие реализации, результаты оценки, выводы компилятора и накопленные рассуждения. Агент может продолжить работу с текущего состояния, а не начинать поиск заново.
  • Супервизор: следит за общей траекторией работы, выявляет застой или повторяющиеся непродуктивные циклы и перенаправляет основного агента на альтернативные стратегии.
  • Исполняемый цикл: агент сам решает, что исследовать, что менять, что тестировать и что фиксировать.

Ключевая идея в том, что эта архитектура универсальна. Она не заточена под конкретную задачу: для работы с GPU-ядрами и для интерактивного бенчмарка ARC-AGI-3 использовался один и тот же агент, менялся только интерфейс взаимодействия со средой.

Проверка на GPU-ядрах: 7 дней автономной работы

Первым испытанием для AVO стала оптимизация GPU-ядер. Это сложная задача: пространство поиска огромно, а небольшие изменения в коде могут непредсказуемо повлиять на производительность.

В ходе эксперимента AVO работал непрерывно в течение семи дней. За это время агент:

  • исследовал более 500 направлений оптимизации;
  • зафиксировал 40 версий ядер;
  • достиг производительности до 10,5% выше, чем у FlashAttention-4, и до 3,5% выше, чем у cuDNN, на системах NVIDIA DGX B200.

Примечательно, что после этого агент адаптировал эволюционировавшее ядро для grouped-query attention примерно за 30 минут автономной работы. Это показывает, что система способна поддерживать продуктивный инженерный цикл без ручного управления каждым шагом.

ARC-AGI-3: перенос на интерактивные рассуждения

ARC-AGI-3 — это интерактивный бенчмарк для проверки рассуждений. Агент попадает в незнакомые игровые среды без инструкций, правил и явных целей. Ему нужно исследовать среду, выводить её динамику и цели, а также эффективно планировать действия.

Метрика бенчмарка — Relative Human Action Efficiency (RHAE), которая сочетает выполнение задач с эффективностью действий относительно базового уровня человека.

Результаты AVO на публичном наборе ARC-AGI-3:

  • 100.00 RHAE — полный результат;
  • 183 уровня решены во всех 25 средах;
  • 6 624 действия в среде потребовалось агенту.

Для сравнения, система VISTA, использующая ту же модель Claude Opus 5, затратила 7 542 действия на те же 183 уровня. Таким образом, AVO использовал примерно на 12% меньше действий. Авторы подчёркивают, что это не контролируемый эксперимент: системы отличаются по бэкенду агента, представлению наблюдений, памяти и другим деталям.

Важный нюанс: ARC Prize отдельно сообщает о примерно 30% для Claude Opus 5 при высоком уровне рассуждений. Разница с результатом AVO объясняется тем, что оценка модели сама по себе не характеризует работу полного агента — решающую роль играет окружающая система.

Почему это важно: перенос архитектуры, а не знаний

Главный вывод исследования — не сам результат 100%, а то, что одна и та же архитектура агента переносится между столь разными задачами, как оптимизация GPU-ядер и интерактивные рассуждения.

В GPU-оптимизации обратная связь поступает от компиляторов, тестов и профайлеров. В ARC-AGI-3 — от переходов между состояниями среды. Интерфейсы разные, но базовый цикл одинаков: сформировать гипотезу, действовать, наблюдать результат, обновить состояние и продолжать.

Это подтверждает, что способность к длительной работе — свойство всей системы: память определяет, что сохраняется, инструменты — какие действия возможны, обратная связь — как прогресс закрепляется, а восстановление позволяет продолжать работу за пределами одного вызова модели.

Технические детали эксперимента

В конфигурации для ARC-AGI-3 использовался текстовый режим: каждое наблюдение подавалось модели как точная текстовая сетка 64x64, без изображений. Агент получал список доступных действий без описания правил или целей игры.

Интересно, что AVO также тестировали с GPT-5.6 Sol на сложном подмножестве игр. В этих ограниченных экспериментах Sol быстрее достигал сопоставимых уровней по времени, но Opus использовал меньше действий среды. Это указывает на разные профили работы моделей в рамках одной архитектуры.

Результаты относятся только к публичному набору из 25 сред с официальной системой оценки и метрикой RHAE. Они не распространяются на полуприватные или полностью приватные наборы соревнований.

Практическая ценность для разработчиков агентов

Для тех, кто строит собственных ИИ-агентов, исследование NVIDIA даёт несколько практических выводов:

  1. Модель — не весь агент. Инвестиции в harness, память и супервизор могут дать больший прирост в долгих задачах, чем смена модели.
  2. Постоянная память критична. Способность возобновлять работу с сохранённого состояния вместо повторного исследования — ключевой фактор эффективности.
  3. Супервизор окупается. Отдельный компонент, следящий за застоем и перенаправляющий агента, поддерживает прогресс в долгих прогонах.
  4. Архитектура переносима. Один и тот же агент может работать с совершенно разными интерфейсами, если базовый цикл «гипотеза → действие → наблюдение» сохранён.

NVIDIA планирует развивать AVO в направлении общих систем агентов, построенных вокруг постоянного состояния, использования инструментов и управления долгосрочным контекстом. Тем, кто строит собственных агентов, стоит помнить о типовых провалах в защите ИИ-агентов, которые выделяет NVIDIA AI Red Team, — безопасность должна проектироваться на уровне всей системы. А для практических задач, например управления GPU, подходы к оптимизации могут дать ощутимый прирост без смены железа.

Частые вопросы

Что такое AVO простыми словами?

AVO — это система-обёртка вокруг языковой модели, которая позволяет ей работать автономно над сложными задачами в течение длительного времени. Она добавляет модели постоянную память, супервизора и собственный цикл исполнения.

Чем AVO отличается от обычного использования ChatGPT или Claude?

Обычный чат-бот отвечает на один запрос. AVO — это полноценный агент: он сам ставит промежуточные цели, выполняет действия, анализирует результаты и корректирует свой подход без участия человека.

Результат 100% на ARC-AGI-3 означает, что ИИ стал разумным?

Нет. Это означает, что конкретная система агента смогла решить все задачи бенчмарка. Сам бенчмарк измеряет способность к адаптации и планированию в незнакомых средах, а не общий интеллект.

Можно ли использовать AVO с любой моделью?

По заявлению NVIDIA, архитектура рассчитана на работу с разными frontier-моделями. В экспериментах она тестировалась с Claude Opus 5 и GPT-5.6 Sol.

Насколько результат на ARC-AGI-3 отличается от оценки самой модели?

ARC Prize оценивает Claude Opus 5 примерно в 30% на этом бенчмарке. В составе AVO та же модель достигает 100%, что показывает — система агента может кардинально улучшить результат.

Что такое RHAE?

Relative Human Action Efficiency — метрика, которая оценивает не только факт решения задачи, но и эффективность действий агента относительно действий человека, выполняющего задачу впервые.

Какие ограничения есть у этих результатов?

Результаты получены только на публичном наборе ARC-AGI-3. Они не распространяются на приватные наборы соревнований, а сравнение с VISTA не является контролируемым экспериментом.

Источник: developer.nvidia.com