ИИ-агенты для исследований уже умеют предлагать, реализовывать и оценивать собственные эксперименты в машинном обучении. Генерация идей — процесс дешёвый, а вот их проверка — нет: обучение одного кандидата может занять от часов до дней на GPU. Поэтому агент создаёт гораздо больше кандидатов, чем способен выполнить. Какой из них запускать — вот что действительно определяет прогресс исследования.
Исследовательская группа из FAIR (Meta), Оксфордского университета и Университетского колледжа Лондона формализовала этот выбор как «исследовательское предпочтение» и представила AI Research Preference Models (RPM). RPM ранжирует невыполненные кандидаты и выбирает один для запуска. Модель никогда не прогнозирует абсолютную оценку: исследователи обнаружили, что языковые модели ненадёжны в предсказании метрик и результатов выполнения.
Где RPM встраивается в цикл агента
Основа системы — AIRA-dojo, эволюционный древовидный поиск: жадный отбор родителей, операторы Draft / Improve / Debug, а в конце возвращается узел с наибольшей валидационной оценкой. RPM вмешивается только на этапе создания потомка. Вместо генерации одного потомка и его выполнения агент применяет оператор 15 раз параллельно, получая 15 невыполненных кандидатов, а затем сравнивает их попарно в «нокаут-турнире». Выполняется только победитель. Каждое сравнение опирается на контекстные узлы, собранные обходом дерева в ширину (BFS), каждый узел показан с полученной им валидационной оценкой.
Два варианта, два бюджета вычислений
Inference-only RPM: LLM в роли судьи оценивает планы кандидатов, код и историю поиска. Промпт оптимизирован с помощью MIPROv2 из DSPy, что привело к рубрике «главного исследователя»: она терпит исправимые баги, поощряет расширяемость и штрафует избыточные направления. Офлайн-точность — от 57,7% до 59,0%.
Agentic RPM: тот же судья плюс песочница, которая клонирует окружение агента, включая один H200. Инструменты — python, bash и submit_solution. Модель запускает небольшие пилотные эксперименты, после чего модель обратной связи либо предлагает следующий наиболее информативный эксперимент, либо завершает цикл. Два ключевых решения: оставшийся бюджет сознательно завышается (сообщается 2700 секунд при реальных 300), чтобы агент не останавливался рано, а количество пилотов ограничено 30 с порогом в 60 секунд. Пилотное время конкурирует с собственным временем агента, поэтому агентный селектор работает только на шагах Draft и Improve; Debug возвращается к случайному выбору.
Результаты на AIRS-Bench
Настройка: 20 публичных задач с текстовыми и табличными данными, 24 часа на одном H200 на задачу, 10 сидов, Qwen3.6-27B как основа для операторов и RPM. Таким образом, выигрыш даёт именно слой отбора, а не более сильный судья.
| Выбор потомка | Средняя нормализованная оценка |
|---|---|
| Без RPM (случайный выбор) | 0,684 |
| Inference-only RPM | 0,711 |
| Agentic RPM | 0,729 |
| Валидационный оракул (потолок) | 0,748 |
| Тестовый оракул (потолок) | 0,759 |
Вероятность улучшения относительно варианта без RPM составляет 0,5923 и 0,5913, с нижними границами 95% доверительного интервала на уровне 0,5066 и 0,5018.
Практический результат — эффективность: Inference-only достигает финальных 0,684 базовой линии за 14,88 часов (ускорение в 1,61 раза), а Agentic — за 15,50 часов (в 1,55 раза). Самостоятельный хостинг инференса добавляет 0,660 часа на запуск; с учётом этого показатель всё равно достигает 0,708 за 23,34 часа.
Также сообщается о двух новых SOTA-результатах: WinoGrande 94,1% с Agentic RPM (предыдущий агентный SOTA — 90,4% у AIRA₂) и SVAMP 95,7% с Inference-only (предыдущий человеческий SOTA — 94,2%).
Доступность и практическое применение
RPM частично развёртываемы: они используют замороженные предобученные LLM без тонкой настройки, а каркас AIRA-dojo и бенчмарк AIRS-Bench — с открытым исходным кодом. Основная модель Qwen3.6-27B имеет открытые веса.
Для инженера, который строит агентов для автоматизации исследований, это означает конкретный способ сэкономить GPU-часы: вместо того чтобы выполнять каждый сгенерированный кандидат, можно ранжировать их и запускать только самый перспективный. Особенно это актуально в условиях, когда вычислительные ресурсы ограничены или дороги. Подход Meta перекликается с другими попытками оптимизировать ИИ-инфраструктуру, например, с маршрутизацией локального инференса от NVIDIA.
Ключевые выводы
- RPM ранжируют невыполненные кандидаты, чтобы агент запускал только самый многообещающий.
- Два варианта с замороженными LLM: судья без инференса и агентный судья с короткими пилотами.
- На AIRS-Bench средняя нормализованная оценка растёт с 0,684 до 0,711 и 0,729.
- Оба варианта достигают результата базовой линии за 24 часа примерно за 15 часов — ускорение в 1,5–1,6 раза.
- Новые заявленные SOTA на WinoGrande (94,1%) и SVAMP (95,7%).
Частые вопросы
Что такое RPM в контексте ИИ-исследований?
RPM (Research Preference Models) — это модели, которые ранжируют ещё не выполненные кандидаты на эксперименты в машинном обучении. Они выбирают один самый перспективный кандидат для запуска, экономя GPU-часы и ускоряя исследовательский цикл.
Чем RPM отличается от обычного предсказания метрик?
RPM не пытается предсказать абсолютную оценку эксперимента, так как LLM ненадёжны в этом. Вместо этого они сравнивают кандидатов попарно и определяют, какой из них лучше в контексте текущего состояния исследования.
Насколько сильно RPM ускоряет исследовательский процесс?
На бенчмарке AIRS-Bench оба варианта RPM достигают результата, который базовая линия получает за 24 часа, примерно за 15 часов. Это ускорение в 1,5–1,6 раза.
Какие модели используются в RPM?
RPM используют замороженные предобученные LLM без тонкой настройки. В экспериментах в качестве основы применялась модель Qwen3.6-27B с открытыми весами.
Можно ли использовать RPM без доступа к большому количеству GPU?
Да, Inference-only RPM требует только инференса LLM для сравнения кандидатов. Agentic RPM требует песочницы с GPU для пилотных экспериментов, но даже он работает эффективнее, чем выполнение всех кандидатов.
Чем AIRS-Bench полезен для исследователей?
AIRS-Bench — это открытый бенчмарк для оценки агентов ИИ-исследований. Он позволяет стандартизированно сравнивать различные подходы к автоматизации экспериментов и измерять их эффективность.
Как это связано с общим трендом на оптимизацию ИИ-инфраструктуры?
Это часть более широкого движения к эффективному использованию вычислительных ресурсов. Подобно тому, как локальные ИИ-модели снижают зависимость от облачных GPU, RPM снижают количество GPU-часов, необходимых для исследовательских задач.
Источник: marktechpost.com