Meta RPM: как ранжировать ML-эксперименты до траты GPU-часов

ИИ-агенты для исследований уже умеют предлагать, реализовывать и оценивать собственные эксперименты в машинном обучении. Генерация идей — процесс дешёвый, а вот их проверка — нет: обучение одного кандидата может занять от часов до дней на GPU. Поэтому агент создаёт гораздо больше кандидатов, чем способен выполнить. Какой из них запускать — вот что действительно определяет прогресс исследования.

Исследовательская группа из FAIR (Meta), Оксфордского университета и Университетского колледжа Лондона формализовала этот выбор как «исследовательское предпочтение» и представила AI Research Preference Models (RPM). RPM ранжирует невыполненные кандидаты и выбирает один для запуска. Модель никогда не прогнозирует абсолютную оценку: исследователи обнаружили, что языковые модели ненадёжны в предсказании метрик и результатов выполнения.

Где RPM встраивается в цикл агента

Основа системы — AIRA-dojo, эволюционный древовидный поиск: жадный отбор родителей, операторы Draft / Improve / Debug, а в конце возвращается узел с наибольшей валидационной оценкой. RPM вмешивается только на этапе создания потомка. Вместо генерации одного потомка и его выполнения агент применяет оператор 15 раз параллельно, получая 15 невыполненных кандидатов, а затем сравнивает их попарно в «нокаут-турнире». Выполняется только победитель. Каждое сравнение опирается на контекстные узлы, собранные обходом дерева в ширину (BFS), каждый узел показан с полученной им валидационной оценкой.

Два варианта, два бюджета вычислений

Inference-only RPM: LLM в роли судьи оценивает планы кандидатов, код и историю поиска. Промпт оптимизирован с помощью MIPROv2 из DSPy, что привело к рубрике «главного исследователя»: она терпит исправимые баги, поощряет расширяемость и штрафует избыточные направления. Офлайн-точность — от 57,7% до 59,0%.

Agentic RPM: тот же судья плюс песочница, которая клонирует окружение агента, включая один H200. Инструменты — python, bash и submit_solution. Модель запускает небольшие пилотные эксперименты, после чего модель обратной связи либо предлагает следующий наиболее информативный эксперимент, либо завершает цикл. Два ключевых решения: оставшийся бюджет сознательно завышается (сообщается 2700 секунд при реальных 300), чтобы агент не останавливался рано, а количество пилотов ограничено 30 с порогом в 60 секунд. Пилотное время конкурирует с собственным временем агента, поэтому агентный селектор работает только на шагах Draft и Improve; Debug возвращается к случайному выбору.

Результаты на AIRS-Bench

Настройка: 20 публичных задач с текстовыми и табличными данными, 24 часа на одном H200 на задачу, 10 сидов, Qwen3.6-27B как основа для операторов и RPM. Таким образом, выигрыш даёт именно слой отбора, а не более сильный судья.

Выбор потомка Средняя нормализованная оценка
Без RPM (случайный выбор) 0,684
Inference-only RPM 0,711
Agentic RPM 0,729
Валидационный оракул (потолок) 0,748
Тестовый оракул (потолок) 0,759

Вероятность улучшения относительно варианта без RPM составляет 0,5923 и 0,5913, с нижними границами 95% доверительного интервала на уровне 0,5066 и 0,5018.

Практический результат — эффективность: Inference-only достигает финальных 0,684 базовой линии за 14,88 часов (ускорение в 1,61 раза), а Agentic — за 15,50 часов (в 1,55 раза). Самостоятельный хостинг инференса добавляет 0,660 часа на запуск; с учётом этого показатель всё равно достигает 0,708 за 23,34 часа.

Также сообщается о двух новых SOTA-результатах: WinoGrande 94,1% с Agentic RPM (предыдущий агентный SOTA — 90,4% у AIRA₂) и SVAMP 95,7% с Inference-only (предыдущий человеческий SOTA — 94,2%).

Доступность и практическое применение

RPM частично развёртываемы: они используют замороженные предобученные LLM без тонкой настройки, а каркас AIRA-dojo и бенчмарк AIRS-Bench — с открытым исходным кодом. Основная модель Qwen3.6-27B имеет открытые веса.

Для инженера, который строит агентов для автоматизации исследований, это означает конкретный способ сэкономить GPU-часы: вместо того чтобы выполнять каждый сгенерированный кандидат, можно ранжировать их и запускать только самый перспективный. Особенно это актуально в условиях, когда вычислительные ресурсы ограничены или дороги. Подход Meta перекликается с другими попытками оптимизировать ИИ-инфраструктуру, например, с маршрутизацией локального инференса от NVIDIA.

Ключевые выводы

  • RPM ранжируют невыполненные кандидаты, чтобы агент запускал только самый многообещающий.
  • Два варианта с замороженными LLM: судья без инференса и агентный судья с короткими пилотами.
  • На AIRS-Bench средняя нормализованная оценка растёт с 0,684 до 0,711 и 0,729.
  • Оба варианта достигают результата базовой линии за 24 часа примерно за 15 часов — ускорение в 1,5–1,6 раза.
  • Новые заявленные SOTA на WinoGrande (94,1%) и SVAMP (95,7%).

Частые вопросы

Что такое RPM в контексте ИИ-исследований?

RPM (Research Preference Models) — это модели, которые ранжируют ещё не выполненные кандидаты на эксперименты в машинном обучении. Они выбирают один самый перспективный кандидат для запуска, экономя GPU-часы и ускоряя исследовательский цикл.

Чем RPM отличается от обычного предсказания метрик?

RPM не пытается предсказать абсолютную оценку эксперимента, так как LLM ненадёжны в этом. Вместо этого они сравнивают кандидатов попарно и определяют, какой из них лучше в контексте текущего состояния исследования.

Насколько сильно RPM ускоряет исследовательский процесс?

На бенчмарке AIRS-Bench оба варианта RPM достигают результата, который базовая линия получает за 24 часа, примерно за 15 часов. Это ускорение в 1,5–1,6 раза.

Какие модели используются в RPM?

RPM используют замороженные предобученные LLM без тонкой настройки. В экспериментах в качестве основы применялась модель Qwen3.6-27B с открытыми весами.

Можно ли использовать RPM без доступа к большому количеству GPU?

Да, Inference-only RPM требует только инференса LLM для сравнения кандидатов. Agentic RPM требует песочницы с GPU для пилотных экспериментов, но даже он работает эффективнее, чем выполнение всех кандидатов.

Чем AIRS-Bench полезен для исследователей?

AIRS-Bench — это открытый бенчмарк для оценки агентов ИИ-исследований. Он позволяет стандартизированно сравнивать различные подходы к автоматизации экспериментов и измерять их эффективность.

Как это связано с общим трендом на оптимизацию ИИ-инфраструктуры?

Это часть более широкого движения к эффективному использованию вычислительных ресурсов. Подобно тому, как локальные ИИ-модели снижают зависимость от облачных GPU, RPM снижают количество GPU-часов, необходимых для исследовательских задач.

Источник: marktechpost.com