Reflection AI представила Beam — свою первую модель с открытыми весами. Это разреженная смесь экспертов (MoE) на 501B общих параметров и 23B активных на каждый токен, рассчитанная на задачи кодинга, рассуждений и агентные сценарии. По словам команды, Beam напрямую конкурирует с более крупными открытыми моделями вроде GLM 5.2, расходуя при этом в 3–4 раза меньше вычислений на инференс в бенчмарках рассуждений.
Самостоятельно развернуть модель пока нельзя: Beam проходит финальный этап red-teaming, а ранний доступ открыт через лист ожидания на платформе Reflection.
Что такое Beam
Beam — универсальная агентная модель, обученная Reflection AI с нуля под корпоративные задачи кодинга и агентные нагрузки. Компания позиционирует её как продвижение «западного» рубежа открытых весов. При этом исследователи прямо говорят о разрыве: Kimi K3 остаётся впереди по сырым возможностям, так что главный аргумент Beam — эффективность на этапе инференса.
Пользователям доступен параметр reasoning effort. Низкие значения дают короткие ответы, высокие — позволяют дольше рассуждать над сложными задачами. Команды могут подбирать уровень усилий под сложность задачи и бюджет вычислений. Это тот же подход к управлению «усилием» модели, что и в других открытых агентных решениях — например, в моделях Holo4 от H Company для кликов, кода и вызова инструментов.
Как обучали модель
Предобучение шло на 23,8 трлн токенов из веба, публичных источников и проприетарных лицензированных датасетов. По заявлению Reflection, отбор данных отбросил около 95% сырых интернет-токенов, но сохранил примерно 1,8 трлн высококачественных токенов, которые обычные фильтры отбросили бы.
Архитектура чередует локальное и глобальное внимание с мелкозернистыми маршрутизируемыми экспертами. Балансировка нагрузки построена на auxiliary-loss-free balancing из DeepSeek-V3 с добавлением косинусного затухания обновлений смещения экспертов. К концу предобучения самый нагруженный эксперт получал всего 1,04x средней нагрузки. Во всех 52 слоях нормы остаточных связей оставались ограниченными за счёт масштабирования по глубине, SandwichNorm, гейтирования внимания и накопления остатков в FP32.
Предобучение завершилось менее чем за 4 недели на 6 144 GPU NVIDIA GB300 NVL72. Goodput к концу достиг 92,3%, потребовалось 9 полуавтоматических откатов. На этапе midtraining эффективный контекст расширили до 1M токенов.
Reinforcement learning как главная ось масштабирования
RL стал для Beam центральной осью масштабирования. Прогон использовал 10,5 тыс. GPU NVIDIA GB300 в течение 4 недель и породил более 100 млн роллаутов. Максимальный контекст роллаута составлял 256K токенов. Обучение и оценка израсходовали около 1,3 млрд песочниц почти в 1 млн сред для кодинга, агентных задач и STEM.
Reflection обучала модель полностью асинхронными policy gradients. Каждый токен помечается версией политики, которая его произвела. Новые алгоритмы удерживали стабильность обучения даже при отставании на сутки — 107 версий весов позади текущей политики. Команда сообщает об отсутствии плато по мере роста вычислений на RL.
Инфраструктурные цифры тоже примечательны. Система в среднем держала 110 тыс. одновременных роллаутов. Новые веса доходили до инференс-флота в медиане примерно за 12 секунд. 71 инцидент на инференсе обработали, не останавливая обучение.
Управляемый штраф за длину научил Beam решать задачи меньшим числом токенов. Навыки браузинга также улучшились, хотя задач на браузинг в наборе RL не было, — это указывает на перенос между агентными доменами.
Безопасность и выравнивание
Reflection обучила отдельного учителя безопасности и выравнивания из предобученного чекпоинта. Его объединили с RL-учителем через multi-teacher on-policy distillation. Обучение безопасности использовало deliberative alignment. Результаты оценки безопасности появятся в техническом отчёте. Похожий подход к изоляции агентных нагрузок развивает и платформа Open Agent Safety Platform от NVIDIA с песочницами OpenShell и карантином Sentry.
Бенчмарки
По данным Reflection, на SWE-bench Verified Beam набирает 80,9 против 70,7 у Nemotron 3 Ultra. На Terminal Bench v2.1 у Beam 80,1 — близко к GLM 5.2 с 81,0. Впереди там DeepSeek V4.1 Flash (90,6) и Kimi K3 (88,3). Эти числа взяты из таблицы Reflection, которая берёт оценки конкурентов из Artificial Analysis и DataCurve.
| Характеристика | Reflection Beam | GLM-5.2 | Nemotron 3 Ultra | DeepSeek V4.1 Flash | Kimi K3 |
|---|---|---|---|---|---|
| Разработчик | Reflection AI (США) | Z.ai (Китай) | NVIDIA (США) | DeepSeek (Китай) | Moonshot AI (Китай) |
| Всего параметров | 501B | ~753B | 550B | 552B backbone + 196B Engram | 2,8T |
| Активных параметров | 23B | ~40B | 55B | 8B prefill / 16B decode | 104B |
| Контекст | 1M (эффективный) | 1M | До 1M | 1M | 1M |
| Вход | Текст | Текст | Текст | Текст + изображение | Текст + изображение |
| Лицензия | Apache 2.0 (план) | MIT | OpenMDW-1.1 | MIT | Kimi K3 License |
| Веса | Позже в октябре 2026 | Доступны | Доступны | Доступны | Доступны |
| Terminal Bench v2.1* | 80,1 | 81,0 | 56,4 | 90,6 | 88,3 |
| Источник | Reflection | Hugging Face | NVIDIA | Hugging Face | Hugging Face |
*Оценки опубликованы в анонсе Beam от Reflection. Спецификации проверены 5 октября 2026 года.
Beam — самая маленькая модель в этом списке по общему числу параметров. Её 23B активных параметров ниже, чем у GLM-5.2, Nemotron 3 Ultra и Kimi K3. Apache 2.0 и MIT — стандартные разрешительные лицензии. Кастомная лицензия Kimi K3 добавляет требования об указании авторства для очень крупных продуктов.
Что это значит на практике
Beam — это 501B MoE с 23B активных параметров, только текстовый вход и эффективный контекст 1M. Предобучение заняло 23,8 трлн токенов на 6 144 GPU NVIDIA GB300 менее чем за 4 недели. RL прогнали на 10,5 тыс. GPU GB300 за 4 недели и более 100 млн роллаутов. Reflection заявляет 80,9 на SWE-bench Verified и 80,1 на Terminal Bench v2.1. Веса под Apache 2.0 обещаны позже в этом месяце.
Для команд, которые выбирают открытую модель под агентные нагрузки, ключевой вопрос — не пиковая позиция в таблице, а стоимость инференса и требования к железу. Заявленная эффективность в 3–4 раза на бенчмарках рассуждений при 23B активных параметрах означает, что модель может оказаться дешевле в эксплуатации, чем конкуренты с большим числом активных параметров. Но пока веса не выложены, проверить это на своём железе нельзя: доступ идёт через лист ожидания, а финальный red-teaming ещё не завершён. Если планируете закладывать Beam в архитектуру, разумно сначала дождаться публикации весов и технического отчёта с результатами оценки безопасности. Для тех, кто уже запускает агентные нагрузки в кластере, полезно заранее посмотреть на стек TauGrid от Microsoft для ИИ-нагрузок на Kubernetes.
Частые вопросы
Можно ли уже скачать Beam?
Нет. Модель проходит финальный red-teaming, а ранний доступ открыт через лист ожидания на платформе Reflection. Веса под лицензией Apache 2.0 обещаны позже в октябре 2026 года.
Сколько параметров у Beam и сколько из них активны?
501B общих параметров и 23B активных на каждый токен. Это разреженная MoE-архитектура: на каждом шаге задействуется лишь часть экспертов.
Какой у Beam контекст?
Эффективный контекст — 1M токенов. До такого размера его расширили на этапе midtraining.
Какие лицензии у конкурентов?
У GLM-5.2 и DeepSeek V4.1 Flash — MIT, у Nemotron 3 Ultra — OpenMDW-1.1, у Kimi K3 — собственная Kimi K3 License с требованиями об указании авторства для очень крупных продуктов. Beam планируется под Apache 2.0.
Чем Beam отличается от Kimi K3 по возможностям?
Сам Reflection признаёт, что Kimi K3 остаётся впереди по сырым возможностям. На Terminal Bench v2.1 Kimi K3 набирает 88,3 против 80,1 у Beam. Главный аргумент Beam — эффективность на инференсе.
Что такое параметр reasoning effort?
Это настройка, управляющая длиной рассуждений. Низкие значения дают короткие ответы, высокие позволяют дольше рассуждать над сложными задачами. Так команды подбирают баланс между качеством и бюджетом вычислений.
На каком железе обучали Beam?
Предобучение шло на 6 144 GPU NVIDIA GB300 NVL72 менее чем за 4 недели, а RL — на 10,5 тыс. GPU GB300 в течение 4 недель.
Насколько надёжны заявленные результаты бенчмарков?
Цифры взяты из таблицы Reflection, которая берёт оценки конкурентов из Artificial Analysis и DataCurve. Независимой проверки на момент публикации нет, а веса модели ещё не выложены — воспроизвести результаты на своём железе пока нельзя.
Подходит ли Beam для задач без кода?
Модель заявлена как универсальная агентная и обучена в том числе на STEM-средах, но вход у неё только текстовый — изображения не принимаются. Конкретные сценарии вне кодинга и агентных нагрузок в анонсе не раскрываются.
Есть ли смысл ждать Beam вместо текущей модели?
Если вам важна стоимость инференса при агентных нагрузках, заявленная эффективность в 3–4 раза делает Beam интересным кандидатом. Но до публикации весов и технического отчёта с результатами по безопасности планировать миграцию рано.
Источник: marktechpost.com