AMD выпустила Instella-MoE-16B-A3B — полностью открытую языковую модель архитектуры Mixture-of-Experts, обученную с нуля на GPU Instinct MI300X и MI325X. Всего у модели 16 млрд параметров, но на каждый токен активируются лишь 2,8 млрд. AMD публикует веса всех этапов обучения, смеси данных, конфигурации и код инференса.
Архитектура и ключевые решения
Это decoder-only MoE: 27 слоёв, скрытая размерность 2048, 16 голов внимания и словарь на 128 896 токенов. В каждом MoE-слое два общих эксперта и шесть маршрутизируемых из 64. При претрейне и промежуточном обучении используется цель Multi-Token Prediction.
Два системных решения заслуживают внимания. Gated Multi-head Latent Attention — лёгкий обучаемый выходной гейт поверх Multi-head Latent Attention: отдельная линейная проекция вычисляет гейт, зависящий от входных данных, и применяет его мультипликативно перед выходной проекцией. FarSkip-Collective передаёт устаревшие и частичные активации в слои MoE и внимания, перекрывая expert-parallel коммуникацию с вычислениями. AMD сообщает о 12,7% ускорении претрейна и сокращении времени до первого токена до 39,2% при экспертно-параллельном обслуживании.
Обучение и пост-обработка
Претрейн прошёл на 7,1 трлн токенов открытых корпусов: Nemotron-CC-v2, MegaMath, FineMath, RefineCode и TxT360. Промежуточный этап использовал Dolma3 Dolmino 100B в трёх вариантах данных с усреднением весов. Отдельный этап расширил контекст с 4K до 64K токенов с помощью YaRN, увеличенного RoPE theta и маскирования документов.
Пост-обработка: SFT на Dolci-Think-SFT-7B и смесях Nemotron, затем DPO с обновлением router bias и отключённым вспомогательным load-balancing loss. RL выполнялся во фреймворке Miles — 1400 шагов instruction-following RLVR и дистилляция Multi-Teacher On-Policy.
Результаты и лицензии
Базовая версия набирает в среднем 76,7 балла — лучший результат среди полностью открытых моделей, выше Moonlight-16B-A3B (76,2), SmolLM3-3B-Base (70,5), OLMo-3-7B (70,1) и OLMoE-1B-7B (61,9); впереди только Qwen3.5-4B-Base (79,5). Сильные стороны — WinoGrande (86,5) и HumanEval+ (65,7). На длинном контексте: HELMET 41,5, RULER 79,4. Пост-обработка поднимает результат с 71,58 (SFT) до 72,67 (DPO) и 73,22 (Think), IFEval — с 77,08 до 83,70.
Веса выложены под ResearchRAIL — только для академических и исследовательских целей, это не готовая коммерческая модель. Обучающий код — под MIT-лицензией, и именно его можно считать главным переиспользуемым активом. Для инференса 16B параметров в BF16 нужно примерно 32 ГБ памяти весов — хватает одного акселератора с большим объёмом памяти; AMD прилагает код на SGLang. Модель собрана полностью на стеке AMD: ROCm, Primus и Miles.
Источник: marktechpost.com