Thinking Machines Lab выпустила Inkling — крупную открытую мультимодальную модель на архитектуре Mixture-of-Experts. Веса открыты под лицензией Apache 2.0.
Архитектура
Основные параметры:
- 975 млрд параметров всего, из них 41 млрд активных на токен;
- окно контекста — 1 млн токенов;
- предобучение на 45 трлн токенов (текст, изображения, аудио, видео);
- 66-слойный декодер-трансформер, 256 маршрутизируемых экспертов плюс 2 общих на каждый MoE-слой;
- на токен активируются шесть маршрутизируемых экспертов, оба общих — всегда.
Есть и меньший вариант Inkling-Small: 276 млрд параметров, 12 млрд активных.
Мультимодальность
Модель принимает текст, изображения и аудио, а на выходе даёт только текст в UTF-8. Аудио подаётся как dMel-спектрограммы, изображения превращаются в патчи 40×40 пикселей через четырёхслойный энкодер hMLP.
Управляемое «усилие мышления»
Интересная фишка — регулируемый объём рассуждения. Через аргумент reasoning_effort пользователь задаёт уровень (от «none» до «max»), меняя число токенов на размышление. По заявлению авторов, при равном результате на Terminal Bench 2.1 Inkling тратит втрое меньше токенов, чем Nemotron 3 Ultra.
Развёртывание и метрики
Доступны два чекпоинта: BF16 (нужно 2+ ТБ суммарной видеопамяти) и NVFP4 (600+ ГБ). Поддержка — transformers, SGLang, vLLM, llama.cpp и хостинг-API (TogetherAI, Fireworks, Modal, Databricks, Baseten).
Из бенчмарков (при effort=0,99): FORTRESS Adversarial — 78,0% (лучший результат среди открытых аналогов), SWEBench Verified — 77,6%, AIME 2026 — 97,1%. При этом SimpleQA Verified — 43,9%, заметно ниже, чем 57,0% у DeepSeek V4 Pro. То есть модель сильна в рассуждении и коде, но по фактологии уступает отдельным конкурентам.