Inkling: открытая мультимодальная модель на 975 млрд параметров с управляемым «усилием мышления»

Thinking Machines Lab выпустила Inkling — крупную открытую мультимодальную модель на архитектуре Mixture-of-Experts. Веса открыты под лицензией Apache 2.0.

Архитектура

Основные параметры:

  • 975 млрд параметров всего, из них 41 млрд активных на токен;
  • окно контекста — 1 млн токенов;
  • предобучение на 45 трлн токенов (текст, изображения, аудио, видео);
  • 66-слойный декодер-трансформер, 256 маршрутизируемых экспертов плюс 2 общих на каждый MoE-слой;
  • на токен активируются шесть маршрутизируемых экспертов, оба общих — всегда.

Есть и меньший вариант Inkling-Small: 276 млрд параметров, 12 млрд активных.

Мультимодальность

Модель принимает текст, изображения и аудио, а на выходе даёт только текст в UTF-8. Аудио подаётся как dMel-спектрограммы, изображения превращаются в патчи 40×40 пикселей через четырёхслойный энкодер hMLP.

Управляемое «усилие мышления»

Интересная фишка — регулируемый объём рассуждения. Через аргумент reasoning_effort пользователь задаёт уровень (от «none» до «max»), меняя число токенов на размышление. По заявлению авторов, при равном результате на Terminal Bench 2.1 Inkling тратит втрое меньше токенов, чем Nemotron 3 Ultra.

Развёртывание и метрики

Доступны два чекпоинта: BF16 (нужно 2+ ТБ суммарной видеопамяти) и NVFP4 (600+ ГБ). Поддержка — transformers, SGLang, vLLM, llama.cpp и хостинг-API (TogetherAI, Fireworks, Modal, Databricks, Baseten).

Из бенчмарков (при effort=0,99): FORTRESS Adversarial — 78,0% (лучший результат среди открытых аналогов), SWEBench Verified — 77,6%, AIME 2026 — 97,1%. При этом SimpleQA Verified — 43,9%, заметно ниже, чем 57,0% у DeepSeek V4 Pro. То есть модель сильна в рассуждении и коде, но по фактологии уступает отдельным конкурентам.