Grok 4.6: 500K контекст, новый уровень рассуждений и цена $2/$6

SpaceXAI представила Grok 4.6 — это не новая базовая модель, а результат дополнительного обучения поверх Grok 4.5. Компания оставила фундамент прежним и сосредоточилась на более длительном тренировочном прогоне, перегенерированных траекториях supervised fine-tuning и обучении с подкреплением в агентных средах. Модель уже доступна в Cursor и Grok Build, а также через API как grok-4.6.

Что изменилось в Grok 4.6

Основное отличие — увеличенный контекст до 500 000 токенов и новый уровень рассуждений xhigh, который добавляется к существующей лестнице low, medium, high (по умолчанию). Модель принимает текстовый и графический ввод, но выводит только текст. Ограничения на длину выходного текста не заявлено, а срез знаний — 1 февраля 2026 года. Количество параметров SpaceXAI не раскрывает.

Компания описывает изменения как более длительный дополнительный тренировочный прогон с использованием курируемых данных для рассуждений и сложных технических концепций, качественных инженерных данных и улучшенного оптимизатора. Для генерации траекторий supervised fine-tuning использовалась Grok 4.5, а проблемные трассы отфильтровывались автоматическими проверками. Обучение с подкреплением проводилось в агентных средах: общее программирование, веб-разработка, CAD и оптимизация ядра.

По наблюдениям вендора, на длинных траекториях модель чаще проверяет собственную работу перед переходом к следующему шагу. Это внутренняя оценка SpaceXAI, а не независимо измеренный результат.

Бенчмарки: сначала потери

На таблице запуска xAI Grok 4.6 (High) набирает 61 балл в Artificial Analysis Intelligence Index — на пять больше, чем у Grok 4.5, и столько же, сколько у GPT-5.6 Sol Max. Она лидирует в GDPval-AA v2 (1753 Elo против 1526 у Grok 4.5), AA-Briefcase (1577 против 1313) и Harvey LAB.

Однако по ключевым для инженерных команд показателям кодинга модель отстает:

  • DeepSWE v1.1 — 65,9% (у GPT-5.6 Sol Max — 73%);
  • Terminal-Bench v3.0 — 26% (почти вдвое больше, чем 15,7% у Grok 4.5, но последнее место среди четырех моделей);
  • CursorBench v3.2 — 69,9%;
  • FrontierCode v1.1 Extended — 61,3%;
  • APEX-Agents — 57,5%.

При оценке стоит учитывать два момента. Во-первых, выделенные жирным победы в GDPval-AA v2 и AA-Briefcase находятся в пределах опубликованных доверительных интервалов Artificial Analysis — это статистическая ничья, а не лидерство. Во-вторых, в сравнительный набор не включен Claude Opus 5 от Anthropic, который сейчас возглавляет этот индекс. Объявленные потери — более надежный сигнал.

Цены и доступ

Согласно релизным заметкам, Grok 4.6 стоит $2 / $0,50 / $6 за миллион токенов (ввод / кэшированный ввод / вывод) при промпте до 200 000 токенов. Выше этого порога — $4 / $1 / $12. На странице запуска также упоминается более быстрый вариант за удвоенную цену, но отдельный идентификатор модели не опубликован. В первую неделю Grok Build и Cursor предлагают удвоенное включенное использование.

Модель доступна через API xAI как grok-4.6, является моделью по умолчанию в Grok Build, работает в Cursor на всех тарифных планах и маршрутизируется через OpenRouter, Vercel и Cloudflare. Открытых весов и возможности самостоятельного хостинга нет — изолированные развертывания исключены. Для сравнения: у Muse Glimmer от Meta веса открыты и модель помещается в 24 ГБ VRAM, а Pokee-Isaac 28B с контекстом 10M токенов предназначена для работы внутри периметра.

Кому подходит

Seed-команды и независимые разработчики могут начать сразу: Cursor и Grok Build не требуют дополнительной настройки. Средние инженерные организации — наиболее подходящий сегмент: документированы интеграция только через API, аутентификация mTLS, пакетная и приоритетная обработка. Регулируемым предприятиям стоит сначала провести пилот — история бренда вендора остается живым вопросом в нескольких закупочных комитетах.

Сферы применения: рефакторинг репозиториев, миграционные агенты, исследовательские конвейеры по корпусам до 500K токенов, первичный каркас приложения из брифа, оптимизация GPU-ядер и работа с документами.

Кэширование промптов

Командам следует задавать prompt_cache_key (или заголовок x-grok-conv-id в Chat Completions). Без него запросы разбрасываются по серверам, попадание в кэш становится ненадежным, и применяется полная цена ввода. В этом Grok 4.6 похож на другие современные модели с большим контекстом: например, TwIL-LM от WebAI решает обратную задачу — работает на локальном железе без API и кэширования.

Частые вопросы

Это новая базовая модель?

Нет, Grok 4.6 — это апгрейд постобучения поверх Grok 4.5. Базовая модель осталась прежней, изменились только дополнительные тренировочные прогоны и настройка.

Какой максимальный контекст у Grok 4.6?

500 000 токенов. Это вдвое больше, чем у многих конкурирующих моделей, и позволяет обрабатывать большие корпуса документов или целые репозитории кода за один запрос.

Что такое уровень рассуждений xhigh?

Это новый, самый высокий уровень параметра reasoning_effort. Он добавлен к существующим low, medium и high (по умолчанию) и предназначен для задач, требующих особенно глубокого анализа.

Сколько стоит Grok 4.6?

$2 за миллион токенов ввода, $0,50 за кэшированный ввод и $6 за вывод. Для промптов длиннее 200 000 токенов цена удваивается: $4 / $1 / $12.

Можно ли развернуть Grok 4.6 у себя?

Нет. Открытых весов не существует, самостоятельный хостинг или изолированное развертывание невозможны. Доступ только через API и партнерские платформы.

Где доступна модель?

Grok 4.6 уже работает в Cursor на всех планах, является моделью по умолчанию в Grok Build и доступна через API xAI как grok-4.6. Также маршрутизируется через OpenRouter, Vercel и Cloudflare.

Стоит ли переходить с Grok 4.5?

Если вам нужны длинные контексты и агентные сценарии — да. Но по ключевым бенчмаркам кодинга модель по-прежнему уступает GPT-5.6 Sol Max, поэтому для задач глубокой разработки стоит сравнить результаты на своих данных.

Источник: marktechpost.com