OpenAI выпустила GPT-6 Astra и позиционирует её не как чат-модель, а как систему для управления компьютером. Astra работает с браузерами, электронными таблицами, десктопными приложениями и терминалами, выполняя многошаговые задачи самостоятельно, а не описывая, как их сделать.
Модель доступна только организациям в программах Trusted Access и Daybreak. Веса не опубликованы, поэтому самостоятельное развёртывание невозможно — Astra работает исключительно как hosted-сервис.
Что нового для разработчиков
Ключевое изменение — подход к работе с контекстом. Codex раньше использовал компактификацию, обобщая ранние сообщения при заполнении контекста. Этот процесс терял детали, которые агенту нужны позже: почему исправление не сработало, какие тесты запускались, какое требование добавили в начале. Astra вместо этого сохраняет заметки между окнами контекста и возвращается к более ранним сообщениям и выводам инструментов. Функция пока экспериментальная и включается настройкой в config.toml, но в ближайшие недели станет поведением Codex по умолчанию.
Astra умеет задавать пользователю вопрос и одновременно продолжать работу, которая от ответа не зависит. Это убирает типичный сбой агентов, когда одно нерешённое решение останавливает всю задачу.
На странице модели указаны: окно контекста 1 050 000 токенов, максимум 128 000 токенов на выходе, срез знаний — 30 апреля 2026 года. На вход принимаются текст и изображения, на выходе — только текст. В параметре reasoning.effort добавлены два уровня выше high: xhigh и max. Поддерживаются инструменты: computer use, hosted shell, apply patch, skills, MCP и tool search. Тонкая настройка не поддерживается.
Результаты бенчмарков
OpenAI сообщает о 72,6% на OSWorld V2-Offline против 65,7% у GPT-5.6 Sol. Среднее время выполнения задачи сократилось примерно с 75 до 40 минут. Anthropic отчитывается о 77,9% у Claude Fable 5.1, но уточняет, что использовала другой релиз OSWorld, поэтому прямое сравнение некорректно.
Показатель 99,9% на ARC-AGI-3 получен с harness на базе Responses API, который сохраняет рассуждения между ходами и использует компактификацию для длинных контекстов. Ранее OpenAI показывала, что эти настройки существенно меняют результаты ARC-AGI-3 без изменения самой модели. То есть результат измеряет связку «модель плюс агентная система», а не модель саму по себе.
Другие заявленные цифры: 97,6% на FrontierMath Tier 4, 95,9% на BenchCAD Vision2Code против 84,3% у Fable 5.1, 64,6% на Terminal-Bench Science против 52,6% у Anthropic. Epoch AI отмечает, что OpenAI финансировала FrontierMath и имеет эксклюзивный доступ к части бенчмарка.
Слабое место — программирование. Astra набирает 74,1% на DeepSWE v1.1 против 72,7% у Sol. Meta сообщила о 75,4% для Muse Spark 1.3 при максимальном уровне рассуждений, а публичный лидерборд ставит Gemini 3.8 Flash и Claude Opus 5 около 74%. На бенчмарке из 113 задач разница составляет одну-две задачи.
Cyber-порог и ограничения доступа
Astra — первая модель OpenAI, достигшая уровня Critical в её Preparedness Framework. В тестах она разрабатывала эксплойты для укреплённых браузеров и операционных систем и нашла две ранее неизвестные уязвимости V8, о которых OpenAI сообщает мейнтейнерам.
Последствия практические. Стандартный доступ отказывает в выполнении задач продвинутой кибербезопасности, включая поиск эксплойтов. Для API-разработчиков проверка безопасности останавливает задачу сразу, а не приостанавливает для одобрения. Миа Глезе из OpenAI предупредила, что пользователи вне программ доверенного доступа могут сталкиваться с замедлениями, паузами или блокировками, иногда во время несвязанной работы. Похожая схема — разные уровни доступа к одной модели — уже применяется у конкурентов: у Gemini 3.8 Flash есть отдельная версия Flash Cyber для задач безопасности.
OpenAI сообщает о 100% на ExploitBench — это агрегированный показатель покрытия возможностей, а не доля успешных прохождений, — и 42,4% на ExploitGym против 30,3% у Sol. Обычное шестичасовое ограничение убрали для обеих моделей.
Цены
Astra стоит $10 за миллион входных токенов и $50 за миллион выходных, кэшированный вход — $1,00. Запросы более 272K входных токенов тарифицируются с коэффициентом 2x на вход и 1,5x на выход для всего запроса. Batch и Flex — со скидкой 50%, Fast — с наценкой 2x. Пользователи Pro, Business и Enterprise получают также Astra Pro.
Частые вопросы
Кому доступна GPT-6 Astra?
Только организациям в программах Trusted Access и Daybreak. Публичного доступа пока нет, но OpenAI обещает появление API и интеграции с AWS в ближайшие дни.
Можно ли запустить Astra на своём оборудовании?
Нет. Веса модели не опубликованы, сам хостинг невозможен. Astra — закрытая hosted-модель. Для работы внутри периметра приходится выбирать открытые альтернативы, например Pokee-Isaac 28B с контекстом 10M токенов.
Чем Astra отличается от обычной чат-модели?
Astra предназначена для выполнения действий в программном обеспечении: работа с браузерами, таблицами, десктопными приложениями и терминалами. Она завершает многошаговые задачи, а не объясняет, как их выполнить.
Что означает уровень Critical в Preparedness Framework?
Это первый случай, когда модель OpenAI достигла порога Critical по кибербезопасности. На практике это означает жёсткие ограничения: стандартный доступ блокирует задачи поиска эксплойтов, а проверка безопасности в API останавливает такие запросы сразу.
Стоит ли обновляться с GPT-5.6 на GPT-6 Astra?
Если ваши задачи — управление компьютером и длинные агентные сценарии, прирост существенный: 72,6% против 65,7% на OSWorld, время задачи падает с 75 до 40 минут. Для программирования прирост маргинальный — разница с конкурентами в одну-две задачи на сотню.
Что такое «заметки вместо компактификации» в Codex?
Astra сохраняет заметки между окнами контекста и ищет информацию в ранних сообщениях и выводах инструментов. Компактификация обобщала старые сообщения и теряла детали, которые агенту нужны позже.
Почему Astra стоит так дорого?
$10 за миллион входных и $50 за миллион выходных токенов — заметно выше среднего по рынку. Дополнительно запросы длиннее 272K токенов тарифицируются с повышающим коэффициентом на весь объём запроса. Видимо, так OpenAI компенсирует вычислительные затраты на модель с огромным контекстом и агентными возможностями.
Как проверка безопасности влияет на обычную работу?
Пользователи вне программ доверенного доступа могут сталкиваться с замедлениями, паузами или блокировками, иногда во время несвязанной работы. Проверка безопасности не всегда точно определяет намерение задачи.
Есть ли у Astra поддержка тонкой настройки?
Нет. Fine-tuning не поддерживается. Доступны только инструменты: computer use, hosted shell, apply patch, skills, MCP и tool search.
Насколько показатель ARC-AGI-3 99,9% отражает реальные способности модели?
Частично. Результат получен со специальным harness, который сохраняет рассуждения между ходами и использует компактификацию. OpenAI ранее показывала, что эти настройки существенно меняют результат без изменения модели. Цифра измеряет связку «модель плюс агентная система».
Источник: marktechpost.com