Gemini 4 Argon: 1M токенов на ответ и лидерство в DeepSWE v1.1

Google DeepMind анонсировала Gemini 4 Argon — первую модель поколения Gemini 4 и новый флагманский релиз компании. Модель нацелена на длительные задачи в разработке ПО, корпоративную работу со знаниями в юриспруденции и финансах, а также на защиту от киберугроз. Главное техническое изменение — длина ответа: Argon генерирует до 1M токенов в одном ответе против 64K у прежних моделей Gemini.

Фазовый запуск и стартовая цена

Google идёт поэтапным путём. Компания участвует в добровольной процедуре доступа к моделям до релиза, принятой в США: сначала отзывы ранних тестировщиков и доработка ограничителей, затем более широкий выпуск. Даты публичного релиза нет.

Цены уже объявлены. На стартовом этапе Argon стоит $2 за 1M входных токенов и $10 за 1M выходных. Кэшированный ввод получает скидку 95% — это $0.10 за 1M токенов. После вводного периода цена вырастет до $4 за ввод и $20 за вывод. Logan Kilpatrick подтвердил стартовые $2 и $10.

Почему лимит в 1M выходных токенов важен

У нынешних флагманских API потолок одного ответа заметно ниже: Claude Opus 5.5, Claude Fable 5.1 и GPT-6 Astra допускают по 128K выходных токенов. Google заявляет, что Argon способен глубоко рассуждать и генерировать сотни тысяч токенов в одной траектории. Для разработчиков это означает крупные рефакторинги или длинные отчёты без разбиения работы на несколько обращений. Цена вопроса реальна: полный 1M выходных токенов стоит $10 по вводному тарифу и $20 после него. Входное контекстное окно Argon Google не раскрыла.

Бенчмарки: где Argon впереди и где отстаёт

Google сравнивала Argon с GPT-6 Astra, Claude Opus 5.5 и Claude Fable 5.1. Модель лидирует в 12 из 18 бенчмарков и делит первое место ещё в одном.

Где Argon впереди:

  • DeepSWE v1.1 (длительная разработка ПО) — 77.9%, новый рекорд. У Opus 5.5 74.2%, у GPT-6 Astra 74.1%.
  • Vals Index (экономический эффект в финансах, разработке, юриспруденции и налогах) — 68.9%, первое место.
  • AutomationBench (сквозное выполнение бизнес-задач, Zapier) — 51.3%, первое место. У Opus 5.5 42.5%.
  • Harvey Legal Agent Benchmark — 19.6% против 5.4% у GPT-6 Astra.
  • LVBench (понимание длинного видео) — 91.7%, новый рекорд.

Где Argon отстаёт:

  • FrontierSWE v2 — 55.0% против 65.5% у GPT-6 Astra.
  • Terminal-Bench 4.0 — 57.4% против 66.4% у Claude Opus 5.5.
  • OSWorld-2.0 (работа с компьютером) — 69.2% против 72.6% у GPT-6 Astra.

Artificial Analysis сообщила, что Argon сравнялась с GPT-6 Astra по своему Intelligence Index при 60% стоимости за задачу — по скидочным ценам.

Киберзащита: найти, проверить, закрыть

Argon обучена автономно находить, валидировать и закрывать критические уязвимости в ПО. Доверенные защитники и внутренние команды Google получают модель без киберограничителей. На CWE-bench v1, который проверяет устранение уязвимостей, Argon делит первое место с 68%. Соперники в этой таблице работают внутри собственных агентных обвязок.

Компания Wiz уже использует Argon в рамках инициативы Scan for Good. Модель нашла критическую уязвимость в медицинском ПО, применяемом больницами по всему миру; по словам Google, прежние флагманские модели её пропустили.

Перед широким релизом Google усиливает защиту по четырём направлениям:

  • меры против злоупотреблений в кибер- и CBRN-рисках, включая мониторинг активаций, в рамках Frontier Safety Framework;
  • устойчивость к косвенным промпт-инъекциям — здесь Argon лидирует в бенчмарке IPI от Gray Swan;
  • мониторинг рассогласования цепочки рассуждений и действий с возможностью остановить выполнение;
  • изолированные «запечатанные» песочницы для рискованного обучения и оценок.

Argon внутри Google

Тысячи сотрудников Google уже пользуются Argon. Компания привела четыре внутренних результата:

  • агенты применили оптимизации памяти в дата-центрах, освободив более 300 TiB; прогноз — от 500 TiB до 1 PiB;
  • агенты заменили 32K строк SIMD-кода в порту libgav1 на Rust — декодер работает в 2.7 раза быстрее при идентичном выводе;
  • идёт миграция кодовых баз C/C++ на Rust, до 800K+ строк в ядре Fuchsia Zircon;
  • Argon обошла опубликованный базовый результат квантового алгоритма на 40% за считаные минуты.

Сравнение с ближайшими конкурентами

Параметр Gemini 4 Argon Claude Opus 5.5 Claude Fable 5.1 GPT-6 Astra
Разработчик Google DeepMind Anthropic Anthropic OpenAI
Доступность только Fairwind Program Claude API и облака Claude API и облака OpenAI API
Максимум вывода на ответ 1M токенов 128K 128K 128K
Контекстное окно не раскрыто 1M 1M 1.05M
Цена ввод/вывод за 1M $2/$10 старт, затем $4/$20 $4/$20 $10/$50 $10/$50
Кэшированный ввод за 1M $0.10 (старт) $0.20 $0.25 $1.00
Открытые веса нет нет нет нет
DeepSWE v1.1 77.9% 74.2% 67.4% 74.1%
Vals Index 68.9% 67.0% 65.8% 63.1%
FrontierSWE v2 55.0% 62.3% 56.3% 65.5%
Terminal-Bench 4.0 57.4% 66.4% 57.9% 58.2%
CWE-bench v1 68% (делит первое) 67% 58% 68% (делит первое)

Оценки взяты из опубликованного Google сравнения; цены GPT-6 Astra — короткоконтекстный тариф.

Главное

Gemini 4 Argon поднимает потолок вывода с 64K до 1M токенов. Она лидирует на DeepSWE v1.1 (77.9%) и в Vals Index (68.9%), но уступает на FrontierSWE v2, Terminal-Bench 4.0 и OSWorld-2.0. Стартовая цена $2/$10 вдвое ниже, чем у Claude Opus 5.5. Доступ ограничен киберзащитниками программы Fairwind, публичной даты релиза нет.

Уязвимости, которые Argon ищет и закрывает, — та же категория рисков, что и дыры, которые эксплуатируют в атаках на компании. А появление модели с 1M токенов вывода продолжает линию предыдущих релизов Gemini, где Google меняет баланс цены и возможностей.

Частые вопросы

Что такое Gemini 4 Argon?

Это первая модель поколения Gemini 4 от Google DeepMind, ориентированная на длительную разработку ПО, корпоративные знания в юриспруденции и финансах и киберзащиту. Ключевое отличие — до 1M токенов в одном ответе.

Чем 1M выходных токенов отличается от контекстного окна?

Выходные токены — это то, что модель генерирует в одном ответе; контекстное окно — сколько она принимает на вход. У Argon заявлен 1M на вывод, а размер входного окна Google не раскрыла. У конкурентов на вывод даётся 128K.

Сколько стоит работа с Argon?

На старте $2 за 1M входных и $10 за 1M выходных токенов, кэшированный ввод — $0.10 за 1M. После вводного периода — $4 за ввод и $20 за вывод.

Можно ли уже получить доступ к модели?

Публичного релиза нет. Доступ ограничен доверенными защитниками и внутренними командами Google; компания участвует в добровольной процедуре доступа к моделям до релиза в США.

В каких бенчмарках Argon проигрывает?

Она уступает на FrontierSWE v2 (55.0% против 65.5% у GPT-6 Astra), Terminal-Bench 4.0 (57.4% против 66.4% у Claude Opus 5.5) и OSWorld-2.0 (69.2% против 72.6% у GPT-6 Astra). Лидерство — в 12 из 18 тестов.

Что Argon умеет в киберзащите?

Модель обучена автономно находить, проверять и закрывать критические уязвимости. На CWE-bench v1 она делит первое место с 68%. Через инициативу Wiz Scan for Good она нашла критическую уязвимость в медицинском ПО, которую пропустили прежние флагманские модели.

Какие внутренние задачи Argon уже решает в Google?

Агенты на её основе освободили более 300 TiB памяти в дата-центрах, заменили 32K строк SIMD-кода в порту libgav1 на Rust с ускорением декодера в 2.7 раза, мигрируют кодовые базы C/C++ на Rust (до 800K+ строк в ядре Fuchsia Zircon) и обошли базовый результат квантового алгоритма на 40%.

Есть ли у Argon открытые веса?

Нет. Как и у Claude Opus 5.5, Claude Fable 5.1 и GPT-6 Astra, веса модели не открыты.

Источник: marktechpost.com