Google DeepMind анонсировала Gemini 4 Argon — первую модель поколения Gemini 4 и новый флагманский релиз компании. Модель нацелена на длительные задачи в разработке ПО, корпоративную работу со знаниями в юриспруденции и финансах, а также на защиту от киберугроз. Главное техническое изменение — длина ответа: Argon генерирует до 1M токенов в одном ответе против 64K у прежних моделей Gemini.
Фазовый запуск и стартовая цена
Google идёт поэтапным путём. Компания участвует в добровольной процедуре доступа к моделям до релиза, принятой в США: сначала отзывы ранних тестировщиков и доработка ограничителей, затем более широкий выпуск. Даты публичного релиза нет.
Цены уже объявлены. На стартовом этапе Argon стоит $2 за 1M входных токенов и $10 за 1M выходных. Кэшированный ввод получает скидку 95% — это $0.10 за 1M токенов. После вводного периода цена вырастет до $4 за ввод и $20 за вывод. Logan Kilpatrick подтвердил стартовые $2 и $10.
Почему лимит в 1M выходных токенов важен
У нынешних флагманских API потолок одного ответа заметно ниже: Claude Opus 5.5, Claude Fable 5.1 и GPT-6 Astra допускают по 128K выходных токенов. Google заявляет, что Argon способен глубоко рассуждать и генерировать сотни тысяч токенов в одной траектории. Для разработчиков это означает крупные рефакторинги или длинные отчёты без разбиения работы на несколько обращений. Цена вопроса реальна: полный 1M выходных токенов стоит $10 по вводному тарифу и $20 после него. Входное контекстное окно Argon Google не раскрыла.
Бенчмарки: где Argon впереди и где отстаёт
Google сравнивала Argon с GPT-6 Astra, Claude Opus 5.5 и Claude Fable 5.1. Модель лидирует в 12 из 18 бенчмарков и делит первое место ещё в одном.
Где Argon впереди:
- DeepSWE v1.1 (длительная разработка ПО) — 77.9%, новый рекорд. У Opus 5.5 74.2%, у GPT-6 Astra 74.1%.
- Vals Index (экономический эффект в финансах, разработке, юриспруденции и налогах) — 68.9%, первое место.
- AutomationBench (сквозное выполнение бизнес-задач, Zapier) — 51.3%, первое место. У Opus 5.5 42.5%.
- Harvey Legal Agent Benchmark — 19.6% против 5.4% у GPT-6 Astra.
- LVBench (понимание длинного видео) — 91.7%, новый рекорд.
Где Argon отстаёт:
- FrontierSWE v2 — 55.0% против 65.5% у GPT-6 Astra.
- Terminal-Bench 4.0 — 57.4% против 66.4% у Claude Opus 5.5.
- OSWorld-2.0 (работа с компьютером) — 69.2% против 72.6% у GPT-6 Astra.
Artificial Analysis сообщила, что Argon сравнялась с GPT-6 Astra по своему Intelligence Index при 60% стоимости за задачу — по скидочным ценам.
Киберзащита: найти, проверить, закрыть
Argon обучена автономно находить, валидировать и закрывать критические уязвимости в ПО. Доверенные защитники и внутренние команды Google получают модель без киберограничителей. На CWE-bench v1, который проверяет устранение уязвимостей, Argon делит первое место с 68%. Соперники в этой таблице работают внутри собственных агентных обвязок.
Компания Wiz уже использует Argon в рамках инициативы Scan for Good. Модель нашла критическую уязвимость в медицинском ПО, применяемом больницами по всему миру; по словам Google, прежние флагманские модели её пропустили.
Перед широким релизом Google усиливает защиту по четырём направлениям:
- меры против злоупотреблений в кибер- и CBRN-рисках, включая мониторинг активаций, в рамках Frontier Safety Framework;
- устойчивость к косвенным промпт-инъекциям — здесь Argon лидирует в бенчмарке IPI от Gray Swan;
- мониторинг рассогласования цепочки рассуждений и действий с возможностью остановить выполнение;
- изолированные «запечатанные» песочницы для рискованного обучения и оценок.
Argon внутри Google
Тысячи сотрудников Google уже пользуются Argon. Компания привела четыре внутренних результата:
- агенты применили оптимизации памяти в дата-центрах, освободив более 300 TiB; прогноз — от 500 TiB до 1 PiB;
- агенты заменили 32K строк SIMD-кода в порту libgav1 на Rust — декодер работает в 2.7 раза быстрее при идентичном выводе;
- идёт миграция кодовых баз C/C++ на Rust, до 800K+ строк в ядре Fuchsia Zircon;
- Argon обошла опубликованный базовый результат квантового алгоритма на 40% за считаные минуты.
Сравнение с ближайшими конкурентами
| Параметр | Gemini 4 Argon | Claude Opus 5.5 | Claude Fable 5.1 | GPT-6 Astra |
|---|---|---|---|---|
| Разработчик | Google DeepMind | Anthropic | Anthropic | OpenAI |
| Доступность | только Fairwind Program | Claude API и облака | Claude API и облака | OpenAI API |
| Максимум вывода на ответ | 1M токенов | 128K | 128K | 128K |
| Контекстное окно | не раскрыто | 1M | 1M | 1.05M |
| Цена ввод/вывод за 1M | $2/$10 старт, затем $4/$20 | $4/$20 | $10/$50 | $10/$50 |
| Кэшированный ввод за 1M | $0.10 (старт) | $0.20 | $0.25 | $1.00 |
| Открытые веса | нет | нет | нет | нет |
| DeepSWE v1.1 | 77.9% | 74.2% | 67.4% | 74.1% |
| Vals Index | 68.9% | 67.0% | 65.8% | 63.1% |
| FrontierSWE v2 | 55.0% | 62.3% | 56.3% | 65.5% |
| Terminal-Bench 4.0 | 57.4% | 66.4% | 57.9% | 58.2% |
| CWE-bench v1 | 68% (делит первое) | 67% | 58% | 68% (делит первое) |
Оценки взяты из опубликованного Google сравнения; цены GPT-6 Astra — короткоконтекстный тариф.
Главное
Gemini 4 Argon поднимает потолок вывода с 64K до 1M токенов. Она лидирует на DeepSWE v1.1 (77.9%) и в Vals Index (68.9%), но уступает на FrontierSWE v2, Terminal-Bench 4.0 и OSWorld-2.0. Стартовая цена $2/$10 вдвое ниже, чем у Claude Opus 5.5. Доступ ограничен киберзащитниками программы Fairwind, публичной даты релиза нет.
Уязвимости, которые Argon ищет и закрывает, — та же категория рисков, что и дыры, которые эксплуатируют в атаках на компании. А появление модели с 1M токенов вывода продолжает линию предыдущих релизов Gemini, где Google меняет баланс цены и возможностей.
Частые вопросы
Что такое Gemini 4 Argon?
Это первая модель поколения Gemini 4 от Google DeepMind, ориентированная на длительную разработку ПО, корпоративные знания в юриспруденции и финансах и киберзащиту. Ключевое отличие — до 1M токенов в одном ответе.
Чем 1M выходных токенов отличается от контекстного окна?
Выходные токены — это то, что модель генерирует в одном ответе; контекстное окно — сколько она принимает на вход. У Argon заявлен 1M на вывод, а размер входного окна Google не раскрыла. У конкурентов на вывод даётся 128K.
Сколько стоит работа с Argon?
На старте $2 за 1M входных и $10 за 1M выходных токенов, кэшированный ввод — $0.10 за 1M. После вводного периода — $4 за ввод и $20 за вывод.
Можно ли уже получить доступ к модели?
Публичного релиза нет. Доступ ограничен доверенными защитниками и внутренними командами Google; компания участвует в добровольной процедуре доступа к моделям до релиза в США.
В каких бенчмарках Argon проигрывает?
Она уступает на FrontierSWE v2 (55.0% против 65.5% у GPT-6 Astra), Terminal-Bench 4.0 (57.4% против 66.4% у Claude Opus 5.5) и OSWorld-2.0 (69.2% против 72.6% у GPT-6 Astra). Лидерство — в 12 из 18 тестов.
Что Argon умеет в киберзащите?
Модель обучена автономно находить, проверять и закрывать критические уязвимости. На CWE-bench v1 она делит первое место с 68%. Через инициативу Wiz Scan for Good она нашла критическую уязвимость в медицинском ПО, которую пропустили прежние флагманские модели.
Какие внутренние задачи Argon уже решает в Google?
Агенты на её основе освободили более 300 TiB памяти в дата-центрах, заменили 32K строк SIMD-кода в порту libgav1 на Rust с ускорением декодера в 2.7 раза, мигрируют кодовые базы C/C++ на Rust (до 800K+ строк в ядре Fuchsia Zircon) и обошли базовый результат квантового алгоритма на 40%.
Есть ли у Argon открытые веса?
Нет. Как и у Claude Opus 5.5, Claude Fable 5.1 и GPT-6 Astra, веса модели не открыты.
Источник: marktechpost.com