DeepSeek опубликовала на Hugging Face новую версию модели DeepSeek-V4-Flash-0731 и перевела официальный API V4-Flash в публичную бета-версию. Релиз состоялся 31 июля 2026 года. В карточке модели прямо указано, что это официальный выпуск, приходящий на смену превью, а архитектура и размер модели не изменились — прирост достигнут за счёт повторного пост-тренинга, а не новой конструкции.
Что внутри
Чекпойнт поставляется вместе с модулем спекулятивного декодирования DSpark, как и версия DeepSeek-V4-Flash-DSpark. Репозиторий на Hugging Face показывает 304B параметров — это с учётом модуля-драфта поверх базовых 284B. На стороне API модель deepseek-v4-flash теперь нативно поддерживает формат Responses API и адаптирована под Codex. V4-Pro API, а также приложения и веб-модели не обновлялись.
Как разворачивать
Варианта два, и они сильно различаются по порогу входа.
Через API модель доступна практически любому: на странице цен DeepSeek указано $0.14 за 1 млн входных токенов при промахе кэша, $0.0028 при попадании в кэш и $0.28 за 1 млн выходных токенов, лимит — 2 500 одновременных подключений. Это примерно треть цены выходных токенов deepseek-v4-pro ($0.87). Стартапам, инди-разработчикам и внутренним платформенным командам такие ценники позволяют гонять агентные циклы без GPU-бюджета.
Для самостоятельного хостинга порог куда выше. Веса распространяются по лицензии MIT без ограничений доступа, но в памяти остаются все эксперты — на токен активируется только 13B. Пример DeepSeek для vLLM обслуживает модель на одном узле 4×GB300. Динамические GGUF от Unsloth: без lossless-8-бит сборка занимает 162 GB, 3-битная — 103 GB, нужно примерно 110 GB суммарно RAM плюс VRAM. То есть self-hosting подходит средним и крупным компаниям с кластером обслуживания или одной мощной рабочей станцией при агрессивном квантовании.
Архитектура и бенчмарки
По техническому отчёту DeepSeek-V4, V4-Flash — это MoE на 284B параметров с активацией 13B на токен и контекстным окном 1 млн токенов. Каждый MoE-слой содержит один общий эксперт и 256 маршрутизируемых экспертов с промежуточной размерностью 2048; на токен срабатывают 6 маршрутизируемых экспертов. Первые три MoE-слоя используют hash-маршрутизацию. Глубина мульти-токенового предсказания — 1. Внимание гибридное: Compressed Sparse Attention (CSA) и Heavily Compressed Attention (HCA); остаточные связи заменены на Manifold-Constrained Hyper-Connections (mHC) с коэффициентом расширения 4 и 20 итерациями Sinkhorn-Knopp. Претрейнинг прошёл на более чем 32 трлн токенов с оптимизатором Muon.
Прирост в бенчмарках (все цифры сообщает сам DeepSeek) заметный: Terminal Bench 2.1 — 82.7 против 61.8 у превью, NL2Repo — 54.2 против 39.4, Cybergym — 76.7 против 38.7, DeepSWE — 54.4 против 7.3, Toolathlon-Verified — 70.3 против 49.7, Agents’ Last Exam — 25.2 против 15.8. Для контекста: GLM-5.2 набирает 81.0 на Terminal Bench 2.1 и 46.2 на DeepSWE, Opus-4.8 — 85.0 и 58.0 соответственно. Стоит оговориться: флагманская цифра из статьи — 27% FLOPs однократного вывода и 10% KV-кэша против DeepSeek-V3.2 при контексте 1 млн — относится к V4-Pro, а не к Flash.
Источник: marktechpost.com