Одна видеокарта на 24 ГБ — это уже вполне рабочая база для локальных языковых моделей. Вот шесть вариантов, которые в неё уверенно помещаются, с их сильными сторонами и требованиями к памяти. Почти все идут под квантованием Q4_K_M — это стандартный баланс качества и размера.
Шесть моделей
- Qwen3.6-27B — 27 млрд параметров (dense), Q4_K_M, около 16 ГБ VRAM, лицензия Apache 2.0. Автор называет её самым сильным вариантом по умолчанию для такой карты: агентный кодинг, рассуждения на уровне репозитория, фронтенд-задачи.
- Qwen3.6-35B-A3B — 35 млрд всего, 3 млрд активных (MoE), Q4_K_M, около 20 ГБ VRAM, Apache 2.0. Самое быстрое декодирование среди универсальных вариантов, работа с инструментами, общий чат.
- Gemma 4 26B — 26 млрд (MoE) с 3,8 млрд активных, Q4_K_M, около 20 ГБ VRAM (оценка), Apache 2.0. Понимает мультимодальный ввод и покрывает более 140 языков.
- Mistral Small 3.2 24B — 24 млрд (dense), Q4_K_M, около 14 ГБ VRAM, Apache 2.0. Отшлифованный повседневный ассистент с самым скромным аппетитом и поддержкой длинного контекста.
- gpt-oss-20b — 21 млрд всего, 3,6 млрд активных (MoE), нативный формат MXFP4, около 14 ГБ VRAM, Apache 2.0. Силён в структурных рассуждениях и работе с инструментами, но слабее в широкой эрудиции.
- DeepSeek-R1-Distill-Qwen-32B — 32 млрд (dense), Q4_K_M, около 18–20 ГБ VRAM (самое плотное размещение), лицензия MIT. Уверенные рассуждения с видимыми токенами размышлений.
О чём помнить с памятью
Расход видеопамяти складывается из трёх частей: веса модели, KV-кеш и накладные расходы рантайма. На короткий контекст к весам стоит добавить примерно 1–2 ГБ на KV-кеш и рантайм. Именно поэтому одни и те же 24 ГБ по-разному вмещают dense- и MoE-модели.