Qwen-Image-2.1-Turbo: 8 шагов вместо 40 на той же 7B-модели

Команда Qwen из Alibaba выложила Qwen-Image-2.1-Turbo — ускоренный чекпойнт открытой модели Qwen-Image-2.1. Он генерирует и редактирует изображения за 8 шагов денойзинга вместо 40 по умолчанию в базовой модели. Архитектура та же — 7B, так что разработчик получает в пять раз меньше шагов на том же железе, плюс возможность работать через облачный API.

Что внутри чекпойнта

Визуальный генератор — 7B параметров, текстовый энкодер — Qwen3-VL 8B. Архитектура представляет собой single-stream DiT на 32 слоя с block-causal attention: текстовые токены получают токен-уровневую причинную маску, изображения — чанк-уровневую двунаправленную. Текстовый энкодер кодирует и инструкции, и условные изображения. VAE — 64-канальный RGBA-автоэнкодер с 16-кратным пространственным сжатием, что даёт нативную прозрачность. Планировщик — Flow Matching с дискретным расписанием Euler и динамическим сдвигом.

Рекомендуемое расписание из 8 шагов уже сохранено внутри чекпойнта. По умолчанию генерация идёт с CFG=1. Префиксное KV-кэширование переиспользует контекст текста и референсных изображений между шагами денойзинга: входные изображения и текст считаются один раз на первом шаге, а каждый следующий шаг берёт готовый кэш. При 8 шагах кэшированный префикс покрывает большую часть стоимости обусловливания — именно дизайн внимания и делает префиксное кэширование рабочим.

Что умеет генерировать и редактировать

Витрина модели описывает восемь категорий: портреты, позы человека, прозрачные изображения, типографика и постеры, макеты интерфейсов. Среди примеров редактирования — преобразование одного изображения, композиция по нескольким референсам и композиция интерьера из четырёх изображений. Базовая модель поддерживает до 10 референсных изображений и локальные правки кругами, нарисованными пометками или масками.

Выход и набор функций редактирования те же, что у Qwen-Image-2.1: 2K. Поддерживаемые пресеты — от квадрата 2048×2048 до 2752×1536 в пропорции 16:9.

Как запустить

Для запуска нужен Diffusers из исходников и transformers>=5.17.0. Чекпойнту требуется Diffusers PR #14950, который добавляет настраиваемые через пайплайн сигмы сэмплирования.

import torch
from diffusers import QwenImage21Pipeline

pipe = QwenImage21Pipeline.from_pretrained(
    "Qwen/Qwen-Image-2.1-Turbo", dtype=torch.bfloat16
).to("cuda")

image = pipe(
    prompt="A ceramic teapot on a wooden table, soft window light",
    width=2048, height=2048, use_kv_cache=True,
).images[0]

Для редактирования передайте image=input_image вместе с промптом-инструкцией.

Отдельно стоит предупредить о граблях: установка одного только num_inference_steps не переопределяет сохранённое расписание. Его меняет лишь явный аргумент sigmas, и Qwen отмечает, что другие расписания не тестировались.

Железо, лицензия и облачные цены

Turbo работает на CUDA-видеокартах в BF16 через Diffusers. Минимальный объём VRAM для Turbo Qwen не публикует. Unsloth оценивает базовую модель в 11 ГБ VRAM с GGUF и 24 ГБ с INT8/FP8 — это ориентир, а не гарантия для Turbo.

Лицензия — Qwen Research License, то есть только для исследований: для коммерческого самостоятельного хостинга нужно отдельное разрешение. Это же ограничение у базовой Qwen-Image-2.1.

Alibaba Cloud Model Studio размещает обе версии. qwen-image-2.1-turbo стоит 0,1 юаня за изображение в большинстве регионов при лимите 120 запросов в минуту. qwen-image-2.1-pro — 0,25 юаня за изображение при 20 RPM. Turbo в 2,5 раза дешевле за картинку и допускает в шесть раз больший темп запросов.

С чем сравнивают

Qwen-Image-2.1-Turbo — 7B, 8 шагов, есть редактирование по нескольким референсам и прозрачный RGBA-выход, нативное разрешение 2K. Базовая Qwen-Image-2.1 — те же 7B и 2K, но 40 шагов и до 10 референсов. Z-Image-Turbo от Alibaba Tongyi-MAI — 6B, 8 NFE, без редактирования (для него есть отдельная Edit-модель), 1024×1024 в примерах, лицензия Apache 2.0, помещается в 16 ГБ VRAM. FLUX.2 klein 9B от Black Forest Labs — 9B, 4 шага, редактирование по нескольким референсам, около 29 ГБ VRAM и RTX 4090 или выше, лицензия FLUX Non-Commercial, доступ через API BFL.

По Qwen-Image-Bench базовая Qwen-Image-2.1 набирает 60,28 — лучший результат среди открытых весов, который сообщает Qwen. Для самого Turbo отдельного бенчмарка пока нет.

Что это значит для практики

Сокращение с 40 шагов до 8 при той же архитектуре — это прямая экономия времени инференса и нагрузки на GPU. Для команд, которые уже развернули Qwen-Image-2.1, переход на Turbo не требует пересборки пайплайна: тот же класс QwenImage21Pipeline, тот же 7B-генератор, те же форматы вывода 2K. Ограничение — исследовательская лицензия, поэтому в продукт без отдельного разрешения веса не поставить; для коммерческого использования остаётся облачный API.

Частые вопросы

Чем Turbo отличается от базовой Qwen-Image-2.1?

Только расписанием денойзинга: 8 шагов вместо 40 при той же 7B-архитектуре и том же выходе 2K. Набор функций редактирования тоже совпадает.

Какие модели входят в комплект?

Визуальный генератор на 7B параметров и текстовый энкодер Qwen3-VL 8B. Отдельной Turbo-версии энкодера нет.

Можно ли использовать модель в коммерческом продукте?

Самостоятельный хостинг — нет: лицензия Qwen Research License требует отдельного разрешения на коммерческое использование. Облачный вариант доступен через Alibaba Cloud Model Studio.

Сколько VRAM нужно для Turbo?

Qwen минимум для Turbo не публикует. Для базовой модели Unsloth оценивает 11 ГБ с GGUF и 24 ГБ с INT8/FP8 — на Turbo эти цифры автоматически не переносятся.

Почему смена num_inference_steps не работает?

Расписание из 8 шагов сохранено внутри чекпойнта, и параметр шагов его не переопределяет. Менять расписание нужно явным аргументом sigmas, другие расписания Qwen не тестировала.

Сколько стоит генерация через API?

Turbo — 0,1 юаня за изображение при лимите 120 запросов в минуту, Pro — 0,25 юаня при 20 RPM. То есть Turbo в 2,5 раза дешевле и допускает в шесть раз больше запросов.

Поддерживается ли прозрачность изображений?

Да. 64-канальный RGBA-автоэнкодер с 16-кратным сжатием даёт нативный прозрачный вывод.

Есть ли у Turbo собственный бенчмарк?

Нет. Опубликован только результат базовой Qwen-Image-2.1 — 60,28 на Qwen-Image-Bench, лучший среди открытых весов по данным Qwen.

Какой максимальный размер изображения?

2K: от 2048×2048 до 2752×1536 в пропорции 16:9 среди поддерживаемых пресетов.

Сколько референсных изображений можно подать?

Базовая Qwen-Image-2.1 поддерживает до 10 референсов и локальные правки кругами, пометками или масками; Turbo сохраняет тот же набор функций редактирования.

Смежные материалы по открытым моделям Qwen и других вендоров: Qwen3.8-Flash-Next на 125B параметров и Mellum2.1 от JetBrains для кодинг-агентов.

Источник: marktechpost.com