
Qwen-Image-2.1: своя генерация фото на одной GPU
Есть проект? Напишите нам
Обсудим задачу и подберём оборудование
Alibaba открыла веса Qwen-Image-2.1 — модели, которая совмещает генерацию изображений и их редактирование в одном чекпоинте. Диффузионный трансформер весит 7 миллиардов параметров, но по тестам разработчика обходит открытую FLUX 2 Max на 32 миллиарда. Для дизайн-студии это шанс поднять генератор картинок на своей станции, а не в облаке.
Краткое содержание
- 7 млрд параметров у трансформера плюс кодировщик текста на 8 млрд — генерация и редактирование в одном чекпоинте;
- родная поддержка альфа-канала и до 10 референсных изображений для правок;
- по тесту Qwen-Image-Bench обходит открытую FLUX 2 Max на 32 млрд параметров;
- хватает видеокарты уровня RTX 3090 — но лицензия ограничивает коммерческое использование.
Чекпоинт из двух моделей, а не один диффузор
Диффузионный трансформер построен на 32 однопотоковых слоях (single-stream DiT) с «блочно-каузальным» вниманием: текстовые токены обрабатываются слева направо, а токены изображения — блоками, без направленных ограничений внутри картинки. За текст и условные изображения отвечает отдельный кодировщик Qwen3-VL на 8 миллиардов параметров, так что весь конвейер тянет на 15 миллиардов, хотя генеративное ядро — только 7. VAE-автокодировщик работает с 64 каналами и родным альфа-каналом: прозрачные объекты получаются без отдельной модели удаления фона.
- генерация и редактирование в одном чекпоинте — до 10 референсных изображений на входе;
- вывод разрешением до 2752×2752 точек в семи форматах кадра;
- локальные правки по маскам и произвольным пометкам на изображении.
Одной RTX 3090 достаточно — вопрос в другом
По тесту Qwen-Image-Bench — это тест самой Alibaba — модель набирает 60,28 балла. Открытую FLUX 2 Max на 32 миллиарда параметров обходит (55,33), закрытую GPT Image 2.5 Sunburst (67,01) — нет. Независимых замеров пока не было, цифры только от разработчика. Для железа это не так важно: планка по памяти — 24 гигабайта, уровень RTX 3090 или RTX 5090, а не выделенный ускоритель для дата-центра. На картах поскромнее часть весов можно сгрузить в память процессора — но скорость упадёт заметно.
Меньше модель, но строже правила
У предыдущей версии Qwen-Image, на 20 миллиардов параметров, была лицензия Apache 2.0 — свободная, без вопросов к коммерческому использованию. Qwen-Image-2.1 меньше и быстрее. Но перешла на Qwen Research License: веса открыты для изучения и тестов, а встраивать модель в платный продукт без отдельного соглашения с Alibaba нельзя. Формально это всё ещё «открытая модель». Для закупщика разница принципиальная: юридический статус нужно зафиксировать до того, как модель попадёт в рабочий процесс, а не после.
Мнение DigitalRazor
Qwen-Image-2.1 — редкий случай, когда для серьёзной генерации и правки изображений хватает одной рабочей станции с картой на 24 гигабайта, а не отдельного GPU-сервера. Но прежде чем заводить модель в производственный процесс, зафиксируйте у юристов статус лицензии — «открытые веса» здесь не значит «можно продавать». Если нужна станция под такие задачи — от одной RTX 3090 до конфигурации с несколькими картами на будущее — можем подобрать и собрать её под конкретную нагрузку.











