8 800 500-99-26 Для звонков по России
Qwen-Image-2.1: своя генерация фото на одной GPU
Железо
2 мин

Qwen-Image-2.1: своя генерация фото на одной GPU

DigitalRazor
DigitalRazor
Подписаться в Telegram
Содержание 4 раздела
Краткое содержание Чекпоинт из двух моделей, а не один диффузор Одной RTX 3090 достаточно — вопрос в другом Меньше модель, но строже правила
Подберём решение под ваш проект

Расскажите о задаче — предложим оптимальную конфигурацию и реализацию.

Обсудить проект
или свяжитесь с нами
Telegram Telegram WhatsApp WhatsApp ВКонтакте ВКонтакте MAX MAX

Есть проект? Напишите нам

Обсудим задачу и подберём оборудование

Обсудить проект

Alibaba открыла веса Qwen-Image-2.1 — модели, которая совмещает генерацию изображений и их редактирование в одном чекпоинте. Диффузионный трансформер весит 7 миллиардов параметров, но по тестам разработчика обходит открытую FLUX 2 Max на 32 миллиарда. Для дизайн-студии это шанс поднять генератор картинок на своей станции, а не в облаке.

Краткое содержание

  • 7 млрд параметров у трансформера плюс кодировщик текста на 8 млрд — генерация и редактирование в одном чекпоинте;
  • родная поддержка альфа-канала и до 10 референсных изображений для правок;
  • по тесту Qwen-Image-Bench обходит открытую FLUX 2 Max на 32 млрд параметров;
  • хватает видеокарты уровня RTX 3090 — но лицензия ограничивает коммерческое использование.

Чекпоинт из двух моделей, а не один диффузор

Диффузионный трансформер построен на 32 однопотоковых слоях (single-stream DiT) с «блочно-каузальным» вниманием: текстовые токены обрабатываются слева направо, а токены изображения — блоками, без направленных ограничений внутри картинки. За текст и условные изображения отвечает отдельный кодировщик Qwen3-VL на 8 миллиардов параметров, так что весь конвейер тянет на 15 миллиардов, хотя генеративное ядро — только 7. VAE-автокодировщик работает с 64 каналами и родным альфа-каналом: прозрачные объекты получаются без отдельной модели удаления фона.

  • генерация и редактирование в одном чекпоинте — до 10 референсных изображений на входе;
  • вывод разрешением до 2752×2752 точек в семи форматах кадра;
  • локальные правки по маскам и произвольным пометкам на изображении.

Одной RTX 3090 достаточно — вопрос в другом

По тесту Qwen-Image-Bench — это тест самой Alibaba — модель набирает 60,28 балла. Открытую FLUX 2 Max на 32 миллиарда параметров обходит (55,33), закрытую GPT Image 2.5 Sunburst (67,01) — нет. Независимых замеров пока не было, цифры только от разработчика. Для железа это не так важно: планка по памяти — 24 гигабайта, уровень RTX 3090 или RTX 5090, а не выделенный ускоритель для дата-центра. На картах поскромнее часть весов можно сгрузить в память процессора — но скорость упадёт заметно.

Меньше модель, но строже правила

У предыдущей версии Qwen-Image, на 20 миллиардов параметров, была лицензия Apache 2.0 — свободная, без вопросов к коммерческому использованию. Qwen-Image-2.1 меньше и быстрее. Но перешла на Qwen Research License: веса открыты для изучения и тестов, а встраивать модель в платный продукт без отдельного соглашения с Alibaba нельзя. Формально это всё ещё «открытая модель». Для закупщика разница принципиальная: юридический статус нужно зафиксировать до того, как модель попадёт в рабочий процесс, а не после.

Мнение DigitalRazor

Qwen-Image-2.1 — редкий случай, когда для серьёзной генерации и правки изображений хватает одной рабочей станции с картой на 24 гигабайта, а не отдельного GPU-сервера. Но прежде чем заводить модель в производственный процесс, зафиксируйте у юристов статус лицензии — «открытые веса» здесь не значит «можно продавать». Если нужна станция под такие задачи — от одной RTX 3090 до конфигурации с несколькими картами на будущее — можем подобрать и собрать её под конкретную нагрузку.

AMD Ryzen AI Halo
Для каких задач Запуск и дообучение больших языковых моделей до 200 млрд локально
Подробнее
Видеокарты
Radeon 8060S
Объем видеопамяти 64 ГБ
Процессоры
Ryzen AI Max+ 395
Количество ядер 16 Zen 5
RAM Объединена с VRAM
Форм-фактор SFF
NVIDIA DGX Spark
Для каких задач Запуск и дообучение больших языковых моделей до 200 млрд локально
Подробнее
Видеокарты
Grace Blackwell
Объем видеопамяти 128 ГБ
Процессоры
NVIDIA GB10
Количество ядер 20 Arm
RAM Объединена с VRAM
Форм-фактор SFF
NVIDIA RTX Spark
Для каких задач Запуск и дообучение больших языковых моделей до 200 млрд локально
Подробнее
Видеокарты
Grace Blackwell
Объем видеопамяти 128 ГБ
Процессоры
NVIDIA Grace
Количество ядер 20 Arm
RAM Объединена с VRAM
Форм-фактор Laptop
Подберём решение под ваш проект

Расскажите о задаче — предложим оптимальную конфигурацию и реализацию.

Обсудить проект
или свяжитесь с нами
Telegram Telegram WhatsApp WhatsApp ВКонтакте ВКонтакте MAX MAX
9.1К

Так же будет интересно почитать

Сайт использует cookies
Узнать подробнее