
Qwen3.8-Flash-Next: 180 млрд параметров, 6 в работе
Подберём сервер под задачи
Ответьте на несколько вопросов — подготовим предложение
Alibaba открыла веса Qwen3.8-Flash-Next — чернового предпоказа архитектуры будущей Qwen4. В модели около 180 миллиардов параметров, но на каждый токен из них работает лишь 6 миллиардов. Для инфраструктуры это меняет привычную логику: важна не столько мощность GPU, сколько объём памяти под гигантский набор весов.
Краткое содержание
- 180 млрд параметров суммарно, активны лишь 6 млрд на токен — экономия на вычислениях;
- архитектура — предпоказ Qwen4: гибридное внимание, гейтед residual, n-gram-эмбеддинги;
- официальный чекпойнт в BF16 — 335 гигабайт, в FP8 — почти 173 гигабайта, нужен кластер уровня GB300 или H200;
- квантованные версии от 72,5 до 111 гигабайт помещаются в одну рабочую станцию с большим объёмом памяти.
Инженерная идея: гигант, который считает как малыш
Qwen3.8-Flash-Next — модель типа MoE (mixture-of-experts) с 512 экспертами, из которых на каждый токен включаются десять маршрутизируемых и один общий — итого 6 миллиардов активных параметров. Ещё 51 миллиард приходится на слой n-gram-эмбеддингов, 4 миллиарда — на модуль предсказания сразу нескольких токенов. Контекст — 262 тысячи токенов нативно, с расширением до миллиона. По тестам Alibaba модель заметно обходит компактную Qwen3.8-27B на кодовых задачах: 58,7 балла против 42,2 по DeepSWE 1.1. На агентном тесте IFBench она даже обходит Claude Opus 4.6 — 81,3 против 62,5.
Что требует прод: кластер, а не одна карта
В боевом развёртывании цифры совсем другие. Чекпойнт в BF16 весит 335 гигабайт, версия в FP8 — около 173 гигабайт. Alibaba рекомендует минимум TP2 на связке ускорителей уровня GB300 для FP8-версии, а для полной пропускной способности — TP4. На узле с восемью H200 модель разворачивают по схеме TEP8. Это уровень гипермасштабируемых операторов и серьёзных инференс-провайдеров, а не одиночного сервера в закупке среднего интегратора.
Обходной путь: квантование ужимает модель до станции
Сообщество Unsloth выпустило GGUF-квантованные версии — от 72,5 гигабайта на 1-бит с точностью около 80 процентов до 111,3 гигабайта на 4-бит с точностью 93,5 процента. Из-за архитектуры с малым числом активных параметров модель почти не теряет в скорости при переносе с видеопамяти на оперативную или объединённую память — редкое свойство для моделей такого масштаба. То есть рабочую станцию со 128 гигабайтами памяти или связку из нескольких видеокарт с суммарным объёмом от 96 гигабайт можно загрузить моделью без покупки отдельного GPU-кластера.
Неочевидный момент: это черновик, а не финальный релиз
Alibaba прямо называет Qwen3.8-Flash-Next предпоказом архитектуры, а не готовым флагманом — компания даёт разработчикам время адаптировать инструменты квантования и инференс-пайплайны до выхода полноценной Qwen4. Плата за компактные версии — потеря точности: на 1-бите модель держит лишь около 80 процентов исходного качества. Для рабочих сценариев это стоит проверять на своих задачах, а не доверять цифре из документации. Веса при этом лежат в открытом доступе на Hugging Face без региональных ограничений на скачивание.
Мнение DigitalRazor
Для прототипирования и тестов агентных сценариев Qwen3.8-Flash-Next можно поднять уже сейчас: квантованная версия укладывается в рабочую станцию со 128 гигабайтами памяти без покупки отдельного GPU-кластера. Но это архитектурный черновик Qwen4, а не финальный продукт — для боевого инференса закладывайте мощности с суммарной видеопамятью от 173 гигабайт и выше. Мы подбираем конфигурацию под обе задачи — от станции для экспериментов до сервера с несколькими ускорителями под прод.













