8 800 500-99-26 Для звонков по России
Qwen3.8-Flash-Next: 180 млрд параметров, 6 в работе
Софт
3 мин

Qwen3.8-Flash-Next: 180 млрд параметров, 6 в работе

DigitalRazor
DigitalRazor
Подписаться в Telegram
Содержание 5 разделов
Краткое содержание Инженерная идея: гигант, который считает как малыш Что требует прод: кластер, а не одна карта Обходной путь: квантование ужимает модель до станции Неочевидный момент: это черновик, а не финальный релиз
Подберём сервер под вашу задачу

Подберём конфигурацию сервера и отправим предложение.

Смотреть серверы
или свяжитесь с нами
Telegram Telegram WhatsApp WhatsApp ВКонтакте ВКонтакте MAX MAX

Подберём сервер под задачи

Ответьте на несколько вопросов — подготовим предложение

Alibaba открыла веса Qwen3.8-Flash-Next — чернового предпоказа архитектуры будущей Qwen4. В модели около 180 миллиардов параметров, но на каждый токен из них работает лишь 6 миллиардов. Для инфраструктуры это меняет привычную логику: важна не столько мощность GPU, сколько объём памяти под гигантский набор весов.

Краткое содержание

  • 180 млрд параметров суммарно, активны лишь 6 млрд на токен — экономия на вычислениях;
  • архитектура — предпоказ Qwen4: гибридное внимание, гейтед residual, n-gram-эмбеддинги;
  • официальный чекпойнт в BF16 — 335 гигабайт, в FP8 — почти 173 гигабайта, нужен кластер уровня GB300 или H200;
  • квантованные версии от 72,5 до 111 гигабайт помещаются в одну рабочую станцию с большим объёмом памяти.

Инженерная идея: гигант, который считает как малыш

Qwen3.8-Flash-Next — модель типа MoE (mixture-of-experts) с 512 экспертами, из которых на каждый токен включаются десять маршрутизируемых и один общий — итого 6 миллиардов активных параметров. Ещё 51 миллиард приходится на слой n-gram-эмбеддингов, 4 миллиарда — на модуль предсказания сразу нескольких токенов. Контекст — 262 тысячи токенов нативно, с расширением до миллиона. По тестам Alibaba модель заметно обходит компактную Qwen3.8-27B на кодовых задачах: 58,7 балла против 42,2 по DeepSWE 1.1. На агентном тесте IFBench она даже обходит Claude Opus 4.6 — 81,3 против 62,5.

Что требует прод: кластер, а не одна карта

В боевом развёртывании цифры совсем другие. Чекпойнт в BF16 весит 335 гигабайт, версия в FP8 — около 173 гигабайт. Alibaba рекомендует минимум TP2 на связке ускорителей уровня GB300 для FP8-версии, а для полной пропускной способности — TP4. На узле с восемью H200 модель разворачивают по схеме TEP8. Это уровень гипермасштабируемых операторов и серьёзных инференс-провайдеров, а не одиночного сервера в закупке среднего интегратора.

Обходной путь: квантование ужимает модель до станции

Сообщество Unsloth выпустило GGUF-квантованные версии — от 72,5 гигабайта на 1-бит с точностью около 80 процентов до 111,3 гигабайта на 4-бит с точностью 93,5 процента. Из-за архитектуры с малым числом активных параметров модель почти не теряет в скорости при переносе с видеопамяти на оперативную или объединённую память — редкое свойство для моделей такого масштаба. То есть рабочую станцию со 128 гигабайтами памяти или связку из нескольких видеокарт с суммарным объёмом от 96 гигабайт можно загрузить моделью без покупки отдельного GPU-кластера.

Неочевидный момент: это черновик, а не финальный релиз

Alibaba прямо называет Qwen3.8-Flash-Next предпоказом архитектуры, а не готовым флагманом — компания даёт разработчикам время адаптировать инструменты квантования и инференс-пайплайны до выхода полноценной Qwen4. Плата за компактные версии — потеря точности: на 1-бите модель держит лишь около 80 процентов исходного качества. Для рабочих сценариев это стоит проверять на своих задачах, а не доверять цифре из документации. Веса при этом лежат в открытом доступе на Hugging Face без региональных ограничений на скачивание.

Мнение DigitalRazor

Для прототипирования и тестов агентных сценариев Qwen3.8-Flash-Next можно поднять уже сейчас: квантованная версия укладывается в рабочую станцию со 128 гигабайтами памяти без покупки отдельного GPU-кластера. Но это архитектурный черновик Qwen4, а не финальный продукт — для боевого инференса закладывайте мощности с суммарной видеопамятью от 173 гигабайт и выше. Мы подбираем конфигурацию под обе задачи — от станции для экспериментов до сервера с несколькими ускорителями под прод.

Rackstation AI
Для каких задач Компактный GPU-сервер до 2 видеокарт для начальных задач в AI и графике. Оптимален для инференса, визуализации, VFX и рендеринга в студиях и лабораториях, где важна гибкость.
Подробнее
Видеокарты
RTX / RTX PRO / H200 NVL
Объем видеопамяти до 282 ГБ
Процессоры
Threadripper PRO
Количество ядер до 96
RAM до 1024 ГБ DDR5
Форм-фактор 4.5U
Devbox AI
Для каких задач Универсальная платформа на 4–6 GPU для локального обучения моделей и генеративных задач. Подходит для команд, которым важна надёжность сервера и свобода выбора графики — от RTX 5090 до PRO RTX 6000.
Подробнее
Видеокарты
RTX / RTX PRO / H200 NVL
Объем видеопамяти до 576 ГБ
Процессоры
Threadripper PRO
Количество ядер до 96
RAM до 1024 ГБ DDR5
Форм-фактор 6.5U
Scale
Для каких задач Сервер промышленного уровня на 8 GPU с кластерной архитектурой. Предназначен для дата-центров и AI-ферм, где требуется масштабируемость и полная загрузка ресурсов под обучение LLM и R&D.
Подробнее
Видеокарты
RTX PRO 6000 / RTX 5090
Объем видеопамяти до 768 ГБ
Процессоры
AMD Epyc, Intel Xeon
Количество ядер до 320
RAM до 3072 ГБ DDR5
Форм-фактор 6U
HPC 4000
Для каких задач Серия серверов для кластеризации на 4 GPU. Предназначены для дата-центров и AI-ферм, где требуется повышенная плотность для обучение LLM и R&D.
Подробнее
Видеокарты
L40s / RTX PRO / H200 NVL
Объем видеопамяти до 564 ГБ
Процессоры
AMD EPYC, Intel Xeon
Количество ядер до 128
RAM до 1536 ГБ DDR5
Форм-фактор 2U
HPC 8000
Для каких задач Серия серверов для кластеризации на 8 GPU. Предназначены для дата-центров и AI-ферм, где требуется повышенная плотность для обучение LLM и R&D.
Подробнее
Видеокарты
L40s / RTX PRO / H200 NVL
Объем видеопамяти до 1128 ГБ
Процессоры
AMD EPYC, Intel Xeon
Количество ядер до 256
RAM до 2048 ГБ DDR5
Форм-фактор 4U
HGX H200
Для каких задач HGX объединяет 8 видеокарт NVIDIA H200, достигая экстремальной плотности производительности. Благодаря внутренней связности NVSwitch мгновенно интегрируется в масштабные вычислительные кластеры.
Подробнее
Видеокарты
NVIDIA H200 SXM
Объем видеопамяти до 1128 ГБ
Процессоры
AMD EPYC, Intel Xeon
Количество ядер до 256
RAM до 2048 ГБ DDR5
Форм-фактор 5U
Подберём сервер под вашу задачу

Подберём конфигурацию сервера и отправим предложение.

Смотреть серверы
или свяжитесь с нами
Telegram Telegram WhatsApp WhatsApp ВКонтакте ВКонтакте MAX MAX
9.6К

Так же будет интересно почитать

Сайт использует cookies
Узнать подробнее