
Qwen3.8-Max: 95 из 2,4 трлн параметров — счёт по GPU
Подберём сервер под задачи
Ответьте на несколько вопросов — подготовим предложение
Alibaba представила Qwen3.8-Max — крупнейшую модель в линейке Qwen: 2,4 триллиона параметров, из которых на каждый запрос считается лишь 95 миллиардов. Открытые веса флагмана обещают через неделю, а рядом уже показали компактную Qwen3.8-27B для локального инференса. Для инфраструктурного отдела вопрос не в размере модели на бумаге, а в том, сколько ускорителей реально нужно, чтобы всё это поднять.
Краткое содержание
- 2,4 трлн параметров всего, MoE-архитектура на гибриде Transformer и Mamba, активны лишь 95 млрд на запрос, контекст — до 1 млн токенов;
- по независимому индексу Artificial Analysis модель на уровне Claude Sonnet 5, по собственным тестам Alibaba обгоняет ряд задач у GPT-5.6;
- открытые веса Qwen3.8-Max выйдут через неделю после анонса — впервые для модели такого масштаба у Alibaba; параллельно доступна компактная Qwen3.8-27B;
- по оценке The Register, для клиентского сервиса нужно 48–64 GPU уровня Nvidia B200, для внутренних задач хватает 8–16 B300 или AMD MI355X.
2,4 триллиона параметров — и только 95 миллиардов в работе
Qwen3.8-Max построена по принципу mixture-of-experts: модель состоит из множества специализированных подсетей, а для каждого конкретного запроса включается лишь их часть. Из 2,4 триллиона параметров активны только 95 миллиардов — на порядок меньше полного размера. Alibaba сохранила гибридную архитектуру Transformer+Mamba из прошлых версий Qwen и подняла контекст до миллиона токенов. Сколько памяти и вычислений уйдёт на запрос, решают активные параметры, а не общий размер модели. Цифра «2,4 трлн» в заголовках пугает сильнее, чем следовало бы.
Сколько GPU нужно, чтобы поднять такую модель
Alibaba не публиковала официальную схему развёртывания, но по оценке The Register, основанной на размере модели и практике аналогичных MoE-систем, для клиентского сервиса с приемлемой задержкой понадобится 48–64 ускорителя уровня Nvidia B200. Для внутренних задач, где отклик не так критичен, достаточно 8–16 карт B300 или AMD Instinct MI355X. Это цифры для полной версии на 2,4 трлн параметров — то есть для облачных провайдеров и крупных лабораторий, а не для типовой компании. Куда практичнее для большинства заказчиков выглядит компактная Qwen3.8-27B: MoE-модель такого размера в квантованном виде помещается на один-два современных ускорителя с 80 гигабайтами памяти — конфигурация, которую реально держать в своей серверной.
Что пока неясно: веса, лицензия и сроки
Ключевая оговорка — открытые веса Qwen3.8-Max на момент анонса ещё не выложены, релиз обещан через неделю, и итоговая лицензия пока не опубликована. Доступ к флагману пока идёт только через облачное API Alibaba, а собственные бенчмарки вендора и независимый рейтинг Artificial Analysis расходятся: по внутренним тестам модель обгоняет конкурентов увереннее, чем показывает независимая проверка. Плюс релиз Qwen3.8-Max — не единичное событие: китайские лаборатории выпускают открытые модели одна за другой, и через неделю на месте сегодняшнего лидера может оказаться другая модель с похожими цифрами. Закупать железо под конкретный чек-пойнт до появления реальных весов и поддержки в vLLM или SGLang — рискованная спешка.
Мнение DigitalRazor
Для работы через API ждать нечего — Qwen3.8-Max уже доступна и по цене заметно дешевле западных флагманов. А вот с закупкой железа под локальный запуск стоит выдержать паузу до появления реальных весов и подтверждённых квантованных конфигураций: обещание против готового чек-пойнта — разные вещи. Большинству наших заказчиков для локального инференса достаточно ориентироваться на Qwen3.8-27B и пару GPU с 80 гигабайтами памяти, а не переплачивать за инфраструктуру под 2,4-триллионный флагман, который создан для гиперскейлеров.













