8 800 500-99-26 Для звонков по России
Qwen3.8-Max: 95 из 2,4 трлн параметров — счёт по GPU
Софт
3 мин

Qwen3.8-Max: 95 из 2,4 трлн параметров — счёт по GPU

DigitalRazor
DigitalRazor
Подписаться в Telegram
Содержание 4 раздела
Краткое содержание 2,4 триллиона параметров — и только 95 миллиардов в работе Сколько GPU нужно, чтобы поднять такую модель Что пока неясно: веса, лицензия и сроки
Подберём сервер под вашу задачу

Подберём конфигурацию сервера и отправим предложение.

Смотреть серверы
или свяжитесь с нами
Telegram Telegram WhatsApp WhatsApp ВКонтакте ВКонтакте MAX MAX

Подберём сервер под задачи

Ответьте на несколько вопросов — подготовим предложение

Alibaba представила Qwen3.8-Max — крупнейшую модель в линейке Qwen: 2,4 триллиона параметров, из которых на каждый запрос считается лишь 95 миллиардов. Открытые веса флагмана обещают через неделю, а рядом уже показали компактную Qwen3.8-27B для локального инференса. Для инфраструктурного отдела вопрос не в размере модели на бумаге, а в том, сколько ускорителей реально нужно, чтобы всё это поднять.

Краткое содержание

  • 2,4 трлн параметров всего, MoE-архитектура на гибриде Transformer и Mamba, активны лишь 95 млрд на запрос, контекст — до 1 млн токенов;
  • по независимому индексу Artificial Analysis модель на уровне Claude Sonnet 5, по собственным тестам Alibaba обгоняет ряд задач у GPT-5.6;
  • открытые веса Qwen3.8-Max выйдут через неделю после анонса — впервые для модели такого масштаба у Alibaba; параллельно доступна компактная Qwen3.8-27B;
  • по оценке The Register, для клиентского сервиса нужно 48–64 GPU уровня Nvidia B200, для внутренних задач хватает 8–16 B300 или AMD MI355X.

2,4 триллиона параметров — и только 95 миллиардов в работе

Qwen3.8-Max построена по принципу mixture-of-experts: модель состоит из множества специализированных подсетей, а для каждого конкретного запроса включается лишь их часть. Из 2,4 триллиона параметров активны только 95 миллиардов — на порядок меньше полного размера. Alibaba сохранила гибридную архитектуру Transformer+Mamba из прошлых версий Qwen и подняла контекст до миллиона токенов. Сколько памяти и вычислений уйдёт на запрос, решают активные параметры, а не общий размер модели. Цифра «2,4 трлн» в заголовках пугает сильнее, чем следовало бы.

Сколько GPU нужно, чтобы поднять такую модель

Alibaba не публиковала официальную схему развёртывания, но по оценке The Register, основанной на размере модели и практике аналогичных MoE-систем, для клиентского сервиса с приемлемой задержкой понадобится 48–64 ускорителя уровня Nvidia B200. Для внутренних задач, где отклик не так критичен, достаточно 8–16 карт B300 или AMD Instinct MI355X. Это цифры для полной версии на 2,4 трлн параметров — то есть для облачных провайдеров и крупных лабораторий, а не для типовой компании. Куда практичнее для большинства заказчиков выглядит компактная Qwen3.8-27B: MoE-модель такого размера в квантованном виде помещается на один-два современных ускорителя с 80 гигабайтами памяти — конфигурация, которую реально держать в своей серверной.

Что пока неясно: веса, лицензия и сроки

Ключевая оговорка — открытые веса Qwen3.8-Max на момент анонса ещё не выложены, релиз обещан через неделю, и итоговая лицензия пока не опубликована. Доступ к флагману пока идёт только через облачное API Alibaba, а собственные бенчмарки вендора и независимый рейтинг Artificial Analysis расходятся: по внутренним тестам модель обгоняет конкурентов увереннее, чем показывает независимая проверка. Плюс релиз Qwen3.8-Max — не единичное событие: китайские лаборатории выпускают открытые модели одна за другой, и через неделю на месте сегодняшнего лидера может оказаться другая модель с похожими цифрами. Закупать железо под конкретный чек-пойнт до появления реальных весов и поддержки в vLLM или SGLang — рискованная спешка.

Мнение DigitalRazor

Для работы через API ждать нечего — Qwen3.8-Max уже доступна и по цене заметно дешевле западных флагманов. А вот с закупкой железа под локальный запуск стоит выдержать паузу до появления реальных весов и подтверждённых квантованных конфигураций: обещание против готового чек-пойнта — разные вещи. Большинству наших заказчиков для локального инференса достаточно ориентироваться на Qwen3.8-27B и пару GPU с 80 гигабайтами памяти, а не переплачивать за инфраструктуру под 2,4-триллионный флагман, который создан для гиперскейлеров.

Для каких задач Компактный GPU-сервер до 2 видеокарт для начальных задач в AI и графике. Оптимален для инференса, визуализации, VFX и рендеринга в студиях и лабораториях, где важна гибкость.
Подробнее
Видеокарты
RTX / RTX PRO / H200 NVL
Объем видеопамяти до 282 ГБ
Процессоры
Threadripper PRO
Количество ядер до 96
RAM до 1024 ГБ DDR5
Форм-фактор 4.5U
Для каких задач Универсальная платформа на 4–6 GPU для локального обучения моделей и генеративных задач. Подходит для команд, которым важна надёжность сервера и свобода выбора графики — от RTX 5090 до PRO RTX 6000.
Подробнее
Видеокарты
RTX / RTX PRO / H200 NVL
Объем видеопамяти до 576 ГБ
Процессоры
Threadripper PRO
Количество ядер до 96
RAM до 1024 ГБ DDR5
Форм-фактор 6.5U
Для каких задач Сервер промышленного уровня на 8 GPU с кластерной архитектурой. Предназначен для дата-центров и AI-ферм, где требуется масштабируемость и полная загрузка ресурсов под обучение LLM и R&D.
Подробнее
Видеокарты
RTX PRO 6000 / RTX 5090
Объем видеопамяти до 768 ГБ
Процессоры
AMD Epyc, Intel Xeon
Количество ядер до 320
RAM до 3072 ГБ DDR5
Форм-фактор 6U
Для каких задач Серия серверов для кластеризации на 4 GPU. Предназначены для дата-центров и AI-ферм, где требуется повышенная плотность для обучение LLM и R&D.
Подробнее
Видеокарты
L40s / RTX PRO / H200 NVL
Объем видеопамяти до 564 ГБ
Процессоры
AMD EPYC, Intel Xeon
Количество ядер до 128
RAM до 1536 ГБ DDR5
Форм-фактор 2U
Для каких задач Серия серверов для кластеризации на 8 GPU. Предназначены для дата-центров и AI-ферм, где требуется повышенная плотность для обучение LLM и R&D.
Подробнее
Видеокарты
L40s / RTX PRO / H200 NVL
Объем видеопамяти до 1128 ГБ
Процессоры
AMD EPYC, Intel Xeon
Количество ядер до 256
RAM до 2048 ГБ DDR5
Форм-фактор 4U
Для каких задач HGX объединяет 8 видеокарт NVIDIA H200, достигая экстремальной плотности производительности. Благодаря внутренней связности NVSwitch мгновенно интегрируется в масштабные вычислительные кластеры.
Подробнее
Видеокарты
NVIDIA H200 SXM
Объем видеопамяти до 1128 ГБ
Процессоры
AMD EPYC, Intel Xeon
Количество ядер до 256
RAM до 2048 ГБ DDR5
Форм-фактор 5U
Подберём сервер под вашу задачу

Подберём конфигурацию сервера и отправим предложение.

Смотреть серверы
или свяжитесь с нами
Telegram Telegram WhatsApp WhatsApp ВКонтакте ВКонтакте MAX MAX
9.7К

Так же будет интересно почитать

Сайт использует cookies
Узнать подробнее