8 800 500-99-26 Для звонков по России
Qwen3.8-2.4T-A95B: 2,4 трлн параметров и цена GPU
Софт
3 мин

Qwen3.8-2.4T-A95B: 2,4 трлн параметров и цена GPU

DigitalRazor
DigitalRazor
Подписаться в Telegram
Содержание 4 раздела
Краткое содержание Архитектура: 512 экспертов и почти бесконечный контекст Сколько GPU действительно нужно Кому это по карману, а кому — подождать
Подберём сервер под вашу задачу

Подберём конфигурацию сервера и отправим предложение.

Смотреть серверы
или свяжитесь с нами
Telegram Telegram WhatsApp WhatsApp ВКонтакте ВКонтакте MAX MAX

Подберём сервер под задачи

Ответьте на несколько вопросов — подготовим предложение

Alibaba выпустила Qwen3.8-2.4T-A95B — самую крупную открытую модель линейки Qwen: 2,4 триллиона параметров, из которых на каждый токен работают 95 миллиардов. Веса лежат в открытом доступе на Hugging Face, но за бесплатной лицензией скрывается не менее серьёзный вопрос: на каком железе всё это поднимать.

Краткое содержание

  • 2,4 трлн параметров всего, 95 млрд активных на токен — архитектура смеси экспертов с 512 экспертами;
  • контекст — 262 144 токена нативно, с расширением до 1 010 000;
  • полные веса в BF16 занимают около 4,8 Тбайт — это уровень нескольких серверных узлов, а не одной видеокарты;
  • доступны квантованные версии вплоть до 4 бит, но и они не помещаются в один типовой сервер с ускорителями.

Архитектура: 512 экспертов и почти бесконечный контекст

Qwen3.8-2.4T-A95B построена на архитектуре Qwen3.5 с механизмами DeltaNet и Gated Attention — они экономят вычисления при работе с длинным контекстом. Из 512 экспертов на каждый токен активируются десять маршрутизируемых и один общий — отсюда и активные 95 миллиардов параметров при общих 2,4 триллиона. Формально это делает инференс дешевле полного плотного гиганта такого объёма, но не отменяет главного: в памяти ускорителей должна поместиться вся модель целиком, а не только активная часть — маршрутизатор на каждом токене может обратиться к любому из 512 экспертов.

Сколько GPU действительно нужно

Официальных рекомендаций по железу Alibaba не публикует, но параметры можно посчитать напрямую. Модель хранится в BF16 — два байта на параметр, значит полный вес — около 4,8 Тбайт. Ни один сервер с восемью ускорителями, даже на новейших NVIDIA B200 с 192 Гбайт памяти на карту, такое не вместит: 4,8 Тбайт делится на 192 Гбайт — и получается порядка 25 ускорителей только на веса, без запаса под контекст и промежуточные вычисления. На практике это четыре-пять узлов с восемью B200 в каждом, объединённых быстрой сетью для распределённого инференса.

  • BF16 (без потерь) — около 4,8 Тбайт, нужен кластер из 4–5 узлов по 8 ускорителей класса B200/H200;
  • 4-битное квантование — около 1,2 Тбайт, укладывается в один узел с восемью картами по 192 Гбайт, но впритык, без запаса под контекст;
  • восемь ускорителей на 80 Гбайт (H100) для 4-битной версии уже не хватит — нужны карты нового поколения с памятью от 141 Гбайт.

Кому это по карману, а кому — подождать

Судя по фреймворкам, под которые Alibaba выпустила официальные рецепты — vLLM и SGLang с поддержкой распределённого инференса, — компания изначально целилась не в энтузиастов с одной видеокартой, а в облачных провайдеров и крупные ИИ-команды с готовым кластером. Для сравнения с закрытыми моделями такого класса компания приводит тесты против Claude Opus 4.8 и GPT-5.6 Sol — то есть Qwen3.8 конкурирует не с локальными помощниками, а с топовыми облачными API. Для большинства российских интеграторов и корпоративных ИИ-проектов практичнее не поднимать эту модель целиком, а присмотреться к более компактным версиям линейки Qwen — благо там богатый выбор по размеру.

Мнение DigitalRazor

Qwen3.8-2.4T-A95B — демонстрация возможностей, а не модель для типового корпоративного внедрения: даже в урезанном 4-битном виде она требует полноценный сервер с восемью топовыми ускорителями и приличный бюджет на память и сеть. Если задача — закрыть конкретный бизнес-кейс, а не догнать топ бенчмарков, разумнее взять модель поменьше из той же линейки Qwen и посчитать её реальную стоимость владения на своём железе. Мы готовы подобрать конфигурацию сервера под нужный размер модели и показать разницу в TCO между вариантами.

Для каких задач Компактный GPU-сервер до 2 видеокарт для начальных задач в AI и графике. Оптимален для инференса, визуализации, VFX и рендеринга в студиях и лабораториях, где важна гибкость.
Подробнее
Видеокарты
RTX / RTX PRO / H200 NVL
Объем видеопамяти до 282 ГБ
Процессоры
Threadripper PRO
Количество ядер до 96
RAM до 1024 ГБ DDR5
Форм-фактор 4.5U
Для каких задач Универсальная платформа на 4–6 GPU для локального обучения моделей и генеративных задач. Подходит для команд, которым важна надёжность сервера и свобода выбора графики — от RTX 5090 до PRO RTX 6000.
Подробнее
Видеокарты
RTX / RTX PRO / H200 NVL
Объем видеопамяти до 576 ГБ
Процессоры
Threadripper PRO
Количество ядер до 96
RAM до 1024 ГБ DDR5
Форм-фактор 6.5U
Для каких задач Сервер промышленного уровня на 8 GPU с кластерной архитектурой. Предназначен для дата-центров и AI-ферм, где требуется масштабируемость и полная загрузка ресурсов под обучение LLM и R&D.
Подробнее
Видеокарты
RTX PRO 6000 / RTX 5090
Объем видеопамяти до 768 ГБ
Процессоры
AMD Epyc, Intel Xeon
Количество ядер до 320
RAM до 3072 ГБ DDR5
Форм-фактор 6U
Для каких задач Серия серверов для кластеризации на 4 GPU. Предназначены для дата-центров и AI-ферм, где требуется повышенная плотность для обучение LLM и R&D.
Подробнее
Видеокарты
L40s / RTX PRO / H200 NVL
Объем видеопамяти до 564 ГБ
Процессоры
AMD EPYC, Intel Xeon
Количество ядер до 128
RAM до 1536 ГБ DDR5
Форм-фактор 2U
Для каких задач Серия серверов для кластеризации на 8 GPU. Предназначены для дата-центров и AI-ферм, где требуется повышенная плотность для обучение LLM и R&D.
Подробнее
Видеокарты
L40s / RTX PRO / H200 NVL
Объем видеопамяти до 1128 ГБ
Процессоры
AMD EPYC, Intel Xeon
Количество ядер до 256
RAM до 2048 ГБ DDR5
Форм-фактор 4U
Для каких задач HGX объединяет 8 видеокарт NVIDIA H200, достигая экстремальной плотности производительности. Благодаря внутренней связности NVSwitch мгновенно интегрируется в масштабные вычислительные кластеры.
Подробнее
Видеокарты
NVIDIA H200 SXM
Объем видеопамяти до 1128 ГБ
Процессоры
AMD EPYC, Intel Xeon
Количество ядер до 256
RAM до 2048 ГБ DDR5
Форм-фактор 5U
Подберём сервер под вашу задачу

Подберём конфигурацию сервера и отправим предложение.

Смотреть серверы
или свяжитесь с нами
Telegram Telegram WhatsApp WhatsApp ВКонтакте ВКонтакте MAX MAX
9.2К

Так же будет интересно почитать

Сайт использует cookies
Узнать подробнее