
Qwen3.8-2.4T-A95B: 2,4 трлн параметров и цена GPU
Подберём сервер под задачи
Ответьте на несколько вопросов — подготовим предложение
Alibaba выпустила Qwen3.8-2.4T-A95B — самую крупную открытую модель линейки Qwen: 2,4 триллиона параметров, из которых на каждый токен работают 95 миллиардов. Веса лежат в открытом доступе на Hugging Face, но за бесплатной лицензией скрывается не менее серьёзный вопрос: на каком железе всё это поднимать.
Краткое содержание
- 2,4 трлн параметров всего, 95 млрд активных на токен — архитектура смеси экспертов с 512 экспертами;
- контекст — 262 144 токена нативно, с расширением до 1 010 000;
- полные веса в BF16 занимают около 4,8 Тбайт — это уровень нескольких серверных узлов, а не одной видеокарты;
- доступны квантованные версии вплоть до 4 бит, но и они не помещаются в один типовой сервер с ускорителями.
Архитектура: 512 экспертов и почти бесконечный контекст
Qwen3.8-2.4T-A95B построена на архитектуре Qwen3.5 с механизмами DeltaNet и Gated Attention — они экономят вычисления при работе с длинным контекстом. Из 512 экспертов на каждый токен активируются десять маршрутизируемых и один общий — отсюда и активные 95 миллиардов параметров при общих 2,4 триллиона. Формально это делает инференс дешевле полного плотного гиганта такого объёма, но не отменяет главного: в памяти ускорителей должна поместиться вся модель целиком, а не только активная часть — маршрутизатор на каждом токене может обратиться к любому из 512 экспертов.
Сколько GPU действительно нужно
Официальных рекомендаций по железу Alibaba не публикует, но параметры можно посчитать напрямую. Модель хранится в BF16 — два байта на параметр, значит полный вес — около 4,8 Тбайт. Ни один сервер с восемью ускорителями, даже на новейших NVIDIA B200 с 192 Гбайт памяти на карту, такое не вместит: 4,8 Тбайт делится на 192 Гбайт — и получается порядка 25 ускорителей только на веса, без запаса под контекст и промежуточные вычисления. На практике это четыре-пять узлов с восемью B200 в каждом, объединённых быстрой сетью для распределённого инференса.
- BF16 (без потерь) — около 4,8 Тбайт, нужен кластер из 4–5 узлов по 8 ускорителей класса B200/H200;
- 4-битное квантование — около 1,2 Тбайт, укладывается в один узел с восемью картами по 192 Гбайт, но впритык, без запаса под контекст;
- восемь ускорителей на 80 Гбайт (H100) для 4-битной версии уже не хватит — нужны карты нового поколения с памятью от 141 Гбайт.
Кому это по карману, а кому — подождать
Судя по фреймворкам, под которые Alibaba выпустила официальные рецепты — vLLM и SGLang с поддержкой распределённого инференса, — компания изначально целилась не в энтузиастов с одной видеокартой, а в облачных провайдеров и крупные ИИ-команды с готовым кластером. Для сравнения с закрытыми моделями такого класса компания приводит тесты против Claude Opus 4.8 и GPT-5.6 Sol — то есть Qwen3.8 конкурирует не с локальными помощниками, а с топовыми облачными API. Для большинства российских интеграторов и корпоративных ИИ-проектов практичнее не поднимать эту модель целиком, а присмотреться к более компактным версиям линейки Qwen — благо там богатый выбор по размеру.
Мнение DigitalRazor
Qwen3.8-2.4T-A95B — демонстрация возможностей, а не модель для типового корпоративного внедрения: даже в урезанном 4-битном виде она требует полноценный сервер с восемью топовыми ускорителями и приличный бюджет на память и сеть. Если задача — закрыть конкретный бизнес-кейс, а не догнать топ бенчмарков, разумнее взять модель поменьше из той же линейки Qwen и посчитать её реальную стоимость владения на своём железе. Мы готовы подобрать конфигурацию сервера под нужный размер модели и показать разницу в TCO между вариантами.













