
Qwen3.8-27B: плотная модель на одной видеокарте
Подберём сервер под задачи
Ответьте на несколько вопросов — подготовим предложение
Alibaba выпустила Qwen3.8-27B — плотную мультимодальную модель на 27 миллиардов параметров с контекстом до 1 миллиона токенов. Её реально запустить на одной мощной видеокарте — не нужен целый кластер под инференс, и это меняет расчёт для бизнеса.
Краткое содержание
- 27 млрд параметров, плотная архитектура без MoE, есть распознавание изображений и видео;
- контекст — 262 144 токена нативно, расширяется до 1 млн;
- в агентном кодировании заметно обгоняет предыдущую Qwen3.6-27B;
- доступна в форматах GGUF, FP8, NVFP4 — можно квантовать под конкретную карту.
Чем 27B отличается от прошлого поколения
Qwen3.8-27B построена на архитектуре Qwen3.5 с блоками Gated DeltaNet и Gated Attention: часть слоёв считает внимание в облегчённом линейном режиме, а часть — в полном, с фокусировкой через вентили. Такая комбинация экономит вычисления на длинном контексте и не теряет точность на коротких запросах. Добавлено многотокенное предсказание (MTP): модель генерирует не один токен за проход, а сразу несколько кандидатов, и это ускоряет инференс.
По заявлениям Alibaba, прирост заметен именно в агентных сценариях: Terminal Bench 2.1 — 73,0 против 63,4 у Qwen3.6-27B, SWE-bench Pro — 61,7 против 53,5. В управлении компьютером (OSWorld-Verified) модель показывает 84,3. Для 27-миллиардной модели это высокий результат — обычно такие показатели ждут от моделей на порядок крупнее.
Сколько видеопамяти реально нужно
27 миллиардов параметров в FP16 — это около 54 гигабайт только под веса, то есть один GPU уровня H100 или A100 на 80 гигабайт. Но Alibaba сразу выпустила модель в FP8 и NVFP4 — с ними веса ужимаются примерно до 27 и 13–14 гигабайт соответственно. Это уже диапазон рабочих станций: карта на 24–32 гигабайта (RTX 5090, RTX 6000 Ada) тянет модель в NVFP4 с запасом под контекст.
Держите в уме: это память под веса. Кэш ключей и значений (KV-cache) растёт вместе с длиной диалога, и при контексте в сотни тысяч токенов он сам способен занять больше памяти, чем модель.
Контекст в 1 миллион — не для локального запуска с ходу
В карточке модели на Hugging Face нативная длина контекста — 262 144 токена, расширение до 1 миллиона заявлено отдельно. Полноценная версия с контекстом в 1 млн токенов сначала появится в облачном Qwen Cloud, а не в весах, которые разворачивают у себя. Локально такой контекст потребует не только видеопамять под KV-кэш, но и проверенную поддержку в vLLM или SGLang — на момент релиза совместимость заявлена, но не проверена на всех конфигурациях. Прежде чем обещать заказчику миллион токенов на его железе, стоит прогнать собственный тест.
Мнение DigitalRazor
Qwen3.8-27B — удобный ориентир для бизнеса, которому нужен собственный мультимодальный ассистент без затрат на кластер GPU: квантованная версия помещается в одну рабочую станцию. Но для контекста от ста тысяч токенов и выше сразу считайте KV-кэш отдельно от весов — иначе конфигурация «на бумаге» разойдётся с тем, что реально влезет в карту. Мы готовы подобрать и настроить сервер под конкретный сценарий инференса — от компактной рабочей станции до многокарточного узла.








