8 800 500-99-26 Для звонков по России
Qwen3.8-27B: плотная модель на одной видеокарте
Софт
2 мин

Qwen3.8-27B: плотная модель на одной видеокарте

DigitalRazor
DigitalRazor
Подписаться в Telegram
Содержание 4 раздела
Краткое содержание Чем 27B отличается от прошлого поколения Сколько видеопамяти реально нужно Контекст в 1 миллион — не для локального запуска с ходу
Подберём сервер под вашу задачу

Подберём конфигурацию сервера и отправим предложение.

Смотреть серверы
или свяжитесь с нами
Telegram Telegram WhatsApp WhatsApp ВКонтакте ВКонтакте MAX MAX

Подберём сервер под задачи

Ответьте на несколько вопросов — подготовим предложение

Alibaba выпустила Qwen3.8-27B — плотную мультимодальную модель на 27 миллиардов параметров с контекстом до 1 миллиона токенов. Её реально запустить на одной мощной видеокарте — не нужен целый кластер под инференс, и это меняет расчёт для бизнеса.

Краткое содержание

  • 27 млрд параметров, плотная архитектура без MoE, есть распознавание изображений и видео;
  • контекст — 262 144 токена нативно, расширяется до 1 млн;
  • в агентном кодировании заметно обгоняет предыдущую Qwen3.6-27B;
  • доступна в форматах GGUF, FP8, NVFP4 — можно квантовать под конкретную карту.

Чем 27B отличается от прошлого поколения

Qwen3.8-27B построена на архитектуре Qwen3.5 с блоками Gated DeltaNet и Gated Attention: часть слоёв считает внимание в облегчённом линейном режиме, а часть — в полном, с фокусировкой через вентили. Такая комбинация экономит вычисления на длинном контексте и не теряет точность на коротких запросах. Добавлено многотокенное предсказание (MTP): модель генерирует не один токен за проход, а сразу несколько кандидатов, и это ускоряет инференс.

По заявлениям Alibaba, прирост заметен именно в агентных сценариях: Terminal Bench 2.1 — 73,0 против 63,4 у Qwen3.6-27B, SWE-bench Pro — 61,7 против 53,5. В управлении компьютером (OSWorld-Verified) модель показывает 84,3. Для 27-миллиардной модели это высокий результат — обычно такие показатели ждут от моделей на порядок крупнее.

Сколько видеопамяти реально нужно

27 миллиардов параметров в FP16 — это около 54 гигабайт только под веса, то есть один GPU уровня H100 или A100 на 80 гигабайт. Но Alibaba сразу выпустила модель в FP8 и NVFP4 — с ними веса ужимаются примерно до 27 и 13–14 гигабайт соответственно. Это уже диапазон рабочих станций: карта на 24–32 гигабайта (RTX 5090, RTX 6000 Ada) тянет модель в NVFP4 с запасом под контекст.

Держите в уме: это память под веса. Кэш ключей и значений (KV-cache) растёт вместе с длиной диалога, и при контексте в сотни тысяч токенов он сам способен занять больше памяти, чем модель.

Контекст в 1 миллион — не для локального запуска с ходу

В карточке модели на Hugging Face нативная длина контекста — 262 144 токена, расширение до 1 миллиона заявлено отдельно. Полноценная версия с контекстом в 1 млн токенов сначала появится в облачном Qwen Cloud, а не в весах, которые разворачивают у себя. Локально такой контекст потребует не только видеопамять под KV-кэш, но и проверенную поддержку в vLLM или SGLang — на момент релиза совместимость заявлена, но не проверена на всех конфигурациях. Прежде чем обещать заказчику миллион токенов на его железе, стоит прогнать собственный тест.

Мнение DigitalRazor

Qwen3.8-27B — удобный ориентир для бизнеса, которому нужен собственный мультимодальный ассистент без затрат на кластер GPU: квантованная версия помещается в одну рабочую станцию. Но для контекста от ста тысяч токенов и выше сразу считайте KV-кэш отдельно от весов — иначе конфигурация «на бумаге» разойдётся с тем, что реально влезет в карту. Мы готовы подобрать и настроить сервер под конкретный сценарий инференса — от компактной рабочей станции до многокарточного узла.

MSI EdgeXpert MS-C931
Для каких задач Запуск и дообучение больших языковых моделей до 200 млрд локально
Подробнее
Видеокарты
Grace Blackwell
Объем видеопамяти 128 ГБ
Процессоры
NVIDIA GB10
Количество ядер 20 Arm
RAM Объединена с VRAM
Форм-фактор SFF
NVIDIA DGX Spark
Для каких задач Запуск и дообучение больших языковых моделей до 200 млрд локально
Подробнее
Видеокарты
Grace Blackwell
Объем видеопамяти 128 ГБ
Процессоры
NVIDIA GB10
Количество ядер 20 Arm
RAM Объединена с VRAM
Форм-фактор SFF
ASUS Ascent GX10
Для каких задач Запуск и дообучение больших языковых моделей до 200 млрд локально
Подробнее
Видеокарты
Grace Blackwell
Объем видеопамяти 128 ГБ
Процессоры
NVIDIA GB10
Количество ядер 20 Arm
RAM Объединена с VRAM
Форм-фактор SFF
Подберём сервер под вашу задачу

Подберём конфигурацию сервера и отправим предложение.

Смотреть серверы
или свяжитесь с нами
Telegram Telegram WhatsApp WhatsApp ВКонтакте ВКонтакте MAX MAX
9.1К

Так же будет интересно почитать

Сайт использует cookies
Узнать подробнее