8 800 500-99-26 Для звонков по России
DeepSeek V4.1 Flash: обходной манёвр вокруг HBM
Железо
3 мин

DeepSeek V4.1 Flash: обходной манёвр вокруг HBM

DigitalRazor
DigitalRazor
Подписаться в Telegram
Содержание 4 раздела
Краткое содержание Архитектура: MoE плюс отдельный блок памяти Engram Экономика инференса: больше пользователей на той же стойке Что учесть при планировании закупки
Подберём сервер под вашу задачу

Подберём конфигурацию сервера и отправим предложение.

Смотреть серверы
или свяжитесь с нами
Telegram Telegram WhatsApp WhatsApp ВКонтакте ВКонтакте MAX MAX

Подберём сервер под задачи

Ответьте на несколько вопросов — подготовим предложение

DeepSeek выпустила V4.1 Flash — открытую модель на 748 миллиардов параметров с новой архитектурой памяти Engram. Часть весов теперь можно держать не в видеопамяти GPU, а в обычной системной оперативной памяти или на NVMe. Для инженера это прямой вопрос: сколько ускорителей нужно под инференс и что это даёт по деньгам.

Краткое содержание

  • 552 млрд «базовых» параметров MoE плюс 196 млрд в блоке памяти Engram — суммарно 748 млрд;
  • на один токен реально работают лишь 8–16 млрд параметров;
  • KV-кэш сжат вчетверо, что даёт до восьми раз больше одновременных пользователей на тех же картах;
  • полный вес модели в FP8 — от 567 до 763 гигабайт видеопамяти: это сервер на семь-восемь топовых ускорителей, а не рабочая станция.

Архитектура: MoE плюс отдельный блок памяти Engram

V4.1 Flash построена на смеси экспертов: один общий эксперт и 384 маршрутизируемых, на каждый токен активируются шесть из них. Отсюда экономия — обработка запроса задействует 8 млрд параметров, генерация ответа — 16 млрд, хотя «на складе» лежат все 552 млрд. Поверх DeepSeek добавила модуль Engram — ещё 196 млрд параметров, устроенных как таблица поиска по n-граммам, а не как обычные веса сети. Компания прямо говорит: Engram можно вынести за пределы GPU — в системную память или на диск, — потому что доступ к нему не нужен на каждом шаге вычислений. Контекст модели — до миллиона токенов, изображения обрабатывает отдельный модуль DeepSeek-ViT.

Экономика инференса: больше пользователей на той же стойке

Ключевая цифра — снижение объёма KV-кэша: по данным DeepSeek, для того же контекста новой модели нужно вчетверо меньше памяти ускорителя и в восемь раз меньше места на SSD под кэш, чем у предыдущей V4-Flash. На практике одна и та же связка GPU обслуживает в четыре-восемь раз больше параллельных сессий. Но за сами веса платить всё равно приходится: издание The Register оценило полный вес модели в FP8 в 763 гигабайта видеопамяти, если держать всё на ускорителях, и в 567 гигабайт, если вынести блок Engram в системную память. Это уровень сервера на семь-восемь топовых карт по 80 гигабайт каждая — не консьюмерская видеокарта и не рабочая станция с одним ускорителем.

Что учесть при планировании закупки

Модель открыта по лицензии MIT, а на Hugging Face уже выложено больше двадцати квантованных вариантов под llama.cpp, Ollama, LM Studio и Jan — путь для тех, кто готов пожертвовать точностью ради меньшего числа карт. Но в родной точности FP8 «Flash» в названии — про скорость и стоимость токена, а не про размер: под полную модель всё равно нужен серверный парк ускорителей, а не одна-две карты в рабочей станции. С 14 сентября DeepSeek начинает по умолчанию направлять на V4.1 Flash даже запросы к старшей V4-Pro — значит, модель встаёт в продакшен-контур API, и конкурентам придётся считать её референсом по цене за токен.

Мнение DigitalRazor

Для компаний, у которых уже развёрнут парк из семи-восьми топовых ускорителей под инференс, V4.1 Flash — чистая экономия: та же стойка обслужит в разы больше пользователей без докупки железа. Для тех, кто только планирует первую закупку под LLM, входной порог не изменился — нужен полноценный многокарточный сервер, а не одна видеокарта, MIT-лицензия и квантованные сборки лишь смягчают требования для урезанных конфигураций. Рекомендуем считать конфигурацию не по числу параметров модели, а по целевому количеству одновременных пользователей и SLA по задержке.

Rackstation AI
Для каких задач Компактный GPU-сервер до 2 видеокарт для начальных задач в AI и графике. Оптимален для инференса, визуализации, VFX и рендеринга в студиях и лабораториях, где важна гибкость.
Подробнее
Видеокарты
RTX / RTX PRO / H200 NVL
Объем видеопамяти до 282 ГБ
Процессоры
Threadripper PRO
Количество ядер до 96
RAM до 1024 ГБ DDR5
Форм-фактор 4.5U
Devbox AI
Для каких задач Универсальная платформа на 4–6 GPU для локального обучения моделей и генеративных задач. Подходит для команд, которым важна надёжность сервера и свобода выбора графики — от RTX 5090 до PRO RTX 6000.
Подробнее
Видеокарты
RTX / RTX PRO / H200 NVL
Объем видеопамяти до 576 ГБ
Процессоры
Threadripper PRO
Количество ядер до 96
RAM до 1024 ГБ DDR5
Форм-фактор 6.5U
Scale
Для каких задач Сервер промышленного уровня на 8 GPU с кластерной архитектурой. Предназначен для дата-центров и AI-ферм, где требуется масштабируемость и полная загрузка ресурсов под обучение LLM и R&D.
Подробнее
Видеокарты
RTX PRO 6000 / RTX 5090
Объем видеопамяти до 768 ГБ
Процессоры
AMD Epyc, Intel Xeon
Количество ядер до 320
RAM до 3072 ГБ DDR5
Форм-фактор 6U
HPC 4000
Для каких задач Серия серверов для кластеризации на 4 GPU. Предназначены для дата-центров и AI-ферм, где требуется повышенная плотность для обучение LLM и R&D.
Подробнее
Видеокарты
L40s / RTX PRO / H200 NVL
Объем видеопамяти до 564 ГБ
Процессоры
AMD EPYC, Intel Xeon
Количество ядер до 128
RAM до 1536 ГБ DDR5
Форм-фактор 2U
HPC 8000
Для каких задач Серия серверов для кластеризации на 8 GPU. Предназначены для дата-центров и AI-ферм, где требуется повышенная плотность для обучение LLM и R&D.
Подробнее
Видеокарты
L40s / RTX PRO / H200 NVL
Объем видеопамяти до 1128 ГБ
Процессоры
AMD EPYC, Intel Xeon
Количество ядер до 256
RAM до 2048 ГБ DDR5
Форм-фактор 4U
HGX H200
Для каких задач HGX объединяет 8 видеокарт NVIDIA H200, достигая экстремальной плотности производительности. Благодаря внутренней связности NVSwitch мгновенно интегрируется в масштабные вычислительные кластеры.
Подробнее
Видеокарты
NVIDIA H200 SXM
Объем видеопамяти до 1128 ГБ
Процессоры
AMD EPYC, Intel Xeon
Количество ядер до 256
RAM до 2048 ГБ DDR5
Форм-фактор 5U
Подберём сервер под вашу задачу

Подберём конфигурацию сервера и отправим предложение.

Смотреть серверы
или свяжитесь с нами
Telegram Telegram WhatsApp WhatsApp ВКонтакте ВКонтакте MAX MAX
10.6К

Так же будет интересно почитать

Сайт использует cookies
Узнать подробнее