
DeepSeek V4.1 Flash: обходной манёвр вокруг HBM
Подберём сервер под задачи
Ответьте на несколько вопросов — подготовим предложение
DeepSeek выпустила V4.1 Flash — открытую модель на 748 миллиардов параметров с новой архитектурой памяти Engram. Часть весов теперь можно держать не в видеопамяти GPU, а в обычной системной оперативной памяти или на NVMe. Для инженера это прямой вопрос: сколько ускорителей нужно под инференс и что это даёт по деньгам.
Краткое содержание
- 552 млрд «базовых» параметров MoE плюс 196 млрд в блоке памяти Engram — суммарно 748 млрд;
- на один токен реально работают лишь 8–16 млрд параметров;
- KV-кэш сжат вчетверо, что даёт до восьми раз больше одновременных пользователей на тех же картах;
- полный вес модели в FP8 — от 567 до 763 гигабайт видеопамяти: это сервер на семь-восемь топовых ускорителей, а не рабочая станция.
Архитектура: MoE плюс отдельный блок памяти Engram
V4.1 Flash построена на смеси экспертов: один общий эксперт и 384 маршрутизируемых, на каждый токен активируются шесть из них. Отсюда экономия — обработка запроса задействует 8 млрд параметров, генерация ответа — 16 млрд, хотя «на складе» лежат все 552 млрд. Поверх DeepSeek добавила модуль Engram — ещё 196 млрд параметров, устроенных как таблица поиска по n-граммам, а не как обычные веса сети. Компания прямо говорит: Engram можно вынести за пределы GPU — в системную память или на диск, — потому что доступ к нему не нужен на каждом шаге вычислений. Контекст модели — до миллиона токенов, изображения обрабатывает отдельный модуль DeepSeek-ViT.
Экономика инференса: больше пользователей на той же стойке
Ключевая цифра — снижение объёма KV-кэша: по данным DeepSeek, для того же контекста новой модели нужно вчетверо меньше памяти ускорителя и в восемь раз меньше места на SSD под кэш, чем у предыдущей V4-Flash. На практике одна и та же связка GPU обслуживает в четыре-восемь раз больше параллельных сессий. Но за сами веса платить всё равно приходится: издание The Register оценило полный вес модели в FP8 в 763 гигабайта видеопамяти, если держать всё на ускорителях, и в 567 гигабайт, если вынести блок Engram в системную память. Это уровень сервера на семь-восемь топовых карт по 80 гигабайт каждая — не консьюмерская видеокарта и не рабочая станция с одним ускорителем.
Что учесть при планировании закупки
Модель открыта по лицензии MIT, а на Hugging Face уже выложено больше двадцати квантованных вариантов под llama.cpp, Ollama, LM Studio и Jan — путь для тех, кто готов пожертвовать точностью ради меньшего числа карт. Но в родной точности FP8 «Flash» в названии — про скорость и стоимость токена, а не про размер: под полную модель всё равно нужен серверный парк ускорителей, а не одна-две карты в рабочей станции. С 14 сентября DeepSeek начинает по умолчанию направлять на V4.1 Flash даже запросы к старшей V4-Pro — значит, модель встаёт в продакшен-контур API, и конкурентам придётся считать её референсом по цене за токен.
Мнение DigitalRazor
Для компаний, у которых уже развёрнут парк из семи-восьми топовых ускорителей под инференс, V4.1 Flash — чистая экономия: та же стойка обслужит в разы больше пользователей без докупки железа. Для тех, кто только планирует первую закупку под LLM, входной порог не изменился — нужен полноценный многокарточный сервер, а не одна видеокарта, MIT-лицензия и квантованные сборки лишь смягчают требования для урезанных конфигураций. Рекомендуем считать конфигурацию не по числу параметров модели, а по целевому количеству одновременных пользователей и SLA по задержке.













