
DeepSeek V4 Pro: флагман весом почти в терабайт
Подберём сервер под задачи
Ответьте на несколько вопросов — подготовим предложение
DeepSeek объявила о выходе из беты флагманской модели V4-Pro-0813 — 1,7 триллиона параметров с открытыми весами по лицензии MIT. На собственных тестах компания показывает результаты выше Claude Opus 4.8 в агентных и кодерских задачах. Но для бизнеса, который планирует держать модель у себя, а не платить за API, главный вопрос — что нужно из железа, чтобы её вообще запустить.
Краткое содержание
- 1,7 трлн параметров всего, активны только 49 млрд на токен — архитектура смеси экспертов;
- три режима «усилия» (low/high/max) и модуль спекулятивного декодирования DSpark для скорости;
- контекст — до 1 млн токенов в API, для локального запуска в режиме max рекомендуют от 384 000 токенов;
- открытые веса на Hugging Face — контрольная точка весит около 900 Гбайт.
Бенчмарки: обходит Opus 4.8 в кодинге и агентности
На собственном наборе тестов DeepSeek приводит десяток метрик против конкурентов. В Terminal-Bench 2.1 модель набирает 87,9 балла против 85,0 у Claude Opus 4.8, в LiveCodeBench Pass@1 — 93,5, лучший результат среди сравниваемых моделей. В задачах, имитирующих работу автономного агента (DeepSWE, Cybergym), разрыв с Opus 4.8 тоже в пользу DeepSeek. Цифры считает сама компания на своём стенде, независимой проверки пока не было — к таким заявлениям стоит относиться с поправкой на маркетинг, но масштаб модели и открытая лицензия делают её интересной даже без стопроцентного доверия к бенчмаркам.
Сколько GPU нужно, чтобы поднять модель у себя
Официальных рекомендаций по железу DeepSeek не публикует, но вес контрольной точки известен — около 900 Гбайт в родном формате FP8. Восемь ускорителей NVIDIA H100 с 80 Гбайт памяти на карту дают суммарно 640 Гбайт — этого не хватает даже под сами веса, без учёта контекста и промежуточных вычислений. Нужен узел на H200 (141 Гбайт на карту, около 1,1 Тбайт на восемь карт) — и то запас под контекстное окно от 384 000 токенов остаётся минимальным. Попытки сжать модель через 4-битное квантование почти не помогают: по данным сторонних GGUF-сборок, даже урезанная версия весит порядка 850 Гбайт — экономия на уровне погрешности по сравнению с оригиналом.
Кому подходит локальный запуск, а кому — остаться в API
Локальный запуск V4-Pro-0813 — задача для компании с готовым парком серверных GPU или планом на его покупку, а не для команды с одной-двумя картами. При этом с 16 августа DeepSeek поднимает цены на API в пиковые часы — по кешированным входным токенам рост доходит до 12 раз. Для бизнеса с равномерной нагрузкой это повод пересчитать экономику: собственный кластер на H200 может окупиться быстрее, чем кажется на первый взгляд, если запросы идут круглосуточно, а не всплесками.
Мнение DigitalRazor
DeepSeek V4 Pro — сильная модель на бумаге, но открытость не делает развёртывание дешёвым: нужен полноценный сервер на GPU класса H200 с запасом памяти под контекст, а не одна-две видеокарты в серверной. Компаниям с постоянной нагрузкой на инференс имеет смысл посчитать TCO собственного кластера против новых пиковых тарифов API — разница может оказаться в пользу своего железа быстрее, чем кажется. Мы готовы подобрать конфигурацию сервера под конкретный сценарий развёртывания.













