8 800 500-99-26 Для звонков по России
DeepSeek V4 Flash Vision: на чём поднять 305 млрд
Софт
3 мин

DeepSeek V4 Flash Vision: на чём поднять 305 млрд

DigitalRazor
DigitalRazor
Подписаться в Telegram
Содержание 4 раздела
Краткое содержание Чем модель отличается от текстовой V4-Flash Сколько видеопамяти нужно на практике Что не учтено: контекст и скорость на слабом железе
Подберём сервер под вашу задачу

Подберём конфигурацию сервера и отправим предложение.

Смотреть серверы
или свяжитесь с нами
Telegram Telegram WhatsApp WhatsApp ВКонтакте ВКонтакте MAX MAX

Подберём сервер под задачи

Ответьте на несколько вопросов — подготовим предложение

DeepSeek открыла веса DeepSeek-V4-Flash-Vision-Exp — первой мультимодальной модели в линейке V4-Flash: 305 млрд параметров, из которых на инференсе работают лишь 13 млрд, и контекст почти на миллион токенов. Раньше модель десять дней жила только в закрытом API. Вопрос для бизнеса один — сколько GPU и видеопамяти нужно, чтобы поднять её у себя.

Краткое содержание

  • 305 млрд параметров всего, общая база для текста и зрения — 284 млрд, активны на инференсе лишь 13 млрд (архитектура MoE);
  • контекст 1 048 576 токенов — почти миллион, без потери качества по тексту;
  • модель понимает изображения, PDF, презентации и видео в одном запросе;
  • открытые веса на Hugging Face под лицензией MIT — через десять дней после запуска в закрытом API.

Чем модель отличается от текстовой V4-Flash

Внутри — тот же каркас V4-Flash. Разреженный трансформер: 256 «рабочих» экспертов и один общий, 43 слоя. На каждый токен включаются лишь шесть рабочих экспертов плюс общий — отсюда и разрыв между 305 млрд общей ёмкости и 13 млрд, которые реально считают. Зрение здесь не приклеено отдельным модулем, как в прошлой версии, а вшито в ту же архитектуру и обучено заново вместе с языковой частью.

По тексту модель держит уровень обычной V4-Flash, а по мультимодальным агентным задачам делает заметный скачок: ApexBench Pass@1 вырос с 26,2 до 36,5, Terminal Bench 2.1 — с 82,7 до 83,9. По разбору диаграмм (Chartography, 64,3) модель почти догнала Claude Opus 4.8 (65,0). Веса при этом сразу лежат в формате FP8 — DeepSeek не сжимала модель постфактум, она изначально считается в этой точности.

Сколько видеопамяти нужно на практике

Родной чекпоинт в FP8 весит около 300 ГБ — это не «облегчённая» версия, а рабочий формат, в котором DeepSeek и обучала модель. В BF16, куда обычно переводят модели для дообучения, вес удвоится примерно до 600 ГБ. Сообщество уже выпустило урезанные GGUF-сборки: 4-битный вариант занимает около 155 ГБ.

  • 155 ГБ (4-бит) — влезает в сервер с двумя картами NVIDIA H100 или H200 (по 80–141 ГБ) или в станцию с четырьмя профессиональными картами по 48 ГБ (RTX 6000 Ada, RTX PRO 6000);
  • 300 ГБ (родной FP8) и тем более 600 ГБ (BF16) — это уже уровень отдельного GPU-сервера на четыре-восемь ускорителей;
  • сама DeepSeek в примерах для SGLang разворачивает модель с параллелизмом на четыре GPU — это ориентир для продакшена, не для теста.

Активных параметров на токен всего 13 млрд, поэтому по вычислительной нагрузке модель ведёт себя как GPU среднего размера. Но память нужна под все 305 млрд — экспертов приходится держать в видеопамяти целиком, ведь заранее не известно, какие из них потребуются на следующем токене.

Что не учтено: контекст и скорость на слабом железе

Контекст в 1 048 576 токенов — это не фиксированная добавка к весу модели, а переменная нагрузка: чем длиннее диалог или документ, тем больше памяти уходит под кеш ключей и значений сверх веса самой модели. Планировать закупку по одной только цифре весов — ошибка, если задача подразумевает работу с полным контекстом и картинками.

DeepSeek прямо пишет: конкретная скорость обработки изображений на потребительских картах вроде RTX 4090 зависит от размера визуального энкодера и длины контекста, и эти цифры не раскрыты. Для закупщика это значит одно — тестировать на своей нагрузке до того, как заказывать железо, а не после.

Мнение DigitalRazor

Открытые веса V4-Flash-Vision-Exp — хорошая новость для тех, кто хочет держать мультимодальный ИИ у себя, а не пропускать документы через чужой API. Но экономить на памяти не выйдет: если в работе действительно нужен полный контекст и разбор изображений, берите сервер с двумя-четырьмя GPU по 80 ГБ и выше, а не одну видеокарту. Для разработки и тестов достаточно и урезанной 4-битной сборки на паре карт попроще — DigitalRazor поможет подобрать конфигурацию под конкретную нагрузку.

Rackstation AI
Для каких задач Компактный GPU-сервер до 2 видеокарт для начальных задач в AI и графике. Оптимален для инференса, визуализации, VFX и рендеринга в студиях и лабораториях, где важна гибкость.
Подробнее
Видеокарты
RTX / RTX PRO / H200 NVL
Объем видеопамяти до 282 ГБ
Процессоры
Threadripper PRO
Количество ядер до 96
RAM до 1024 ГБ DDR5
Форм-фактор 4.5U
Devbox AI
Для каких задач Универсальная платформа на 4–6 GPU для локального обучения моделей и генеративных задач. Подходит для команд, которым важна надёжность сервера и свобода выбора графики — от RTX 5090 до PRO RTX 6000.
Подробнее
Видеокарты
RTX / RTX PRO / H200 NVL
Объем видеопамяти до 576 ГБ
Процессоры
Threadripper PRO
Количество ядер до 96
RAM до 1024 ГБ DDR5
Форм-фактор 6.5U
Scale
Для каких задач Сервер промышленного уровня на 8 GPU с кластерной архитектурой. Предназначен для дата-центров и AI-ферм, где требуется масштабируемость и полная загрузка ресурсов под обучение LLM и R&D.
Подробнее
Видеокарты
RTX PRO 6000 / RTX 5090
Объем видеопамяти до 768 ГБ
Процессоры
AMD Epyc, Intel Xeon
Количество ядер до 320
RAM до 3072 ГБ DDR5
Форм-фактор 6U
HPC 4000
Для каких задач Серия серверов для кластеризации на 4 GPU. Предназначены для дата-центров и AI-ферм, где требуется повышенная плотность для обучение LLM и R&D.
Подробнее
Видеокарты
L40s / RTX PRO / H200 NVL
Объем видеопамяти до 564 ГБ
Процессоры
AMD EPYC, Intel Xeon
Количество ядер до 128
RAM до 1536 ГБ DDR5
Форм-фактор 2U
HPC 8000
Для каких задач Серия серверов для кластеризации на 8 GPU. Предназначены для дата-центров и AI-ферм, где требуется повышенная плотность для обучение LLM и R&D.
Подробнее
Видеокарты
L40s / RTX PRO / H200 NVL
Объем видеопамяти до 1128 ГБ
Процессоры
AMD EPYC, Intel Xeon
Количество ядер до 256
RAM до 2048 ГБ DDR5
Форм-фактор 4U
HGX H200
Для каких задач HGX объединяет 8 видеокарт NVIDIA H200, достигая экстремальной плотности производительности. Благодаря внутренней связности NVSwitch мгновенно интегрируется в масштабные вычислительные кластеры.
Подробнее
Видеокарты
NVIDIA H200 SXM
Объем видеопамяти до 1128 ГБ
Процессоры
AMD EPYC, Intel Xeon
Количество ядер до 256
RAM до 2048 ГБ DDR5
Форм-фактор 5U
Подберём сервер под вашу задачу

Подберём конфигурацию сервера и отправим предложение.

Смотреть серверы
или свяжитесь с нами
Telegram Telegram WhatsApp WhatsApp ВКонтакте ВКонтакте MAX MAX
986

Так же будет интересно почитать

Сайт использует cookies
Узнать подробнее