8 800 500-99-26 Для звонков по России
DeepSeek V4-Flash-0731: 13 из 284 млрд — экономика GPU
Софт
3 мин

DeepSeek V4-Flash-0731: 13 из 284 млрд — экономика GPU

DigitalRazor
DigitalRazor
Подписаться в Telegram
Содержание 4 раздела
Краткое содержание Что изменилось: не архитектура, а обучение Сколько видеопамяти нужно на самом деле Обновление, а не новое поколение — и дефицит старших карт
Подберём сервер под вашу задачу

Подберём конфигурацию сервера и отправим предложение.

Смотреть серверы
или свяжитесь с нами
Telegram Telegram WhatsApp WhatsApp ВКонтакте ВКонтакте MAX MAX

Подберём сервер под задачи

Ответьте на несколько вопросов — подготовим предложение

DeepSeek обновила флагманскую быструю модель — вышла версия V4-Flash-0731. В тестах на агентные задачи она обходит GLM-5.2 и почти догоняет Claude Opus 4.8, а по индексу интеллекта уступает только GPT-5.6 Luna. При этом из 284 миллиардов параметров на каждый запрос активируется лишь 13 миллиардов — поэтому для инференса не нужен парк из десятков ускорителей.

Краткое содержание

  • 284 млрд параметров всего, активны лишь 13 млрд за один проход — архитектура MoE: 43 слоя по 256 экспертов с маршрутизацией top-6;
  • в Terminal-Bench 2.1 обходит GLM-5.2 и уступает только Claude Opus 4.8; по индексу интеллекта — второе место после GPT-5.6 Luna;
  • контекст — 1 миллион токенов, цена в API — 0,14 доллара за миллион входных и 0,28 доллара за миллион выходных токенов;
  • чтобы поднять модель у себя, нужно от ~155 ГБ видеопамяти (NVFP4) до ~570 ГБ (BF16) — заметно меньше, чем у GLM-5.2.

Что изменилось: не архитектура, а обучение

Каркас модели остался прежним — тот же MoE на 43 слоя и 256 экспертов на слой с маршрутизацией top-6, что и в предыдущей версии V4-Flash. Разработчики заново провели пост-тренинг с нуля, и это заметно подняло агентные возможности: модель увереннее держит многочасовые автономные сессии, работает с инструментами и справляется с длинным контекстом до миллиона токенов.

  • Terminal-Bench 2.1 — 81,0 балла (у Claude Opus 4.8 — 85,0, лучший результат);
  • агентный тест — 25,2 балла против 25,7 у Claude Opus 4.8;
  • рейтинг по коду — 1559 баллов, между Kimi K3 (1687) и GLM-5.2 (1510);
  • индекс интеллекта — 50 баллов, второе место после GPT-5.6 Luna (51).

Сколько видеопамяти нужно на самом деле

Считаем по «железному» счёту. Видеопамять нужна под все 284 миллиарда параметров — модель хранит их целиком, даже если на каждый запрос включается только 13 миллиардов. В восьмибитном формате FP8 это около 284 ГБ, в BF16 без квантования — около 570 ГБ, а при агрессивном сжатии NVFP4 хватит порядка 155 ГБ.

На практике BF16-версия целиком помещается в обычный сервер с восемью ускорителями по 80 ГБ — суммарно 640 ГБ, с запасом под контекст и KV-кэш. Для сравнения: открытая GLM-5.2 (753 млрд параметров) в BF16 требует около 1,5 терабайта, а Nemotron 3 Ultra (550 млрд) — около 1,1 терабайта. V4-Flash-0731 заметно легче обеих и укладывается в один стандартный узел, а не в кластер из нескольких серверов.

Обновление, а не новое поколение — и дефицит старших карт

Это не новая модель, а тот же V4-Flash после повторного пост-тренинга: архитектура и число параметров не изменились, требования к железу — тоже. Прирост в качестве агентных сценариев не снижает нагрузку на видеопамять. Второй момент: веса открыты, но старшие ускорители вроде H100 и H200 в Россию идут только параллельным импортом — с наценкой и непредсказуемыми сроками. Для конфигурации на ~155 ГБ хватит и карт попроще, только агрессивное квантование NVFP4 стоит сначала проверить на своих задачах: просадка качества иногда заметна.

Мнение DigitalRazor

Для компаний, у которых уже есть сервер с восемью ускорителями по 80 ГБ, V4-Flash-0731 — редкий случай: топовая открытая модель влезает в BF16 без квантования и докупки железа. На менее мощных площадках разумный путь — NVFP4 на двух-трёх картах, но с обязательным тестом качества под свою задачу перед продакшеном. Если сценарий — долгие агентные сессии с инструментами, сравните эту версию со старым V4-Flash: разница в поведении заметнее, чем в цифрах бенчмарков.

Для каких задач Компактный GPU-сервер до 2 видеокарт для начальных задач в AI и графике. Оптимален для инференса, визуализации, VFX и рендеринга в студиях и лабораториях, где важна гибкость.
Подробнее
Видеокарты
RTX / RTX PRO / H200 NVL
Объем видеопамяти до 282 ГБ
Процессоры
Threadripper PRO
Количество ядер до 96
RAM до 1024 ГБ DDR5
Форм-фактор 4.5U
Для каких задач Универсальная платформа на 4–6 GPU для локального обучения моделей и генеративных задач. Подходит для команд, которым важна надёжность сервера и свобода выбора графики — от RTX 5090 до PRO RTX 6000.
Подробнее
Видеокарты
RTX / RTX PRO / H200 NVL
Объем видеопамяти до 576 ГБ
Процессоры
Threadripper PRO
Количество ядер до 96
RAM до 1024 ГБ DDR5
Форм-фактор 6.5U
Для каких задач Сервер промышленного уровня на 8 GPU с кластерной архитектурой. Предназначен для дата-центров и AI-ферм, где требуется масштабируемость и полная загрузка ресурсов под обучение LLM и R&D.
Подробнее
Видеокарты
RTX PRO 6000 / RTX 5090
Объем видеопамяти до 768 ГБ
Процессоры
AMD Epyc, Intel Xeon
Количество ядер до 320
RAM до 3072 ГБ DDR5
Форм-фактор 6U
Для каких задач Серия серверов для кластеризации на 4 GPU. Предназначены для дата-центров и AI-ферм, где требуется повышенная плотность для обучение LLM и R&D.
Подробнее
Видеокарты
L40s / RTX PRO / H200 NVL
Объем видеопамяти до 564 ГБ
Процессоры
AMD EPYC, Intel Xeon
Количество ядер до 128
RAM до 1536 ГБ DDR5
Форм-фактор 2U
Для каких задач Серия серверов для кластеризации на 8 GPU. Предназначены для дата-центров и AI-ферм, где требуется повышенная плотность для обучение LLM и R&D.
Подробнее
Видеокарты
L40s / RTX PRO / H200 NVL
Объем видеопамяти до 1128 ГБ
Процессоры
AMD EPYC, Intel Xeon
Количество ядер до 256
RAM до 2048 ГБ DDR5
Форм-фактор 4U
Для каких задач HGX объединяет 8 видеокарт NVIDIA H200, достигая экстремальной плотности производительности. Благодаря внутренней связности NVSwitch мгновенно интегрируется в масштабные вычислительные кластеры.
Подробнее
Видеокарты
NVIDIA H200 SXM
Объем видеопамяти до 1128 ГБ
Процессоры
AMD EPYC, Intel Xeon
Количество ядер до 256
RAM до 2048 ГБ DDR5
Форм-фактор 5U
Подберём сервер под вашу задачу

Подберём конфигурацию сервера и отправим предложение.

Смотреть серверы
или свяжитесь с нами
Telegram Telegram WhatsApp WhatsApp ВКонтакте ВКонтакте MAX MAX
9.3К

Так же будет интересно почитать

Сайт использует cookies
Узнать подробнее