
DeepSeek V4-Flash-0731: 13 из 284 млрд — экономика GPU
Подберём сервер под задачи
Ответьте на несколько вопросов — подготовим предложение
DeepSeek обновила флагманскую быструю модель — вышла версия V4-Flash-0731. В тестах на агентные задачи она обходит GLM-5.2 и почти догоняет Claude Opus 4.8, а по индексу интеллекта уступает только GPT-5.6 Luna. При этом из 284 миллиардов параметров на каждый запрос активируется лишь 13 миллиардов — поэтому для инференса не нужен парк из десятков ускорителей.
Краткое содержание
- 284 млрд параметров всего, активны лишь 13 млрд за один проход — архитектура MoE: 43 слоя по 256 экспертов с маршрутизацией top-6;
- в Terminal-Bench 2.1 обходит GLM-5.2 и уступает только Claude Opus 4.8; по индексу интеллекта — второе место после GPT-5.6 Luna;
- контекст — 1 миллион токенов, цена в API — 0,14 доллара за миллион входных и 0,28 доллара за миллион выходных токенов;
- чтобы поднять модель у себя, нужно от ~155 ГБ видеопамяти (NVFP4) до ~570 ГБ (BF16) — заметно меньше, чем у GLM-5.2.
Что изменилось: не архитектура, а обучение
Каркас модели остался прежним — тот же MoE на 43 слоя и 256 экспертов на слой с маршрутизацией top-6, что и в предыдущей версии V4-Flash. Разработчики заново провели пост-тренинг с нуля, и это заметно подняло агентные возможности: модель увереннее держит многочасовые автономные сессии, работает с инструментами и справляется с длинным контекстом до миллиона токенов.
- Terminal-Bench 2.1 — 81,0 балла (у Claude Opus 4.8 — 85,0, лучший результат);
- агентный тест — 25,2 балла против 25,7 у Claude Opus 4.8;
- рейтинг по коду — 1559 баллов, между Kimi K3 (1687) и GLM-5.2 (1510);
- индекс интеллекта — 50 баллов, второе место после GPT-5.6 Luna (51).
Сколько видеопамяти нужно на самом деле
Считаем по «железному» счёту. Видеопамять нужна под все 284 миллиарда параметров — модель хранит их целиком, даже если на каждый запрос включается только 13 миллиардов. В восьмибитном формате FP8 это около 284 ГБ, в BF16 без квантования — около 570 ГБ, а при агрессивном сжатии NVFP4 хватит порядка 155 ГБ.
На практике BF16-версия целиком помещается в обычный сервер с восемью ускорителями по 80 ГБ — суммарно 640 ГБ, с запасом под контекст и KV-кэш. Для сравнения: открытая GLM-5.2 (753 млрд параметров) в BF16 требует около 1,5 терабайта, а Nemotron 3 Ultra (550 млрд) — около 1,1 терабайта. V4-Flash-0731 заметно легче обеих и укладывается в один стандартный узел, а не в кластер из нескольких серверов.
Обновление, а не новое поколение — и дефицит старших карт
Это не новая модель, а тот же V4-Flash после повторного пост-тренинга: архитектура и число параметров не изменились, требования к железу — тоже. Прирост в качестве агентных сценариев не снижает нагрузку на видеопамять. Второй момент: веса открыты, но старшие ускорители вроде H100 и H200 в Россию идут только параллельным импортом — с наценкой и непредсказуемыми сроками. Для конфигурации на ~155 ГБ хватит и карт попроще, только агрессивное квантование NVFP4 стоит сначала проверить на своих задачах: просадка качества иногда заметна.
Мнение DigitalRazor
Для компаний, у которых уже есть сервер с восемью ускорителями по 80 ГБ, V4-Flash-0731 — редкий случай: топовая открытая модель влезает в BF16 без квантования и докупки железа. На менее мощных площадках разумный путь — NVFP4 на двух-трёх картах, но с обязательным тестом качества под свою задачу перед продакшеном. Если сценарий — долгие агентные сессии с инструментами, сравните эту версию со старым V4-Flash: разница в поведении заметнее, чем в цифрах бенчмарков.













