8 800 500-99-26 Для звонков по России
VAST Data и AMD: хранилище ускоряет инференс в 9 раз
Железо
3 мин

VAST Data и AMD: хранилище ускоряет инференс в 9 раз

DigitalRazor
DigitalRazor
Подписаться в Telegram
Содержание 4 раздела
Краткое содержание Что меняется: KV-кеш переезжает на СХД Не только под NVIDIA: снимаем привязку к одному вендору GPU Цифры от вендора и сроки платформы Venice
Подберём сервер под вашу задачу

Подберём конфигурацию сервера и отправим предложение.

Смотреть серверы
или свяжитесь с нами
Telegram Telegram WhatsApp WhatsApp ВКонтакте ВКонтакте MAX MAX

Подберём сервер под задачи

Ответьте на несколько вопросов — подготовим предложение

VAST Data расширила партнёрство с AMD: платформа VAST AI OS теперь строится на процессорах EPYC 6-го поколения (Venice), ускорителях Instinct MI355X и сетевых картах Pensando Pollara 400. В тестах с выгрузкой KV-кеша на СХД время до первого токена сократилось в девять раз, а пропускная способность по токенам выросла почти в десять раз.

Краткое содержание

  • платформы CBox 6-го поколения и EBox 3-го поколения переходят на EPYC Venice с поддержкой PCIe 6.0;
  • связка с Instinct MI355X, AMD Infinity Context и ROCm выгружает KV-кеш инференса на СХД вместо памяти GPU;
  • в тестах VAST — ускорение времени до первого токена в 9 раз и рост токенов в секунду в 9,7 раза;
  • сетевая часть — карты AMD Pensando Pollara 400, эталонная архитектура развёрнута вместе с DriveNets.

Что меняется: KV-кеш переезжает на СХД

При длинном контексте и агентных сценариях именно KV-кеш — промежуточные данные об уже обработанных токенах — съедает память ускорителя быстрее всего: чем длиннее диалог или цепочка рассуждений модели, тем больше видеопамяти уходит не на веса модели, а на этот кеш. VAST предлагает выгружать его на быструю СХД по сети и подтягивать обратно по мере необходимости. Так GPU получает свободную память под большее число параллельных запросов, и растёт число токенов в секунду при высокой конкурентной нагрузке: на первое место выходит не сырая мощность ускорителя, а то, сколько запросов одновременно помещается в его память. Речь не только о чат-ботах: агентные конвейеры, где модель по многу раз обращается к инструментам и держит в памяти историю всех вызовов, растят KV-кеш ещё быстрее диалоговых сценариев — именно там выгрузка на СХД даёт наибольший эффект.

Не только под NVIDIA: снимаем привязку к одному вендору GPU

До сих пор VAST была известна прежде всего партнёрствами вокруг NVIDIA — BlueField, Cisco, Supermicro. Соглашение с AMD добавляет второй независимый маршрут: один и тот же AI OS с одной и той же логикой кеширования работает и на инфраструктуре NVIDIA, и на связке EPYC плюс Instinct. Для интегратора и корпоративного заказчика это конкретная развилка при выборе платформы — переход на ускорители AMD больше не означает отказ от уже освоенного программного стека для хранения и подготовки данных.

Цифры от вендора и сроки платформы Venice

Цифры в 9 и 9,7 раза — результат тестов самой VAST, а не независимой лаборатории, и получены на конкретной конфигурации с MI355X. Переносить их напрямую на свой профиль нагрузки не стоит: выгода зависит от длины контекста, доли повторных запросов и скорости сети до СХД. Дополнительный нюанс: чтобы получить заявленное удвоение пропускной способности ввода-вывода через PCIe 6.0, нужна вся платформа именно на EPYC 6-го поколения целиком, а не отдельные карты, добавленные в серверы на Turin. Дату отгрузки серверов на EPYC Venice под вашу конфигурацию стоит уточнять у поставщика отдельно: часть линеек 6-го поколения EPYC выходит на рынок позже флагманской.

Мнение DigitalRazor

Для заказчиков, уже собравших парк на ускорителях AMD Instinct, партнёрство VAST и AMD снимает вопрос совместимости на уровне хранения — можно наращивать инференс-мощности без пересборки стека данных. Тем, кто выбирает платформу с нуля, стоит просить у интегратора собственный тест на профильной нагрузке, а не опираться на цифры пресс-релиза: девятикратное ускорение — это верхняя граница, а не гарантия.

Для каких задач Компактный GPU-сервер до 2 видеокарт для начальных задач в AI и графике. Оптимален для инференса, визуализации, VFX и рендеринга в студиях и лабораториях, где важна гибкость.
Подробнее
Видеокарты
RTX / RTX PRO / H200 NVL
Объем видеопамяти до 282 ГБ
Процессоры
Threadripper PRO
Количество ядер до 96
RAM до 1024 ГБ DDR5
Форм-фактор 4.5U
Для каких задач Универсальная платформа на 4–6 GPU для локального обучения моделей и генеративных задач. Подходит для команд, которым важна надёжность сервера и свобода выбора графики — от RTX 5090 до PRO RTX 6000.
Подробнее
Видеокарты
RTX / RTX PRO / H200 NVL
Объем видеопамяти до 576 ГБ
Процессоры
Threadripper PRO
Количество ядер до 96
RAM до 1024 ГБ DDR5
Форм-фактор 6.5U
Для каких задач Сервер промышленного уровня на 8 GPU с кластерной архитектурой. Предназначен для дата-центров и AI-ферм, где требуется масштабируемость и полная загрузка ресурсов под обучение LLM и R&D.
Подробнее
Видеокарты
RTX PRO 6000 / RTX 5090
Объем видеопамяти до 768 ГБ
Процессоры
AMD Epyc, Intel Xeon
Количество ядер до 320
RAM до 3072 ГБ DDR5
Форм-фактор 6U
Для каких задач Серия серверов для кластеризации на 4 GPU. Предназначены для дата-центров и AI-ферм, где требуется повышенная плотность для обучение LLM и R&D.
Подробнее
Видеокарты
L40s / RTX PRO / H200 NVL
Объем видеопамяти до 564 ГБ
Процессоры
AMD EPYC, Intel Xeon
Количество ядер до 128
RAM до 1536 ГБ DDR5
Форм-фактор 2U
Для каких задач Серия серверов для кластеризации на 8 GPU. Предназначены для дата-центров и AI-ферм, где требуется повышенная плотность для обучение LLM и R&D.
Подробнее
Видеокарты
L40s / RTX PRO / H200 NVL
Объем видеопамяти до 1128 ГБ
Процессоры
AMD EPYC, Intel Xeon
Количество ядер до 256
RAM до 2048 ГБ DDR5
Форм-фактор 4U
Для каких задач HGX объединяет 8 видеокарт NVIDIA H200, достигая экстремальной плотности производительности. Благодаря внутренней связности NVSwitch мгновенно интегрируется в масштабные вычислительные кластеры.
Подробнее
Видеокарты
NVIDIA H200 SXM
Объем видеопамяти до 1128 ГБ
Процессоры
AMD EPYC, Intel Xeon
Количество ядер до 256
RAM до 2048 ГБ DDR5
Форм-фактор 5U
Подберём сервер под вашу задачу

Подберём конфигурацию сервера и отправим предложение.

Смотреть серверы
или свяжитесь с нами
Telegram Telegram WhatsApp WhatsApp ВКонтакте ВКонтакте MAX MAX
9.3К

Так же будет интересно почитать

Сайт использует cookies
Узнать подробнее