
VAST Data и AMD: хранилище ускоряет инференс в 9 раз
Подберём сервер под задачи
Ответьте на несколько вопросов — подготовим предложение
VAST Data расширила партнёрство с AMD: платформа VAST AI OS теперь строится на процессорах EPYC 6-го поколения (Venice), ускорителях Instinct MI355X и сетевых картах Pensando Pollara 400. В тестах с выгрузкой KV-кеша на СХД время до первого токена сократилось в девять раз, а пропускная способность по токенам выросла почти в десять раз.
Краткое содержание
- платформы CBox 6-го поколения и EBox 3-го поколения переходят на EPYC Venice с поддержкой PCIe 6.0;
- связка с Instinct MI355X, AMD Infinity Context и ROCm выгружает KV-кеш инференса на СХД вместо памяти GPU;
- в тестах VAST — ускорение времени до первого токена в 9 раз и рост токенов в секунду в 9,7 раза;
- сетевая часть — карты AMD Pensando Pollara 400, эталонная архитектура развёрнута вместе с DriveNets.
Что меняется: KV-кеш переезжает на СХД
При длинном контексте и агентных сценариях именно KV-кеш — промежуточные данные об уже обработанных токенах — съедает память ускорителя быстрее всего: чем длиннее диалог или цепочка рассуждений модели, тем больше видеопамяти уходит не на веса модели, а на этот кеш. VAST предлагает выгружать его на быструю СХД по сети и подтягивать обратно по мере необходимости. Так GPU получает свободную память под большее число параллельных запросов, и растёт число токенов в секунду при высокой конкурентной нагрузке: на первое место выходит не сырая мощность ускорителя, а то, сколько запросов одновременно помещается в его память. Речь не только о чат-ботах: агентные конвейеры, где модель по многу раз обращается к инструментам и держит в памяти историю всех вызовов, растят KV-кеш ещё быстрее диалоговых сценариев — именно там выгрузка на СХД даёт наибольший эффект.
Не только под NVIDIA: снимаем привязку к одному вендору GPU
До сих пор VAST была известна прежде всего партнёрствами вокруг NVIDIA — BlueField, Cisco, Supermicro. Соглашение с AMD добавляет второй независимый маршрут: один и тот же AI OS с одной и той же логикой кеширования работает и на инфраструктуре NVIDIA, и на связке EPYC плюс Instinct. Для интегратора и корпоративного заказчика это конкретная развилка при выборе платформы — переход на ускорители AMD больше не означает отказ от уже освоенного программного стека для хранения и подготовки данных.
Цифры от вендора и сроки платформы Venice
Цифры в 9 и 9,7 раза — результат тестов самой VAST, а не независимой лаборатории, и получены на конкретной конфигурации с MI355X. Переносить их напрямую на свой профиль нагрузки не стоит: выгода зависит от длины контекста, доли повторных запросов и скорости сети до СХД. Дополнительный нюанс: чтобы получить заявленное удвоение пропускной способности ввода-вывода через PCIe 6.0, нужна вся платформа именно на EPYC 6-го поколения целиком, а не отдельные карты, добавленные в серверы на Turin. Дату отгрузки серверов на EPYC Venice под вашу конфигурацию стоит уточнять у поставщика отдельно: часть линеек 6-го поколения EPYC выходит на рынок позже флагманской.
Мнение DigitalRazor
Для заказчиков, уже собравших парк на ускорителях AMD Instinct, партнёрство VAST и AMD снимает вопрос совместимости на уровне хранения — можно наращивать инференс-мощности без пересборки стека данных. Тем, кто выбирает платформу с нуля, стоит просить у интегратора собственный тест на профильной нагрузке, а не опираться на цифры пресс-релиза: девятикратное ускорение — это верхняя граница, а не гарантия.













