8 800 500-99-26 Для звонков по России
Samsung CMM-D: как CXL-память разгружает VRAM GPU
Железо
2 мин

Samsung CMM-D: как CXL-память разгружает VRAM GPU

DigitalRazor
DigitalRazor
Подписаться в Telegram
Содержание 4 раздела
Краткое содержание Что именно проверяла Samsung Почему это важно для инференса, а не только для теста Что учесть до продакшена
Подберём сервер под вашу задачу

Подберём конфигурацию сервера и отправим предложение.

Смотреть серверы
или свяжитесь с нами
Telegram Telegram WhatsApp WhatsApp ВКонтакте ВКонтакте MAX MAX

Подберём сервер под задачи

Ответьте на несколько вопросов — подготовим предложение

Samsung проверила на практике идею: можно ли заменить часть DRAM пулом CXL-памяти без потери скорости. Модули CMM-D объединили в пул на 1 терабайт и подключили через коммутатор PCIe Gen 5 к восьми ускорителям NVIDIA RTX PRO 6000 Blackwell. Результат — просадка около 8% при кратно большей ёмкости под кеш KV-cache для инференса больших языковых моделей.

Краткое содержание

  • CMM-D — модули DRAM с интерфейсом CXL, объединяются в общий пул через коммутатор PCIe Gen 5;
  • тест на восьми NVIDIA RTX PRO 6000 Blackwell: пул на 1 терабайт против 512 гигабайт DRAM;
  • при полной нагрузке всех восьми GPU производительность держится на уровне около 92% от DRAM;
  • решает нехватку памяти под KV-cache при длинном контексте и множестве сессий инференса.

Что именно проверяла Samsung

Речь о технологии KV-cache offload — переносе кеша ключей и значений трансформерной модели из видеопамяти GPU в более дешёвую и ёмкую память. Обычно для этого используют системную DRAM. Но её объём в сервере жёстко ограничен платформой процессора. Samsung подключила модули CMM-D через коммутатор CXL на шине PCIe Gen 5 и собрала пул на 1 терабайт — вдвое больше, чем 512 гигабайт DRAM в контрольной конфигурации. Программный стек — vLLM и LMCache, обычный выбор для продакшен-инференса. На одном GPU пул CMM-D показал результат на уровне DRAM. При загрузке всех восьми — просел до 92% от DRAM, что для памяти, вынесенной на отдельную шину, можно считать хорошим результатом.

Почему это важно для инференса, а не только для теста

Проблема с KV-cache в том, что он растёт вместе с длиной контекста и числом параллельных запросов. И довольно быстро упирается в объём DRAM. Когда кеш не помещается, система вынуждена пересчитывать часть контекста заново — а это прямая просадка задержки и пропускной способности на нагруженном сервере. CXL-пул снимает этот потолок: ёмкость наращивается модулями памяти, а не покупкой дополнительных GPU ради их видеопамяти. Для сервиса с длинным контекстом и множеством одновременных сессий — чат-боты, RAG, агентные системы — это способ держать больше активных диалогов на той же партии ускорителей.

Что учесть до продакшена

Пока это лабораторный тест самого производителя памяти, а не серийная платформа. Нужен сервер с поддержкой CXL и коммутатором на шине PCIe Gen 5 или новее. Массовая поддержка CXL 3.0 придёт вместе с новыми платформами: у AMD это уже выходящий на рынок EPYC Venice, у Intel — Diamond Rapids, который ожидается в 2027 году. До их широкого распространения пул CMM-D остаётся решением для избранных платформ и требует отдельной проверки совместимости с конкретным сервером и версией прошивки коммутатора.

Мнение DigitalRazor

Идея разгрузки KV-cache через CXL-память интересна прежде всего тем, кто упирается в объём DRAM при длинном контексте, а не в вычислительную мощность GPU. Пока это не массовая технология: закладывать её в проект стоит только вместе с проверкой конкретной платформы и коммутатора CXL. Присматриваться к ней вплотную стоит по мере распространения EPYC Venice и с выходом Diamond Rapids в 2027 году — тогда поддержка CXL 3.0 станет стандартом, а не опцией.

Для каких задач Компактный GPU-сервер до 2 видеокарт для начальных задач в AI и графике. Оптимален для инференса, визуализации, VFX и рендеринга в студиях и лабораториях, где важна гибкость.
Подробнее
Видеокарты
RTX / RTX PRO / H200 NVL
Объем видеопамяти до 282 ГБ
Процессоры
Threadripper PRO
Количество ядер до 96
RAM до 1024 ГБ DDR5
Форм-фактор 4.5U
Для каких задач Универсальная платформа на 4–6 GPU для локального обучения моделей и генеративных задач. Подходит для команд, которым важна надёжность сервера и свобода выбора графики — от RTX 5090 до PRO RTX 6000.
Подробнее
Видеокарты
RTX / RTX PRO / H200 NVL
Объем видеопамяти до 576 ГБ
Процессоры
Threadripper PRO
Количество ядер до 96
RAM до 1024 ГБ DDR5
Форм-фактор 6.5U
Для каких задач Сервер промышленного уровня на 8 GPU с кластерной архитектурой. Предназначен для дата-центров и AI-ферм, где требуется масштабируемость и полная загрузка ресурсов под обучение LLM и R&D.
Подробнее
Видеокарты
RTX PRO 6000 / RTX 5090
Объем видеопамяти до 768 ГБ
Процессоры
AMD Epyc, Intel Xeon
Количество ядер до 320
RAM до 3072 ГБ DDR5
Форм-фактор 6U
Для каких задач Серия серверов для кластеризации на 4 GPU. Предназначены для дата-центров и AI-ферм, где требуется повышенная плотность для обучение LLM и R&D.
Подробнее
Видеокарты
L40s / RTX PRO / H200 NVL
Объем видеопамяти до 564 ГБ
Процессоры
AMD EPYC, Intel Xeon
Количество ядер до 128
RAM до 1536 ГБ DDR5
Форм-фактор 2U
Для каких задач Серия серверов для кластеризации на 8 GPU. Предназначены для дата-центров и AI-ферм, где требуется повышенная плотность для обучение LLM и R&D.
Подробнее
Видеокарты
L40s / RTX PRO / H200 NVL
Объем видеопамяти до 1128 ГБ
Процессоры
AMD EPYC, Intel Xeon
Количество ядер до 256
RAM до 2048 ГБ DDR5
Форм-фактор 4U
Для каких задач HGX объединяет 8 видеокарт NVIDIA H200, достигая экстремальной плотности производительности. Благодаря внутренней связности NVSwitch мгновенно интегрируется в масштабные вычислительные кластеры.
Подробнее
Видеокарты
NVIDIA H200 SXM
Объем видеопамяти до 1128 ГБ
Процессоры
AMD EPYC, Intel Xeon
Количество ядер до 256
RAM до 2048 ГБ DDR5
Форм-фактор 5U
Подберём сервер под вашу задачу

Подберём конфигурацию сервера и отправим предложение.

Смотреть серверы
или свяжитесь с нами
Telegram Telegram WhatsApp WhatsApp ВКонтакте ВКонтакте MAX MAX
10К

Так же будет интересно почитать

Сайт использует cookies
Узнать подробнее