
Samsung CMM-D: как CXL-память разгружает VRAM GPU
Подберём сервер под задачи
Ответьте на несколько вопросов — подготовим предложение
Samsung проверила на практике идею: можно ли заменить часть DRAM пулом CXL-памяти без потери скорости. Модули CMM-D объединили в пул на 1 терабайт и подключили через коммутатор PCIe Gen 5 к восьми ускорителям NVIDIA RTX PRO 6000 Blackwell. Результат — просадка около 8% при кратно большей ёмкости под кеш KV-cache для инференса больших языковых моделей.
Краткое содержание
- CMM-D — модули DRAM с интерфейсом CXL, объединяются в общий пул через коммутатор PCIe Gen 5;
- тест на восьми NVIDIA RTX PRO 6000 Blackwell: пул на 1 терабайт против 512 гигабайт DRAM;
- при полной нагрузке всех восьми GPU производительность держится на уровне около 92% от DRAM;
- решает нехватку памяти под KV-cache при длинном контексте и множестве сессий инференса.
Что именно проверяла Samsung
Речь о технологии KV-cache offload — переносе кеша ключей и значений трансформерной модели из видеопамяти GPU в более дешёвую и ёмкую память. Обычно для этого используют системную DRAM. Но её объём в сервере жёстко ограничен платформой процессора. Samsung подключила модули CMM-D через коммутатор CXL на шине PCIe Gen 5 и собрала пул на 1 терабайт — вдвое больше, чем 512 гигабайт DRAM в контрольной конфигурации. Программный стек — vLLM и LMCache, обычный выбор для продакшен-инференса. На одном GPU пул CMM-D показал результат на уровне DRAM. При загрузке всех восьми — просел до 92% от DRAM, что для памяти, вынесенной на отдельную шину, можно считать хорошим результатом.
Почему это важно для инференса, а не только для теста
Проблема с KV-cache в том, что он растёт вместе с длиной контекста и числом параллельных запросов. И довольно быстро упирается в объём DRAM. Когда кеш не помещается, система вынуждена пересчитывать часть контекста заново — а это прямая просадка задержки и пропускной способности на нагруженном сервере. CXL-пул снимает этот потолок: ёмкость наращивается модулями памяти, а не покупкой дополнительных GPU ради их видеопамяти. Для сервиса с длинным контекстом и множеством одновременных сессий — чат-боты, RAG, агентные системы — это способ держать больше активных диалогов на той же партии ускорителей.
Что учесть до продакшена
Пока это лабораторный тест самого производителя памяти, а не серийная платформа. Нужен сервер с поддержкой CXL и коммутатором на шине PCIe Gen 5 или новее. Массовая поддержка CXL 3.0 придёт вместе с новыми платформами: у AMD это уже выходящий на рынок EPYC Venice, у Intel — Diamond Rapids, который ожидается в 2027 году. До их широкого распространения пул CMM-D остаётся решением для избранных платформ и требует отдельной проверки совместимости с конкретным сервером и версией прошивки коммутатора.
Мнение DigitalRazor
Идея разгрузки KV-cache через CXL-память интересна прежде всего тем, кто упирается в объём DRAM при длинном контексте, а не в вычислительную мощность GPU. Пока это не массовая технология: закладывать её в проект стоит только вместе с проверкой конкретной платформы и коммутатора CXL. Присматриваться к ней вплотную стоит по мере распространения EPYC Venice и с выходом Diamond Rapids в 2027 году — тогда поддержка CXL 3.0 станет стандартом, а не опцией.













