
Xcena MX1: вычисления внутри модуля памяти
Подберём сервер под задачи
Ответьте на несколько вопросов — подготовим предложение
Южнокорейский стартап Xcena показал MX1 — модули памяти со встроенными вычислениями для инференса больших языковых моделей. Внутри модуля DDR5 расположены 2048 ядер RISC-V, которые обрабатывают данные прямо на месте хранения — это разгружает GPU и CPU и снимает часть нагрузки с дорогой и дефицитной HBM.
Краткое содержание
- MX1 Compute — 2048 ядер RISC-V, четыре слота DDR5, интерфейсы CXL 3.2 и PCIe 6.0;
- MX1 Expand — восемь слотов DDR5, модуль для расширения общего пула памяти;
- технология Near Data Processing считает данные без пересылки в CPU или GPU;
- задача — предобработка данных и управление KV-кэшем при инференсе.
Как устроены вычисления рядом с памятью
В обычном сервере данные всё время путешествуют: из памяти — в процессор или ускоритель, посчитались — обратно в память. При больших контекстных окнах и растущем KV-кэше этот трафик становится узким местом сам по себе, а GPU тратит такты не на инференс, а на ожидание данных. MX1 переворачивает схему: вычислительные ядра стоят прямо рядом с чипами DDR5, в том же модуле. Предобработку и часть операций с KV-кэшем можно выполнить, не гоняя данные через шину к центральному процессору или ускорителю. Это не замена HBM по скорости: задержка обычной DDR5-памяти выше, чем у памяти на подложке ускорителя. Смысл MX1 в другом — снять с GPU рутинные операции, для которых такая скорость просто не нужна.
MX1 Compute и MX1 Expand — разные роли
В линейке два устройства с разными задачами. MX1 Compute — активный узел с 2048 ядрами RISC-V и четырьмя слотами DDR5, он и считает, и хранит. MX1 Expand — исключительно про объём: восемь слотов DDR5 без собственных вычислительных ядер, для наращивания общего пула памяти в стойке через CXL. Вместе они формируют масштабируемый пул, к которому через CXL 3.2 и PCIe 6.0 обращаются несколько ускорителей сразу — не отдельная память под каждый GPU, а общий ресурс. Идея вписывается в более широкий тренд: память как отдельный пулируемый ресурс стойки через CXL уже продвигают и другие игроки, от Panmnesia до Astera Labs, каждый со своей архитектурой.
Кому это может пригодиться
В первую очередь — операторам, которым уже не хватает HBM на ускорителях при длинных контекстных окнах и агентных сценариях: там KV-кэш растёт быстрее, чем успевает освобождаться, и часть этой нагрузки логично снять с GPU. Для классического инференса коротких запросов выигрыш будет куда скромнее — там узкое место обычно не память, а сама вычислительная мощность ускорителя.
Что настораживает: стартап и сроки
Xcena — молодая компания: в мае 2026 года она привлекла 135 миллионов долларов раунда серии B при оценке 570 миллионов долларов, а всего с момента основания собрала 185 миллионов. Массовое производство MX1 запланировано на конец года, а выручку компания ждёт не раньше 2027-го. Это значит, что перед вами решение без многолетней истории эксплуатации в проде — и оно требует платформы с поддержкой CXL 3.2 и PCIe 6.0, которая пока есть далеко не в каждом серверном парке. О ценах и каналах поставок в Россию компания пока не говорит вообще.
Мнение DigitalRazor
Идея разгрузить GPU от рутины вроде управления KV-кэшем выглядит логично на фоне цен и дефицита HBM. Но это решение для новых платформ с CXL 3.2 и PCIe 6.0, и закладывать его в проект стоит только после проверки совместимости с конкретным сервером. Для парков, где уже стоит HBM-инфраструктура, разумнее дождаться первых независимых тестов производительности — обещания стартапа и цифры в проде обычно расходятся.













