
NVIDIA Rubin CPX: ускоритель вернули — с памятью HBM4
Подберём сервер под задачи
Ответьте на несколько вопросов — подготовим предложение
NVIDIA возвращает в работу ускоритель Rubin CPX. Если верить аналитику Ming-Chi Kuo, чип для «префилла» — обработки входного контекста больших языковых моделей — пересобрали: вместо 128 ГБ дешёвой GDDR7 теперь 168 ГБ HBM4. Полгода назад проект вообще снимали с дорожной карты. Для тех, кто считает бюджет на ИИ-инференс с длинным контекстом, это не косметическая правка.
Краткое содержание
- Rubin CPX возвращается на дорожную карту NVIDIA с другой памятью — 168 ГБ HBM4 вместо 128 ГБ GDDR7;
- чип берёт на себя «префилл» (обработку контекста), пока обычные Rubin с 288 ГБ HBM4 генерируют ответ;
- один узел с восемью ускорителями держит до 1,34 ТБ контекста, системы масштабируются до 256 чипов;
- производство намечено на первый квартал 2027 года — с оговоркой, что проект уже один раз отменяли.
Зачем разделять GPU на «читающий» и «пишущий»
В инференсе больших моделей есть две разные по характеру фазы. Сначала GPU «читает» весь входной контекст — промпт, документы, историю диалога — и строит из него кеш внимания (KV-кеш). Задача вычислительно тяжёлая, но не особо требовательная к объёму памяти. Затем начинается генерация ответа — токен за токеном, и здесь узкое место уже не вычисления, а пропускная способность памяти и её объём под растущий кеш.
NVIDIA не гонится за одним универсальным чипом: фазы развели по разным GPU. Rubin CPX читает контекст, обычный Rubin с HBM4 генерирует ответ. У каждого своя работа, а не компромисс между двумя.
Что изменилось: GDDR7 против HBM4
Первая версия Rubin CPX, показанная в сентябре 2025 года, ставила на дешёвую и быструю в производстве GDDR7 — экономика имела смысл именно потому, что памяти под префилл нужно меньше, чем под декодирование. Новая версия отказывается от этой логики в пользу HBM4:
- память: 168 ГБ HBM4 (было 128 ГБ GDDR7);
- производительность: около 30 PFLOPS в формате NVFP4;
- кристалл: монолитный, упаковка CoWoS-S или CoWoS-L;
- видеоблоки: четыре кодера NVENC и четыре декодера NVDEC на чип;
- конфигурации узлов: от 64 до 256 ускорителей, отдельная стойка MGX вместо совместной с обычными Rubin.
Для сравнения: у обычного Rubin — 288 ГБ HBM4. Разрыв CPX сокращает, но не убирает: чипы по-прежнему разделены на «читающий» и «пишущий», просто теперь оба на HBM4.
Что учесть: это пока слух, а не анонс
Источник всей истории — аналитик поставочной цепочки Ming-Chi Kuo, а не официальное заявление NVIDIA. У его прогнозов неплохая, но не идеальная репутация. Rubin CPX уже один раз попадал на дорожную карту в 2025 году и пропадал из неё полгода спустя. Гарантий нет. Планировать закупки под конкретные 168 ГБ и первый квартал 2027 года рано — эти цифры могут поменяться ещё не раз до официального анонса.
Отдельный вопрос — доступность топовых ИИ-ускорителей NVIDIA на российском рынке: она и так ограничена экспортными режимами, и Rubin CPX вряд ли станет исключением. Для отечественных интеграторов новость скорее сигнал о направлении архитектуры, чем повод резервировать бюджет под конкретное железо.
Мнение DigitalRazor
Сама идея — развести префилл и декодирование по разным GPU — рациональна и, вероятно, приживётся независимо от судьбы конкретного Rubin CPX: разделённый инференс (disaggregated serving) уже работает и на связках обычных GPU через vLLM и подобные фреймворки. Мы бы советовали закупщикам смотреть в эту сторону при проектировании инференс-кластеров уже сейчас, не дожидаясь конкретного железа под маркой CPX.













