8 800 500-99-26 Для звонков по России
NVIDIA Rubin CPX: ускоритель вернули — с памятью HBM4
Железо
3 мин

NVIDIA Rubin CPX: ускоритель вернули — с памятью HBM4

DigitalRazor
DigitalRazor
Подписаться в Telegram
Содержание 4 раздела
Краткое содержание Зачем разделять GPU на «читающий» и «пишущий» Что изменилось: GDDR7 против HBM4 Что учесть: это пока слух, а не анонс
Подберём сервер под вашу задачу

Подберём конфигурацию сервера и отправим предложение.

Смотреть серверы
или свяжитесь с нами
Telegram Telegram WhatsApp WhatsApp ВКонтакте ВКонтакте MAX MAX

Подберём сервер под задачи

Ответьте на несколько вопросов — подготовим предложение

NVIDIA возвращает в работу ускоритель Rubin CPX. Если верить аналитику Ming-Chi Kuo, чип для «префилла» — обработки входного контекста больших языковых моделей — пересобрали: вместо 128 ГБ дешёвой GDDR7 теперь 168 ГБ HBM4. Полгода назад проект вообще снимали с дорожной карты. Для тех, кто считает бюджет на ИИ-инференс с длинным контекстом, это не косметическая правка.

Краткое содержание

  • Rubin CPX возвращается на дорожную карту NVIDIA с другой памятью — 168 ГБ HBM4 вместо 128 ГБ GDDR7;
  • чип берёт на себя «префилл» (обработку контекста), пока обычные Rubin с 288 ГБ HBM4 генерируют ответ;
  • один узел с восемью ускорителями держит до 1,34 ТБ контекста, системы масштабируются до 256 чипов;
  • производство намечено на первый квартал 2027 года — с оговоркой, что проект уже один раз отменяли.

Зачем разделять GPU на «читающий» и «пишущий»

В инференсе больших моделей есть две разные по характеру фазы. Сначала GPU «читает» весь входной контекст — промпт, документы, историю диалога — и строит из него кеш внимания (KV-кеш). Задача вычислительно тяжёлая, но не особо требовательная к объёму памяти. Затем начинается генерация ответа — токен за токеном, и здесь узкое место уже не вычисления, а пропускная способность памяти и её объём под растущий кеш.

NVIDIA не гонится за одним универсальным чипом: фазы развели по разным GPU. Rubin CPX читает контекст, обычный Rubin с HBM4 генерирует ответ. У каждого своя работа, а не компромисс между двумя.

Что изменилось: GDDR7 против HBM4

Первая версия Rubin CPX, показанная в сентябре 2025 года, ставила на дешёвую и быструю в производстве GDDR7 — экономика имела смысл именно потому, что памяти под префилл нужно меньше, чем под декодирование. Новая версия отказывается от этой логики в пользу HBM4:

  • память: 168 ГБ HBM4 (было 128 ГБ GDDR7);
  • производительность: около 30 PFLOPS в формате NVFP4;
  • кристалл: монолитный, упаковка CoWoS-S или CoWoS-L;
  • видеоблоки: четыре кодера NVENC и четыре декодера NVDEC на чип;
  • конфигурации узлов: от 64 до 256 ускорителей, отдельная стойка MGX вместо совместной с обычными Rubin.

Для сравнения: у обычного Rubin — 288 ГБ HBM4. Разрыв CPX сокращает, но не убирает: чипы по-прежнему разделены на «читающий» и «пишущий», просто теперь оба на HBM4.

Что учесть: это пока слух, а не анонс

Источник всей истории — аналитик поставочной цепочки Ming-Chi Kuo, а не официальное заявление NVIDIA. У его прогнозов неплохая, но не идеальная репутация. Rubin CPX уже один раз попадал на дорожную карту в 2025 году и пропадал из неё полгода спустя. Гарантий нет. Планировать закупки под конкретные 168 ГБ и первый квартал 2027 года рано — эти цифры могут поменяться ещё не раз до официального анонса.

Отдельный вопрос — доступность топовых ИИ-ускорителей NVIDIA на российском рынке: она и так ограничена экспортными режимами, и Rubin CPX вряд ли станет исключением. Для отечественных интеграторов новость скорее сигнал о направлении архитектуры, чем повод резервировать бюджет под конкретное железо.

Мнение DigitalRazor

Сама идея — развести префилл и декодирование по разным GPU — рациональна и, вероятно, приживётся независимо от судьбы конкретного Rubin CPX: разделённый инференс (disaggregated serving) уже работает и на связках обычных GPU через vLLM и подобные фреймворки. Мы бы советовали закупщикам смотреть в эту сторону при проектировании инференс-кластеров уже сейчас, не дожидаясь конкретного железа под маркой CPX.

Rackstation AI
Для каких задач Компактный GPU-сервер до 2 видеокарт для начальных задач в AI и графике. Оптимален для инференса, визуализации, VFX и рендеринга в студиях и лабораториях, где важна гибкость.
Подробнее
Видеокарты
RTX / RTX PRO / H200 NVL
Объем видеопамяти до 282 ГБ
Процессоры
Threadripper PRO
Количество ядер до 96
RAM до 1024 ГБ DDR5
Форм-фактор 4.5U
Devbox AI
Для каких задач Универсальная платформа на 4–6 GPU для локального обучения моделей и генеративных задач. Подходит для команд, которым важна надёжность сервера и свобода выбора графики — от RTX 5090 до PRO RTX 6000.
Подробнее
Видеокарты
RTX / RTX PRO / H200 NVL
Объем видеопамяти до 576 ГБ
Процессоры
Threadripper PRO
Количество ядер до 96
RAM до 1024 ГБ DDR5
Форм-фактор 6.5U
Scale
Для каких задач Сервер промышленного уровня на 8 GPU с кластерной архитектурой. Предназначен для дата-центров и AI-ферм, где требуется масштабируемость и полная загрузка ресурсов под обучение LLM и R&D.
Подробнее
Видеокарты
RTX PRO 6000 / RTX 5090
Объем видеопамяти до 768 ГБ
Процессоры
AMD Epyc, Intel Xeon
Количество ядер до 320
RAM до 3072 ГБ DDR5
Форм-фактор 6U
HPC 4000
Для каких задач Серия серверов для кластеризации на 4 GPU. Предназначены для дата-центров и AI-ферм, где требуется повышенная плотность для обучение LLM и R&D.
Подробнее
Видеокарты
L40s / RTX PRO / H200 NVL
Объем видеопамяти до 564 ГБ
Процессоры
AMD EPYC, Intel Xeon
Количество ядер до 128
RAM до 1536 ГБ DDR5
Форм-фактор 2U
HPC 8000
Для каких задач Серия серверов для кластеризации на 8 GPU. Предназначены для дата-центров и AI-ферм, где требуется повышенная плотность для обучение LLM и R&D.
Подробнее
Видеокарты
L40s / RTX PRO / H200 NVL
Объем видеопамяти до 1128 ГБ
Процессоры
AMD EPYC, Intel Xeon
Количество ядер до 256
RAM до 2048 ГБ DDR5
Форм-фактор 4U
HGX H200
Для каких задач HGX объединяет 8 видеокарт NVIDIA H200, достигая экстремальной плотности производительности. Благодаря внутренней связности NVSwitch мгновенно интегрируется в масштабные вычислительные кластеры.
Подробнее
Видеокарты
NVIDIA H200 SXM
Объем видеопамяти до 1128 ГБ
Процессоры
AMD EPYC, Intel Xeon
Количество ядер до 256
RAM до 2048 ГБ DDR5
Форм-фактор 5U
Подберём сервер под вашу задачу

Подберём конфигурацию сервера и отправим предложение.

Смотреть серверы
или свяжитесь с нами
Telegram Telegram WhatsApp WhatsApp ВКонтакте ВКонтакте MAX MAX
2.6К

Так же будет интересно почитать

Сайт использует cookies
Узнать подробнее