8 800 500-99-26 Для звонков по России
AMD Instinct MI455X: CDNA 5 меняет чип под инференс
Железо
3 мин

AMD Instinct MI455X: CDNA 5 меняет чип под инференс

DigitalRazor
DigitalRazor
Подписаться в Telegram
Содержание 4 раздела
Краткое содержание Что изменилось в цифрах Wave32 и Work Group Processor: чип пересобрали под инференс Что уточнить перед заказом
Подберём сервер под вашу задачу

Подберём конфигурацию сервера и отправим предложение.

Смотреть серверы
или свяжитесь с нами
Telegram Telegram WhatsApp WhatsApp ВКонтакте ВКонтакте MAX MAX

Подберём сервер под задачи

Ответьте на несколько вопросов — подготовим предложение

AMD раскрыла архитектурные подробности Instinct MI455X — первого ускорителя на CDNA 5, самой заметной переработке серверной GPU-архитектуры компании за десять лет. Чип получил 12 стеков HBM4, техпроцесс TSMC N2 и логику, заточенную под инференс больших моделей, а не только под бенчмарки. Для закупщика ИИ-инфраструктуры это значит: борьба с NVIDIA перешла на уровень архитектуры кристалла.

Краткое содержание

  • CDNA 5 — первая за десять лет глубокая переработка архитектуры Instinct, техпроцесс TSMC N2 (2 нм), 320 миллиардов транзисторов;
  • 12 стеков HBM4 дают 432 ГБ памяти на чип и 23,3 ТБ/с полосы — почти втрое больше, чем у MI355X;
  • базовый вычислительный блок переименован в Work Group Processor, ширина волны снижена до 32 потоков — расчёт на инференс, а не на HPC-нагрузки;
  • пиковая производительность — свыше 40 PFLOPS в FP4, но точный теплопакет чипа AMD пока не раскрывает.

Что изменилось в цифрах

Главный скачок — в тензорных операциях и памяти, а не в «сырой» векторной мощности: там прирост скромнее, зато то, что критично для инференса, выросло в разы.

  • до 40+ PFLOPS FP4 и 20 PFLOPS FP6/FP8 — рост в 4 раза к MI355X;
  • 315 TFLOPS FP32/FP16 — рост примерно в 2 раза;
  • 432 ГБ HBM4 на 12 стеках (против восьми у MI355X), 23,3 ТБ/с полосы — рост в 2,9 раза;
  • 3,6 ТБ/с — интерконнект Ultra Accelerator Link; техпроцесс TSMC N2, 320 миллиардов транзисторов (+72% к прошлому поколению).

Wave32 и Work Group Processor: чип пересобрали под инференс

Помимо цифр AMD поменяла саму логику работы кристалла. Базовый строительный блок, который раньше назывался Compute Unit, теперь называется Work Group Processor — не просто ребрендинг, а перестройка внутренней организации ядра. Ширина волны (wavefront) уменьшена с 64 до 32 потоков — так называемый Wave32: меньше задержки на уровне инструкций, меньше потери на ветвлениях и нагрузка на регистровый файл. Для тренировочных HPC-нагрузок с широкими однородными вычислениями выгоднее были широкие волны. А для инференса с его ветвлением, переменной длиной запросов и агентными сценариями быстрее реагируют как раз компактные волны.

Изменился и путь данных: блок TDM теперь переносит данные из DRAM сразу в LDS-кеш вычислительного блока, минуя промежуточные уровни кеша, а память получила поддержку мультикаста при чтении — несколько блоков одновременно получают одни и те же веса без дублирующих запросов. Для инференса крупных MoE-моделей, где одни и те же веса нужны параллельно множеству блоков, это прямая экономия полосы и задержки.

Что уточнить перед заказом

Точный теплопакет MI455X AMD не раскрыла — по независимым оценкам, речь о более чем 2 кВт на карту, а компоновка Helios предполагает четыре ускорителя на один вычислительный лоток. Это жидкостное охлаждение и рост плотности в стойке, которые не впишутся в существующий зал без пересчёта питания и контура охлаждения. Второй момент — программная зрелость: AMD опубликовала ISA-документацию CDNA 5 и обещает поддержку через открытые драйверы AMDGPU/AMDKFD и стек ROCm в основной ветке Linux, но экосистема инференс-фреймворков вокруг CUDA у NVIDIA пока обкатана заметно дольше.

Мнение DigitalRazor

MI455X — это прежде всего заявка на архитектурное лидерство в инференсе, а не готовое решение «поставили и работает» в любой стойке. Для крупных ИИ-проектов на десятках ускорителей присматриваться к CDNA 5 стоит уже сейчас, особенно если в планах — MoE-модели с большим числом одновременных запросов. Но перед заказом мы всегда считаем реальный теплопакет и совместимость с контуром охлаждения: цифры из презентации и то, что действительно впишется в вашу инфраструктуру, не всегда совпадают.

Для каких задач Компактный GPU-сервер до 2 видеокарт для начальных задач в AI и графике. Оптимален для инференса, визуализации, VFX и рендеринга в студиях и лабораториях, где важна гибкость.
Подробнее
Видеокарты
RTX / RTX PRO / H200 NVL
Объем видеопамяти до 282 ГБ
Процессоры
Threadripper PRO
Количество ядер до 96
RAM до 1024 ГБ DDR5
Форм-фактор 4.5U
Для каких задач Универсальная платформа на 4–6 GPU для локального обучения моделей и генеративных задач. Подходит для команд, которым важна надёжность сервера и свобода выбора графики — от RTX 5090 до PRO RTX 6000.
Подробнее
Видеокарты
RTX / RTX PRO / H200 NVL
Объем видеопамяти до 576 ГБ
Процессоры
Threadripper PRO
Количество ядер до 96
RAM до 1024 ГБ DDR5
Форм-фактор 6.5U
Для каких задач Сервер промышленного уровня на 8 GPU с кластерной архитектурой. Предназначен для дата-центров и AI-ферм, где требуется масштабируемость и полная загрузка ресурсов под обучение LLM и R&D.
Подробнее
Видеокарты
RTX PRO 6000 / RTX 5090
Объем видеопамяти до 768 ГБ
Процессоры
AMD Epyc, Intel Xeon
Количество ядер до 320
RAM до 3072 ГБ DDR5
Форм-фактор 6U
Для каких задач Серия серверов для кластеризации на 4 GPU. Предназначены для дата-центров и AI-ферм, где требуется повышенная плотность для обучение LLM и R&D.
Подробнее
Видеокарты
L40s / RTX PRO / H200 NVL
Объем видеопамяти до 564 ГБ
Процессоры
AMD EPYC, Intel Xeon
Количество ядер до 128
RAM до 1536 ГБ DDR5
Форм-фактор 2U
Для каких задач Серия серверов для кластеризации на 8 GPU. Предназначены для дата-центров и AI-ферм, где требуется повышенная плотность для обучение LLM и R&D.
Подробнее
Видеокарты
L40s / RTX PRO / H200 NVL
Объем видеопамяти до 1128 ГБ
Процессоры
AMD EPYC, Intel Xeon
Количество ядер до 256
RAM до 2048 ГБ DDR5
Форм-фактор 4U
Для каких задач HGX объединяет 8 видеокарт NVIDIA H200, достигая экстремальной плотности производительности. Благодаря внутренней связности NVSwitch мгновенно интегрируется в масштабные вычислительные кластеры.
Подробнее
Видеокарты
NVIDIA H200 SXM
Объем видеопамяти до 1128 ГБ
Процессоры
AMD EPYC, Intel Xeon
Количество ядер до 256
RAM до 2048 ГБ DDR5
Форм-фактор 5U
Подберём сервер под вашу задачу

Подберём конфигурацию сервера и отправим предложение.

Смотреть серверы
или свяжитесь с нами
Telegram Telegram WhatsApp WhatsApp ВКонтакте ВКонтакте MAX MAX

Так же будет интересно почитать

Сайт использует cookies
Узнать подробнее