8 800 500-99-26 Для звонков по России
AMD и Cerebras разделили инференс на два движка
Железо
2 мин

AMD и Cerebras разделили инференс на два движка

DigitalRazor
DigitalRazor
Подписаться в Telegram
Содержание 4 раздела
Краткое содержание Зачем делить инференс на два этапа Что это меняет для инференс-инфраструктуры Что пока не проверено независимо
Подберём сервер под вашу задачу

Подберём конфигурацию сервера и отправим предложение.

Смотреть серверы
или свяжитесь с нами
Telegram Telegram WhatsApp WhatsApp ВКонтакте ВКонтакте MAX MAX

Подберём сервер под задачи

Ответьте на несколько вопросов — подготовим предложение

AMD и Cerebras представили совместную платформу для инференса: стойки Helios с ускорителями Instinct MI455X берут на себя обработку запроса и контекста, а чип Cerebras Wafer-Scale Engine отвечает за генерацию токенов. По данным компаний, связка даёт до пяти раз больше токенов на ватт против решения на одном типе чипов — это особенно важно для агентных сценариев и ассистентов с жёсткими требованиями к задержке.

Краткое содержание

  • инференс разбит на два этапа: Helios обрабатывает запрос и контекст, Wafer-Scale Engine генерирует токены;
  • стойка AMD Helios — до 72 ускорителей Instinct MI455X, около 2,9 эксафлопс на FP4 и 31 ТБ памяти HBM4;
  • связка чипов соединена по UALink через Ethernet с совокупной пропускной способностью до 260 ТБ/с;
  • заявлено до 5 раз больше токенов на ватт; первое развёртывание — в облаке Cerebras Cloud во второй половине 2026 года.

Зачем делить инференс на два этапа

Инференс большой модели состоит из двух разных по нагрузке фаз. Сначала система читает запрос и контекст. Это тяжёлая по вычислениям работа, с ней хорошо справляются массивы GPU вроде Instinct MI455X в стойке Helios. Дальше начинается генерация ответа токен за токеном, и тут решает не вычислительная мощность, а скорость доступа к памяти. Для этой фазы AMD и Cerebras подключают Wafer-Scale Engine — чип с памятью SRAM прямо на кристалле, задержка у него минимальна по конструкции. Раньше обе фазы выполнял один и тот же GPU-кластер, и приходилось выбирать: либо пропускная способность, либо задержка.

Что это меняет для инференс-инфраструктуры

Разделение фаз позволяет отдельно масштабировать то, что упирается в разные пределы: докупать GPU-мощность Helios под рост числа запросов и отдельно наращивать Wafer-Scale-ёмкость под требования к задержке, не завязываясь на пропорции одного типа железа. Для агентных систем, голосовых ассистентов и copilot-сценариев, где ответ должен идти без заметной паузы, такая архитектура выглядит логичнее, чем наращивание количества одинаковых GPU в надежде выехать за счёт параллелизма.

Что пока не проверено независимо

Цифра «до 5 раз» — это модельные расчёты AMD Performance Labs и Cerebras на модели Kimi 2.6 на 1 трлн параметров, а не результат независимых тестов на реальной нагрузке заказчика. Готовое решение пока доступно только через облако Cerebras Cloud, а не как оборудование для покупки в свой ЦОД — Cerebras разворачивает стойки Helios прежде всего у себя. Дата старта — вторая половина 2026 года, и до этого момента цена и условия доступа для российских интеграторов остаются открытым вопросом.

Мнение DigitalRazor

Идея развести подготовку контекста и генерацию токенов по разным чипам — правильный вектор для тяжёлых агентных нагрузок, и полезно держать её в поле зрения при планировании инференс-инфраструктуры. Но пока это облачный сервис одного поставщика, а не железо, которое можно поставить в свою стойку, — переносить цифры «5x» на собственные расчёты TCO рано. Реальную выгоду для конкретной нагрузки стоит проверять на своих запросах, а не на модельном тесте вендора.

Для каких задач Компактный GPU-сервер до 2 видеокарт для начальных задач в AI и графике. Оптимален для инференса, визуализации, VFX и рендеринга в студиях и лабораториях, где важна гибкость.
Подробнее
Видеокарты
RTX / RTX PRO / H200 NVL
Объем видеопамяти до 282 ГБ
Процессоры
Threadripper PRO
Количество ядер до 96
RAM до 1024 ГБ DDR5
Форм-фактор 4.5U
Для каких задач Универсальная платформа на 4–6 GPU для локального обучения моделей и генеративных задач. Подходит для команд, которым важна надёжность сервера и свобода выбора графики — от RTX 5090 до PRO RTX 6000.
Подробнее
Видеокарты
RTX / RTX PRO / H200 NVL
Объем видеопамяти до 576 ГБ
Процессоры
Threadripper PRO
Количество ядер до 96
RAM до 1024 ГБ DDR5
Форм-фактор 6.5U
Для каких задач Сервер промышленного уровня на 8 GPU с кластерной архитектурой. Предназначен для дата-центров и AI-ферм, где требуется масштабируемость и полная загрузка ресурсов под обучение LLM и R&D.
Подробнее
Видеокарты
RTX PRO 6000 / RTX 5090
Объем видеопамяти до 768 ГБ
Процессоры
AMD Epyc, Intel Xeon
Количество ядер до 320
RAM до 3072 ГБ DDR5
Форм-фактор 6U
Для каких задач Серия серверов для кластеризации на 4 GPU. Предназначены для дата-центров и AI-ферм, где требуется повышенная плотность для обучение LLM и R&D.
Подробнее
Видеокарты
L40s / RTX PRO / H200 NVL
Объем видеопамяти до 564 ГБ
Процессоры
AMD EPYC, Intel Xeon
Количество ядер до 128
RAM до 1536 ГБ DDR5
Форм-фактор 2U
Для каких задач Серия серверов для кластеризации на 8 GPU. Предназначены для дата-центров и AI-ферм, где требуется повышенная плотность для обучение LLM и R&D.
Подробнее
Видеокарты
L40s / RTX PRO / H200 NVL
Объем видеопамяти до 1128 ГБ
Процессоры
AMD EPYC, Intel Xeon
Количество ядер до 256
RAM до 2048 ГБ DDR5
Форм-фактор 4U
Для каких задач HGX объединяет 8 видеокарт NVIDIA H200, достигая экстремальной плотности производительности. Благодаря внутренней связности NVSwitch мгновенно интегрируется в масштабные вычислительные кластеры.
Подробнее
Видеокарты
NVIDIA H200 SXM
Объем видеопамяти до 1128 ГБ
Процессоры
AMD EPYC, Intel Xeon
Количество ядер до 256
RAM до 2048 ГБ DDR5
Форм-фактор 5U
Подберём сервер под вашу задачу

Подберём конфигурацию сервера и отправим предложение.

Смотреть серверы
или свяжитесь с нами
Telegram Telegram WhatsApp WhatsApp ВКонтакте ВКонтакте MAX MAX
8.8К

Так же будет интересно почитать

Сайт использует cookies
Узнать подробнее