
AMD и Cerebras разделили инференс на два движка
Подберём сервер под задачи
Ответьте на несколько вопросов — подготовим предложение
AMD и Cerebras представили совместную платформу для инференса: стойки Helios с ускорителями Instinct MI455X берут на себя обработку запроса и контекста, а чип Cerebras Wafer-Scale Engine отвечает за генерацию токенов. По данным компаний, связка даёт до пяти раз больше токенов на ватт против решения на одном типе чипов — это особенно важно для агентных сценариев и ассистентов с жёсткими требованиями к задержке.
Краткое содержание
- инференс разбит на два этапа: Helios обрабатывает запрос и контекст, Wafer-Scale Engine генерирует токены;
- стойка AMD Helios — до 72 ускорителей Instinct MI455X, около 2,9 эксафлопс на FP4 и 31 ТБ памяти HBM4;
- связка чипов соединена по UALink через Ethernet с совокупной пропускной способностью до 260 ТБ/с;
- заявлено до 5 раз больше токенов на ватт; первое развёртывание — в облаке Cerebras Cloud во второй половине 2026 года.
Зачем делить инференс на два этапа
Инференс большой модели состоит из двух разных по нагрузке фаз. Сначала система читает запрос и контекст. Это тяжёлая по вычислениям работа, с ней хорошо справляются массивы GPU вроде Instinct MI455X в стойке Helios. Дальше начинается генерация ответа токен за токеном, и тут решает не вычислительная мощность, а скорость доступа к памяти. Для этой фазы AMD и Cerebras подключают Wafer-Scale Engine — чип с памятью SRAM прямо на кристалле, задержка у него минимальна по конструкции. Раньше обе фазы выполнял один и тот же GPU-кластер, и приходилось выбирать: либо пропускная способность, либо задержка.
Что это меняет для инференс-инфраструктуры
Разделение фаз позволяет отдельно масштабировать то, что упирается в разные пределы: докупать GPU-мощность Helios под рост числа запросов и отдельно наращивать Wafer-Scale-ёмкость под требования к задержке, не завязываясь на пропорции одного типа железа. Для агентных систем, голосовых ассистентов и copilot-сценариев, где ответ должен идти без заметной паузы, такая архитектура выглядит логичнее, чем наращивание количества одинаковых GPU в надежде выехать за счёт параллелизма.
Что пока не проверено независимо
Цифра «до 5 раз» — это модельные расчёты AMD Performance Labs и Cerebras на модели Kimi 2.6 на 1 трлн параметров, а не результат независимых тестов на реальной нагрузке заказчика. Готовое решение пока доступно только через облако Cerebras Cloud, а не как оборудование для покупки в свой ЦОД — Cerebras разворачивает стойки Helios прежде всего у себя. Дата старта — вторая половина 2026 года, и до этого момента цена и условия доступа для российских интеграторов остаются открытым вопросом.
Мнение DigitalRazor
Идея развести подготовку контекста и генерацию токенов по разным чипам — правильный вектор для тяжёлых агентных нагрузок, и полезно держать её в поле зрения при планировании инференс-инфраструктуры. Но пока это облачный сервис одного поставщика, а не железо, которое можно поставить в свою стойку, — переносить цифры «5x» на собственные расчёты TCO рано. Реальную выгоду для конкретной нагрузки стоит проверять на своих запросах, а не на модельном тесте вендора.













