
Cerebras CS-4: тот же чип на удвоенной частоте против GPU
Подберём сервер под задачи
Ответьте на несколько вопросов — подготовим предложение
Cerebras показала CS-4 — стоечную систему на чипе WSE-3 Turbo, который физически остаётся тем же 5-нанометровым кристаллом, что и в CS-3. Двукратный прирост дали не новый техпроцесс, а удвоенная частота и переработанное питание с охлаждением. Для закупщика вывод простой: конкурент GPU в инференсе ускорился без смены кремния и без роста цены за транзистор.
Краткое содержание
- WSE-3 Turbo — тот же 5-нанометровый кристалл, что в WSE-3, но частота выросла с 1,4 до 2,8 ГГц;
- один чип — 900 тысяч ядер, 44 ГБ SRAM на кристалле и 43,2 Пбайт/с полосы памяти;
- стойка CS-4 из трёх чипов — до 750 Пфлопс и заявленные до 30 раз больше токенов в секунду на пользователя, чем у GPU;
- ранний доступ — с августа 2026 года, серийные поставки — в третьем квартале.
Разгон вместо нового кристалла
Обычно двукратный прирост в ускорителе — это новый техпроцесс или архитектура. У Cerebras иначе. WSE-3 Turbo — тот же кристалл TSMC 5 нм, что и в WSE-3 двухлетней давности, только частота выросла с 1,4 до 2,8 ГГц. Вычислительные блоки не трогали — перестроили подачу питания: конвертеры теперь стоят в сто раз ближе к кристаллу, чем в обычных платах с GPU, а тепло снимает встроенное жидкостное охлаждение прямо в модуле «бэкпак».
Изменился и сам модуль компоновки. В стойке CS-4 деталей на 50% меньше, чем в CS-3, автоматизация сборки выросла на 60%, а развёртывание, по словам Cerebras, ускорилось втрое. Дата-центру от этого тоже польза: такие стойки проще смонтировать и обслуживать, а не только быстрее считать на них токены.
Что внутри: чип и стойка
- WSE-3 Turbo — пластина 46 225 мм², 4 триллиона транзисторов, 900 тысяч ядер, 44 ГБ SRAM прямо на кристалле;
- до 250 Пфлопс на разреженных вычислениях и 25 Пфлопс на плотных, полоса памяти — 43,2 Пбайт/с на чип;
- стойка CS-4 — три чипа WSE-3 Turbo: суммарно до 750 Пфлопс, 132 ГБ SRAM и до 129,6 Пбайт/с агрегированной полосы;
- задержка между кристаллами внутри стойки — 2 микросекунды, энергопотребление стойки оценивается в 120–140 киловатт.
Питание, охлаждение и место в инфраструктуре
120–140 киловатт на стойку — это уровень топовых GPU-стоек с жидкостным охлаждением, и без соответствующего ввода питания и контура охлаждения такую систему в свой ЦОД не поставить. Это не «замена GPU в любой задаче», а специализированный ускоритель для декодирования токенов: Cerebras прямо говорит о партнёрстве с AMD Instinct и AWS Trainium, где GPU и Trainium берут на себя предварительную обработку запроса, а CS-4 — генерацию ответа на скорости, недостижимой для GPU. Для модели на триллион с лишним параметров, по заявлению компании, достаточно нескольких десятков ускорителей CS-4 — конкурирующим чипам для инференса такого класса обычно нужны тысячи плат.
Ранний доступ к CS-4 стартовал в августе 2026 года для отдельных заказчиков, серийные поставки Cerebras обещает в третьем квартале. Цену компания не раскрывает — как и прежде, система продаётся не поштучно, а как часть кластерного решения с обвязкой и поддержкой.
Мнение DigitalRazor
CS-4 — это не альтернатива GPU-серверу на полке склада, а решение для тех, кому уже не хватает скорости генерации токенов на конкретной агентной или чат-нагрузке и кто готов проектировать под неё отдельный контур питания и охлаждения. Для большинства задач инференса GPU-кластер остаётся более гибким и предсказуемым выбором. Если у вас есть конкретный сценарий с жёсткими требованиями к задержке ответа — обсудите его с нами: подберём конфигурацию под нагрузку, а не под маркетинговые цифры вендора.














