
NVIDIA Groq 3 LPX: скорость ответа для ИИ-агентов
Подберём сервер под задачи
Ответьте на несколько вопросов — подготовим предложение
NVIDIA перевела в серийное производство Groq 3 LPX — стоечную систему инференса на технологии Groq, купленной за 20 миллиардов долларов. В независимом тесте система выдала 3400 токенов в секунду на модели Gemma 4 31B с контекстом 100 000 токенов — вчетверо быстрее ближайшего конкурента. Для бизнеса, который строит быстрых ИИ-агентов, это готовая инфраструктура под генерацию ответа.
Краткое содержание
- Groq 3 LPX построена на технологии Groq, чьи активы NVIDIA купила за 20 миллиардов долларов — крупнейшая сделка компании;
- независимый тест Artificial Analysis — 3400 токенов в секунду на Gemma 4 31B с контекстом 100 000 токенов, вчетверо быстрее ближайшего конкурента;
- стойка вмещает до 256 ускорителей LP30, вычислительный блок — 2U с жидкостным охлаждением на 16 ускорителей;
- первый облачный партнёр — Nebius, система уже в серийном производстве.
Что купила NVIDIA за 20 миллиардов долларов
В конце 2025 года NVIDIA закрыла крупнейшую сделку в своей истории — приобрела активы и технологию чипмейкера Groq примерно за 20 миллиардов долларов, обойдя по сумме даже покупку Mellanox в 2019 году. В сделку вошли архитектура LPU (language processing unit) и часть команды инженеров, а вот облачный сервис GroqCloud остался у Groq и продолжает работать отдельно. Groq 3 LPX — первый серийный продукт на основе купленной технологии, встроенный в платформу NVIDIA Vera Rubin.
LPU — это акселератор с потоковой архитектурой на SRAM, изначально спроектированный не под обучение, а именно под генерацию токенов с предсказуемой низкой задержкой. Для NVIDIA это готовое решение давней проблемы: в фазе декодирования при длинном контексте её GPU традиционно уступают специализированным чипам.
Стойка на 256 ускорителей: архитектура Groq 3 LPX
Базовый блок — вычислительный лоток 2U с жидкостным охлаждением на 16 ускорителей LP30. В одной стойке таких лотков умещается столько, что общее число ускорителей доходит до 256, связанных высокоскоростными оптическими соединениями чип-чип.
- 32 оптических межчиповых линка и 400-гигабитный Ethernet на каждый вычислительный лоток;
- до 256 ускорителей LP30 в одной стойке;
- хост-часть — на выбор DPU BlueField-4 или сетевая карта ConnectX-9;
- совместное проектирование с платформой Vera Rubin — семь типов чипов и пять специализированных стоек в едином комплексе.
Такая плотность соединений нужна ровно для одной задачи — раздать генерацию токенов по множеству ускорителей без потери синхронности. Именно эта часть инференса определяет, ощущается ли диалог с ИИ-агентом как живой разговор или как переписка с задержкой.
Насколько честен рекорд и кому эта скорость нужна
Тест Artificial Analysis реален и независим, но условия для него подобраны выгодно: Gemma 4 31B — сравнительно компактная плотная модель, а не тяжёлая MoE-архитектура вроде тех, что используют для сложных агентных сценариев. Как система поведёт себя на модели с сотнями миллиардов активных параметров, пока не показал ни один независимый замер.
Важнее другое: Groq 3 LPX — не отдельный ускоритель, который можно докупить в свой сервер, а часть рэковой платформы, спроектированной совместно с Vera Rubin. Доступ к такой мощности идёт в первую очередь через облачных партнёров вроде Nebius, а не через прямую закупку железа. Для российского рынка это означает ещё один слой ограничений поверх обычных сложностей с поставками NVIDIA — практический путь к такой инфраструктуре лежит через облачных провайдеров с легальным доступом к платформе, а не через параллельный импорт стоек целиком.
Мнение DigitalRazor
Если ваш продукт — это агентный ИИ с диалогом в реальном времени и длинным контекстом, задержка генерации токенов важнее общей пропускной способности кластера, и здесь Groq 3 LPX задаёт новую планку. Но для большинства заказчиков это история про выбор облачного провайдера с доступом к такой инфраструктуре, а не про закупку собственных стоек. При оценке инференс-провайдеров под агентные сценарии просите бенчмарки именно по задержке декодирования на длинном контексте — не общее число токенов в секунду на коротких запросах.














