8 800 500-99-26 Для звонков по России
NVIDIA Groq 3 LPX: скорость ответа для ИИ-агентов
Железо
3 мин

NVIDIA Groq 3 LPX: скорость ответа для ИИ-агентов

DigitalRazor
DigitalRazor
Подписаться в Telegram
Содержание 4 раздела
Краткое содержание Что купила NVIDIA за 20 миллиардов долларов Стойка на 256 ускорителей: архитектура Groq 3 LPX Насколько честен рекорд и кому эта скорость нужна
Подберём сервер под вашу задачу

Подберём конфигурацию сервера и отправим предложение.

Смотреть серверы
или свяжитесь с нами
Telegram Telegram WhatsApp WhatsApp ВКонтакте ВКонтакте MAX MAX

Подберём сервер под задачи

Ответьте на несколько вопросов — подготовим предложение

NVIDIA перевела в серийное производство Groq 3 LPX — стоечную систему инференса на технологии Groq, купленной за 20 миллиардов долларов. В независимом тесте система выдала 3400 токенов в секунду на модели Gemma 4 31B с контекстом 100 000 токенов — вчетверо быстрее ближайшего конкурента. Для бизнеса, который строит быстрых ИИ-агентов, это готовая инфраструктура под генерацию ответа.

Краткое содержание

  • Groq 3 LPX построена на технологии Groq, чьи активы NVIDIA купила за 20 миллиардов долларов — крупнейшая сделка компании;
  • независимый тест Artificial Analysis — 3400 токенов в секунду на Gemma 4 31B с контекстом 100 000 токенов, вчетверо быстрее ближайшего конкурента;
  • стойка вмещает до 256 ускорителей LP30, вычислительный блок — 2U с жидкостным охлаждением на 16 ускорителей;
  • первый облачный партнёр — Nebius, система уже в серийном производстве.

Что купила NVIDIA за 20 миллиардов долларов

В конце 2025 года NVIDIA закрыла крупнейшую сделку в своей истории — приобрела активы и технологию чипмейкера Groq примерно за 20 миллиардов долларов, обойдя по сумме даже покупку Mellanox в 2019 году. В сделку вошли архитектура LPU (language processing unit) и часть команды инженеров, а вот облачный сервис GroqCloud остался у Groq и продолжает работать отдельно. Groq 3 LPX — первый серийный продукт на основе купленной технологии, встроенный в платформу NVIDIA Vera Rubin.

LPU — это акселератор с потоковой архитектурой на SRAM, изначально спроектированный не под обучение, а именно под генерацию токенов с предсказуемой низкой задержкой. Для NVIDIA это готовое решение давней проблемы: в фазе декодирования при длинном контексте её GPU традиционно уступают специализированным чипам.

Стойка на 256 ускорителей: архитектура Groq 3 LPX

NVIDIA Groq 3 LPX

Базовый блок — вычислительный лоток 2U с жидкостным охлаждением на 16 ускорителей LP30. В одной стойке таких лотков умещается столько, что общее число ускорителей доходит до 256, связанных высокоскоростными оптическими соединениями чип-чип.

  • 32 оптических межчиповых линка и 400-гигабитный Ethernet на каждый вычислительный лоток;
  • до 256 ускорителей LP30 в одной стойке;
  • хост-часть — на выбор DPU BlueField-4 или сетевая карта ConnectX-9;
  • совместное проектирование с платформой Vera Rubin — семь типов чипов и пять специализированных стоек в едином комплексе.

Такая плотность соединений нужна ровно для одной задачи — раздать генерацию токенов по множеству ускорителей без потери синхронности. Именно эта часть инференса определяет, ощущается ли диалог с ИИ-агентом как живой разговор или как переписка с задержкой.

Насколько честен рекорд и кому эта скорость нужна

Тест Artificial Analysis реален и независим, но условия для него подобраны выгодно: Gemma 4 31B — сравнительно компактная плотная модель, а не тяжёлая MoE-архитектура вроде тех, что используют для сложных агентных сценариев. Как система поведёт себя на модели с сотнями миллиардов активных параметров, пока не показал ни один независимый замер.

Важнее другое: Groq 3 LPX — не отдельный ускоритель, который можно докупить в свой сервер, а часть рэковой платформы, спроектированной совместно с Vera Rubin. Доступ к такой мощности идёт в первую очередь через облачных партнёров вроде Nebius, а не через прямую закупку железа. Для российского рынка это означает ещё один слой ограничений поверх обычных сложностей с поставками NVIDIA — практический путь к такой инфраструктуре лежит через облачных провайдеров с легальным доступом к платформе, а не через параллельный импорт стоек целиком.

Мнение DigitalRazor

Если ваш продукт — это агентный ИИ с диалогом в реальном времени и длинным контекстом, задержка генерации токенов важнее общей пропускной способности кластера, и здесь Groq 3 LPX задаёт новую планку. Но для большинства заказчиков это история про выбор облачного провайдера с доступом к такой инфраструктуре, а не про закупку собственных стоек. При оценке инференс-провайдеров под агентные сценарии просите бенчмарки именно по задержке декодирования на длинном контексте — не общее число токенов в секунду на коротких запросах.

Rackstation AI
Для каких задач Компактный GPU-сервер до 2 видеокарт для начальных задач в AI и графике. Оптимален для инференса, визуализации, VFX и рендеринга в студиях и лабораториях, где важна гибкость.
Подробнее
Видеокарты
RTX / RTX PRO / H200 NVL
Объем видеопамяти до 282 ГБ
Процессоры
Threadripper PRO
Количество ядер до 96
RAM до 1024 ГБ DDR5
Форм-фактор 4.5U
Devbox AI
Для каких задач Универсальная платформа на 4–6 GPU для локального обучения моделей и генеративных задач. Подходит для команд, которым важна надёжность сервера и свобода выбора графики — от RTX 5090 до PRO RTX 6000.
Подробнее
Видеокарты
RTX / RTX PRO / H200 NVL
Объем видеопамяти до 576 ГБ
Процессоры
Threadripper PRO
Количество ядер до 96
RAM до 1024 ГБ DDR5
Форм-фактор 6.5U
Scale
Для каких задач Сервер промышленного уровня на 8 GPU с кластерной архитектурой. Предназначен для дата-центров и AI-ферм, где требуется масштабируемость и полная загрузка ресурсов под обучение LLM и R&D.
Подробнее
Видеокарты
RTX PRO 6000 / RTX 5090
Объем видеопамяти до 768 ГБ
Процессоры
AMD Epyc, Intel Xeon
Количество ядер до 320
RAM до 3072 ГБ DDR5
Форм-фактор 6U
HPC 4000
Для каких задач Серия серверов для кластеризации на 4 GPU. Предназначены для дата-центров и AI-ферм, где требуется повышенная плотность для обучение LLM и R&D.
Подробнее
Видеокарты
L40s / RTX PRO / H200 NVL
Объем видеопамяти до 564 ГБ
Процессоры
AMD EPYC, Intel Xeon
Количество ядер до 128
RAM до 1536 ГБ DDR5
Форм-фактор 2U
HPC 8000
Для каких задач Серия серверов для кластеризации на 8 GPU. Предназначены для дата-центров и AI-ферм, где требуется повышенная плотность для обучение LLM и R&D.
Подробнее
Видеокарты
L40s / RTX PRO / H200 NVL
Объем видеопамяти до 1128 ГБ
Процессоры
AMD EPYC, Intel Xeon
Количество ядер до 256
RAM до 2048 ГБ DDR5
Форм-фактор 4U
HGX H200
Для каких задач HGX объединяет 8 видеокарт NVIDIA H200, достигая экстремальной плотности производительности. Благодаря внутренней связности NVSwitch мгновенно интегрируется в масштабные вычислительные кластеры.
Подробнее
Видеокарты
NVIDIA H200 SXM
Объем видеопамяти до 1128 ГБ
Процессоры
AMD EPYC, Intel Xeon
Количество ядер до 256
RAM до 2048 ГБ DDR5
Форм-фактор 5U
Подберём сервер под вашу задачу

Подберём конфигурацию сервера и отправим предложение.

Смотреть серверы
или свяжитесь с нами
Telegram Telegram WhatsApp WhatsApp ВКонтакте ВКонтакте MAX MAX
8.9К

Так же будет интересно почитать

Сайт использует cookies
Узнать подробнее