8 800 500-99-26 Для звонков по России
10 ошибок при заказе GPU-сервера или рабочей станции
Рабочие станции
9 мин

10 ошибок при заказе GPU-сервера или рабочей станции

DigitalRazor
DigitalRazor
Подписаться в Telegram
Содержание 12 разделов
Ошибка 1. Принять список комплектующих за техническое задание Ошибка 2. Разослать BOM и удивляться, что все предложения отличаются только ценой Ошибка 3. Считать, что одинаковое название GPU означает одинаковое оборудование Ошибка 4. Выбрать сервер и только потом подумать, куда его поставить Ошибка 5. Посчитать GPU и забыть про всё, что их окружает Ошибка 6. Сравнивать итоговую стоимость в КП, не приведя предложения к одинаковым условиям Ошибка 7. Удовлетвориться фразой «мы тестируем сервер 48 часов» Ошибка 8. Не договориться, что означает «сервер готов к работе» Ошибка 9. Не подумать об апгрейде до того, как он понадобился Ошибка 10. Не решить заранее, кто будет разбираться, если всё вроде исправно, но не работает Что делать на практике Есть несколько вариантов ТКП на одну систему?
Подберём сервер под вашу задачу

Подберём конфигурацию сервера и отправим предложение.

Смотреть серверы
или свяжитесь с нами
Telegram Telegram WhatsApp WhatsApp ВКонтакте ВКонтакте MAX MAX

Подберём сервер под задачи

Ответьте на несколько вопросов — подготовим предложение

Объясняем, как избежать типичных ошибок при выборе и заказе GPU-сервера или рабочей станции, которые могут стоить вам и вашему бизнесу времени, денег и нервов.

Сценарий знакомый. К вам приходит инженер, руководитель ИИ-команды или эксплуатант и говорит: «Нужен сервер. Два GPU, такой-то процессор, 512 ГБ памяти, четыре NVMe. Желательно побыстрее».

Дальше задача попадает к ИТ-директору или CTO. Вы находите несколько компаний, рассылаете спецификацию, через пару дней получаете три коммерческих предложения. В одном дешевле GPU. В другом дороже вся система. В третьем вообще поменяли половину конфигурации.

Теперь надо выбрать.

На этом этапе и совершают большую часть ошибок. Причём для этого совершенно не обязательно плохо разбираться в железе. Часто проблема как раз в том, что привычный процесс закупки обычных серверов или ПК плохо переносится на дорогие GPU-системы.

Разберём десять типовых ошибок и простые способы их избежать.

Ошибка 1. Принять список комплектующих за техническое задание

Почему это происходит

Специалист знает свою работу и уже придумал решение: «Нам нужны две RTX PRO 6000, Threadripper, 512 ГБ RAM и 8 ТБ NVMe».

ИТ-директор получает не описание задачи, а готовую спецификацию и вполне логично отправляет её поставщикам.

Что может пойти не так

Проблема в том, что спецификация — это уже одна из гипотез решения.

Из неё НЕ видно:

  • какое ПО будет использоваться;
  • что именно сейчас ограничивает производительность;
  • зачем нужны два GPU;
  • сколько пользователей будет работать одновременно;
  • какая требуется производительность;
  • как система будет использоваться через год.

В результате пять поставщиков честно посчитают одну и ту же ошибку.

Как избежать

Отправляйте вместе со спецификацией короткое описание задачи. Иногда достаточно буквально нескольких строк:

Что запускаем → сколько пользователей → какой объём данных → что сейчас не устраивает → какой результат хотим получить.

И попросите поставщика не просто посчитать BOM (перечень комплектующих), а проверить её.

Если один поставщик прислал цену через двадцать минут, а второй сначала задал пять неприятных вопросов — это не обязательно означает, что второй усложняет вам жизнь. Возможно, именно он первым начал работать с задачей.

Ошибка 2. Разослать BOM и удивляться, что все предложения отличаются только ценой

Почему это происходит

Для закупки это удобный формат: одинаковая таблица с комплектующими ушла пяти компаниям, значит предложения легко сравнить.

Что может пойти не так

Вы сами свели работу поставщика к роли магазина.

Один мог бы предложить другую платформу. Другой — заметить избыточную память. Третий — увидеть проблему с multi-GPU. Но от всех попросили одно: «Дайте нам точную цену и срок поставки по нашему списку». И получили в ответ именно это.

Как избежать

Добавьте к запросу одну фразу:

«Спецификация предварительная. Просим проверить архитектуру под описанную задачу и указать рекомендуемые изменения и ограничения».

Теперь поставщики начинают конкурировать не только закупочной ценой.

А у вас появляется ещё один критерий сравнения: насколько глубоко каждый из них вообще разобрался в проекте.

Ошибка 3. Считать, что одинаковое название GPU означает одинаковое оборудование

RTX PRO 6000 Blackwell

NVIDIA RTX PRO 6000 Blackwell

Почему это происходит

В Excel легко написать: NVIDIA H200 или NVIDIA RTX 6000. Название совпадает с желаемым графическим ускорителем — кажется, сравниваем одно и то же. Но с современными GPU этого недостаточно.

Например, под запросом H200 может подразумеваться H200 NVL для PCIe-систем или H200 в платформе HGX с SXM-модулями. Это разные варианты построения системы и межсоединения GPU. NVIDIA отдельно описывает H200 NVL и HGX H200.

С RTX путаница ещё проще. RTX 6000 Ada Generation — отдельная модель предыдущего поколения. У RTX PRO 6000 Blackwell есть Server Edition, Workstation Edition и Max-Q Workstation Edition. Все три имеют 96 ГБ памяти, но различаются энергопотреблением, охлаждением, габаритами и предполагаемым способом установки. Например, Server Edition рассчитана на серверное пассивное охлаждение, а Max-Q — на плотные multi-GPU рабочие станции.

Что может пойти не так

В двух КП будет написано почти одно и то же название GPU, но фактически вам предлагают разные платформы:

  • с другим охлаждением;
  • другим энергопотреблением;
  • другими возможностями масштабирования;
  • другим форм-фактором;
  • а иногда и другим поколением GPU.

Цена при этом тоже будет разной — и совершенно закономерно.

Как избежать

Для дорогих GPU сравнивайте не только название, а точную модификацию и артикул.

Обязательно уточните: поколение → исполнение → память → форм-фактор → охлаждение → энергопотребление → поддерживаемые технологии и лицензии.

Одной строки «RTX 6000 96 GB» для нормальной спецификации уже мало.

Ошибка 4. Выбрать сервер и только потом подумать, куда его поставить

Почему это происходит

Пока выбирают CPU и GPU, серверная кажется чем-то очевидным: «Стойка у нас есть».

Что может пойти не так

После поставки внезапно выясняется:

  • сервер физически не помещается по глубине;
  • нет свободного места нужной высоты;
  • не подходит распределение питания;
  • не хватает мощности;
  • существующая стойка уже перегружена;
  • не хватает сетевых портов нужной скорости;
  • тепловыделение нового узла серверная нормально не отводит.

Получается довольно дорогой предмет интерьера.

Для рабочей станции ситуация похожая: система может оказаться слишком большой или шумной для места, где её собираются использовать.

Как избежать

До согласования конфигурации передайте поставщику простое описание места установки: стойка → доступные U → глубина → доступная электрическая мощность → тип PDU/разъёмов → наличие A/B-линий питания → сеть → охлаждение → ограничения по шуму.

Для мощного GPU-сервера место эксплуатации — такая же важная часть проекта, как процессор или память.

Ошибка 5. Посчитать GPU и забыть про всё, что их окружает

Почему это происходит

GPU — самая дорогая и самая понятная строка предложения. Отсюда естественная логика: четыре GPU быстрее двух, а 384 ГБ VRAM лучше 192 ГБ. На уровне рекламного буклета всё прекрасно.

Что может пойти не так

Производительность GPU-системы зависит не только от количества ускорителей.

Имеют значение:

  • топология PCIe;
  • CPU и его связь с GPU;
  • оперативная память;
  • межсоединение ускорителей;
  • сеть;
  • накопители;
  • физическое размещение карт;
  • питание и охлаждение.

Объём памяти нескольких GPU нельзя автоматически считать единым пулом. Даже наличие NVLink само по себе не означает, что приложение увидит память всех GPU как один общий объём — это зависит от программного стека и способа распределения модели или данных.

Можно купить четыре очень быстрые GPU и обнаружить, что конкретная рабочая нагрузка масштабируется на них гораздо хуже, чем ожидалось.

Как избежать

Просите поставщика объяснить не только какие GPU установлены, но и как они соединены между собой и с остальной системой.

Для дорогого multi-GPU-узла фраза «материнская плата поддерживает четыре видеокарты» — это начало разговора, а не его конец. Подробнее о технологии multi-GPU мы рассказывали в этом материале.

Ошибка 6. Сравнивать итоговую стоимость в КП, не приведя предложения к одинаковым условиям

Почему это происходит

В таблице руководителю всё равно в конце понадобится одна цифра.

  1. Поставщик А — 4,8 млн.
  2. Поставщик Б — 5,1 млн.
  3. Поставщик В — 5,4 млн.

Кажется, осталось только выбрать самое привлекательное предложение.

Что может пойти не так

После внимательного чтения условий договора оказывается:

  • одна цена указана с НДС, другая — без;
  • у одного включена доставка, а у другого она считается отдельно;
  • где-то включена настройка, а где-то только сборка;
  • отличаются сроки поставки;
  • отличаются условия оплаты;
  • разные сроки и условия гарантии;
  • разные составы программной подготовки.

То есть вы сравнивали три совершенно разные поставки по одной только итоговой цене.

Как избежать

Перед финальным выбором сведите предложения в небольшую таблицу: оборудование → НДС → доставка → срок → настройка → тестирование → ПО → гарантия → условия оплаты.

И только после этого сравнивайте цену. Банально? Да. Но когда речь идёт о нескольких миллионах рублей, эта банальность иногда может стоить очень дорого.

Ошибка 7. Удовлетвориться фразой «мы тестируем сервер 48 часов»

Почему это происходит

Количество часов тестирования оборудования выглядит измеримым показателем качества. 48 часов звучит значительно надёжнее восьми.

Что может пойти не так

Можно двое суток запускать тест, который вообще не воспроизводит проблему будущего пользователя.

Само количество часов ничего не говорит о том:

  • какие подсистемы проверяли;
  • нагружали ли CPU и GPU одновременно;
  • контролировали ли температуры и частоты;
  • проверяли ли память;
  • были ли ошибки;
  • использовали ли реальную или максимально близкую к ней профильную нагрузку.

Поэтому программа испытаний важнее красивого числа на сайте поставщика.

Как избежать

Задайте поставщику три вопроса:

  • Что тестируете?
  • Что измеряете?
  • При каком результате сервер не проходит ОТК?

Для нестандартной системы полезно добавить четвёртый: проверяли ли вы раньше именно такую конфигурацию? А ещё лучше передать поставщику тестовый контейнер, модель, бенчмарк или обезличенный сценарий нагрузки, если это возможно

Ответы обычно быстро показывают разницу между «прогнали стресс-тест для галочки» и нормальной проверкой системы.

Ошибка 8. Не договориться, что означает «сервер готов к работе»

Почему это происходит

В коммерческом предложении написано: Ubuntu, драйверы NVIDIA, необходимое ПО. И вроде все довольны. Ровно до момента поставки.

Что может пойти не так

Для поставщика «готов» означает: ОС загружается, GPU определяется.

Для ИИ-команды: наш контейнер запускается, видит GPU, модель загружается и отдаёт результат.

Между этими двумя состояниями могут находиться драйверы, CUDA, контейнерная среда, библиотеки, фреймворки, сервер инференса, мониторинг и конфигурация доступа. Другими словами: важна программная подготовка под конкретные рабочие задачи бизнеса.

И здесь начинается классический разговор:

— Но вы же обещали готовый сервер!
— Он готов. Вот Linux, система стартует. Если вам нужна Windows — переустановите ОС сами.

Как избежать

Зафиксируйте в договоре критерии приёмки, а не только список установленного ПО.

То есть не просто «Docker установлен», а:

  • контейнер запускается;
  • GPU доступен;
  • нужная модель загружается;
  • тестовый запрос проходит;
  • производительность/стабильность соответствует согласованному критерию.

Это лишь пример, здесь стоит отталкиваться от того, какая программная подготовка нужна под ваши задачи. В этом случае обе стороны одинаково понимают, что должно получиться перед приёмкой системы.

Ошибка 9. Не подумать об апгрейде до того, как он понадобился

Апгрейд GPU-сервера

Почему это происходит

Покупка и так дорогая. Сначала хочется решить сегодняшнюю проблему, а уже потом, через два года разберёмся с масштабированием.

Что может пойти не так

Через год появляется задача добавить GPU.

И неожиданно требуется поменять:

  • корпус;
  • блоки питания;
  • платформу;
  • систему охлаждения;
  • иногда практически весь сервер.

Фраза «есть возможность расширения» в коммерческом предложении обычно слишком расплывчата.

Как избежать

Спросите поставщика конкретно: что именно можно добавить в эту систему без замены платформы?

Например:

  • сколько GPU;
  • сколько RAM;
  • какие накопители;
  • какие сетевые карты.

Не обязательно покупать запас сейчас. Нужно просто понимать цену следующего шага и оставить пространство для манёвров в будущем.

Ошибка 10. Не решить заранее, кто будет разбираться, если всё вроде исправно, но не работает

Почему это происходит

До оплаты всем интереснее лишь характеристики и цена. Гарантия воспринимается как строка: 12 / 24 / 36 месяцев.

Что может пойти не так

Через три месяца система начинает периодически падать. При этом GPU проходит диагностику, память проходит тесты, SSD исправен, блок питания тоже. Что делать дальше?

Если за каждый компонент отвечает отдельный поставщик или производитель, интегратором внезапно становится ваш собственный ИТ-отдел.

Для сложной системы гораздо важнее не только срок гарантии, но и наличие единой точки диагностики всей конфигурации.

Как избежать

До покупки задайте один очень простой вопрос: «Если после запуска система работает нестабильно, кому мы звоним и что происходит дальше?».

Хороший ответ должен быть понятен человеку, который реально будет звонить в случае проблем.

Что делать на практике

Не нужно превращать закупку каждой рабочей станции в шестимесячный инфраструктурный проект. Для большинства заказов достаточно нескольких простых действий.

Перед рассылкой спецификации системы приложите к ней короткое описание задачи. Попросите поставщиков проверить архитектуру, а не только назвать цену. Сверяйте точные модификации дорогих компонентов. До заказа проверьте место установки. Приведите все коммерческие условия к одному виду. И заранее договоритесь, что поставщик должен передать вам систему в работающем состоянии.

А затем сравнивайте поставщиков не только по BOM.

Обратите внимание на того, кто:

  • задал содержательные вопросы;
  • нашёл ограничения исходной конфигурации;
  • смог объяснить выбранную архитектуру;
  • описал программу проверки;
  • чётко определил границы поставки и поддержки.

Если после этого два предложения действительно одинаковы — выбирайте то, которое дешевле. Но сначала убедитесь, что они действительно одинаковы.

Есть несколько вариантов ТКП на одну систему?

Пришлите их инженерам DigitalRazor вместе с описанием задачи. Мы сравним не только стоимость компонентов, но и архитектуру, ограничения, состав поставки и условия эксплуатации. В итоге покажем, в чём предложения действительно отличаются.

Для каких задач Компактный GPU-сервер до 2 видеокарт для начальных задач в AI и графике. Оптимален для инференса, визуализации, VFX и рендеринга в студиях и лабораториях, где важна гибкость.
Подробнее
Видеокарты
RTX / RTX PRO / H200 NVL
Объем видеопамяти до 282 ГБ
Процессоры
Threadripper PRO
Количество ядер до 96
RAM до 1024 ГБ DDR5
Форм-фактор 4.5U
Для каких задач Универсальная платформа на 4–6 GPU для локального обучения моделей и генеративных задач. Подходит для команд, которым важна надёжность сервера и свобода выбора графики — от RTX 5090 до PRO RTX 6000.
Подробнее
Видеокарты
RTX / RTX PRO / H200 NVL
Объем видеопамяти до 576 ГБ
Процессоры
Threadripper PRO
Количество ядер до 96
RAM до 1024 ГБ DDR5
Форм-фактор 6.5U
Для каких задач Сервер промышленного уровня на 8 GPU с кластерной архитектурой. Предназначен для дата-центров и AI-ферм, где требуется масштабируемость и полная загрузка ресурсов под обучение LLM и R&D.
Подробнее
Видеокарты
RTX PRO 6000 / RTX 5090
Объем видеопамяти до 768 ГБ
Процессоры
AMD Epyc, Intel Xeon
Количество ядер до 320
RAM до 3072 ГБ DDR5
Форм-фактор 6U
Для каких задач Серия серверов для кластеризации на 4 GPU. Предназначены для дата-центров и AI-ферм, где требуется повышенная плотность для обучение LLM и R&D.
Подробнее
Видеокарты
L40s / RTX PRO / H200 NVL
Объем видеопамяти до 564 ГБ
Процессоры
AMD EPYC, Intel Xeon
Количество ядер до 128
RAM до 1536 ГБ DDR5
Форм-фактор 2U
Для каких задач Серия серверов для кластеризации на 8 GPU. Предназначены для дата-центров и AI-ферм, где требуется повышенная плотность для обучение LLM и R&D.
Подробнее
Видеокарты
L40s / RTX PRO / H200 NVL
Объем видеопамяти до 1128 ГБ
Процессоры
AMD EPYC, Intel Xeon
Количество ядер до 256
RAM до 2048 ГБ DDR5
Форм-фактор 4U
Для каких задач HGX объединяет 8 видеокарт NVIDIA H200, достигая экстремальной плотности производительности. Благодаря внутренней связности NVSwitch мгновенно интегрируется в масштабные вычислительные кластеры.
Подробнее
Видеокарты
NVIDIA H200 SXM
Объем видеопамяти до 1128 ГБ
Процессоры
AMD EPYC, Intel Xeon
Количество ядер до 256
RAM до 2048 ГБ DDR5
Форм-фактор 5U
Подберём сервер под вашу задачу

Подберём конфигурацию сервера и отправим предложение.

Смотреть серверы
или свяжитесь с нами
Telegram Telegram WhatsApp WhatsApp ВКонтакте ВКонтакте MAX MAX
694

Так же будет интересно почитать

Выбираем компьютер для работы в Blender
Олег Олегович Олег Олегович
Статьи
Выбираем компьютер для работы в Blender

Blender полюбился многим за стабильное развитие и техническую поддержку. Спектр возможностей у приложения широкий: от визуализации до монтажа и рендеринга. Поэтому выбор оптимального компьютера вызывает вопросы. В продолжении цикла статей разберем системные требования и ответим, какую графическую станцию выбрать для комфортной работы.

4 мин
74.7К
Процессоры AMD Ryzen X3D в рабочих задачах
Олег Олегович Олег Олегович
Статьи
Процессоры AMD Ryzen X3D в рабочих задачах

В этом материале расскажем, почему постулат «Ryzen X3D предназначены только для игр» можно считать устаревшим. Почему Ryzen 9900X3D и 9950X3D — не просто какие-то странные процессоры, а очень любопытное гибридное решение. Вариант для тех, кто использует компьютер не только для игр, но и для работы.

9 мин
68.9К

Сайт использует cookies
Узнать подробнее