
Готова ли ваша серверная к GPU-серверу: что проверить до покупки
Подберём сервер под задачи
Ответьте на несколько вопросов — подготовим предложение
Можно правильно подобрать GPU, процессоры и память, согласовать стоимость сервера и всё равно получить проблему в день поставки.
Сервер приехал — а в стойку не помещается. Для питания не хватает линии. PDU уже работает почти на пределе. Коммутатор не поддерживает нужный интерфейс. Или после запуска температура вокруг стойки начинает расти быстрее, чем система кондиционирования успевает отводить тепло.
Причина одна: сервер спроектировали, а площадку под него — нет.
GPU-серверы особенно чувствительны к питанию, охлаждению, размерам стойки и сети. Чем больше ускорителей внутри, тем меньше остаётся места для подхода «поставим, а дальше разберёмся».
Поэтому перед согласованием конфигурации стоит проверить пять вещей:
- поместится ли сервер в стойку;
- хватит ли питания;
- справится ли охлаждение;
- есть ли подходящая сеть;
- можно ли оборудование нормально обслуживать.
Это не полноценное проектирование ЦОДа. Для первичной проверки достаточно собрать несколько параметров и передать их поставщику оборудования или инженерам, которые отвечают за серверную.
Почему с GPU-сервером больше нюансов, чем с обычным узлом
Типичный сервер с одним или двумя процессорами может годами занимать привычные 1–2U и не создавать инфраструктуре никаких сюрпризов.
GPU-узел другого класса способен:
- занимать значительно больше места;
- быть заметно глубже;
- весить десятки килограммов;
- потреблять несколько киловатт;
- создавать сопоставимую тепловую нагрузку;
- требовать нескольких линий питания;
- использовать сеть 100/200/400 Гбит/с или InfiniBand;
- работать практически постоянно под высокой нагрузкой.
Особенно это касается серверов с четырьмя, шестью или восемью ускорителями для обучения моделей, рендеринга, высокопроизводительных вычислений и корпоративного инференса.
У такого оборудования сама спецификация сервера — только половина проекта. Вторая половина начинается на площадке.
1. Поместится ли GPU-сервер в стойку
Фраза «у нас стандартная 19-дюймовая стойка» ещё не отвечает на этот вопрос.
Стандарт определяет формат установки оборудования, но внутри двух 19-дюймовых шкафов могут сильно отличаться:
- доступная глубина;
- расстояние между направляющими;
- максимальная нагрузка;
- конструкция дверей;
- свободное пространство сзади;
- расположение PDU;
- возможности обслуживания.
Первое, что нужно определить, — сколько свободных юнитов осталось в стойке.
Но количество U — только начало.
Проверьте глубину
Именно здесь чаще всего возникает неприятный сюрприз.
Высокопроизводительный GPU-сервер может быть значительно длиннее привычного сетевого оборудования или компактного сервера. При этом нужно учитывать не только длину самого корпуса.
Сзади должны поместиться:
- силовые кабели;
- сетевые кабели;
- трансиверы;
- кабельный органайзер;
- часть направляющих.
Если задняя дверь закрывается вплотную к разъёмам, формально сервер в стойку вошёл, но обслуживать такую систему уже неудобно.
Проверьте массу
GPU, радиаторы, блоки питания и крупные системы охлаждения быстро увеличивают массу узла.
Нужно проверить:
- допустимую нагрузку самой стойки;
- нагрузку на направляющие;
- суммарную массу уже установленного оборудования;
- возможность безопасно установить сервер.
Способ монтажа определяет производитель. Для тяжёлых GPU-узлов часто требуется специализированный серверный подъёмник. До поставки проверьте его грузоподъёмность, нагрузку на стойку и пол, а также весь маршрут заноса — от зоны разгрузки до места установки.
Проверьте направляющие
Даже если корпус подходит по ширине и глубине, остаётся механика установки.
Уточните:
- входят ли направляющие в комплект;
- совместимы ли они с вашей стойкой;
- какая глубина монтажа поддерживается;
- можно ли выдвинуть сервер для обслуживания.
Что отправить поставщику
Самый простой способ снять большую часть вопросов — заранее отправить:
- модель стойки;
- её глубину;
- количество свободных U;
- фотографию места установки.
Часто этих данных уже достаточно, чтобы обнаружить очевидную несовместимость до оплаты оборудования.
2. Хватит ли серверу питания
GPU-сервер с несколькими ускорителями способен потреблять несколько киловатт.
Поэтому проверка «свободная розетка есть» здесь практически бесполезна.
Нужно ответить на четыре отдельных вопроса:
- какую мощность требует конфигурация;
- откуда её взять;
- чем подключить сервер;
- что произойдёт при отказе одной линии.
Не ориентируйтесь только на мощность блоков питания
Если в спецификации указаны два блока питания по несколько киловатт, это ещё не означает, что сервер постоянно потребляет их суммарную номинальную мощность.
И наоборот: нельзя посмотреть на среднее энергопотребление в типичной задаче и построить всю инфраструктуру вплотную к этому значению.
У поставщика нужно запросить следующие показатели:
- типичное энергопотребление под рабочей нагрузкой;
- максимальную входную мощность и ток при выбранном напряжении;
- количество и тип силовых подключений;
- поведение сервера при потере части входов.
И уже эти данные передавать инженеру, который отвечает за электроснабжение площадки.
Проверьте PDU
Power Distribution Unit распределяет питание внутри стойки.
Перед установкой нужно знать:
- модель PDU;
- допустимую мощность;
- текущую нагрузку;
- количество свободных разъёмов;
- тип этих разъёмов;
- напряжение;
- какие устройства уже подключены.
Сам факт наличия свободного порта ничего не гарантирует. PDU может уже работать близко к пределу своей линии.
Нужна ли схема A/B
В корпоративной инфраструктуре сервер можно подключить к независимым веткам A и B. Если одна линия или PDU выходит из строя, оборудование продолжает работать от второй.
Но результат отказа одной ветки зависит от схемы блоков питания и настроек конкретной системы: сервер может продолжить работу без ограничений, снизить мощность или отключиться. Поэтому заранее проверьте, как конфигурация ведёт себя при потере одной ветки и рассчитана ли оставшаяся ветка на такой режим.
Для конкретного проекта нужно заранее определить:
- требуется ли такое резервирование;
- есть ли две независимые линии;
- выдержит ли одна ветка сервер при отказе другой;
- как распределены блоки питания.
Для тестового стенда требования могут быть мягче. Для сервиса, который работает 24/7 и обслуживает сотрудников или клиентов, цена отключения уже другая.
Вопрос, который нужно задать поставщику
Не «какой блок питания стоит в сервере?». А «какое максимальное и типичное энергопотребление имеет именно эта конфигурация и какие подключения питания ей требуются?». Это намного полезнее для подготовки площадки.
3. Справится ли охлаждение
Почти вся потребляемая сервером электроэнергия в итоге превращается в тепло. Если сервер с воздушным охлаждением потребляет около 5,5 кВт, системе кондиционирования нужно отвести примерно такую же дополнительную тепловую нагрузку.
Два узла — это уже порядка 11 кВт. Для серверов с жидкостным охлаждением отдельно проверяют требования к CDU и жидкостному контуру, а также остаточную нагрузку на воздушное охлаждение.
Но даже этот расчёт не описывает ситуацию полностью.
Средняя температура серверной может быть нормальной, а серверу всё равно жарко
Проблема часто возникает непосредственно вокруг конкретной стойки.
Например:
- перед сервером недостаточно холодного воздуха;
- соседняя стойка выбрасывает горячий воздух в его сторону;
- горячий выхлоп возвращается обратно к входу;
- кабели или двери ограничивают поток;
- система кондиционирования рассчитана на общую нагрузку помещения, но не на такую плотность в одной стойке.
В результате датчик на стене показывает нормальную температуру, а воздух на входе GPU-сервера уже заметно горячее.
Температуру и влажность нужно проверять непосредственно на входе сервера и сверять с требованиями конкретной модели. Рекомендованный ASHRAE диапазон для большинства серверного оборудования — 18–27 °C, но документация производителя всегда имеет приоритет.
Смотрите на тепловую нагрузку в месте установки
До покупки нужно связать три величины: потребляемая мощность сервера → дополнительное тепло → доступная холодопроизводительность.
Для одного относительно компактного сервера площадка может иметь достаточный запас.
Для нескольких систем с четырьмя-восьмью GPU уже стоит подключать специалиста по инженерной инфраструктуре помещения и смотреть:
- текущую нагрузку на кондиционирование;
- резерв;
- направление воздушных потоков;
- плотность мощности на стойку;
- возможность дальнейшего расширения.
Не забывайте о втором сервере
Инфраструктуру часто проверяют только под текущую закупку.
Но если через полгода планируется второй GPU-узел, лучше учитывать его сейчас. Перестроить систему охлаждения после заполнения стойки обычно сложнее и дороже, чем заранее оставить запас.
Если сервис должен работать непрерывно, проверьте не только общую холодопроизводительность, но и то, останется ли её достаточно при обслуживании или отказе одного кондиционера.
4. Есть ли к чему подключить сеть
CPU, GPU и объём памяти обычно обсуждают в самом начале. Сеть иногда остаётся на финал.
И уже после заказа выясняется, что новый сервер поддерживает быстрый Ethernet или InfiniBand, но существующая инфраструктура не умеет использовать этот интерфейс.
Проверить нужно всю цепочку
Не только сетевую карту сервера.
Нужно понять:
- какой интерфейс нужен для задачи;
- есть ли подходящие порты на коммутаторе;
- поддерживает ли он требуемую скорость;
- какие нужны трансиверы;
- используется оптика или медь;
- есть ли подходящие кабели;
- достаточно ли скорости хранилища;
- не станет ли текущая сеть узким местом.
Одинаковая скорость и похожий разъём ещё не гарантируют совместимость. Для кластерной сети отдельно зафиксируйте протокол — Ethernet/RoCE или InfiniBand, — форм-фактор портов и совместимость кабелей и трансиверов с обеими сторонами соединения.
Когда 100/200/400 Гбит/с действительно важны
Большая пропускная способность нужна не просто потому, что сетевой адаптер её поддерживает.
Она особенно важна в сценариях, где между узлами постоянно перемещаются большие объёмы данных:
- распределённое обучение;
- работа нескольких GPU-серверов в кластере;
- доступ к быстрому сетевому хранилищу;
- параллельная обработка крупных датасетов;
- высокопроизводительные вычисления.
Если сервер в основном обслуживает локальный инференс и данные лежат внутри него, требования могут быть совсем другими.
Поэтому сеть тоже выбирают от задачи.
Самый полезный вопрос
Не «в сервере есть 100 GbE?», а «к чему именно мы подключим эти 100 GbE после установки?».
Если ответа пока нет, покупать быстрый сетевой интерфейс «на всякий случай» рано.
5. Можно ли этот сервер нормально эксплуатировать
Последняя группа требований выглядит второстепенной ровно до первой неисправности.
Сервер нужно не только однажды установить.
Его придётся:
- обновлять;
- диагностировать;
- перезагружать;
- менять накопители;
- обслуживать блоки питания;
- менять компоненты по регламенту производителя;
- проверять кабели;
- выдвигать из стойки.
Удалённое управление
Для промышленной эксплуатации GPU-сервера стоит предусмотреть отдельный контроллер удалённого управления BMC и подключить его к изолированной административной сети или VLAN, без прямого доступа из интернета.
Этот контроллер позволяет:
- включить или перезагрузить узел;
- посмотреть состояние оборудования;
- получить доступ к консоли;
- проверить ошибки;
- выполнить базовую диагностику без поездки в серверную.
Особенно это важно, если сервер находится в другом офисе или дата-центре.
Физический доступ
Проверьте, можно ли:
- открыть переднюю и заднюю двери стойки;
- выдвинуть сервер на направляющих;
- снять крышку;
- заменить компонент;
- добраться до кабелей;
- временно разместить оборудование при обслуживании.
Если перед стойкой стоит шкаф, а сзади остаётся 20 сантиметров до стены, первая серьёзная замена компонента быстро превратит эту «экономию пространства» в проблему.
Кабельная укладка
У мощного сервера может быть несколько силовых подключений, несколько сетевых портов и отдельный интерфейс управления.
Кабели не должны:
- блокировать горячий выхлоп;
- мешать выдвижению сервера;
- создавать нагрузку на разъёмы;
- перепутываться с соседними узлами.
При нескольких GPU-серверах маркировка кабелей становится уже не эстетикой, а инструментом обслуживания.
Шум тоже имеет значение
Высокопроизводительный стоечный GPU-сервер проектируют прежде всего для эффективного охлаждения.
Под серьёзной нагрузкой вентиляторы могут работать очень громко.
Для выделенной серверной это обычно не проблема.
Если же оборудование планируют поставить:
- в лаборатории;
- рядом с рабочими местами;
- в офисном техническом помещении,
акустические требования нужно обсуждать ещё на этапе выбора форм-фактора.
В некоторых случаях вместо стоечного сервера рациональнее использовать мощную рабочую станцию.
Что проверить до заказа GPU-сервера
Ниже — минимальный набор данных, который стоит собрать до согласования технического предложения.
Стойка
- модель стойки;
- количество свободных U;
- допустимая глубина оборудования;
- расстояние между монтажными стойками;
- максимальная нагрузка;
- наличие совместимых направляющих;
- свободное пространство спереди и сзади.
Электропитание
- доступная мощность;
- напряжение;
- число линий;
- модели PDU;
- свободные розетки PDU;
- текущая нагрузка;
- тип разъёмов;
- наличие резервирования;
- требования к схеме A/B;
- номинал автоматов и допустимый ток каждой ветки;
- текущую нагрузку по веткам или фазам;
- достаточность ИБП и ДГУ, если они входят в схему;
- максимальную нагрузку не только всего PDU, но и отдельных групп розеток.
Охлаждение
- доступная холодопроизводительность;
- текущая нагрузка на систему охлаждения;
- способ подачи холодного воздуха;
- способ отвода горячего;
- положение стойки;
- планы по установке дополнительных GPU-узлов.
Сеть
- требуемая скорость;
- модель коммутатора;
- количество свободных портов;
- поддерживаемые интерфейсы;
- необходимые трансиверы;
- тип кабелей;
- скорость подключения к хранилищу;
- требования к межсерверному обмену.
Эксплуатация
- наличие удалённого управления;
- физический доступ к стойке;
- возможность выдвинуть сервер;
- пространство для ремонта;
- схема кабельной укладки;
- ограничения по шуму.
Кто должен проверять площадку
Необязательно самостоятельно рассчитывать электрику и кондиционирование.
Но важно вовремя свести вместе три стороны:
- специалиста, который понимает рабочую нагрузку;
- поставщика GPU-сервера;
- команду, которая отвечает за площадку.
Поставщик знает требования конкретной конфигурации.
ИТ-отдел знает сеть и существующую инфраструктуру.
Эксплуатация знает питание, PDU, стойки и охлаждение.
Если каждая сторона принимает решение отдельно, проблема обычно обнаруживается уже на этапе монтажа.
Что мы рекомендуем делать в DigitalRazor
До финального согласования GPU-сервера полезно передать инженерам:
- модель или размеры стойки;
- фотографию места установки;
- параметры электропитания и PDU;
- информацию об охлаждении;
- схему или параметры сети;
- ограничения площадки.
После этого требования выбранной конфигурации можно сопоставить с реальной инфраструктурой.
Для простых случаев проверки достаточно характеристик.
Для более сложных проектов — нескольких GPU-серверов, кластеров или высокой плотности мощности — уже потребуется полноценная проработка инженерной инфраструктуры.
Проверьте площадку до заказа
Пришлите параметры стойки, питания, охлаждения и сети. Инженеры DigitalRazor сопоставят их с требованиями выбранного GPU-сервера
Самый важный вопрос перед согласованием технико-коммерческого предложения (ТКП)
Перед оплатой спросите поставщика: какие требования эта конкретная конфигурация предъявляет к стойке, питанию, охлаждению и сети?
Хороший ответ содержит конкретные параметры:
- размеры;
- массу;
- требуемые U;
- энергопотребление;
- подключения питания;
- тепловую нагрузку;
- сетевые интерфейсы;
- требования к обслуживанию.
Эти данные можно передать своему ИТ-отделу или эксплуатации и проверить площадку.
Если ответ звучит как: «обычная серверная подойдёт», то лучше уточнить ещё раз.
Профессиональный GPU-сервер — слишком дорогое оборудование, чтобы выяснять требования к его установке уже после доставки.
FAQ
Итог
Подготовка серверной не начинается после доставки GPU-сервера. Она начинается одновременно с выбором конфигурации.
До заказа нужно знать не только: сколько GPU нам нужно? Но ещё и: куда мы поставим сервер, чем запитаем, как охладим, к чему подключим и как будем обслуживать?
Пять проверок — стойка, питание, охлаждение, сеть и эксплуатация — позволяют найти большую часть очевидных проблем ещё до оплаты оборудования.
Именно поэтому в проектах с GPU-инфраструктурой задача интегратора шире, чем просто подобрать процессоры и видеокарты.
Нужно убедиться, что оборудование сможет нормально работать в той среде, куда оно приедет.
Если планируете установить GPU-сервер, пришлите инженерам DigitalRazor параметры площадки. Сопоставим их с требованиями Rackstation AI, Devbox AI, Scale или другой выбранной конфигурации до заказа оборудования.
























