
DigitalRazor Scale с RTX PRO 6000: сервер для круглосуточной корпоративной ИИ-платформы
Подберём сервер под задачи
Ответьте на несколько вопросов — подготовим предложение
Запустить локальный чат-бот для двадцати сотрудников можно и на одной мощной видеокарте. Совсем другой уровень начинается, когда компания хочет одновременно обслуживать несколько моделей, корпоративный RAG, ИИ-агентов, компьютерное зрение и внутренние сервисы — причём не пару часов в тестовой среде, а постоянно.
Для такого сценария мы предлагаем DigitalRazor Scale с восемью NVIDIA RTX PRO 6000 Blackwell по 96 ГБ.
Это уже не отдельная рабочая станция разработчика. Это общий вычислительный узел, который можно поставить в ЦОД или серверную и превратить в основу корпоративной ИИ-платформы.
Зачем восемь RTX PRO 6000
У Scale есть два принципиально разных способа использовать восемь GPU.
Первый — распределить одну большую задачу между несколькими ускорителями. Так запускают крупные языковые модели, которые не помещаются в память одной карты, или обучают модели с тензорным и конвейерным параллелизмом.
Второй — раздать разные GPU независимым сервисам.
Например:
- два ускорителя обслуживают корпоративную LLM;
- ещё два заняты RAG и поиском по внутренним документам;
- отдельная карта работает с компьютерным зрением;
- несколько GPU выделены команде разработки и тестирования.
Для корпоративной инфраструктуры второй сценарий зачастую даже важнее рекордов одного большого запуска. Сервер становится не машиной «для одной нейросети», а общим пулом вычислительных ресурсов.
768 ГБ VRAM — но с важной оговоркой
Восемь RTX PRO 6000 дают 768 ГБ установленной видеопамяти. Это очень много. Одна карта располагает 96 ГБ GDDR7, поэтому крупные модели гораздо реже упираются в необходимость выгружать данные в системную память.
Но 8 × 96 ГБ нельзя воспринимать как одну видеокарту на 768 ГБ. Память каждого ускорителя остаётся отдельной. Чтобы большая модель использовала несколько GPU, программный стек должен распределять её между ними.
В зависимости от задачи применяются:
- тензорный параллелизм;
- конвейерный параллелизм;
- распределение данных;
- независимые экземпляры модели на разных GPU.
Поэтому конфигурацию Scale нужно выбирать не только по количеству гигабайт в спецификации, но и под конкретный фреймворк и архитектуру модели.
Почему не восемь RTX 5090
У Scale есть и конфигурации на GeForce RTX 5090. Для исследовательской фермы или проекта, где главное — получить максимум вычислений за бюджет, это очень интересный вариант.
Но у корпоративной платформы другие приоритеты.
| Возможность | RTX 5090 | RTX PRO 6000 |
|---|---|---|
| Видеопамять на GPU | 32 ГБ | 96 ГБ |
| ECC для VRAM | Нет | Есть |
| MIG | Нет | Есть |
| vGPU | Нет | Есть |
RTX PRO 6000 дороже не просто потому, что на ней написано PRO.
Она рассчитана на сценарии, где важно держать крупные модели в памяти, изолировать рабочие нагрузки и использовать один физический сервер сразу для нескольких внутренних сервисов.
Для экспериментального стенда это может быть лишним. Для круглосуточной корпоративной платформы — уже нет.
Что дают 96 ГБ на одной видеокарте
Разница особенно хорошо заметна на крупных языковых моделях.
В наших тестах одной RTX PRO 6000 Blackwell и RTX 5090 небольшие LLM иногда показывали близкую скорость. Например, DeepSeek R1 объёмом около 8,5 ГБ выдавал примерно одинаковый результат.
Но по мере роста модели ситуация резко менялась.
| Модель | RTX PRO 6000 | RTX 5090 |
|---|---|---|
| DeepSeek R1, 8,5 ГБ | 81 токен/с | 81 токен/с |
| Phi-4, 15,6 ГБ | 62 токена/с | 51 токен/с |
| Mistral Small, 25,9 ГБ | 42,4 токена/с | 17 токенов/с |
| Gemma 3 27B | 29 токенов/с | около 5 токенов/с |
Это тест одной карты, а не готового Scale на восьми GPU. Но он хорошо показывает сам принцип.
Пока модель помещается в память потребительской видеокарты, RTX 5090 остаётся очень быстрой. Когда объём VRAM становится ограничением, преимущество RTX PRO 6000 резко возрастает.
Подробные результаты есть в нашем обзоре NVIDIA RTX PRO 6000 Blackwell.
MIG: один GPU для нескольких задач
Для общей ИИ-платформы особенно интересна технология MIG — Multi-Instance GPU.
Она позволяет разделять ресурсы одного физического ускорителя между несколькими изолированными рабочими нагрузками.
Практический смысл понятный. Не каждому сервису компании нужны все 96 ГБ памяти и вся вычислительная мощность RTX PRO 6000.
Один отдел запускает небольшую модель для классификации документов. Другой использует собственного ассистента. Третий тестирует новый сервис.
Без разделения ресурсов один процесс может занять целую видеокарту, даже если фактически использует лишь небольшую часть её возможностей.
MIG позволяет распределять GPU гораздо аккуратнее и превращает Scale в инфраструктурный ресурс для нескольких команд.
vGPU и виртуальные среды
Ещё один важный сценарий — виртуализация GPU.
В корпоративной инфраструктуре сотрудники редко должны получать прямой доступ к физическому серверу. Гораздо удобнее выделять вычислительные ресурсы через виртуальные машины или отдельные окружения.
Поддержка vGPU позволяет строить такой сценарий на профессиональных ускорителях.
В результате одна команда может получить окружение для машинного обучения, другая — среду для инференса, а третий отдел — отдельный сервис с собственной моделью.
Это значительно ближе к нормальной внутренней ИТ-инфраструктуре, чем сервер, на котором все пользователи вручную договариваются, кому сегодня принадлежит GPU №4.
Два процессора нужны не для красоты
В Scale используется двухпроцессорная серверная платформа.
Она важна потому, что восемь ускорителей нужно постоянно снабжать данными.
До того как информация попадёт на GPU, процессоры занимаются:
- подготовкой датасетов;
- предварительной обработкой;
- токенизацией;
- ETL-процессами;
- декодированием видео;
- работой сетевых сервисов;
- обслуживанием нескольких параллельных процессов.
Если CPU-подсистема не успевает, дорогостоящие видеокарты начинают простаивать.
Именно поэтому для Scale мы используем серверные Intel Xeon и AMD EPYC, а не обычный настольный процессор рядом с восемью GPU.
Для каких корпоративных задач нужен Scale
Scale с RTX PRO 6000 имеет смысл там, где ИИ уже перестал быть экспериментом одного отдела.
Например, если компания одновременно разворачивает:
Корпоративного ИИ-ассистента. Сотрудники обращаются к общей LLM через внутренний интерфейс.
RAG по документации. Модель работает с договорами, инструкциями, технической документацией и внутренней базой знаний.
ИИ-агентов. Разные подразделения получают специализированных помощников для работы с документами, кодом или внутренними процессами.
Компьютерное зрение. Сервер постоянно обрабатывает несколько видеопотоков.
Внутренний API. Корпоративные приложения обращаются к моделям программно.
Среду R&D. Разработчики параллельно тестируют разные модели, квантизации и версии программного стека.
Scale особенно полезен, когда эти задачи должны существовать одновременно, а не сменять друг друга в очереди.
До модели на 671B — но не одним кликом
В случае со Scale можно осуществлять сценарии вплоть до крупных MoE-моделей класса 671B в квантизации Q4. Это не означает, что любую такую модель достаточно скачать и нажать «Запустить».
Результат зависит от конкретной архитектуры, активного количества параметров, квантизации, длины контекста и способа распределения модели между ускорителями. Но именно здесь восемь RTX PRO 6000 начинают показывать смысл платформы.
Если одна карта имеет 96 ГБ VRAM, а сервер позволяет распределить вычисления между восемью ускорителями, появляется пространство для моделей и режимов эксплуатации, которые просто не помещаются на обычную рабочую станцию.
А что с программной частью
Купить восемь профессиональных GPU — только половина задачи.
Нужно установить Linux, драйверы, CUDA, контейнеры, движки инференса, средства мониторинга и прикладные сервисы. После этого всё это ещё нужно поддерживать.
Поэтому Scale можно использовать вместе с DigitalRazor OneStack.
Это наш программно-аппаратный комплекс для локального развёртывания ИИ. Он подходит для корпоративного чата, RAG, внутренних ассистентов и инференс-сервисов без передачи чувствительных данных в публичные облака.
OneStack особенно полезен компании, которой нужна готовая внутренняя ИИ-платформа, но не хочется сначала несколько недель превращать GPU-сервер в рабочую инфраструктуру.
Scale или несколько серверов поменьше
Один Scale с восемью GPU не всегда лучше четырёх серверов по две карты.
Несколько небольших узлов дают более естественное физическое разделение задач и уменьшают последствия отказа одного сервера.
Scale выигрывает, когда:
- одной модели требуется несколько GPU;
- нужен большой общий пул ускорителей;
- важна высокая плотность вычислений в стойке;
- требуется единая платформа для нескольких сервисов;
- инфраструктурой управляет одна команда.
Если же разные подразделения должны работать совершенно независимо, иногда рациональнее разнести задачи по нескольким Rackstation AI или Devbox AI.
Это тот случай, когда архитектуру лучше определять до покупки железа.
Когда корпоративному ИИ нужен профессиональный GPU
RTX 5090 остаётся отличным ускорителем. Мы сами используем эту видеокарту в серверах Scale там, где проекту важна стоимость вычислений. Но круглосуточная корпоративная ИИ-платформа предъявляет другие требования.
96 ГБ памяти на одном GPU, ECC, MIG, виртуализация и возможность организовать несколько параллельных сервисов меняют сам подход к инфраструктуре.
DigitalRazor Scale с восемью RTX PRO 6000 — это уже не просто быстрый сервер для запуска LLM. Это фундамент, на котором можно построить внутреннюю ИИ-платформу для всей компании.


















