8 800 500-99-26 Для звонков по России
DGX Spark или Ryzen AI Max+ 395: какой мини-ПК для локальных LLM выбрать
Рабочие станции
14 мин

DGX Spark или Ryzen AI Max+ 395: какой мини-ПК для локальных LLM выбрать

DigitalRazor
DigitalRazor
Подписаться в Telegram
Содержание 9 разделов
Что такое NVIDIA DGX Spark и AMD Ryzen AI Max+ 395 Архитектура и память: одинаковые 128 ГБ работают по-разному Сравнение производительности на задачах LLM Дообучение моделей Экосистема ПО: CUDA против ROCm Цена и доступность Какую платформу выбрать FAQ Итоги
Подберём решение под ваш проект

Расскажите о задаче — предложим оптимальную конфигурацию и реализацию.

Обсудить проект
или свяжитесь с нами
Telegram Telegram WhatsApp WhatsApp ВКонтакте ВКонтакте MAX MAX

Есть проект? Напишите нам

Обсудим задачу и подберём оборудование

Обсудить проект

DGX Spark лучше подходит для проектов на CUDA, TensorRT-LLM и NIM, а также для переноса разработки на серверные GPU NVIDIA. Система на Ryzen AI Max+ 395 практичнее, если нужны Windows, x86-64 и обычные рабочие программы. Ниже сравним скорость LLM, память, программный стек и цену обеих платформ.

Что такое NVIDIA DGX Spark и AMD Ryzen AI Max+ 395

DGX Spark — готовая специализированная система на Arm со стеком NVIDIA. Ryzen AI Max+ 395 — x86-64 процессор для мини-ПК и рабочих станций разных производителей.

NVIDIA DGX Spark — мини-суперкомпьютер на чипе GB10

NVIDIA DGX Spark

DGX Spark построен на однокристальной системе GB10 Grace Blackwell. Она объединяет 20-ядерный Arm-процессор — 10 ядер Cortex-X925 и 10 Cortex-A725 — со встроенным графическим ускорителем архитектуры Blackwell. Компьютер оснащён 128 ГБ когерентной объединённой памяти LPDDR5X с пропускной способностью 273 ГБ/с. Процессор и графика обращаются к одному пулу, поэтому веса модели не нужно копировать между системной памятью и отдельной VRAM.

В GB10 входят тензорные ядра пятого поколения. NVIDIA указывает производительность до 1 петафлопса в формате FP4 с разреженностью. Это теоретическая вычислительная величина, а не скорость конкретной локальной LLM: количество токенов в секунду также зависит от архитектуры модели, квантизации, контекста и программной среды.

DGX Spark работает под управлением DGX OS. В систему входят инструменты NVIDIA, поддержка CUDA, контейнерная среда Docker и доступ к NGC. Производитель заявляет запуск моделей до 200 млрд параметров на одном компьютере и дообучение моделей до 70 млрд параметров. Эти числа обозначают предельный класс задач: фактическая вместимость зависит от формата весов и памяти, которую займут операционная система, KV-кэш и среда выполнения.

Размер корпуса составляет 150 × 150 × 50,5 мм, масса — 1,2 кг. TDP чипа GB10 равен 140 Вт, а комплектный блок питания рассчитан на 240 Вт. Эти показатели нельзя считать потреблением всей системы из розетки под конкретной нагрузкой. Подробнее характеристики GB10, результаты тестов и сценарии применения мы разобрали в отдельном обзоре NVIDIA DGX Spark.

AMD Ryzen AI Max+ 395 — APU Strix Halo с общей памятью

AMD Ryzen AI Halo

Ryzen AI Max+ 395 — старшая модель семейства Strix Halo. Это не отдельный мини-ПК, а процессор, который устанавливают в компьютеры разных производителей. Поэтому перед покупкой нужно проверять объём памяти, накопитель, режим мощности, охлаждение и поддержку нужной операционной системы у конкретной модели.

Процессор получил 16 ядер и 32 потока Zen 5 с максимальной частотой до 5,1 ГГц. Встроенная Radeon 8060S содержит 40 вычислительных блоков RDNA 3.5, а нейропроцессор XDNA 2 обеспечивает до 50 TOPS. AMD указывает до 126 TOPS для всей однокристальной системы. Однако NPU TOPS не показывают скорость генерации LLM на графическом ядре, поэтому напрямую сравнивать 50 TOPS XDNA 2 с показателем GB10 нельзя.

Ryzen AI Max+ 395 поддерживает до 128 ГБ LPDDR5X-8000 с 256-битной шиной. Теоретическая пропускная способность памяти рассчитывается так:

8000 МТ/с × 256 бит ÷ 8 = 256 ГБ/с.

Память физически общая для процессора и Radeon 8060S. В документации ROCm AMD поясняет, что Strix Halo использует виртуальную память GPU: приложения могут отображать системную память в адресное пространство графики без отдельного пула дискретной VRAM. Доступный для модели объём всё равно будет меньше 128 ГБ, поскольку память нужна операционной системе, приложениям, KV-кэшу и служебным буферам.

Платформа работает на архитектуре x86-64 и поддерживает Windows и Linux. Это упрощает использование привычных настольных программ, но возможности ускорения ИИ зависят от драйвера и программного бэкенда. Для ROCm на Linux также важна совместимая версия ядра.

Первое различие уже видно: DGX Spark продаётся как готовая платформа с заранее настроенной экосистемой NVIDIA, а Ryzen AI Max+ 395 даёт производителям больше свободы в конфигурации. В следующей части сравним память, её реальную доступность для моделей и показатели TOPS без смешения несовместимых метрик.

Архитектура и память: одинаковые 128 ГБ работают по-разному

Обе платформы используют LPDDR5X как общую память для процессора и встроенной графики. Это позволяет загружать модели крупнее доступного объёма VRAM потребительских видеокарт. Однако часть памяти занимают операционная система, приложения, среда выполнения и KV-кэш, поэтому отдать модели все 128 ГБ не получится.

Характеристика NVIDIA DGX Spark Система на AMD Ryzen AI Max+ 395
Процессор 20 ядер Arm 16 ядер и 32 потока Zen 5
Графика NVIDIA Blackwell Radeon 8060S, 40 блоков RDNA 3.5
Память 128 ГБ LPDDR5X До 128 ГБ LPDDR5X-8000
Шина памяти 256 бит 256 бит
Пропускная способность памяти 273 ГБ/с 256 ГБ/с, расчётное значение
ИИ-производительность До 1000 TOPS для инференса, до 1 PFLOP FP4 с разреженностью До 126 TOPS для всей системы, включая 50 TOPS NPU
Архитектура CPU Arm64 x86-64
Диапазон мощности процессора TDP GB10 — 140 Вт cTDP — 45–120 Вт

Общая память вместо отдельных ОЗУ и VRAM

В обычном компьютере процессор работает с системной ОЗУ, а дискретная видеокарта — с собственной VRAM. Если модель не помещается в видеопамять, часть её слоёв приходится переносить в системную ОЗУ. Обмен данными через PCIe снижает скорость генерации.

У сравниваемых платформ физического разделения нет. В DGX Spark процессор и графика используют когерентную объединённую память. NVIDIA указывает, что такая архитектура позволяет динамически распределять DRAM между CPU, GPU и другими вычислительными блоками. Поэтому nvidia-smi не показывает привычный объём выделенной видеопамяти: у встроенной графики нет отдельного кадрового буфера.

Чипы памяти AMD Ryzen AI Max+ 395

Чип AMD Ryzen AI Max+ 395

У Strix Halo память также физически общая. В Linux драйвер отображает её в адресное пространство Radeon 8060S через GPU Virtual Memory. По умолчанию приложениям может быть доступно около половины системной памяти, но лимит GTT можно увеличить. AMD рекомендует не резервировать большой объём в BIOS без необходимости, поскольку динамическое распределение оставляет больше памяти другим программам.

В Windows работает механизм Variable Graphics Memory. На компьютере со 128 ГБ AMD предлагает выделить графике до 96 ГБ. С учётом динамически адресуемой памяти Radeon может использовать до 112 ГБ, но зарезервированные 96 ГБ перестают быть доступными процессору. Значение нужно выбирать под размер модели и остальные приложения, а не устанавливать максимальный объём автоматически.

Пропускная способность: 273 ГБ/с против 256 ГБ/с

Для платформы NVIDIA производитель указывает 273 ГБ/с. У AMD значение можно рассчитать по скорости LPDDR5X-8000 и ширине шины:

8000 МТ/с × 256 бит ÷ 8 = 256 ГБ/с.

Разница составляет около 6,6%:

(273 ÷ 256 − 1) × 100% = 6,6%.

Эти 6,6% нельзя автоматически переносить на скорость генерации токенов. Результат также зависит от архитектуры модели, квантизации, длины контекста, драйвера и программного бэкенда. Для системы AMD важны ещё режим мощности и охлаждение конкретного мини-ПК.

Почему нельзя сравнивать 1000 и 50 TOPS

Показатели TOPS в спецификациях относятся к разным вычислительным блокам. NVIDIA заявляет до 1000 TOPS для Blackwell при вычислениях FP4 с разреженностью. AMD указывает 50 TOPS для нейропроцессора XDNA 2 и до 126 TOPS для всего чипа.

Разделить 1000 на 50 и сделать вывод о двадцатикратной разнице нельзя. Большинство рассматриваемых далее тестов локальных LLM выполняется на графике через CUDA, ROCm или Vulkan, а не на NPU. Поэтому реальную производительность будем сравнивать по скорости одной модели в одинаковой квантизации, времени до первого токена и условиям запуска.

Какие модели помещаются в 128 ГБ

Нижнюю границу объёма весов можно приблизительно рассчитать по числу параметров. Для грубой нижней оценки 4-битной квантизации можно считать по 4 бита на параметр. Реальный файл обычно больше: дополнительную память занимают данные квантования и параметры, которые хранятся с другой точностью.

Размер модели Расчёт Теоретический минимум под веса
7B 7 млрд × 4 бита ÷ 8 3,5 ГБ
13B 13 млрд × 4 бита ÷ 8 6,5 ГБ
30B 30 млрд × 4 бита ÷ 8 15 ГБ
70B 70 млрд × 4 бита ÷ 8 35 ГБ

Это теоретический минимум. Форматы GGUF Q4_K_M содержат дополнительные данные квантования, поэтому готовый файл будет крупнее. Отдельная память потребуется для KV-кэша, контекстного окна и служебных буферов.

Модели класса 7B, 13B и 30B в распространённых 4–8-битных квантизациях помещаются в 128 ГБ с большим запасом. Квантованная модель 70B также оставляет запас памяти, но его размер зависит от формата весов и длины контекста. Преимущество 128 ГБ сильнее проявляется на моделях свыше 70B и архитектурах Mixture of Experts.

О требованиях разных моделей к памяти и способах их установки мы подробнее рассказывали в гиде по локальному развёртыванию ИИ на ПК и сервере.

У MoE-моделей в память загружаются все веса, но при обработке каждого токена используется только часть экспертов. Например, Qwen3-Coder-30B-A3B-Instruct содержит 30,5 млрд параметров, из которых активируются 3,3 млрд. Это снижает вычислительную нагрузку по сравнению с плотной моделью сопоставимого общего размера, но само по себе не гарантирует более высокую скорость.

Сравнение производительности на задачах LLM

Скорость локальной LLM нельзя описать одним числом. Для интерактивной работы важны три показателя:

  • обработка промпта — как быстро система читает запрос и контекст;
  • время до первого токена — сколько проходит между отправкой запроса и началом ответа;
  • генерация — сколько новых токенов в секунду создаёт загруженная модель.

На результат влияют модель, квантизация, длина контекста, размер пакета, версия драйвера и вычислительная среда. Поэтому сравнивать результаты из разных тестов напрямую нельзя.

Что показывают тесты AMD и независимые измерения

В мае 2026 года AMD сравнила свою Ryzen AI Halo Developer Platform с NVIDIA DGX Spark. Обе системы получили 128 ГБ LPDDR5X и работали под Linux. Производитель использовал актуальные на 6 мая программные среды и измерял скорость при контексте 100 токенов.

Модель Результат системы AMD относительно NVIDIA
GLM 4.7 Flash 30B-A3B На 14% быстрее
GPT-OSS-120B На 7% быстрее
Qwen 3.5 122B-A10B На 12% быстрее
Qwen 3.6 35B-A3B На 4% быстрее

Это тест производителя на предварительной версии AMD Ryzen AI Halo, а не независимое исследование. Короткий контекст также не показывает поведение платформ при работе с крупной базой документов или длинной историей диалога. Результаты подтверждают близкий класс производительности, но не гарантируют такой же отрыв на других моделях.

Независимое сравнение показало другой результат. В тестах llama.cpp DGX Spark и системы Corsair AI Workstation 300 на Ryzen AI Max+ 395 платформа NVIDIA быстрее обрабатывала промпт и в большинстве сценариев быстрее генерировала токены, особенно с ростом контекста. Наиболее близкие результаты системы показали с Gemma 3 27B. Это не противоречит тесту AMD: использовались другие модели, версии ПО и длины контекста. Поэтому переносить преимущество одной платформы на все LLM нельзя.

В репозитории llama.cpp опубликованы абсолютные результаты DGX Spark. Тесты проводились через CUDA с Flash Attention и полным переносом слоёв модели на GPU.

Модель Квантизация Генерация без заполненного контекста Генерация при контексте 32K
Qwen2.5-Coder 7B Q8_0 29,43 токена/с 22,51 токена/с
Qwen3-Coder 30B-A3B Q8_0 61,06 токена/с 30,21 токена/с
GPT-OSS-120B MXFP4 58,72 токена/с 42,76 токена/с

Тесты не сравнивают платформы между собой, но показывают влияние контекста.

Для GPT-OSS-120B скорость снизилась примерно на 27%:

(58,72 − 42,76) ÷ 58,72 × 100% = 27,2%.

У Qwen3-Coder 30B-A3B снижение достигло 50,5%:

(61,06 − 30,21) ÷ 61,06 × 100% = 50,5%.

Поэтому график с одним значением «токенов в секунду» без длины контекста будет неполным. Для рабочего сравнения нужно тестировать одну модель, квантизацию и версию llama.cpp при одинаковых настройках.

Для каких задач Запуск и дообучение больших языковых моделей до 200 млрд локально
Подробнее
Видеокарты
Grace Blackwell
Объем видеопамяти 128 ГБ
Процессоры
NVIDIA GB10
Количество ядер 20 Arm
RAM Объединена с VRAM
Форм-фактор SFF
Для каких задач Запуск и дообучение больших языковых моделей до 200 млрд локально
Подробнее
Видеокарты
Grace Blackwell
Объем видеопамяти 128 ГБ
Процессоры
NVIDIA GB10
Количество ядер 20 Arm
RAM Объединена с VRAM
Форм-фактор SFF
Для каких задач Запуск и дообучение больших языковых моделей до 200 млрд локально
Подробнее
Видеокарты
Grace Blackwell
Объем видеопамяти 128 ГБ
Процессоры
NVIDIA GB10
Количество ядер 20 Arm
RAM Объединена с VRAM
Форм-фактор SFF

Время до первого токена и длинный контекст

Время до первого токена зависит прежде всего от скорости обработки промпта. Чем больше документов, фрагментов кода или сообщений передано модели, тем дольше система обрабатывает запрос до начала генерации.

В тестах MLPerf Client система на Ryzen AI Max+ 395 выдала первый токен Phi-3.5 менее чем за 0,7 секунды. Для более крупных Llama 2 7B и Llama 3.1 8B задержка составила немногим больше секунды. AMD использовала Windows 11 и гибридный режим NPU + iGPU: XDNA 2 обрабатывал промпт, а Radeon отвечала за генерацию. Эти результаты нельзя напрямую сопоставлять с тестами llama.cpp на CUDA, но они показывают пользу NPU в совместимой программной среде.

Длинный контекст влияет и на память. KV-кэш растёт вместе с количеством токенов, числом слоёв и размерностью модели. Если веса занимают почти весь доступный объём, заявленное моделью контекстное окно может не поместиться. Поэтому перед запуском крупной LLM нужно проверять не только размер файла GGUF, но и расход памяти при требуемой длине контекста.

Дообучение моделей

Обе платформы подходят для LoRA и QLoRA, но 128 ГБ памяти не означают, что на них можно полноценно обучить модель на 128 ГБ весов. Во время обучения память требуется не только параметрам, но и градиентам, состояниям оптимизатора и активациям.

NVIDIA заявляет для своей системы дообучение моделей до 70B. Реальный предел зависит от длины последовательности, размера пакета и выбранного метода. Для крупных моделей практичнее QLoRA: базовые веса хранятся в четырёхбитном формате, а обучение изменяет небольшие адаптеры.

AMD предоставляет инструкции для LoRA, QLoRA и полного дообучения через PyTorch и ROCm. В официальном примере используется Gemma 3 4B. В официальном playbook AMD QLoRA для Strix Halo рассчитана на Linux: используемый метод зависит от bitsandbytes. Для Windows AMD в этой конфигурации рекомендует LoRA или полное дообучение.

Для экспериментов с адаптерами обе платформы подходят. Если требуется регулярное дообучение крупных моделей, большие пакеты или несколько задач одновременно, вместо компактной системы стоит рассматривать рабочую станцию или GPU-сервер с несколькими дискретными ускорителями.

Выберите GPU-сервер для нейросетей

Готовые решения для работы с большими массивами данных

Переход в каталог

Экосистема ПО: CUDA против ROCm

Главное различие между платформами — настройка программной среды. NVIDIA предлагает готовую Linux-среду с CUDA и контейнерами. AMD сохраняет совместимость с x86-64 и Windows, но требует внимательнее следить за версиями ROCm, драйвера и ядра Linux.

NVIDIA: DGX OS, CUDA и контейнеры NGC

DGX Spark поставляется с DGX OS, драйвером NVIDIA, Docker и NVIDIA Container Toolkit. Для установки PyTorch, vLLM, TensorRT-LLM и других инструментов можно использовать готовые NGC-контейнеры, собранные под Grace Blackwell. Это снижает риск конфликта версий CUDA, библиотек и фреймворка.

У NGC есть отдельные образы и профили для архитектуры Arm64. Обычный контейнер, рассчитанный только на x86-64, на GB10 не запустится без пересборки или эмуляции. Даже среди NVIDIA NIM не каждый микросервис имеет версию для Spark, поэтому совместимость конкретной модели нужно проверять в каталоге.

Платформа подходит для проектов, которые уже используют CUDA, cuDNN, TensorRT-LLM, NVIDIA NIM или другие библиотеки компании. Код и контейнеры затем можно перенести на серверные ускорители NVIDIA, если проекту потребуется больше памяти или многобатчевый инференс.

AMD: ROCm и графика gfx1151

Radeon 8060S использует архитектуру gfx1151. Основной стек для вычислений на графике — ROCm и HIP. При этом система остаётся обычным компьютером x86-64, поэтому на ней работают стандартные версии Windows- и Linux-программ.

Для gfx1151 уже доступны готовые сборки. AMD публикует пакеты PyTorch, готовые бинарники llama.cpp и инструменты для vLLM. Сборка из исходников нужна не во всех сценариях. Ручная компиляция остаётся нужна, если готовый пакет не поддерживает конкретную модель, оператор или версию программы.

На Linux важна версия ядра. Для вычислений на Strix Halo нужен Linux с необходимыми исправлениями AMDGPU/KFD. AMD поддерживает Ubuntu 24.04 с актуальными HWE- и OEM-ядрами, а для остальных дистрибутивов ориентир — Linux 6.18.4 или новее.

В Windows удобно использовать настольные приложения вроде LM Studio, но поддержка вычислительных библиотек зависит от конкретной среды выполнения и сборки. Например, llama.cpp и LM Studio могут использовать Radeon через совместимую среду, тогда как отдельным пакетам PyTorch или расширениям всё ещё нужна подходящая сборка ROCm.

Совместимость популярных программ

Программа NVIDIA DGX Spark AMD Ryzen AI Max+ 395
llama.cpp CUDA HIP/ROCm или Vulkan
Ollama CUDA ROCm 7 или Vulkan
LM Studio Нативное приложение Linux ARM64, GUI и локальный сервер Приложение для Windows/Linux и локальный сервер
vLLM Готовый NGC-контейнер Готовый контейнер ROCm
PyTorch Контейнеры NGC для Grace Blackwell Пакеты ROCm для gfx1151
TensorRT-LLM Поддерживается Не поддерживается
NVIDIA NIM Поддерживается для совместимых образов Не поддерживается

llama.cpp — наиболее универсальный вариант для GGUF-моделей. Проект поддерживает CUDA для NVIDIA, HIP для AMD и общий бэкенда Vulkan. На обеих платформах можно запускать квантованные модели и поднимать локальный сервер с API.

Ollama упрощает загрузку и запуск моделей из командной строки. Программа поддерживает CUDA, ROCm и Vulkan. Готовая установка не гарантирует, что ускорение включилось: после запуска нужно проверить, использует ли модель графику, а не процессор.

LM Studio поддерживает DGX Spark нативно: доступна ARM64-версия с графическим интерфейсом и локальным API-сервером. Установку, настройку RAG и работу с API мы отдельно разобрали в руководстве по LM Studio.

vLLM рассчитан на серверный инференс, параллельные запросы и непрерывное формирование пакетов. Для платформы NVIDIA доступен готовый контейнер NGC и проверенные конфигурации моделей. Поддерживается и распределённый запуск на двух устройствах. В актуальном ROCm для gfx1151 доступен vLLM на Linux. AMD публикует готовые пакеты и контейнеры, но совместимость и производительность всё равно нужно проверять для конкретной версии vLLM и модели.

Какая программная среда удобнее

Обе платформы подходят для llama.cpp, Ollama и LM Studio. DGX Spark удобнее, если нужны CUDA, TensorRT-LLM, NIM и готовые NGC-контейнеры. Ryzen AI Max+ 395 — если важны Windows, x86-64 и обычное настольное ПО. На AMD совместимость сильнее зависит от версии ROCm, драйвера и ядра Linux.

Для каких задач Запуск и дообучение больших языковых моделей до 200 млрд локально
Подробнее
Видеокарты
Radeon 8060S
Объем видеопамяти 64 ГБ
Процессоры
Ryzen AI Max+ 395
Количество ядер 16 Zen 5
RAM Объединена с VRAM
Форм-фактор SFF
Для каких задач Запуск и дообучение больших языковых моделей до 200 млрд локально
Подробнее
Видеокарты
Radeon 8060S
Объем видеопамяти 64 ГБ
Процессоры
Ryzen AI Max+ 395
Количество ядер 16 Zen 5
RAM Объединена с VRAM
Форм-фактор SFF

Цена и доступность

Ryzen AI Max+ 395 — процессор, поэтому сравнивать его цену с DGX Spark напрямую некорректно. При сопоставлении готовых систем нужно учитывать не только объём памяти, но и накопитель, охлаждение, сетевые интерфейсы и комплект поставки.

В США AMD Ryzen AI Halo Developer Platform со 128 ГБ памяти стоит 3999 долларов, а NVIDIA DGX Spark Founders Edition — 4699 долларов. Разница составляет 700 долларов, или около 17,5% относительно системы AMD. Эти суммы показывают стоимость входа, но не означают равноценность комплектаций. Перед покупкой стоит отдельно сравнить объём SSD и оснащение конкретных моделей.

На 24 августа 2026 года в каталоге DigitalRazor указаны следующие стартовые цены:

Система Память Цена
NVIDIA DGX Spark 128 ГБ от 660 000 ₽
ASUS Ascent GX10 128 ГБ от 670 000 ₽
MSI EdgeXpert MS-C931 128 ГБ от 500 000 ₽
MS-S1 MAX на Ryzen AI Max+ 395 64 ГБ от 360 000 ₽
MS-S1 MAX на Ryzen AI Max+ 395 128 ГБ от 660 000 ₽

DigitalRazor указывает для трёх систем на GB10 одинаковые 128 ГБ общей памяти, а для MS-S1 MAX предлагает версии на 64 и 128 ГБ.

При одинаковых 128 ГБ цена зависит уже не только от платформы, но и от конкретного устройства. MS-S1 MAX и DGX Spark стоят от 660 000 рублей, ASUS Ascent GX10 — от 670 000 рублей, а MSI EdgeXpert MS-C931 — от 500 000 рублей. Поэтому сравнивать AMD и GB10 только по цене платформы некорректно.

При выборе стоит сравнивать не только цену, но и конкретную комплектацию, доступность и программную среду. DGX Spark и его аналоги на GB10 ориентированы на стек NVIDIA и CUDA, тогда как Ryzen AI Max+ 395 предлагает x86-64, Windows или Linux и лучше подходит на роль универсального рабочего компьютера.

Какую платформу выбрать

Выбор зависит прежде всего от программного стека. Одинаковые 128 ГБ памяти не делают DGX Spark и Ryzen AI Max+ 395 взаимозаменяемыми.

Сценарий Предпочтительная платформа Почему
Локальный инференс через llama.cpp, Ollama или LM Studio Обе Оба стека поддерживают эти инструменты; выбор зависит от ОС и остальных приложений
Разработка и перенос проектов на серверы NVIDIA DGX Spark CUDA, TensorRT-LLM, NIM и близкое к серверной экосистеме NVIDIA окружение
Эксперименты с моделями 70B–120B Обе Модели помещаются в память при подходящей квантизации, а скорость зависит от бэкенда и контекста
Дообучение моделей DGX Spark Более зрелый стек CUDA и больше готовых инструментов
Рабочая станция для ИИ и обычных x86-приложений Ryzen AI Max+ 395 Можно использовать Windows, привычное настольное ПО и x86-64-инструменты
Готовая специализированная система без подбора конфигурации DGX Spark Фиксированное оснащение, DGX OS и предустановленный стек NVIDIA
Несколько связанных узлов Обе, но DGX Spark удобнее для двух быстрых узлов Spark имеет ConnectX-7 200 Гбит/с, системы Ryzen AI Max+ тоже можно объединять по сети
Минимальная стоимость входа Ryzen AI Max+ 395 с 64 ГБ Такие конфигурации дешевле, но сильнее ограничивают размер модели и контекста

Когда лучше NVIDIA DGX Spark

DGX Spark стоит выбрать, если проект уже использует CUDA или его планируют переносить на серверные ускорители NVIDIA. Платформа также удобнее для TensorRT-LLM, NIM и другого ПО, оптимизированного под экосистему NVIDIA.

Главное ограничение — Arm-процессор. Перед покупкой нужно проверить наличие сборок всех зависимостей для aarch64. Программа, контейнер или библиотека, рассчитанные только на x86-64, могут потребовать пересборки или замены.

Когда лучше Ryzen AI Max+ 395

Система AMD подходит тем, кому нужен не только ИИ-ускоритель, но и универсальный компактный компьютер. Архитектура x86-64 упрощает запуск привычных приложений, а выбор между Windows и Linux позволяет настроить платформу под существующий рабочий процесс.

В опубликованных AMD тестах Ryzen AI Halo опережал DGX Spark на 4–14% в скорости генерации четырёх выбранных моделей. Эти результаты нельзя переносить на все LLM: тесты проводила AMD, а итог зависит от модели, квантизации, длины контекста и версии ПО. Поэтому преимущество платформы нужно подтверждать на собственном наборе моделей.

Найдите станцию под ваши задачи

Готовые конфигурации для работы с большими массивами данных

FAQ

1. Можно ли запускать модели 70B на обеих платформах?
Да. Квантизованная модель 70B помещается в 128 ГБ. Расход памяти зависит от формата весов, размера KV-кэша и контекста, а скорость — от движка инференса.
2. Поместится ли модель на 120B или 200B?
Модель 120B помещается при подходящей квантизации. Для 200B потребуется около 100 ГБ только под 4-битные веса, поэтому для контекста и служебных данных останется мало памяти.
3. Доступны ли графике все 128 ГБ?
Нет. Это общая системная память: её используют графика, процессор, операционная система, приложения и KV-кэш. Доступный модели объём всегда будет меньше 128 ГБ.
4. Можно ли установить Windows на DGX Spark?
NVIDIA поставляет DGX Spark с DGX OS на базе Ubuntu и не заявляет поддержку Windows. Если она необходима для рабочих приложений, лучше выбрать систему на Ryzen AI Max+ 395.
5. Работает ли ROCm на Ryzen AI Max+ 395?
Да. AMD официально поддерживает графику Strix Halo в ROCm, но совместимость зависит от версии ROCm, операционной системы и ядра Linux. Перед установкой нужно проверить матрицу AMD.
6. Какая платформа быстрее?
Единого победителя нет. Результат зависит от модели, квантизации, длины контекста и движка. AMD быстрее в одних тестах, а DGX Spark получает преимущество в оптимизированном ПО NVIDIA.
7. Можно ли дообучать LLM локально?
Да. Для крупных моделей применяют LoRA и QLoRA, которые сокращают расход памяти. NVIDIA заявляет дообучение моделей до 70B на DGX Spark, но результат зависит от настроек.

Итоги

DGX Spark предпочтительнее для проектов на CUDA, TensorRT-LLM, NIM и других инструментах NVIDIA. Система на Ryzen AI Max+ 395 удобнее, если наряду с локальными LLM нужны Windows, x86-64 и обычные рабочие приложения. Если выбор зависит от конкретной модели, платформы нужно сравнивать в одинаковой квантизации, с одинаковым контекстом и бэкендом — объём памяти и TOPS сами по себе скорость не определяют.

Выбирать платформу только по объёму памяти, TOPS или отдельному бенчмарку не стоит. Сначала нужно определить модель, квантизацию, длину контекста и рабочий движок, а затем сравнить скорость и расход памяти в одинаковых условиях.

Посмотреть доступные конфигурации можно в каталогах NVIDIA DGX Spark и систем на GB10 и мини-ПК на AMD Ryzen AI Max+ 395.

Подберём решение под ваш проект

Расскажите о задаче — предложим оптимальную конфигурацию и реализацию.

Обсудить проект
или свяжитесь с нами
Telegram Telegram WhatsApp WhatsApp ВКонтакте ВКонтакте MAX MAX
299

Так же будет интересно почитать

Выбираем компьютер для работы в Blender
Олег Олегович Олег Олегович
Статьи
Выбираем компьютер для работы в Blender

Blender полюбился многим за стабильное развитие и техническую поддержку. Спектр возможностей у приложения широкий: от визуализации до монтажа и рендеринга. Поэтому выбор оптимального компьютера вызывает вопросы. В продолжении цикла статей разберем системные требования и ответим, какую графическую станцию выбрать для комфортной работы.

4 мин
74.8К
Процессоры AMD Ryzen X3D в рабочих задачах
Олег Олегович Олег Олегович
Статьи
Процессоры AMD Ryzen X3D в рабочих задачах

В этом материале расскажем, почему постулат «Ryzen X3D предназначены только для игр» можно считать устаревшим. Почему Ryzen 9900X3D и 9950X3D — не просто какие-то странные процессоры, а очень любопытное гибридное решение. Вариант для тех, кто использует компьютер не только для игр, но и для работы.

9 мин
69К

Сайт использует cookies
Узнать подробнее