
DGX Spark или Ryzen AI Max+ 395: какой мини-ПК для локальных LLM выбрать
Есть проект? Напишите нам
Обсудим задачу и подберём оборудование
DGX Spark лучше подходит для проектов на CUDA, TensorRT-LLM и NIM, а также для переноса разработки на серверные GPU NVIDIA. Система на Ryzen AI Max+ 395 практичнее, если нужны Windows, x86-64 и обычные рабочие программы. Ниже сравним скорость LLM, память, программный стек и цену обеих платформ.
Что такое NVIDIA DGX Spark и AMD Ryzen AI Max+ 395
DGX Spark — готовая специализированная система на Arm со стеком NVIDIA. Ryzen AI Max+ 395 — x86-64 процессор для мини-ПК и рабочих станций разных производителей.
NVIDIA DGX Spark — мини-суперкомпьютер на чипе GB10
DGX Spark построен на однокристальной системе GB10 Grace Blackwell. Она объединяет 20-ядерный Arm-процессор — 10 ядер Cortex-X925 и 10 Cortex-A725 — со встроенным графическим ускорителем архитектуры Blackwell. Компьютер оснащён 128 ГБ когерентной объединённой памяти LPDDR5X с пропускной способностью 273 ГБ/с. Процессор и графика обращаются к одному пулу, поэтому веса модели не нужно копировать между системной памятью и отдельной VRAM.
В GB10 входят тензорные ядра пятого поколения. NVIDIA указывает производительность до 1 петафлопса в формате FP4 с разреженностью. Это теоретическая вычислительная величина, а не скорость конкретной локальной LLM: количество токенов в секунду также зависит от архитектуры модели, квантизации, контекста и программной среды.
DGX Spark работает под управлением DGX OS. В систему входят инструменты NVIDIA, поддержка CUDA, контейнерная среда Docker и доступ к NGC. Производитель заявляет запуск моделей до 200 млрд параметров на одном компьютере и дообучение моделей до 70 млрд параметров. Эти числа обозначают предельный класс задач: фактическая вместимость зависит от формата весов и памяти, которую займут операционная система, KV-кэш и среда выполнения.
Размер корпуса составляет 150 × 150 × 50,5 мм, масса — 1,2 кг. TDP чипа GB10 равен 140 Вт, а комплектный блок питания рассчитан на 240 Вт. Эти показатели нельзя считать потреблением всей системы из розетки под конкретной нагрузкой. Подробнее характеристики GB10, результаты тестов и сценарии применения мы разобрали в отдельном обзоре NVIDIA DGX Spark.
AMD Ryzen AI Max+ 395 — APU Strix Halo с общей памятью
Ryzen AI Max+ 395 — старшая модель семейства Strix Halo. Это не отдельный мини-ПК, а процессор, который устанавливают в компьютеры разных производителей. Поэтому перед покупкой нужно проверять объём памяти, накопитель, режим мощности, охлаждение и поддержку нужной операционной системы у конкретной модели.
Процессор получил 16 ядер и 32 потока Zen 5 с максимальной частотой до 5,1 ГГц. Встроенная Radeon 8060S содержит 40 вычислительных блоков RDNA 3.5, а нейропроцессор XDNA 2 обеспечивает до 50 TOPS. AMD указывает до 126 TOPS для всей однокристальной системы. Однако NPU TOPS не показывают скорость генерации LLM на графическом ядре, поэтому напрямую сравнивать 50 TOPS XDNA 2 с показателем GB10 нельзя.
Ryzen AI Max+ 395 поддерживает до 128 ГБ LPDDR5X-8000 с 256-битной шиной. Теоретическая пропускная способность памяти рассчитывается так:
8000 МТ/с × 256 бит ÷ 8 = 256 ГБ/с.
Память физически общая для процессора и Radeon 8060S. В документации ROCm AMD поясняет, что Strix Halo использует виртуальную память GPU: приложения могут отображать системную память в адресное пространство графики без отдельного пула дискретной VRAM. Доступный для модели объём всё равно будет меньше 128 ГБ, поскольку память нужна операционной системе, приложениям, KV-кэшу и служебным буферам.
Платформа работает на архитектуре x86-64 и поддерживает Windows и Linux. Это упрощает использование привычных настольных программ, но возможности ускорения ИИ зависят от драйвера и программного бэкенда. Для ROCm на Linux также важна совместимая версия ядра.
Первое различие уже видно: DGX Spark продаётся как готовая платформа с заранее настроенной экосистемой NVIDIA, а Ryzen AI Max+ 395 даёт производителям больше свободы в конфигурации. В следующей части сравним память, её реальную доступность для моделей и показатели TOPS без смешения несовместимых метрик.
Архитектура и память: одинаковые 128 ГБ работают по-разному
Обе платформы используют LPDDR5X как общую память для процессора и встроенной графики. Это позволяет загружать модели крупнее доступного объёма VRAM потребительских видеокарт. Однако часть памяти занимают операционная система, приложения, среда выполнения и KV-кэш, поэтому отдать модели все 128 ГБ не получится.
| Характеристика | NVIDIA DGX Spark | Система на AMD Ryzen AI Max+ 395 |
|---|---|---|
| Процессор | 20 ядер Arm | 16 ядер и 32 потока Zen 5 |
| Графика | NVIDIA Blackwell | Radeon 8060S, 40 блоков RDNA 3.5 |
| Память | 128 ГБ LPDDR5X | До 128 ГБ LPDDR5X-8000 |
| Шина памяти | 256 бит | 256 бит |
| Пропускная способность памяти | 273 ГБ/с | 256 ГБ/с, расчётное значение |
| ИИ-производительность | До 1000 TOPS для инференса, до 1 PFLOP FP4 с разреженностью | До 126 TOPS для всей системы, включая 50 TOPS NPU |
| Архитектура CPU | Arm64 | x86-64 |
| Диапазон мощности процессора | TDP GB10 — 140 Вт | cTDP — 45–120 Вт |
Общая память вместо отдельных ОЗУ и VRAM
В обычном компьютере процессор работает с системной ОЗУ, а дискретная видеокарта — с собственной VRAM. Если модель не помещается в видеопамять, часть её слоёв приходится переносить в системную ОЗУ. Обмен данными через PCIe снижает скорость генерации.
У сравниваемых платформ физического разделения нет. В DGX Spark процессор и графика используют когерентную объединённую память. NVIDIA указывает, что такая архитектура позволяет динамически распределять DRAM между CPU, GPU и другими вычислительными блоками. Поэтому nvidia-smi не показывает привычный объём выделенной видеопамяти: у встроенной графики нет отдельного кадрового буфера.
Чип AMD Ryzen AI Max+ 395
У Strix Halo память также физически общая. В Linux драйвер отображает её в адресное пространство Radeon 8060S через GPU Virtual Memory. По умолчанию приложениям может быть доступно около половины системной памяти, но лимит GTT можно увеличить. AMD рекомендует не резервировать большой объём в BIOS без необходимости, поскольку динамическое распределение оставляет больше памяти другим программам.
В Windows работает механизм Variable Graphics Memory. На компьютере со 128 ГБ AMD предлагает выделить графике до 96 ГБ. С учётом динамически адресуемой памяти Radeon может использовать до 112 ГБ, но зарезервированные 96 ГБ перестают быть доступными процессору. Значение нужно выбирать под размер модели и остальные приложения, а не устанавливать максимальный объём автоматически.
Пропускная способность: 273 ГБ/с против 256 ГБ/с
Для платформы NVIDIA производитель указывает 273 ГБ/с. У AMD значение можно рассчитать по скорости LPDDR5X-8000 и ширине шины:
8000 МТ/с × 256 бит ÷ 8 = 256 ГБ/с.
Разница составляет около 6,6%:
(273 ÷ 256 − 1) × 100% = 6,6%.
Эти 6,6% нельзя автоматически переносить на скорость генерации токенов. Результат также зависит от архитектуры модели, квантизации, длины контекста, драйвера и программного бэкенда. Для системы AMD важны ещё режим мощности и охлаждение конкретного мини-ПК.
Почему нельзя сравнивать 1000 и 50 TOPS
Показатели TOPS в спецификациях относятся к разным вычислительным блокам. NVIDIA заявляет до 1000 TOPS для Blackwell при вычислениях FP4 с разреженностью. AMD указывает 50 TOPS для нейропроцессора XDNA 2 и до 126 TOPS для всего чипа.
Разделить 1000 на 50 и сделать вывод о двадцатикратной разнице нельзя. Большинство рассматриваемых далее тестов локальных LLM выполняется на графике через CUDA, ROCm или Vulkan, а не на NPU. Поэтому реальную производительность будем сравнивать по скорости одной модели в одинаковой квантизации, времени до первого токена и условиям запуска.
Какие модели помещаются в 128 ГБ
Нижнюю границу объёма весов можно приблизительно рассчитать по числу параметров. Для грубой нижней оценки 4-битной квантизации можно считать по 4 бита на параметр. Реальный файл обычно больше: дополнительную память занимают данные квантования и параметры, которые хранятся с другой точностью.
| Размер модели | Расчёт | Теоретический минимум под веса |
|---|---|---|
| 7B | 7 млрд × 4 бита ÷ 8 | 3,5 ГБ |
| 13B | 13 млрд × 4 бита ÷ 8 | 6,5 ГБ |
| 30B | 30 млрд × 4 бита ÷ 8 | 15 ГБ |
| 70B | 70 млрд × 4 бита ÷ 8 | 35 ГБ |
Это теоретический минимум. Форматы GGUF Q4_K_M содержат дополнительные данные квантования, поэтому готовый файл будет крупнее. Отдельная память потребуется для KV-кэша, контекстного окна и служебных буферов.
Модели класса 7B, 13B и 30B в распространённых 4–8-битных квантизациях помещаются в 128 ГБ с большим запасом. Квантованная модель 70B также оставляет запас памяти, но его размер зависит от формата весов и длины контекста. Преимущество 128 ГБ сильнее проявляется на моделях свыше 70B и архитектурах Mixture of Experts.
О требованиях разных моделей к памяти и способах их установки мы подробнее рассказывали в гиде по локальному развёртыванию ИИ на ПК и сервере.
У MoE-моделей в память загружаются все веса, но при обработке каждого токена используется только часть экспертов. Например, Qwen3-Coder-30B-A3B-Instruct содержит 30,5 млрд параметров, из которых активируются 3,3 млрд. Это снижает вычислительную нагрузку по сравнению с плотной моделью сопоставимого общего размера, но само по себе не гарантирует более высокую скорость.
Сравнение производительности на задачах LLM
Скорость локальной LLM нельзя описать одним числом. Для интерактивной работы важны три показателя:
- обработка промпта — как быстро система читает запрос и контекст;
- время до первого токена — сколько проходит между отправкой запроса и началом ответа;
- генерация — сколько новых токенов в секунду создаёт загруженная модель.
На результат влияют модель, квантизация, длина контекста, размер пакета, версия драйвера и вычислительная среда. Поэтому сравнивать результаты из разных тестов напрямую нельзя.
Что показывают тесты AMD и независимые измерения
В мае 2026 года AMD сравнила свою Ryzen AI Halo Developer Platform с NVIDIA DGX Spark. Обе системы получили 128 ГБ LPDDR5X и работали под Linux. Производитель использовал актуальные на 6 мая программные среды и измерял скорость при контексте 100 токенов.
| Модель | Результат системы AMD относительно NVIDIA |
|---|---|
| GLM 4.7 Flash 30B-A3B | На 14% быстрее |
| GPT-OSS-120B | На 7% быстрее |
| Qwen 3.5 122B-A10B | На 12% быстрее |
| Qwen 3.6 35B-A3B | На 4% быстрее |
Это тест производителя на предварительной версии AMD Ryzen AI Halo, а не независимое исследование. Короткий контекст также не показывает поведение платформ при работе с крупной базой документов или длинной историей диалога. Результаты подтверждают близкий класс производительности, но не гарантируют такой же отрыв на других моделях.
Независимое сравнение показало другой результат. В тестах llama.cpp DGX Spark и системы Corsair AI Workstation 300 на Ryzen AI Max+ 395 платформа NVIDIA быстрее обрабатывала промпт и в большинстве сценариев быстрее генерировала токены, особенно с ростом контекста. Наиболее близкие результаты системы показали с Gemma 3 27B. Это не противоречит тесту AMD: использовались другие модели, версии ПО и длины контекста. Поэтому переносить преимущество одной платформы на все LLM нельзя.
В репозитории llama.cpp опубликованы абсолютные результаты DGX Spark. Тесты проводились через CUDA с Flash Attention и полным переносом слоёв модели на GPU.
| Модель | Квантизация | Генерация без заполненного контекста | Генерация при контексте 32K |
|---|---|---|---|
| Qwen2.5-Coder 7B | Q8_0 | 29,43 токена/с | 22,51 токена/с |
| Qwen3-Coder 30B-A3B | Q8_0 | 61,06 токена/с | 30,21 токена/с |
| GPT-OSS-120B | MXFP4 | 58,72 токена/с | 42,76 токена/с |
Тесты не сравнивают платформы между собой, но показывают влияние контекста.
Для GPT-OSS-120B скорость снизилась примерно на 27%:
(58,72 − 42,76) ÷ 58,72 × 100% = 27,2%.
У Qwen3-Coder 30B-A3B снижение достигло 50,5%:
(61,06 − 30,21) ÷ 61,06 × 100% = 50,5%.
Поэтому график с одним значением «токенов в секунду» без длины контекста будет неполным. Для рабочего сравнения нужно тестировать одну модель, квантизацию и версию llama.cpp при одинаковых настройках.
Время до первого токена и длинный контекст
Время до первого токена зависит прежде всего от скорости обработки промпта. Чем больше документов, фрагментов кода или сообщений передано модели, тем дольше система обрабатывает запрос до начала генерации.
В тестах MLPerf Client система на Ryzen AI Max+ 395 выдала первый токен Phi-3.5 менее чем за 0,7 секунды. Для более крупных Llama 2 7B и Llama 3.1 8B задержка составила немногим больше секунды. AMD использовала Windows 11 и гибридный режим NPU + iGPU: XDNA 2 обрабатывал промпт, а Radeon отвечала за генерацию. Эти результаты нельзя напрямую сопоставлять с тестами llama.cpp на CUDA, но они показывают пользу NPU в совместимой программной среде.
Длинный контекст влияет и на память. KV-кэш растёт вместе с количеством токенов, числом слоёв и размерностью модели. Если веса занимают почти весь доступный объём, заявленное моделью контекстное окно может не поместиться. Поэтому перед запуском крупной LLM нужно проверять не только размер файла GGUF, но и расход памяти при требуемой длине контекста.
Дообучение моделей
Обе платформы подходят для LoRA и QLoRA, но 128 ГБ памяти не означают, что на них можно полноценно обучить модель на 128 ГБ весов. Во время обучения память требуется не только параметрам, но и градиентам, состояниям оптимизатора и активациям.
NVIDIA заявляет для своей системы дообучение моделей до 70B. Реальный предел зависит от длины последовательности, размера пакета и выбранного метода. Для крупных моделей практичнее QLoRA: базовые веса хранятся в четырёхбитном формате, а обучение изменяет небольшие адаптеры.
AMD предоставляет инструкции для LoRA, QLoRA и полного дообучения через PyTorch и ROCm. В официальном примере используется Gemma 3 4B. В официальном playbook AMD QLoRA для Strix Halo рассчитана на Linux: используемый метод зависит от bitsandbytes. Для Windows AMD в этой конфигурации рекомендует LoRA или полное дообучение.
Для экспериментов с адаптерами обе платформы подходят. Если требуется регулярное дообучение крупных моделей, большие пакеты или несколько задач одновременно, вместо компактной системы стоит рассматривать рабочую станцию или GPU-сервер с несколькими дискретными ускорителями.
Выберите GPU-сервер для нейросетей
Готовые решения для работы с большими массивами данных
Экосистема ПО: CUDA против ROCm
Главное различие между платформами — настройка программной среды. NVIDIA предлагает готовую Linux-среду с CUDA и контейнерами. AMD сохраняет совместимость с x86-64 и Windows, но требует внимательнее следить за версиями ROCm, драйвера и ядра Linux.
NVIDIA: DGX OS, CUDA и контейнеры NGC
DGX Spark поставляется с DGX OS, драйвером NVIDIA, Docker и NVIDIA Container Toolkit. Для установки PyTorch, vLLM, TensorRT-LLM и других инструментов можно использовать готовые NGC-контейнеры, собранные под Grace Blackwell. Это снижает риск конфликта версий CUDA, библиотек и фреймворка.
У NGC есть отдельные образы и профили для архитектуры Arm64. Обычный контейнер, рассчитанный только на x86-64, на GB10 не запустится без пересборки или эмуляции. Даже среди NVIDIA NIM не каждый микросервис имеет версию для Spark, поэтому совместимость конкретной модели нужно проверять в каталоге.
Платформа подходит для проектов, которые уже используют CUDA, cuDNN, TensorRT-LLM, NVIDIA NIM или другие библиотеки компании. Код и контейнеры затем можно перенести на серверные ускорители NVIDIA, если проекту потребуется больше памяти или многобатчевый инференс.
AMD: ROCm и графика gfx1151
Radeon 8060S использует архитектуру gfx1151. Основной стек для вычислений на графике — ROCm и HIP. При этом система остаётся обычным компьютером x86-64, поэтому на ней работают стандартные версии Windows- и Linux-программ.
Для gfx1151 уже доступны готовые сборки. AMD публикует пакеты PyTorch, готовые бинарники llama.cpp и инструменты для vLLM. Сборка из исходников нужна не во всех сценариях. Ручная компиляция остаётся нужна, если готовый пакет не поддерживает конкретную модель, оператор или версию программы.
На Linux важна версия ядра. Для вычислений на Strix Halo нужен Linux с необходимыми исправлениями AMDGPU/KFD. AMD поддерживает Ubuntu 24.04 с актуальными HWE- и OEM-ядрами, а для остальных дистрибутивов ориентир — Linux 6.18.4 или новее.
В Windows удобно использовать настольные приложения вроде LM Studio, но поддержка вычислительных библиотек зависит от конкретной среды выполнения и сборки. Например, llama.cpp и LM Studio могут использовать Radeon через совместимую среду, тогда как отдельным пакетам PyTorch или расширениям всё ещё нужна подходящая сборка ROCm.
Совместимость популярных программ
| Программа | NVIDIA DGX Spark | AMD Ryzen AI Max+ 395 |
|---|---|---|
| llama.cpp | CUDA | HIP/ROCm или Vulkan |
| Ollama | CUDA | ROCm 7 или Vulkan |
| LM Studio | Нативное приложение Linux ARM64, GUI и локальный сервер | Приложение для Windows/Linux и локальный сервер |
| vLLM | Готовый NGC-контейнер | Готовый контейнер ROCm |
| PyTorch | Контейнеры NGC для Grace Blackwell | Пакеты ROCm для gfx1151 |
| TensorRT-LLM | Поддерживается | Не поддерживается |
| NVIDIA NIM | Поддерживается для совместимых образов | Не поддерживается |
llama.cpp — наиболее универсальный вариант для GGUF-моделей. Проект поддерживает CUDA для NVIDIA, HIP для AMD и общий бэкенда Vulkan. На обеих платформах можно запускать квантованные модели и поднимать локальный сервер с API.
Ollama упрощает загрузку и запуск моделей из командной строки. Программа поддерживает CUDA, ROCm и Vulkan. Готовая установка не гарантирует, что ускорение включилось: после запуска нужно проверить, использует ли модель графику, а не процессор.
LM Studio поддерживает DGX Spark нативно: доступна ARM64-версия с графическим интерфейсом и локальным API-сервером. Установку, настройку RAG и работу с API мы отдельно разобрали в руководстве по LM Studio.
vLLM рассчитан на серверный инференс, параллельные запросы и непрерывное формирование пакетов. Для платформы NVIDIA доступен готовый контейнер NGC и проверенные конфигурации моделей. Поддерживается и распределённый запуск на двух устройствах. В актуальном ROCm для gfx1151 доступен vLLM на Linux. AMD публикует готовые пакеты и контейнеры, но совместимость и производительность всё равно нужно проверять для конкретной версии vLLM и модели.
Какая программная среда удобнее
Обе платформы подходят для llama.cpp, Ollama и LM Studio. DGX Spark удобнее, если нужны CUDA, TensorRT-LLM, NIM и готовые NGC-контейнеры. Ryzen AI Max+ 395 — если важны Windows, x86-64 и обычное настольное ПО. На AMD совместимость сильнее зависит от версии ROCm, драйвера и ядра Linux.
Цена и доступность
Ryzen AI Max+ 395 — процессор, поэтому сравнивать его цену с DGX Spark напрямую некорректно. При сопоставлении готовых систем нужно учитывать не только объём памяти, но и накопитель, охлаждение, сетевые интерфейсы и комплект поставки.
В США AMD Ryzen AI Halo Developer Platform со 128 ГБ памяти стоит 3999 долларов, а NVIDIA DGX Spark Founders Edition — 4699 долларов. Разница составляет 700 долларов, или около 17,5% относительно системы AMD. Эти суммы показывают стоимость входа, но не означают равноценность комплектаций. Перед покупкой стоит отдельно сравнить объём SSD и оснащение конкретных моделей.
На 24 августа 2026 года в каталоге DigitalRazor указаны следующие стартовые цены:
| Система | Память | Цена |
|---|---|---|
| NVIDIA DGX Spark | 128 ГБ | от 660 000 ₽ |
| ASUS Ascent GX10 | 128 ГБ | от 670 000 ₽ |
| MSI EdgeXpert MS-C931 | 128 ГБ | от 500 000 ₽ |
| MS-S1 MAX на Ryzen AI Max+ 395 | 64 ГБ | от 360 000 ₽ |
| MS-S1 MAX на Ryzen AI Max+ 395 | 128 ГБ | от 660 000 ₽ |
DigitalRazor указывает для трёх систем на GB10 одинаковые 128 ГБ общей памяти, а для MS-S1 MAX предлагает версии на 64 и 128 ГБ.
При одинаковых 128 ГБ цена зависит уже не только от платформы, но и от конкретного устройства. MS-S1 MAX и DGX Spark стоят от 660 000 рублей, ASUS Ascent GX10 — от 670 000 рублей, а MSI EdgeXpert MS-C931 — от 500 000 рублей. Поэтому сравнивать AMD и GB10 только по цене платформы некорректно.
При выборе стоит сравнивать не только цену, но и конкретную комплектацию, доступность и программную среду. DGX Spark и его аналоги на GB10 ориентированы на стек NVIDIA и CUDA, тогда как Ryzen AI Max+ 395 предлагает x86-64, Windows или Linux и лучше подходит на роль универсального рабочего компьютера.
Какую платформу выбрать
Выбор зависит прежде всего от программного стека. Одинаковые 128 ГБ памяти не делают DGX Spark и Ryzen AI Max+ 395 взаимозаменяемыми.
| Сценарий | Предпочтительная платформа | Почему |
|---|---|---|
| Локальный инференс через llama.cpp, Ollama или LM Studio | Обе | Оба стека поддерживают эти инструменты; выбор зависит от ОС и остальных приложений |
| Разработка и перенос проектов на серверы NVIDIA | DGX Spark | CUDA, TensorRT-LLM, NIM и близкое к серверной экосистеме NVIDIA окружение |
| Эксперименты с моделями 70B–120B | Обе | Модели помещаются в память при подходящей квантизации, а скорость зависит от бэкенда и контекста |
| Дообучение моделей | DGX Spark | Более зрелый стек CUDA и больше готовых инструментов |
| Рабочая станция для ИИ и обычных x86-приложений | Ryzen AI Max+ 395 | Можно использовать Windows, привычное настольное ПО и x86-64-инструменты |
| Готовая специализированная система без подбора конфигурации | DGX Spark | Фиксированное оснащение, DGX OS и предустановленный стек NVIDIA |
| Несколько связанных узлов | Обе, но DGX Spark удобнее для двух быстрых узлов | Spark имеет ConnectX-7 200 Гбит/с, системы Ryzen AI Max+ тоже можно объединять по сети |
| Минимальная стоимость входа | Ryzen AI Max+ 395 с 64 ГБ | Такие конфигурации дешевле, но сильнее ограничивают размер модели и контекста |
Когда лучше NVIDIA DGX Spark
DGX Spark стоит выбрать, если проект уже использует CUDA или его планируют переносить на серверные ускорители NVIDIA. Платформа также удобнее для TensorRT-LLM, NIM и другого ПО, оптимизированного под экосистему NVIDIA.
Главное ограничение — Arm-процессор. Перед покупкой нужно проверить наличие сборок всех зависимостей для aarch64. Программа, контейнер или библиотека, рассчитанные только на x86-64, могут потребовать пересборки или замены.
Когда лучше Ryzen AI Max+ 395
Система AMD подходит тем, кому нужен не только ИИ-ускоритель, но и универсальный компактный компьютер. Архитектура x86-64 упрощает запуск привычных приложений, а выбор между Windows и Linux позволяет настроить платформу под существующий рабочий процесс.
В опубликованных AMD тестах Ryzen AI Halo опережал DGX Spark на 4–14% в скорости генерации четырёх выбранных моделей. Эти результаты нельзя переносить на все LLM: тесты проводила AMD, а итог зависит от модели, квантизации, длины контекста и версии ПО. Поэтому преимущество платформы нужно подтверждать на собственном наборе моделей.
Найдите станцию под ваши задачи
Готовые конфигурации для работы с большими массивами данных
FAQ
Итоги
DGX Spark предпочтительнее для проектов на CUDA, TensorRT-LLM, NIM и других инструментах NVIDIA. Система на Ryzen AI Max+ 395 удобнее, если наряду с локальными LLM нужны Windows, x86-64 и обычные рабочие приложения. Если выбор зависит от конкретной модели, платформы нужно сравнивать в одинаковой квантизации, с одинаковым контекстом и бэкендом — объём памяти и TOPS сами по себе скорость не определяют.
Выбирать платформу только по объёму памяти, TOPS или отдельному бенчмарку не стоит. Сначала нужно определить модель, квантизацию, длину контекста и рабочий движок, а затем сравнить скорость и расход памяти в одинаковых условиях.
Посмотреть доступные конфигурации можно в каталогах NVIDIA DGX Spark и систем на GB10 и мини-ПК на AMD Ryzen AI Max+ 395.













