8 800 500-99-26 Для звонков по России
Какой компьютер выбрать для локального ИИ: DGX Spark, Ryzen AI или RTX 5090
Железо
12 мин

Какой компьютер выбрать для локального ИИ: DGX Spark, Ryzen AI или RTX 5090

DigitalRazor
DigitalRazor
Подписаться в Telegram
Содержание 11 разделов
Зачем нужен локальный компьютер для ИИ, если есть облачные LLM Какая скорость генерации нужна для разных задач Что можно запустить благодаря большому объёму памяти NVIDIA DGX Spark: 128 ГБ памяти и готовая среда для ИИ AMD Ryzen AI Max+ 395: мини-ПК, который умеет больше одного инференса ПК на RTX 5090: максимальная скорость, пока модель помещается в видеопамять Альтернатива: Apple Silicon для пользователей macOS Сравнение платформ Что выбрать для локальных LLM в 2026 году FAQ — ответы на частые вопросы Итог
Подберём решение под ваш проект

Расскажите о задаче — предложим оптимальную конфигурацию и реализацию.

Обсудить проект
или свяжитесь с нами
Telegram Telegram WhatsApp WhatsApp ВКонтакте ВКонтакте MAX MAX

Есть проект? Напишите нам

Обсудим задачу и подберём оборудование

Обсудить проект

Выбор компьютера для локальных LLM — это компромисс между скоростью, объёмом памяти и программной совместимостью. Этот подробный разбор поможет понять, чем различаются NVIDIA DGX Spark, системы на AMD Ryzen AI Max+ 395 и ПК с GeForce RTX 5090. Разберём, какие модели помещаются в их память, сравним результаты тестов, энергопотребление и стоимость, а затем определим, какая платформа лучше подходит для крупных LLM, быстрого инференса и повседневной работы.

Зачем нужен локальный компьютер для ИИ, если есть облачные LLM

Облачные сервисы позволяют работать с языковыми моделями без покупки собственного оборудования. Локальный компьютер нужен в тех случаях, когда важны контроль над данными, автономность и возможность самостоятельно выбирать модели и параметры запуска.

Критерий Облачная LLM Локальная LLM
Начальные затраты Покупка оборудования не требуется Необходимо приобрести компьютер
Оплата По подписке или объёму использования Электроэнергия и обслуживание
Передача данных Запросы обрабатывает внешний сервис Данные можно оставить внутри системы
Выбор моделей Ограничен возможностями провайдера Можно устанавливать совместимые модели
Настройки Зависят от сервиса Доступен выбор квантизации, контекста и backend
Работа без интернета Обычно недоступна Возможна после установки модели
Масштабирование Ресурсы предоставляет провайдер Ограничено возможностями оборудования
Обслуживание Выполняет провайдер Выполняет владелец системы

Локальный запуск особенно полезен для следующих задач:

  • обработки внутренних документов;
  • работы с конфиденциальным программным кодом;
  • тестирования собственных и экспериментальных моделей;
  • создания локальных ассистентов и ИИ-агентов;
  • работы без постоянного подключения к интернету;
  • многократного запуска моделей без оплаты каждого запроса.

При этом локальная система не всегда выгоднее облака. Помимо цены компьютера, необходимо учитывать настройку, энергопотребление, обслуживание и последующее обновление оборудования. Для нерегулярных запросов облачный сервис может оказаться проще.

Перед покупкой нужно проверить три параметра:

  • Помещаются ли веса модели в доступную память.
  • Сколько памяти потребуется для KV-кэша, контекста и runtime.
  • Обеспечивает ли выбранная платформа необходимую скорость.

Объём памяти нельзя оценивать только по числу параметров модели. Например, 70 млрд параметров при условных пяти битах на параметр потребуют:

70 млрд × 5 бит ÷ 8 = 43,75 млрд байт, или около 40,75 ГиБ.

После добавления служебных данных размер может оказаться ещё больше. Поэтому такая модель не помещается целиком в 32 ГБ VRAM, даже если используется квантование.

Найдите станцию под ваши задачи

Готовые конфигурации для работы с большими массивами данных

Какая скорость генерации нужна для разных задач

Скорость работы локальной LLM обычно измеряют в токенах в секунду. Один токен не равен одному слову: в зависимости от языка и текста токеном может быть часть слова, целое слово или несколько знаков.

Токены в ИИ

При этом одного показателя токенов в секунду недостаточно. Для интерактивной работы важны как минимум две метрики:

  • скорость обработки промпта, или prompt processing — насколько быстро система читает исходный запрос и контекст;
  • скорость генерации — сколько новых токенов модель создаёт за секунду после обработки запроса.

Кроме того, на восприятие скорости влияет задержка первого токена. Для автодополнения кода она может быть важнее максимальной скорости длинного ответа.

Официальных порогов, разделяющих «медленную» и «быструю» локальную LLM, нет. В обычном диалоге даже 10–20 токенов/с могут быть приемлемы, тогда как локальным агентам и интерактивным инструментам для программирования полезна более высокая скорость. При нескольких пользователях нужно оценивать не скорость одного ответа, а совокупный throughput и задержку каждого запроса.

Как мы сравниваем результаты

Для более корректного сравнения возьмём две плотные модели одного семейства:

  • Qwen3 8B — относительно компактная модель;
  • Qwen3 32B — значительно более требовательная плотная модель.

Во всех приведённых тестах используется 4-битный GGUF-вариант и среда выполнения llama.cpp. Однако результаты получены разными авторами, на разных сборках программы и при разной длине контекста. Поэтому таблицу следует воспринимать как ориентир по классу производительности, а не как прямой лабораторный тест.

Система Qwen3 8B, генерация Qwen3 32B, генерация Условия и ограничения
NVIDIA DGX Spark 43,7 токена/с 10,7 токена/с Q4_K_M, llama.cpp, CUDA; измерение декодирования при контексте 512 токенов
Мини-ПК на Ryzen AI Max+ 395 около 36 токенов/с около 9 токенов/с 4-битные версии; 64 ГБ общей памяти выделено графике; точная сборка llama.cpp и длина контекста в опубликованном пересказе не указаны
ПК с GeForce RTX 5090 200,4 токена/с 61,4 токена/с Q4_K, llama.cpp; показатели при контексте 4K

Результаты DGX Spark представлены вместе со сценарием запуска и показывают 43,7 токена/с для Qwen3 8B и 10,7 токена/с для плотной Qwen3 32B. При увеличении контекста до 2048 токенов скорость снижается до 42,0 и 10,5 токена/с соответственно.

Для RTX 5090 представлены результаты 200,4 токена/с на Qwen3 8B и 61,4 токена/с на Qwen3 32B при контексте 4K. При увеличении контекста скорость уменьшается: например, Qwen3 8B показывает 162,3 токена/с при 16K и 129,8 токена/с при 32K. Это наглядно показывает, почему нельзя приводить одну скорость модели без указания длины контекста.

Для Ryzen AI Max+ 395 набор содержит примерно 36 токенов/с на Llama 3.1 8B Q4 и 9 токенов/с на Qwen3 32B Q4. Поскольку в строке 8B использована другая модель, значение Ryzen нельзя считать прямым результатом общего теста Qwen3 8B. Оно оставлено только как ориентир для 8B-класса.

Из таблицы можно сделать только общий вывод: когда плотная модель полностью помещается в 32 ГБ GDDR7, RTX 5090 имеет заметное преимущество в скорости генерации. Но числа нельзя использовать для расчёта точного процентного отрыва, поскольку тестовые протоколы различаются.

Что можно запустить благодаря большому объёму памяти

Плотные и MoE-модели необходимо рассматривать отдельно. У плотной модели в каждом шаге участвует основная часть весов. В MoE-модели в память также загружается полный набор весов, но при создании очередного токена используется только часть экспертов. Поэтому MoE может занимать десятки гигабайт памяти, но генерировать быстрее плотной модели похожего общего размера.

Параметр / платформа Qwen3 30B-A3B GPT-OSS-120B Qwen3-235B-A22B
Архитектура и формат MoE, Q4_K_M MoE, MXFP4/Q4 MoE, Q3_K_M
Размер файла весов Около 17,3 ГиБ Около 59 ГиБ Около 104,7 ГиБ
RTX 5090, 32 ГБ Помещается полностью Не помещается полностью в VRAM; потребуется offload Не помещается полностью
Ryzen AI Max+ 395, 128 ГБ Помещается полностью Помещается полностью Помещается с запасом под runtime и умеренный контекст Запуск подтверждён, но запас памяти ограничен
DGX Spark, 128 ГБ Помещается полностью Помещается; запуск подтверждён тестами llama.cpp Один Spark за официальный ориентир NVIDIA до 200B. Два Spark заявлены для моделей до 405B

Размер памяти не определяет скорость автоматически. Например, Qwen3 30B-A3B Q4_K_M занимает около 17,3 ГиБ и активирует примерно 3 млрд параметров на токен. В независимых тестах llama.cpp эта модель показала около 89 токенов/с на DGX Spark, 86 токенов/с на Ryzen AI Max+ 395 и 226 токенов/с на RTX 5090. Эти значения снова получены при разных версиях backend и глубине контекста, поэтому показывают порядок производительности, но не точный процентный разрыв.

Более показательный пример — GPT-OSS-120B. В формате MXFP4 модель занимает около 59 ГиБ. Она не помещается целиком в 32 ГБ RTX 5090, но помещается в память DGX Spark и 128-гигабайтной системы на Ryzen AI Max+ 395. В тесте основного репозитория llama.cpp DGX Spark показал 58,72 токена/с при коротком тесте генерации tg32; при глубине контекста 32K результат снизился до 42,76 токена/с.

Ryzen AI Max+ 395 в тесте запускал GPT-OSS-120B Q4_K_M размером около 58,5 ГиБ со скоростью 53,4 токена/с. Но этот результат получен через llama-server, тогда как часть других строк измерена в llama-bench. Его нельзя напрямую сравнивать с результатом DGX Spark без повторного теста в одинаковой конфигурации.

Для ещё более крупных MoE-моделей преимущество 128 ГБ заключается прежде всего в возможности запуска. Например, Qwen3-235B-A22B Q3_K_M занимает около 104,7 ГиБ и был запущен на системе с Ryzen AI Max+ 395 со скоростью 17,2 токена/с. При таком размере остаётся сравнительно небольшой запас под операционную систему, KV-кэш и runtime, поэтому допустимая длина контекста требует отдельной проверки.

NVIDIA заявляет для одного DGX Spark работу с моделями до 200 млрд параметров, а для двух связанных устройств — до 405 млрд. Qwen3-235B выходит за официальный заявленный NVIDIA ориентир до 200B для одного DGX Spark. Поэтому такой запуск нельзя считать гарантированным сценарием производителя: его нужно проверять экспериментально с конкретной квантизацией и контекстом.

Главный вывод

У RTX 5090 преимущество появляется, когда модель целиком помещается в 32 ГБ видеопамяти: высокая пропускная способность GDDR7 обеспечивает более быструю генерацию плотных моделей класса 8B–32B.

DGX Spark и системы на Ryzen AI Max+ 395 решают другую задачу. Их 128 ГБ общей памяти позволяют полностью размещать модели, которые не помещаются в RTX 5090. Это не гарантирует более высокую скорость, но устраняет необходимость переносить значительную часть модели в обычную системную память.

Для MoE-моделей нужно учитывать сразу два значения: полный объём весов определяет возможность загрузки, а число активных параметров заметно влияет на скорость генерации.

NVIDIA DGX Spark: 128 ГБ памяти и готовая среда для ИИ

NVIDIA DGX Spark

NVIDIA DGX Spark — компактный компьютер для разработки и локального запуска моделей ИИ. Он построен на SoC GB10 Grace Blackwell, объединяющей 20-ядерный ARM64-процессор и GPU архитектуры Blackwell.

Параметр Характеристика
Процессор 20 ядер ARM64: 10 Cortex-X925 и 10 Cortex-A725
Графика Blackwell, Tensor Cores пятого поколения
Память 128 ГБ общей LPDDR5X
Пропускная способность памяти 273 ГБ/с
Накопитель 4 ТБ у Founders Edition
Программная среда DGX OS, CUDA, cuDNN, Docker, NGC
Размеры 150 × 150 × 50,5 мм
Масса 1,2 кг
TDP SoC 140 Вт
Блок питания 240 Вт
Цена на 17 августа 2026 года 4699 долларов в официальном магазине NVIDIA в США

Подробнее об устройстве, производительности и ограничениях платформы читайте в нашем обзоре NVIDIA DGX Spark.

Главная особенность DGX Spark — общий когерентный пул памяти для процессора и GPU. Модель не нужно разделять между системной ОЗУ и отдельной VRAM. Однако часть из 128 ГБ занимают операционная система, среда выполнения и KV-кэш.

NVIDIA заявляет следующие возможности:

  • инференс моделей до 200 млрд параметров на одном устройстве;
  • работу с моделями до 405 млрд параметров при объединении двух DGX Spark;
  • соединение двух устройств через ConnectX-7;
  • локальную работу с CUDA-инструментами и контейнерами NVIDIA.

Эти значения обозначают предельный класс моделей, а не гарантируют запуск любой модели соответствующего размера. Результат зависит от архитектуры, квантизации, формата весов и длины контекста.

Преимущества DGX Spark:

  • 128 ГБ общей памяти;
  • готовая программная среда NVIDIA;
  • компактный корпус;
  • поддержка CUDA, cuDNN и NGC;
  • возможность объединить два устройства.

Ограничения:

  • плотные модели, помещающиеся в 32 ГБ VRAM, RTX 5090 обрабатывает быстрее;
  • программы и контейнеры только для x86-64 могут потребовать адаптации;
  • 128 ГБ нельзя полностью отдать под веса модели;
  • цена относится к американскому магазину и может отличаться в других регионах.

Кому подходит: разработчикам и исследователям, которым нужны 128 ГБ общей памяти, CUDA и готовая компактная Linux-система.

Для каких задач Запуск и дообучение больших языковых моделей до 200 млрд локально
Подробнее
Видеокарты
Grace Blackwell
Объем видеопамяти 128 ГБ
Процессоры
NVIDIA GB10
Количество ядер 20 Arm
RAM Объединена с VRAM
Форм-фактор SFF
Для каких задач Запуск и дообучение больших языковых моделей до 200 млрд локально
Подробнее
Видеокарты
Grace Blackwell
Объем видеопамяти 128 ГБ
Процессоры
NVIDIA GB10
Количество ядер 20 Arm
RAM Объединена с VRAM
Форм-фактор SFF
Для каких задач Запуск и дообучение больших языковых моделей до 200 млрд локально
Подробнее
Видеокарты
Grace Blackwell
Объем видеопамяти 128 ГБ
Процессоры
NVIDIA GB10
Количество ядер 20 Arm
RAM Объединена с VRAM
Форм-фактор SFF

AMD Ryzen AI Max+ 395: мини-ПК, который умеет больше одного инференса

AMD Ryzen AI Halo

AMD Ryzen AI Max+ 395 — не отдельная модель мини-ПК, а процессор семейства Strix Halo. Его устанавливают в компьютеры разных производителей, поэтому производительность, шум и энергопотребление зависят от конкретного устройства.

Параметр Характеристика
Процессор 16 ядер и 32 потока Zen 5
Максимальная частота До 5,1 ГГц
Встроенная графика Radeon 8060S, 40 вычислительных блоков
Нейропроцессор XDNA 2, до 50 TOPS
Общая производительность До 126 TOPS
Память До 128 ГБ LPDDR5X-8000
Шина памяти 256 бит
Расчётная пропускная способность 256 ГБ/с
Архитектура x86-64
Операционные системы Windows и Linux
Диапазон TDP 45–120 Вт

Возможности готовой 128-гигабайтной платформы мы подробнее разобрали в материале о компактной ИИ-станции на Ryzen AI Max+ 395.

Расчётная пропускная способность памяти:

8000 МТ/с × 256 бит ÷ 8 = 256 ГБ/с.

Это теоретическое значение. Реальный результат зависит от конструкции компьютера, режима мощности, охлаждения и используемого программного backend.

Процессор и Radeon 8060S используют общий пул памяти. Благодаря этому система может загружать модели, которые не помещаются в 32 ГБ видеопамяти RTX 5090. Часть памяти при этом занимают операционная система, приложения, runtime и KV-кэш.

Преимущества Ryzen AI Max+ 395:

  • до 128 ГБ общей памяти;
  • привычная архитектура x86-64;
  • поддержка Windows и Linux;
  • возможность использовать систему как обычный рабочий компьютер;
  • компактный форм-фактор;
  • запуск моделей, превышающих объём VRAM потребительских видеокарт.

Ограничения:

  • на моделях, помещающихся в VRAM, встроенная графика уступает RTX 5090;
  • скорость зависит от настроек мощности и охлаждения;
  • доступный GPU объём памяти может зависеть от прошивки;
  • поддержку ROCm нужно проверять для конкретного компьютера и ОС;
  • результаты фирменной Ryzen AI Halo Developer Platform нельзя автоматически переносить на другие устройства.

Единой цены у систем на Ryzen AI Max+ 395 нет. Например, в мае 2026 года AMD указывала для Ryzen AI Halo Developer Platform со 128 ГБ памяти цену 3999 долларов. Другие устройства необходимо сравнивать с указанием конфигурации и даты проверки.

Кому подходит: пользователям, которым нужны более 32 ГБ памяти, Windows или Linux и возможность совмещать локальный ИИ с обычными рабочими задачами.

Для каких задач Запуск и дообучение больших языковых моделей до 200 млрд локально
Подробнее
Видеокарты
Radeon 8060S
Объем видеопамяти 64 ГБ
Процессоры
Ryzen AI Max+ 395
Количество ядер 16 Zen 5
RAM Объединена с VRAM
Форм-фактор SFF
Для каких задач Запуск и дообучение больших языковых моделей до 200 млрд локально
Подробнее
Видеокарты
Radeon 8060S
Объем видеопамяти 64 ГБ
Процессоры
Ryzen AI Max+ 395
Количество ядер 16 Zen 5
RAM Объединена с VRAM
Форм-фактор SFF

ПК на RTX 5090: максимальная скорость, пока модель помещается в видеопамять

NVIDIA GeForce RTX 5090

В отличие от DGX Spark и систем на Ryzen AI Max+ 395, GeForce RTX 5090 — не готовый компьютер, а дискретная видеокарта. Поэтому при сравнении необходимо учитывать характеристики и стоимость всей сборки: процессора, оперативной памяти, накопителя, охлаждения и блока питания.

Параметр Характеристика
Архитектура NVIDIA Blackwell
Видеопамять 32 ГБ GDDR7
Шина памяти 512 бит
Скорость памяти 28 Гбит/с
Пропускная способность памяти 1792 ГБ/с
TGP видеокарты 575 Вт
Рекомендуемый блок питания От 1000 Вт для всей системы
Программная экосистема CUDA, TensorRT, llama.cpp, Ollama, vLLM, PyTorch
Стартовая цена видеокарты 1999 долларов при анонсе в январе 2025 года

Характеристики и производительность флагмана подробнее рассмотрены в нашем обзоре GeForce RTX 5090.

Расчёт пропускной способности:

28 Гбит/с × 512 бит ÷ 8 = 1792 ГБ/с.

Это примерно:

  • в 6,6 раза больше 273 ГБ/с у DGX Spark;
  • в 7 раз больше расчётных 256 ГБ/с у Ryzen AI Max+ 395.

Разница в пропускной способности не означает такой же разницы в скорости генерации. На результат также влияют архитектура модели, квантизация, backend, контекст и размер пакета.

Преимущества RTX 5090:

  • высокая скорость генерации, когда модель целиком помещается в VRAM;
  • 1792 ГБ/с пропускной способности памяти;
  • развитая экосистема CUDA;
  • поддержка распространённых инструментов локального инференса;
  • универсальность полноценного настольного ПК;
  • возможность последующего обновления компонентов.

Ограничения:

  • только 32 ГБ физической видеопамяти;
  • крупным моделям потребуется перенос части слоёв в системную память;
  • offload снижает преимущество быстрой GDDR7;
  • высокое энергопотребление;
  • повышенные требования к блоку питания и охлаждению;
  • для сравнения цен нужно учитывать весь компьютер, а не только видеокарту.

RTX 5090 особенно интересна для квантизированных моделей класса 8B–32B. Однако 32B нельзя считать гарантированным пределом: требуемый объём памяти зависит от формата весов, KV-кэша и длины контекста.

Кому подходит: пользователям, которым нужна максимальная скорость на моделях, полностью помещающихся в 32 ГБ VRAM, а также совместимость с CUDA-инструментами.

[ PERFORMANCE PRO 350D ]
350D Tower
R7 9700X · RTX 5080 16ГБ · 64GB DDR5 RGB · 1 ТБ
463 000 ₽
34 725 ₽ / мес Примерный ежемесячный платёж. Итоговая сумма рассчитывается индивидуально.
Подробнее
350D Tower
i9-14900K · RTX 5090 32ГБ · 64GB DDR5 RGB · 1 ТБ
936 500 ₽
70 238 ₽ / мес Примерный ежемесячный платёж. Итоговая сумма рассчитывается индивидуально.
Подробнее
350D Tower
R9 9950X · RTX 5090 32ГБ · 64GB DDR5 RGB · 1 ТБ NVME 5.0
1 036 500 ₽
77 738 ₽ / мес Примерный ежемесячный платёж. Итоговая сумма рассчитывается индивидуально.
Подробнее

Альтернатива: Apple Silicon для пользователей macOS

Компьютеры Apple можно рассматривать как альтернативу, если рабочий процесс построен вокруг macOS, Metal или MLX. Они используют общую память для CPU и GPU, но не поддерживают CUDA, поэтому напрямую сравнивать их с NVIDIA и AMD по результатам одних тестов некорректно.

Параметр Mac mini M4 Pro Mac Studio M3 Ultra
Общая память До 64 ГБ От 96 до 512 ГБ
Пропускная способность 273 ГБ/с Более 800 ГБ/с
Программный стек Metal, MLX, llama.cpp Metal, MLX, llama.cpp
Основной сценарий Небольшие и средние модели Крупные модели и профессиональные задачи

Mac mini M4 Pro — компактная точка входа для моделей, помещающихся в 64 ГБ общей памяти. Mac Studio M3 Ultra поддерживает до 512 ГБ и, по заявлению Apple, позволяет локально запускать LLM более чем на 600 млрд параметров. Это не гарантирует совместимость с любой моделью такого класса: необходимый объём памяти зависит от формата весов, квантизации и контекста.

Обе системы стоит выбирать прежде всего ради macOS и инструментов Apple. Если рабочий процесс требует CUDA, TensorRT или другого программного обеспечения NVIDIA, лучше рассматривать DGX Spark либо ПК с RTX 5090.

Сравнение платформ

В основной таблице сопоставлены DGX Spark, фирменная AMD Ryzen AI Halo Developer Platform с Ryzen AI Max+ 395 и ПК с RTX 5090. Последний вариант представляет собой не готовое устройство, а компьютер с дискретной видеокартой, поэтому его итоговые характеристики и цена зависят от остальных комплектующих.

Параметр NVIDIA DGX Spark AMD Ryzen AI Halo ПК с RTX 5090
Тип системы Готовый специализированный Arm-компьютер Готовый универсальный x86-компьютер Настольный x86-ПК с дискретной GPU
Память 128 ГБ общей LPDDR5X 128 ГБ общей LPDDR5X 32 ГБ GDDR7 на GPU; системная ОЗУ отдельно
Пропускная способность 273 ГБ/с До 256 ГБ/с, расчётное значение 1792 ГБ/с
ОС NVIDIA DGX OS Windows 11 или Linux Windows 11 или Linux
Основной ИИ-стек CUDA, DGX OS, NVIDIA AI Software ROCm, Vulkan и совместимые backend CUDA и совместимые backend
Доступное пространство для модели Общая память за вычетом ОС, runtime и KV-кэша Общая память за вычетом ОС, runtime и KV-кэша VRAM за вычетом runtime, KV-кэша и служебных буферов
Основной сценарий Крупные модели и готовая среда NVIDIA Крупные модели и обычные x86-приложения Высокая скорость, если модель полностью помещается в VRAM
Ограничение Меньшая пропускная способность, чем у RTX 5090; Arm и DGX OS Результат зависит от ОС, драйвера и backend 32 ГБ VRAM и высокое энергопотребление
Ориентир мощности TDP GB10 — 140 Вт; блок питания — 240 Вт cTDP процессора — 45–120 Вт TGP видеокарты — 575 Вт; БП системы — от 1000 Вт
Цена в США 4699 долларов за готовую систему 3999 долларов за Developer Platform Стартовый MSRP GPU — 1999 долларов; остальные компоненты отдельно

Строку мощности нельзя использовать для прямого расчёта энергопотребления. У DGX Spark приведён TDP процессора и мощность комплектного блока питания, у AMD — настраиваемый TDP процессора, а у RTX 5090 — TGP только видеокарты. Для точного сравнения нужны измерения полной системы из розетки в одинаковой нагрузке.

Цены также относятся к разным категориям товара. DGX Spark и AMD Ryzen AI Halo — готовые компьютеры, тогда как 1999 долларов для RTX 5090 — первоначальная рекомендованная цена только видеокарты.

Нужна помощь с выбором?

Специалисты помогут подобрать оборудование под нагрузку, бюджет и задачи

Написать

Что выбрать для локальных LLM в 2026 году

Универсального победителя нет. Выбор определяется объёмом модели, требуемой скоростью и программным стеком.

Условие Подходящая платформа Почему
Модель помещается в 32 ГБ, важна скорость ПК с RTX 5090 Быстрая GDDR7 и экосистема CUDA
Нужно больше 32 ГБ и универсальная x86-система Ryzen AI Max+ 395 До 128 ГБ общей памяти, Windows и Linux
Нужно больше 32 ГБ и программный стек NVIDIA DGX Spark 128 ГБ общей памяти, DGX OS и CUDA
Требуются macOS, Metal или MLX Mac mini или Mac Studio Нативная экосистема Apple

Перед выбором нужно проверить:

  1. Размер весов в выбранной квантизации.
  2. Память для KV-кэша, контекста и runtime.
  3. Поддержку CUDA, ROCm, Vulkan, Metal или MLX.
  4. Скорость конкретной модели в требуемом backend.
  5. Стоимость и энергопотребление всей системы.

FAQ — ответы на частые вопросы

1. Сколько памяти нужно для модели на 70 млрд параметров?
Для Llama 3.1 70B Q4_K_M веса занимают 42,52 ГБ. Дополнительно нужна память для контекста, KV-кэша и runtime.
2. Что быстрее — DGX Spark, Ryzen AI Max+ 395 или RTX 5090?
RTX 5090 быстрее, пока модель помещается в 32 ГБ VRAM. Для более крупных моделей удобнее 128 ГБ памяти DGX Spark или Ryzen.
3. Можно ли использовать ИИ-компьютер как обычный ПК?
Ryzen AI Max+ 395 и ПК с RTX 5090 — да. DGX Spark работает на Arm и DGX OS, поэтому совместимость обычных программ нужно проверять.
4. Какая скорость генерации комфортна для работы с кодом?
Единого стандарта нет: важны токены в секунду, задержка первого токена, длина ответа и скорость обработки контекста.
5. Стоит ли выбирать Mac Studio для локальных LLM?
Да, если нужны macOS, Metal или MLX. Mac Studio M3 Ultra оснащён 96 ГБ общей памяти и стартует в США от 3999 долларов; объём памяти можно увеличить до 512 ГБ.
6. Можно ли объединить два DGX Spark?
Да. Два DGX Spark связываются через ConnectX для распределённого запуска моделей до 405B, но это не единый прозрачный пул памяти.
7. Чем ПК с RTX 5090 отличается от игрового ПК?
Принципиальной разницы нет. Для И важны большой SSD, достаточная ОЗУ, мощный БП, охлаждение и совместимый программный стек.

Итог

Лучший компьютер для локального ИИ определяется не количеством TOPS и не числом параметров модели. Сначала нужно рассчитать объём весов в выбранной квантизации, добавить память для KV-кэша, контекста и runtime, а затем проверить поддержку необходимого программного стека.

ПК с RTX 5090 подходит, если весь рабочий набор помещается в 32 ГБ VRAM и приоритетом является скорость генерации. В рассмотренных тестах она опережает остальные платформы в таких условиях. Ограничения — объём видеопамяти, TGP 575 Вт и стоимость полноценного компьютера.

Система с Ryzen AI Max+ 395 подходит, если требуется больше 32 ГБ памяти и одновременно нужен универсальный x86-компьютер на Windows или Linux. Общий пул объёмом до 128 ГБ позволяет размещать более крупные модели, но скорость и совместимость необходимо проверять для конкретного устройства, ОС и backend.

NVIDIA DGX Spark имеет те же 128 ГБ общей памяти, но предлагает готовую среду DGX OS и программный стек CUDA. Его стоит выбирать, когда важны инструменты NVIDIA, компактный корпус и возможность распределённой работы двух устройств. Высокая вместимость не делает Spark быстрее RTX 5090 на моделях, помещающихся в видеопамять последней.

Компьютеры Apple следует рассматривать отдельно. Они подходят для рабочих процессов на macOS с Metal и MLX. На 17 августа 2026 года Mac mini M4 Pro доступен максимум с 64 ГБ памяти, а актуальная спецификация Mac Studio M3 Ultra указывает 96 ГБ.

Итоговый выбор выглядит так:

  • модель и её рабочий набор помещаются в 32 ГБ, важна скорость — ПК с RTX 5090;
  • требуется больше 32 ГБ и универсальная x86-система — Ryzen AI Max+ 395;
  • требуется большой пул памяти и экосистема CUDA/DGX — NVIDIA DGX Spark;
  • необходимы macOS, Metal или MLX — подходящая по памяти система Apple.

Перед покупкой необходимо сравнить одну и ту же модель, квантизацию, длину контекста и backend. Только такой тест показывает реальную разницу между платформами; паспортные TOPS, пропускная способность и количество параметров по отдельности не определяют итоговую скорость.

В DigitalRazor можно заказать рабочую станцию для локальных LLM. Если вы не уверены, какая платформа лучше подойдёт для ваших задач, обратитесь к специалистам DigitalRazor. Они помогут сопоставить требования моделей с возможностями оборудования и избежать переплаты за невостребованные характеристики.

Чтобы локальная LLM работала стабильно, недостаточно выбрать видеокарту или процессор. Необходимо заранее рассчитать объём памяти, подобрать охлаждение, блок питания и остальные компоненты под конкретные модели и программный стек.

[ PERFORMANCE PRO TOWER ]
350D Tower
i9-14900K · RTX 5090 32ГБ · 64GB DDR5 RGB · 1 ТБ
936 500 ₽
70 238 ₽ / мес Примерный ежемесячный платёж. Итоговая сумма рассчитывается индивидуально.
Подробнее
750D Tower
7965WX · RTX 5090 32ГБ · 256GB DDR5 ECC · 1 ТБ NVME 5.0
2 795 500 ₽
209 663 ₽ / мес Примерный ежемесячный платёж. Итоговая сумма рассчитывается индивидуально.
Подробнее
900D Tower
2 x EPYC 9534 · RTX PRO 5000 48GB · 512GB DDR5 ECC · 2 ТБ
6 125 000 ₽
459 375 ₽ / мес Примерный ежемесячный платёж. Итоговая сумма рассчитывается индивидуально.
Подробнее
Подберём решение под ваш проект

Расскажите о задаче — предложим оптимальную конфигурацию и реализацию.

Обсудить проект
или свяжитесь с нами
Telegram Telegram WhatsApp WhatsApp ВКонтакте ВКонтакте MAX MAX
111

Так же будет интересно почитать

Сайт использует cookies
Узнать подробнее