
Какой компьютер выбрать для локального ИИ: DGX Spark, Ryzen AI или RTX 5090
Есть проект? Напишите нам
Обсудим задачу и подберём оборудование
Выбор компьютера для локальных LLM — это компромисс между скоростью, объёмом памяти и программной совместимостью. Этот подробный разбор поможет понять, чем различаются NVIDIA DGX Spark, системы на AMD Ryzen AI Max+ 395 и ПК с GeForce RTX 5090. Разберём, какие модели помещаются в их память, сравним результаты тестов, энергопотребление и стоимость, а затем определим, какая платформа лучше подходит для крупных LLM, быстрого инференса и повседневной работы.
Зачем нужен локальный компьютер для ИИ, если есть облачные LLM
Облачные сервисы позволяют работать с языковыми моделями без покупки собственного оборудования. Локальный компьютер нужен в тех случаях, когда важны контроль над данными, автономность и возможность самостоятельно выбирать модели и параметры запуска.
| Критерий | Облачная LLM | Локальная LLM |
|---|---|---|
| Начальные затраты | Покупка оборудования не требуется | Необходимо приобрести компьютер |
| Оплата | По подписке или объёму использования | Электроэнергия и обслуживание |
| Передача данных | Запросы обрабатывает внешний сервис | Данные можно оставить внутри системы |
| Выбор моделей | Ограничен возможностями провайдера | Можно устанавливать совместимые модели |
| Настройки | Зависят от сервиса | Доступен выбор квантизации, контекста и backend |
| Работа без интернета | Обычно недоступна | Возможна после установки модели |
| Масштабирование | Ресурсы предоставляет провайдер | Ограничено возможностями оборудования |
| Обслуживание | Выполняет провайдер | Выполняет владелец системы |
Локальный запуск особенно полезен для следующих задач:
- обработки внутренних документов;
- работы с конфиденциальным программным кодом;
- тестирования собственных и экспериментальных моделей;
- создания локальных ассистентов и ИИ-агентов;
- работы без постоянного подключения к интернету;
- многократного запуска моделей без оплаты каждого запроса.
При этом локальная система не всегда выгоднее облака. Помимо цены компьютера, необходимо учитывать настройку, энергопотребление, обслуживание и последующее обновление оборудования. Для нерегулярных запросов облачный сервис может оказаться проще.
Перед покупкой нужно проверить три параметра:
- Помещаются ли веса модели в доступную память.
- Сколько памяти потребуется для KV-кэша, контекста и runtime.
- Обеспечивает ли выбранная платформа необходимую скорость.
Объём памяти нельзя оценивать только по числу параметров модели. Например, 70 млрд параметров при условных пяти битах на параметр потребуют:
70 млрд × 5 бит ÷ 8 = 43,75 млрд байт, или около 40,75 ГиБ.
После добавления служебных данных размер может оказаться ещё больше. Поэтому такая модель не помещается целиком в 32 ГБ VRAM, даже если используется квантование.
Найдите станцию под ваши задачи
Готовые конфигурации для работы с большими массивами данных
Какая скорость генерации нужна для разных задач
Скорость работы локальной LLM обычно измеряют в токенах в секунду. Один токен не равен одному слову: в зависимости от языка и текста токеном может быть часть слова, целое слово или несколько знаков.
При этом одного показателя токенов в секунду недостаточно. Для интерактивной работы важны как минимум две метрики:
- скорость обработки промпта, или prompt processing — насколько быстро система читает исходный запрос и контекст;
- скорость генерации — сколько новых токенов модель создаёт за секунду после обработки запроса.
Кроме того, на восприятие скорости влияет задержка первого токена. Для автодополнения кода она может быть важнее максимальной скорости длинного ответа.
Официальных порогов, разделяющих «медленную» и «быструю» локальную LLM, нет. В обычном диалоге даже 10–20 токенов/с могут быть приемлемы, тогда как локальным агентам и интерактивным инструментам для программирования полезна более высокая скорость. При нескольких пользователях нужно оценивать не скорость одного ответа, а совокупный throughput и задержку каждого запроса.
Как мы сравниваем результаты
Для более корректного сравнения возьмём две плотные модели одного семейства:
- Qwen3 8B — относительно компактная модель;
- Qwen3 32B — значительно более требовательная плотная модель.
Во всех приведённых тестах используется 4-битный GGUF-вариант и среда выполнения llama.cpp. Однако результаты получены разными авторами, на разных сборках программы и при разной длине контекста. Поэтому таблицу следует воспринимать как ориентир по классу производительности, а не как прямой лабораторный тест.
| Система | Qwen3 8B, генерация | Qwen3 32B, генерация | Условия и ограничения |
|---|---|---|---|
| NVIDIA DGX Spark | 43,7 токена/с | 10,7 токена/с | Q4_K_M, llama.cpp, CUDA; измерение декодирования при контексте 512 токенов |
| Мини-ПК на Ryzen AI Max+ 395 | около 36 токенов/с | около 9 токенов/с | 4-битные версии; 64 ГБ общей памяти выделено графике; точная сборка llama.cpp и длина контекста в опубликованном пересказе не указаны |
| ПК с GeForce RTX 5090 | 200,4 токена/с | 61,4 токена/с | Q4_K, llama.cpp; показатели при контексте 4K |
Результаты DGX Spark представлены вместе со сценарием запуска и показывают 43,7 токена/с для Qwen3 8B и 10,7 токена/с для плотной Qwen3 32B. При увеличении контекста до 2048 токенов скорость снижается до 42,0 и 10,5 токена/с соответственно.
Для RTX 5090 представлены результаты 200,4 токена/с на Qwen3 8B и 61,4 токена/с на Qwen3 32B при контексте 4K. При увеличении контекста скорость уменьшается: например, Qwen3 8B показывает 162,3 токена/с при 16K и 129,8 токена/с при 32K. Это наглядно показывает, почему нельзя приводить одну скорость модели без указания длины контекста.
Для Ryzen AI Max+ 395 набор содержит примерно 36 токенов/с на Llama 3.1 8B Q4 и 9 токенов/с на Qwen3 32B Q4. Поскольку в строке 8B использована другая модель, значение Ryzen нельзя считать прямым результатом общего теста Qwen3 8B. Оно оставлено только как ориентир для 8B-класса.
Из таблицы можно сделать только общий вывод: когда плотная модель полностью помещается в 32 ГБ GDDR7, RTX 5090 имеет заметное преимущество в скорости генерации. Но числа нельзя использовать для расчёта точного процентного отрыва, поскольку тестовые протоколы различаются.
Что можно запустить благодаря большому объёму памяти
Плотные и MoE-модели необходимо рассматривать отдельно. У плотной модели в каждом шаге участвует основная часть весов. В MoE-модели в память также загружается полный набор весов, но при создании очередного токена используется только часть экспертов. Поэтому MoE может занимать десятки гигабайт памяти, но генерировать быстрее плотной модели похожего общего размера.
| Параметр / платформа | Qwen3 30B-A3B | GPT-OSS-120B | Qwen3-235B-A22B |
|---|---|---|---|
| Архитектура и формат | MoE, Q4_K_M | MoE, MXFP4/Q4 | MoE, Q3_K_M |
| Размер файла весов | Около 17,3 ГиБ | Около 59 ГиБ | Около 104,7 ГиБ |
| RTX 5090, 32 ГБ | Помещается полностью | Не помещается полностью в VRAM; потребуется offload | Не помещается полностью |
| Ryzen AI Max+ 395, 128 ГБ | Помещается полностью | Помещается полностью Помещается с запасом под runtime и умеренный контекст | Запуск подтверждён, но запас памяти ограничен |
| DGX Spark, 128 ГБ | Помещается полностью | Помещается; запуск подтверждён тестами llama.cpp | Один Spark за официальный ориентир NVIDIA до 200B. Два Spark заявлены для моделей до 405B |
Размер памяти не определяет скорость автоматически. Например, Qwen3 30B-A3B Q4_K_M занимает около 17,3 ГиБ и активирует примерно 3 млрд параметров на токен. В независимых тестах llama.cpp эта модель показала около 89 токенов/с на DGX Spark, 86 токенов/с на Ryzen AI Max+ 395 и 226 токенов/с на RTX 5090. Эти значения снова получены при разных версиях backend и глубине контекста, поэтому показывают порядок производительности, но не точный процентный разрыв.
Более показательный пример — GPT-OSS-120B. В формате MXFP4 модель занимает около 59 ГиБ. Она не помещается целиком в 32 ГБ RTX 5090, но помещается в память DGX Spark и 128-гигабайтной системы на Ryzen AI Max+ 395. В тесте основного репозитория llama.cpp DGX Spark показал 58,72 токена/с при коротком тесте генерации tg32; при глубине контекста 32K результат снизился до 42,76 токена/с.
Ryzen AI Max+ 395 в тесте запускал GPT-OSS-120B Q4_K_M размером около 58,5 ГиБ со скоростью 53,4 токена/с. Но этот результат получен через llama-server, тогда как часть других строк измерена в llama-bench. Его нельзя напрямую сравнивать с результатом DGX Spark без повторного теста в одинаковой конфигурации.
Для ещё более крупных MoE-моделей преимущество 128 ГБ заключается прежде всего в возможности запуска. Например, Qwen3-235B-A22B Q3_K_M занимает около 104,7 ГиБ и был запущен на системе с Ryzen AI Max+ 395 со скоростью 17,2 токена/с. При таком размере остаётся сравнительно небольшой запас под операционную систему, KV-кэш и runtime, поэтому допустимая длина контекста требует отдельной проверки.
NVIDIA заявляет для одного DGX Spark работу с моделями до 200 млрд параметров, а для двух связанных устройств — до 405 млрд. Qwen3-235B выходит за официальный заявленный NVIDIA ориентир до 200B для одного DGX Spark. Поэтому такой запуск нельзя считать гарантированным сценарием производителя: его нужно проверять экспериментально с конкретной квантизацией и контекстом.
Главный вывод
У RTX 5090 преимущество появляется, когда модель целиком помещается в 32 ГБ видеопамяти: высокая пропускная способность GDDR7 обеспечивает более быструю генерацию плотных моделей класса 8B–32B.
DGX Spark и системы на Ryzen AI Max+ 395 решают другую задачу. Их 128 ГБ общей памяти позволяют полностью размещать модели, которые не помещаются в RTX 5090. Это не гарантирует более высокую скорость, но устраняет необходимость переносить значительную часть модели в обычную системную память.
Для MoE-моделей нужно учитывать сразу два значения: полный объём весов определяет возможность загрузки, а число активных параметров заметно влияет на скорость генерации.
NVIDIA DGX Spark: 128 ГБ памяти и готовая среда для ИИ
NVIDIA DGX Spark — компактный компьютер для разработки и локального запуска моделей ИИ. Он построен на SoC GB10 Grace Blackwell, объединяющей 20-ядерный ARM64-процессор и GPU архитектуры Blackwell.
| Параметр | Характеристика |
|---|---|
| Процессор | 20 ядер ARM64: 10 Cortex-X925 и 10 Cortex-A725 |
| Графика | Blackwell, Tensor Cores пятого поколения |
| Память | 128 ГБ общей LPDDR5X |
| Пропускная способность памяти | 273 ГБ/с |
| Накопитель | 4 ТБ у Founders Edition |
| Программная среда | DGX OS, CUDA, cuDNN, Docker, NGC |
| Размеры | 150 × 150 × 50,5 мм |
| Масса | 1,2 кг |
| TDP SoC | 140 Вт |
| Блок питания | 240 Вт |
| Цена на 17 августа 2026 года | 4699 долларов в официальном магазине NVIDIA в США |
Подробнее об устройстве, производительности и ограничениях платформы читайте в нашем обзоре NVIDIA DGX Spark.
Главная особенность DGX Spark — общий когерентный пул памяти для процессора и GPU. Модель не нужно разделять между системной ОЗУ и отдельной VRAM. Однако часть из 128 ГБ занимают операционная система, среда выполнения и KV-кэш.
NVIDIA заявляет следующие возможности:
- инференс моделей до 200 млрд параметров на одном устройстве;
- работу с моделями до 405 млрд параметров при объединении двух DGX Spark;
- соединение двух устройств через ConnectX-7;
- локальную работу с CUDA-инструментами и контейнерами NVIDIA.
Эти значения обозначают предельный класс моделей, а не гарантируют запуск любой модели соответствующего размера. Результат зависит от архитектуры, квантизации, формата весов и длины контекста.
Преимущества DGX Spark:
- 128 ГБ общей памяти;
- готовая программная среда NVIDIA;
- компактный корпус;
- поддержка CUDA, cuDNN и NGC;
- возможность объединить два устройства.
Ограничения:
- плотные модели, помещающиеся в 32 ГБ VRAM, RTX 5090 обрабатывает быстрее;
- программы и контейнеры только для x86-64 могут потребовать адаптации;
- 128 ГБ нельзя полностью отдать под веса модели;
- цена относится к американскому магазину и может отличаться в других регионах.
Кому подходит: разработчикам и исследователям, которым нужны 128 ГБ общей памяти, CUDA и готовая компактная Linux-система.
AMD Ryzen AI Max+ 395: мини-ПК, который умеет больше одного инференса
AMD Ryzen AI Max+ 395 — не отдельная модель мини-ПК, а процессор семейства Strix Halo. Его устанавливают в компьютеры разных производителей, поэтому производительность, шум и энергопотребление зависят от конкретного устройства.
| Параметр | Характеристика |
|---|---|
| Процессор | 16 ядер и 32 потока Zen 5 |
| Максимальная частота | До 5,1 ГГц |
| Встроенная графика | Radeon 8060S, 40 вычислительных блоков |
| Нейропроцессор | XDNA 2, до 50 TOPS |
| Общая производительность | До 126 TOPS |
| Память | До 128 ГБ LPDDR5X-8000 |
| Шина памяти | 256 бит |
| Расчётная пропускная способность | 256 ГБ/с |
| Архитектура | x86-64 |
| Операционные системы | Windows и Linux |
| Диапазон TDP | 45–120 Вт |
Возможности готовой 128-гигабайтной платформы мы подробнее разобрали в материале о компактной ИИ-станции на Ryzen AI Max+ 395.
Расчётная пропускная способность памяти:
8000 МТ/с × 256 бит ÷ 8 = 256 ГБ/с.
Это теоретическое значение. Реальный результат зависит от конструкции компьютера, режима мощности, охлаждения и используемого программного backend.
Процессор и Radeon 8060S используют общий пул памяти. Благодаря этому система может загружать модели, которые не помещаются в 32 ГБ видеопамяти RTX 5090. Часть памяти при этом занимают операционная система, приложения, runtime и KV-кэш.
Преимущества Ryzen AI Max+ 395:
- до 128 ГБ общей памяти;
- привычная архитектура x86-64;
- поддержка Windows и Linux;
- возможность использовать систему как обычный рабочий компьютер;
- компактный форм-фактор;
- запуск моделей, превышающих объём VRAM потребительских видеокарт.
Ограничения:
- на моделях, помещающихся в VRAM, встроенная графика уступает RTX 5090;
- скорость зависит от настроек мощности и охлаждения;
- доступный GPU объём памяти может зависеть от прошивки;
- поддержку ROCm нужно проверять для конкретного компьютера и ОС;
- результаты фирменной Ryzen AI Halo Developer Platform нельзя автоматически переносить на другие устройства.
Единой цены у систем на Ryzen AI Max+ 395 нет. Например, в мае 2026 года AMD указывала для Ryzen AI Halo Developer Platform со 128 ГБ памяти цену 3999 долларов. Другие устройства необходимо сравнивать с указанием конфигурации и даты проверки.
Кому подходит: пользователям, которым нужны более 32 ГБ памяти, Windows или Linux и возможность совмещать локальный ИИ с обычными рабочими задачами.
ПК на RTX 5090: максимальная скорость, пока модель помещается в видеопамять
В отличие от DGX Spark и систем на Ryzen AI Max+ 395, GeForce RTX 5090 — не готовый компьютер, а дискретная видеокарта. Поэтому при сравнении необходимо учитывать характеристики и стоимость всей сборки: процессора, оперативной памяти, накопителя, охлаждения и блока питания.
| Параметр | Характеристика |
|---|---|
| Архитектура | NVIDIA Blackwell |
| Видеопамять | 32 ГБ GDDR7 |
| Шина памяти | 512 бит |
| Скорость памяти | 28 Гбит/с |
| Пропускная способность памяти | 1792 ГБ/с |
| TGP видеокарты | 575 Вт |
| Рекомендуемый блок питания | От 1000 Вт для всей системы |
| Программная экосистема | CUDA, TensorRT, llama.cpp, Ollama, vLLM, PyTorch |
| Стартовая цена видеокарты | 1999 долларов при анонсе в январе 2025 года |
Характеристики и производительность флагмана подробнее рассмотрены в нашем обзоре GeForce RTX 5090.
Расчёт пропускной способности:
28 Гбит/с × 512 бит ÷ 8 = 1792 ГБ/с.
Это примерно:
- в 6,6 раза больше 273 ГБ/с у DGX Spark;
- в 7 раз больше расчётных 256 ГБ/с у Ryzen AI Max+ 395.
Разница в пропускной способности не означает такой же разницы в скорости генерации. На результат также влияют архитектура модели, квантизация, backend, контекст и размер пакета.
Преимущества RTX 5090:
- высокая скорость генерации, когда модель целиком помещается в VRAM;
- 1792 ГБ/с пропускной способности памяти;
- развитая экосистема CUDA;
- поддержка распространённых инструментов локального инференса;
- универсальность полноценного настольного ПК;
- возможность последующего обновления компонентов.
Ограничения:
- только 32 ГБ физической видеопамяти;
- крупным моделям потребуется перенос части слоёв в системную память;
- offload снижает преимущество быстрой GDDR7;
- высокое энергопотребление;
- повышенные требования к блоку питания и охлаждению;
- для сравнения цен нужно учитывать весь компьютер, а не только видеокарту.
RTX 5090 особенно интересна для квантизированных моделей класса 8B–32B. Однако 32B нельзя считать гарантированным пределом: требуемый объём памяти зависит от формата весов, KV-кэша и длины контекста.
Кому подходит: пользователям, которым нужна максимальная скорость на моделях, полностью помещающихся в 32 ГБ VRAM, а также совместимость с CUDA-инструментами.
Альтернатива: Apple Silicon для пользователей macOS
Компьютеры Apple можно рассматривать как альтернативу, если рабочий процесс построен вокруг macOS, Metal или MLX. Они используют общую память для CPU и GPU, но не поддерживают CUDA, поэтому напрямую сравнивать их с NVIDIA и AMD по результатам одних тестов некорректно.
| Параметр | Mac mini M4 Pro | Mac Studio M3 Ultra |
|---|---|---|
| Общая память | До 64 ГБ | От 96 до 512 ГБ |
| Пропускная способность | 273 ГБ/с | Более 800 ГБ/с |
| Программный стек | Metal, MLX, llama.cpp | Metal, MLX, llama.cpp |
| Основной сценарий | Небольшие и средние модели | Крупные модели и профессиональные задачи |
Mac mini M4 Pro — компактная точка входа для моделей, помещающихся в 64 ГБ общей памяти. Mac Studio M3 Ultra поддерживает до 512 ГБ и, по заявлению Apple, позволяет локально запускать LLM более чем на 600 млрд параметров. Это не гарантирует совместимость с любой моделью такого класса: необходимый объём памяти зависит от формата весов, квантизации и контекста.
Обе системы стоит выбирать прежде всего ради macOS и инструментов Apple. Если рабочий процесс требует CUDA, TensorRT или другого программного обеспечения NVIDIA, лучше рассматривать DGX Spark либо ПК с RTX 5090.
Сравнение платформ
В основной таблице сопоставлены DGX Spark, фирменная AMD Ryzen AI Halo Developer Platform с Ryzen AI Max+ 395 и ПК с RTX 5090. Последний вариант представляет собой не готовое устройство, а компьютер с дискретной видеокартой, поэтому его итоговые характеристики и цена зависят от остальных комплектующих.
| Параметр | NVIDIA DGX Spark | AMD Ryzen AI Halo | ПК с RTX 5090 |
|---|---|---|---|
| Тип системы | Готовый специализированный Arm-компьютер | Готовый универсальный x86-компьютер | Настольный x86-ПК с дискретной GPU |
| Память | 128 ГБ общей LPDDR5X | 128 ГБ общей LPDDR5X | 32 ГБ GDDR7 на GPU; системная ОЗУ отдельно |
| Пропускная способность | 273 ГБ/с | До 256 ГБ/с, расчётное значение | 1792 ГБ/с |
| ОС | NVIDIA DGX OS | Windows 11 или Linux | Windows 11 или Linux |
| Основной ИИ-стек | CUDA, DGX OS, NVIDIA AI Software | ROCm, Vulkan и совместимые backend | CUDA и совместимые backend |
| Доступное пространство для модели | Общая память за вычетом ОС, runtime и KV-кэша | Общая память за вычетом ОС, runtime и KV-кэша | VRAM за вычетом runtime, KV-кэша и служебных буферов |
| Основной сценарий | Крупные модели и готовая среда NVIDIA | Крупные модели и обычные x86-приложения | Высокая скорость, если модель полностью помещается в VRAM |
| Ограничение | Меньшая пропускная способность, чем у RTX 5090; Arm и DGX OS | Результат зависит от ОС, драйвера и backend | 32 ГБ VRAM и высокое энергопотребление |
| Ориентир мощности | TDP GB10 — 140 Вт; блок питания — 240 Вт | cTDP процессора — 45–120 Вт | TGP видеокарты — 575 Вт; БП системы — от 1000 Вт |
| Цена в США | 4699 долларов за готовую систему | 3999 долларов за Developer Platform | Стартовый MSRP GPU — 1999 долларов; остальные компоненты отдельно |
Строку мощности нельзя использовать для прямого расчёта энергопотребления. У DGX Spark приведён TDP процессора и мощность комплектного блока питания, у AMD — настраиваемый TDP процессора, а у RTX 5090 — TGP только видеокарты. Для точного сравнения нужны измерения полной системы из розетки в одинаковой нагрузке.
Цены также относятся к разным категориям товара. DGX Spark и AMD Ryzen AI Halo — готовые компьютеры, тогда как 1999 долларов для RTX 5090 — первоначальная рекомендованная цена только видеокарты.
Нужна помощь с выбором?
Специалисты помогут подобрать оборудование под нагрузку, бюджет и задачи
Что выбрать для локальных LLM в 2026 году
Универсального победителя нет. Выбор определяется объёмом модели, требуемой скоростью и программным стеком.
| Условие | Подходящая платформа | Почему |
|---|---|---|
| Модель помещается в 32 ГБ, важна скорость | ПК с RTX 5090 | Быстрая GDDR7 и экосистема CUDA |
| Нужно больше 32 ГБ и универсальная x86-система | Ryzen AI Max+ 395 | До 128 ГБ общей памяти, Windows и Linux |
| Нужно больше 32 ГБ и программный стек NVIDIA | DGX Spark | 128 ГБ общей памяти, DGX OS и CUDA |
| Требуются macOS, Metal или MLX | Mac mini или Mac Studio | Нативная экосистема Apple |
Перед выбором нужно проверить:
- Размер весов в выбранной квантизации.
- Память для KV-кэша, контекста и runtime.
- Поддержку CUDA, ROCm, Vulkan, Metal или MLX.
- Скорость конкретной модели в требуемом backend.
- Стоимость и энергопотребление всей системы.
FAQ — ответы на частые вопросы
Итог
Лучший компьютер для локального ИИ определяется не количеством TOPS и не числом параметров модели. Сначала нужно рассчитать объём весов в выбранной квантизации, добавить память для KV-кэша, контекста и runtime, а затем проверить поддержку необходимого программного стека.
ПК с RTX 5090 подходит, если весь рабочий набор помещается в 32 ГБ VRAM и приоритетом является скорость генерации. В рассмотренных тестах она опережает остальные платформы в таких условиях. Ограничения — объём видеопамяти, TGP 575 Вт и стоимость полноценного компьютера.
Система с Ryzen AI Max+ 395 подходит, если требуется больше 32 ГБ памяти и одновременно нужен универсальный x86-компьютер на Windows или Linux. Общий пул объёмом до 128 ГБ позволяет размещать более крупные модели, но скорость и совместимость необходимо проверять для конкретного устройства, ОС и backend.
NVIDIA DGX Spark имеет те же 128 ГБ общей памяти, но предлагает готовую среду DGX OS и программный стек CUDA. Его стоит выбирать, когда важны инструменты NVIDIA, компактный корпус и возможность распределённой работы двух устройств. Высокая вместимость не делает Spark быстрее RTX 5090 на моделях, помещающихся в видеопамять последней.
Компьютеры Apple следует рассматривать отдельно. Они подходят для рабочих процессов на macOS с Metal и MLX. На 17 августа 2026 года Mac mini M4 Pro доступен максимум с 64 ГБ памяти, а актуальная спецификация Mac Studio M3 Ultra указывает 96 ГБ.
Итоговый выбор выглядит так:
- модель и её рабочий набор помещаются в 32 ГБ, важна скорость — ПК с RTX 5090;
- требуется больше 32 ГБ и универсальная x86-система — Ryzen AI Max+ 395;
- требуется большой пул памяти и экосистема CUDA/DGX — NVIDIA DGX Spark;
- необходимы macOS, Metal или MLX — подходящая по памяти система Apple.
Перед покупкой необходимо сравнить одну и ту же модель, квантизацию, длину контекста и backend. Только такой тест показывает реальную разницу между платформами; паспортные TOPS, пропускная способность и количество параметров по отдельности не определяют итоговую скорость.
В DigitalRazor можно заказать рабочую станцию для локальных LLM. Если вы не уверены, какая платформа лучше подойдёт для ваших задач, обратитесь к специалистам DigitalRazor. Они помогут сопоставить требования моделей с возможностями оборудования и избежать переплаты за невостребованные характеристики.
Чтобы локальная LLM работала стабильно, недостаточно выбрать видеокарту или процессор. Необходимо заранее рассчитать объём памяти, подобрать охлаждение, блок питания и остальные компоненты под конкретные модели и программный стек.

































