
Сколько VRAM нужно для Llama 70B и DeepSeek: практическое руководство от 8 до 192+ ГБ
Подберём сервер под задачи
Ответьте на несколько вопросов — подготовим предложение
Детальное практическое руководство, которое наглядно объяснит, сколько VRAM нужно для Llama 70B и как грамотно рассчитать потребление памяти. Материал поможет подобрать оборудование, чтобы запустить Llama 70B локально или развернуть DeepSeek-R1, избежать обидных ошибок с нехваткой памяти при инференсе, когда модель падает с ошибкой «Out of Memory» (OOM).
Мы подробно разобрали специфику форматов сжатия, влияние длины контекста на размер KV-cache, а также подготовили конкретные конфигурации оборудования: от парных видеокарт игрового класса до решений с объединённой памятью (Unified Memory) и высокопроизводительных кластеров. Статья будет полезна как энтузиастам, собирающим домашнюю ИИ-станцию, так и ML-инженерам, планирующим локальный запуск LLM в защищённом корпоративном сегменте.
Быстрый ответ: что нужно знать с первых строк
Короткие выводы для тех, кто сразу ищет сухие цифры и не располагает временем на чтение лонгрида. Три главных тезиса:
- В оригинальном формате FP16 модель Llama 3.3 70B требует около 140 ГБ VRAM. Это сугубо серверный масштаб. Запустить такую махину дома на одной видеокарте физически нереально — потребуется минимум два ускорителя уровня H100, топовый Mac Studio или пара специализированных рабочих станций.
- При использовании формата GGUF и квантования модели до уровня Q4 порог входа резко снижается до 40–42 ГБ. Такая видеопамять для нейросети уже вполне доступна. Её можно получить, объединив два флагманских игровых адаптера (например, пару RTX 4090 или RTX 5090) или установив одну профессиональную карту вроде RTX A6000.
- Дистиллированная версия DeepSeek-R1-Distill-Llama-70B потребляет ровно столько же ресурсов. По сути, это та же 70B-архитектура, но обученная мыслить иначе. Однако полноразмерный оригинальный алгоритм DeepSeek-R1 (использующий архитектуру Mixture of Experts, MoE на 671 млрд параметров) — это совершенно иная весовая категория, которая требует свыше 380–400 ГБ видеопамяти даже при экстремальном сжатии Q4.
Наши инженеры уже подготовили оптимальные конфигурации под оба сценария. Вы можете выбрать мощную рабочую станцию для работы со сжатыми моделями или полноценный ИИ-сервер для максимальных нагрузок в FP16.
Нужна помощь с выбором сервера?
Специалисты помогут подобрать оборудование под нагрузку, бюджет и задачи
Почему 70B — это не просто «большая модель»
Запуск тяжёлых языковых сетей класса 70B (с 70 миллиардами параметров) является серьёзным техническим барьером, отделяющим простые домашние эксперименты от профессионального ИИ-хостинга. Три совершенно независимых фактора формируют итоговое потребление ресурсов, и каждый из них критически важно учитывать при проектировании рабочей станции или серверного узла. Забудете об одном — и система гарантированно выдаст сбой при увеличении нагрузки.
Фактор 1 — размер весов
Если параметры модели хранятся в стандартной шестнадцатибитной точности (форматы FP16 или BF16), на каждую единицу информации уходит ровно 2 байта или 16 бит. Соответственно, 70 миллиардов параметров умножаются на два — получается около 140 гигабайт чистых данных. При базовом уплотнении данных до формата Q8 (8 бит на вес) размер сокращается ровно вдвое — до 70 ГБ.
Агрессивное квантование модели до самого популярного уровня Q4 позволяет ужать чистые веса до 40–42 ГБ. Важно понимать: это только статический размер файлов на диске, который загружается в VRAM без учёта дополнительных процессов в памяти при генерации токенов.
Универсальная формула расчёта объёма
Количество параметров умножается на размер одного параметра в байтах (N_params × bytes_per_param / 1e9 = VRAM в ГБ).
О том, как подбирать вычислительные мощности с учётом этих метрик под разные ИИ-архитектуры, подробно рассказывает эта статья.
Фактор 2 — KV-cache растёт вместе с контекстом
KV-cache (Key-Value cache) представляет собой динамическое хранилище состояний всех уже обработанных токенов диалога. Это своеобразная «кратковременная память» нейросети. Чем длиннее скармливаемый текст, тем больше памяти поглощается безвозвратно.
Важное техническое уточнение
В отличие от старых алгоритмов, архитектуры Llama 3 и 3.3 используют оптимизированную технологию Grouped-Query Attention (GQA). Она сдерживает рост кэша, сокращая его размер примерно до 0,32 МБ на каждый токен в формате FP16.
Для наглядности ниже показано, как длина входных данных влияет на общее потребление для одного пользователя (batch size = 1) при использовании сжатых весов Q4 (в статике ~42 ГБ):
| Контекст (Токены) | Затраты на KV-cache (GQA) | Итог с весами (VRAM) | Сценарий использования |
|---|---|---|---|
| 4K токенов | ~1,3 ГБ | ~43–44 ГБ | Базовый короткий диалог, Q&A сессия |
| 8K токенов | ~2,6 ГБ | ~44–46 ГБ | Написание эссе, анализ небольшого скрипта |
| 16K токенов | ~5,2 ГБ | ~47–49 ГБ | Анализ крупной научной статьи или документа |
| 32K токенов | ~10,5 ГБ | ~52–54 ГБ | Работа с массивами кода, программирование |
| 128K токенов | ~42,0 ГБ | ~84–86 ГБ | Обработка целых книг, масштабная аналитика |
Под длинный контекст модели всё равно требуется внушительный запас аппаратных ресурсов поверх самих весов. Продвинутые технологии и фреймворки вроде механизма PagedAttention (активно используется в vLLM) весьма эффективно снижают внутреннюю фрагментацию буфера, но саму физическую потребность в гигабайтах отменить невозможно.
Фактор 3 — накладные расходы движка
Помимо статического хранения самих весов и динамической буферизации прошлых токенов, алгоритм инференса (будь то продвинутый vLLM, Ollama или легковесный llama.cpp) резервирует от 1 до 3 ГБ под собственные нужды. Эта видеопамять для нейросети расходуется на системный CUDA-контекст, промежуточные вычисления при передаче данных между слоями и формирование внутренних тензоров.
Негласное правило ML-инженеров
Всегда необходимо закладывать минимум 10% запаса видеопамяти сверх базовых математических формул, иначе падение системы с ошибкой OOM неизбежно.
Примерные требования к памяти в случае модели объёмом 42 ГБ:
| Контекст | KV-cache (ГБ) | Системные расходы (ГБ) | Итоговая потребность (ГБ) |
|---|---|---|---|
| 4K токенов | 1,3 | 2 | 45 |
| 8K токенов | 2,6 | 2 | 46 |
| 16K токенов | 5,2 | 2 | 49 |
| 32K токенов | 10,5 | 2 | 54 |
| 128K токенов | 42 | 2 | 86 |
Главная таблица — карта VRAM: что можно запустить
Это основной ориентир для подбора конфигурации. Данная матрица строится от имеющегося объёма памяти к доступным сценариям использования — то есть от железа к ИИ.
| Доступная память | Примеры оборудования | Llama 70B и DeepSeek-R1-Distill (Q4) | Доступный контекст |
|---|---|---|---|
| 8–16 ГБ | RTX 3060, 4070, 4080 | Невозможно | — |
| 24 ГБ | RTX 3090, 4090 | Только с offload | Очень медленный |
| 32 ГБ | RTX 5090 | Версия Q3 (стабильно) | Короткий (до 4–8K) |
| 48 ГБ | 2× RTX 4090, L40S | Стабильный Q4 | Около 8–16K токенов |
| 64 ГБ | 2× RTX 5090, Mac (64GB) | Q4 или Q5 | До 32K токенов |
| 80–96 ГБ | A100 80GB, PRO 6000 | Q8 или FP8 | До 128K (для Q8) |
| 128 ГБ | Mac Studio (128GB Unified) | Полный Q8 | Максимальный 128K+ |
| 192+ ГБ | 2× A100, Mac Studio (192GB) | Полный FP16 | Максимальный 128K+ |
Важное примечание: термин offload (частичная выгрузка) обозначает принудительную выгрузку части слоёв нейросети в системную оперативную память материнской платы. В таком гибридном режиме генерация работает, но замедляется в 10–50 раз из-за скромной пропускной способности планок DDR5 (около 100 ГБ/с) по сравнению с огромной скоростью GDDR7 на видеокарте RTX 5090 (свыше 1700 ГБ/с).
О том, какие ещё алгоритмы уместятся в скромные объёмы памяти домашнего ПК, подробно описано в «Какие модели ИИ можно развернуть на ПК или сервере».
Квантование — не просто «сжать модель»
Многие ошибочно полагают, что квантование модели представляет собой обычное сжатие (архивирование) данных вроде формата ZIP. На деле это математическое огрубление числовых параметров внутри матриц тензоров. Числа с плавающей запятой половинной точности (FP16) округляются до более грубых целочисленных значений (например, INT4). Выбор степени такого квантования напрямую диктует скорость работы ИИ и логическое качество ответов — сеть начинает «глупеть», теряя тонкие нюансы восприятия языка.
Форматы и их реальные компромиссы в работе
Уровень квантования определяет тонкий баланс между занимаемым местом и итоговым «интеллектом» алгоритма:
| Формат сжатия и расход VRAM (70B) | Скорость генерации | Качество логики | Идеальный сценарий применения |
|---|---|---|---|
| FP16 / BF16 (~140 ГБ) | Базовая (1x) | Эталонное | Исключительно корпоративные серверы |
| Q8 / FP8 (~70–80 ГБ) | ≈ FP16 | Практически идентично | Одиночные карты A100 или H100 |
| Q6_K (~55–65 ГБ) | На 5–10 % быстрее | Отличное, без деградации | Пара RTX 5090 или одна L40S |
| Q5_K_M (~45–55 ГБ) | На 10–15 % быстрее | Очень хорошее | Пара RTX 4090 или 5090 |
| Q4_K_M (~40–42 ГБ) | На 15–25 % быстрее | Абсолютная золотая середина | Пара RTX 4090, одиночная RTX A6000 |
| NVFP4 (~38–42 ГБ) | На 30–40 % быстрее | Сопоставимо с Q4 или Q5 | Карты архитектуры Blackwell (RTX 5090) |
| Q3_K_M (~26–29 ГБ) | На 20–30 % быстрее | Заметное падение сложной логики | Для систем с 32 ГБ VRAM |
| Q2_K (~22–26 ГБ) | На 30–40 % быстрее | Значительные потери, ошибки | Крайний случай, лучше не использовать |
Уровень Q4_K_M закрепился в комьюнити ИИ-энтузиастов в качестве золотого стандарта для инференса. Скорость обработки токенов возрастает на 15–25% по сравнению с тяжёлыми форматами, а ухудшение связности текста и логики рассуждений остаётся минимальным, практически незаметным в повседневных задачах.
NVFP4 — новый стандарт качества на архитектуре Blackwell
Графические адаптеры новейшего поколения Blackwell (в том числе флагманская потребительская видеокарта RTX 5090 и профессиональная RTX PRO 6000 Blackwell) аппаратно поддерживают инновационный формат вычислений NVFP4 (четырёхбитная точность с плавающей запятой). В отличие от классического целочисленного квантования Q4 (INT4), где значения жёстко привязаны к целым числам, формат NVFP4 безупречно сохраняет динамический диапазон математических значений, не срезая критически важные хвосты чисел.
На практике это даёт впечатляющий результат: скорость генерации увеличивается на 30–40% по сравнению со старым форматом Q4 INT4, при этом сохраняется логика ответов и качество текста на уровне более «тяжёлых» версий Q5 или Q6. Подробнее о возможностях новых чипов мы рассказывали в этом материале.
Бенчмарк моделей, обученных NVIDIA с точностями FP8 и NVFP4
DeepSeek — две принципиально разные архитектуры
Главная ошибка начинающих исследователей ИИ заключается в путанице вокруг актуальных модификаций DeepSeek. Под этим громким брендом в сети сосуществуют совершенно разные классы алгоритмов. Попытка запустить оригинальный MoE-алгоритм по гайду для дистиллята приведёт к краху всей системы.
DeepSeek-R1-Distill-Llama-70B — то же самое, что Llama 70B
Чтобы развернуть дистиллированный (упрощенная, более быстрая модель) DeepSeek локально в размерности 70B, применяются абсолютно те же настройки, форматы и объёмы памяти, что и для базовой Llama 3.3. Почему? Потому что это дистиллированная нейросеть, обученная на логических выводах оригинального флагмана, но структурно полностью опирающаяся на надёжный скелет Llama. Потребление VRAM здесь абсолютно идентично: порядка 42 ГБ при сжатии Q4.
| Имя модификации и размер | Требование VRAM (FP16) | Требование VRAM (Q4) | Оптимальная видеокарта |
|---|---|---|---|
| R1-Distill-Qwen-7B (7 млрд) | ~16 ГБ | ~4,5 ГБ | RTX 5060 Ti 16 ГБ |
| R1-Distill-Qwen-14B (14 млрд) | ~28 ГБ | ~9 ГБ | RTX 5070 Ti |
| R1-Distill-Qwen-32B (32 млрд) | ~64 ГБ | ~21 ГБ | RTX 4090 |
| R1-Distill-Llama-70B (70 млрд) | ~140 ГБ | ~42 ГБ | 2× RTX 4090 или 5090 |
DeepSeek-R1 / V3 полноразмерный — совсем другой масштаб
Оригинальная массивная версия базируется на передовой архитектуре Mixture of Experts (MoE). Общая сумма параметров здесь достигает чудовищных 671 миллиарда, хотя благодаря специфике маршрутизации при каждом ответе задействуется лишь около 37 миллиардов активных весов.
Суть главной проблемы в том, что для корректной работы сеть должна храниться в памяти целиком — нельзя подгружать «экспертов» с диска в реальном времени.
| Точность сжатия | Расход VRAM | Требуемая конфигурация серверов | Реалистичность сценария |
|---|---|---|---|
| FP16 / BF16 | ~1340 ГБ | 16–20× A100 80GB | Доступно только гигантам IT-рынка |
| Q8 / FP8 | ~670 ГБ | 8–9× A100 80GB | Средний корпоративный кластер |
| Q4 (INT4) | ~380–420 ГБ | 5–6× A100 80GB | Минимально возможный кластер |
Полноразмерный алгоритм DeepSeek-R1 физически недоступен для домашнего, лабораторного или малого корпоративного запуска на GPU в нормальном качестве. Осуществить локальный запуск LLM такого масштаба невозможно без многомиллионных инвестиций.
Для работы «у себя» следует ориентироваться на дистиллированные версии до 70B (или использовать мощные компьютеры Mac на 192+ ГБ, где R1 можно запустить с сильным сжатием).
Для развёртывания систем такого уровня компании заказывают специализированные многокарточные серверные кластеры. Выберите подходящее решение для задач промышленного масштаба:
Один GPU или несколько — как работает Multi-GPU
Запросы алгоритмов тяжелее 40 ГБ сильно превышают физические возможности одиночных игровых чипов, где потолок сегодня составляет 32 ГБ (для RTX 5090). Единственное решение — создание эффективных связок Multi-GPU.
Потребительские GPU: RTX 4090 / 5090
Построение вычислительных систем на базе игровых флагманов привлекает в первую очередь своей финансовой доступностью. Главный недостаток такого подхода кроется в отсутствии аппаратной высокоскоростной шины NVLink у современных поколений потребительских видеокарт.
Видеокарты игрового класса обмениваются информацией по стандартному интерфейсу материнской платы PCIe 4.0/5.0. В задачах полноценного глубокого обучения нейросетей (Fine-Tuning) это стало бы фатальным «узким горлышком». Но для задачи инференса (генерации ответов) пропускной способности шины PCIe вполне хватает. Механизм распределения слоёв через llama.cpp или Ollama на двух потребительских картах работает без критичных потерь скорости. Использование связки из двух RTX 4090 даёт суммарно 48 ГБ, чего достаточно для запуска Q4 с приличным контекстом. Детальнее о сравнении PCI-Express и NVLink мы рассказывали в профильной статье.
Профессиональные ускорители
Использование одного корпоративного адаптера с огромным видеобуфером полностью снимает любые трудности с синхронизацией потоков данных между чипами:
| Модель и память | Поддержка 70B (Q4) | Поддержка 70B (FP16) | Наличие ECC и NVLink |
|---|---|---|---|
| RTX A6000 / L40S (48 ГБ) | До 16K контекста | Недостаточно | ECC: да, NVLink: по-разному |
| RTX PRO 6000 Blackwell (96 ГБ) | Идеально (+ NVFP4) | С трудом (частично) | ECC: да, NVLink: да |
| A100 80GB (80 ГБ) | Работает свободно | Очень впритык | ECC: да, NVLink 3.0 |
| H100 80/141GB (80–141 ГБ) | Идеально | Свободно | ECC: да, NVLink 4.0 |
Важнейшая особенность профессиональных адаптеров — они оснащены ECC-памятью, которая исправляет битовые системные ошибки «на лету». При работе потребительских карт случайный сбой в памяти может привести к галлюцинациям нейросети или падению процесса.
Оперативная память и offload — когда VRAM не хватает
Современный инструментарий вроде движка llama.cpp поддерживает «частичный offload» (выгрузку). Если видеокарта обладает лишь 24 ГБ памяти (как RTX 4090), а модель требует 42 ГБ, движок загружает в VRAM максимум слоёв, а остальные принудительно выгружает в системную оперативную память (RAM) компьютера. Это спасает от ошибки Out of Memory.
Но за всё приходится платить. Скорость обработки падает катастрофически из-за разницы в пропускной способности: DDR5 выдаёт около 100 ГБ/с, а видеопамять — свыше 1000 ГБ/с. Сравним реальную скорость генерации (в токенах/секунду):
| Конфигурация | Скорость (токен/сек) | Комментарий к сценарию |
|---|---|---|
| 2× RTX 4090 (суммарно 48 ГБ VRAM), Q4 | 25–45 т/с | Идеально, очень комфортно для активной работы |
| RTX 5090 (32 ГБ) + RAM offload, Q4 | 10–15 т/с | Работает, но ощущается заметное замедление ответов |
| RTX 4090 (24 ГБ) + RAM offload, Q4 | 1–4 т/с | Мучительно долго, пригодно только для фоновых скриптов |
| CPU only (без использования GPU), Q4 | 0,5–2 т/с | Исключительно для самых терпеливых пользователей |
Для комфортного использования нейросети 70B как ассистента в реальном времени необходимо уложить хотя бы 95-100% слоёв модели непосредственно в быструю VRAM. Если планируется использовать системную память, настоятельно рекомендуем ознакомиться с нюансами её выбора в материале «Как выбрать оперативную память для сервера».
Инструменты для запуска — что выбрать
llama.cpp + Ollama — самый простой путь
Проект llama.cpp, созданный на языке C++ и оптимизированный под голое железо, поддерживает формат GGUF. Платформа Ollama представляет собой удобную оболочку над этим базовым движком с понятным интерфейсом. Запуск Llama 70B Q4 через Ollama сводится к вводу одной простой команды в терминале: ollama run llama3.3:70b.
Оболочка автоматически скачивает GGUF-файл, самостоятельно определяет доступную VRAM всех установленных в системе видеокарт и грамотно распределяет слои. Пошаговую тонкую настройку локального ИИ мы разбирали в руководстве «Что такое LM Studio и зачем он нужен».
vLLM — для production-инференса
Фреймворк vLLM спроектирован специально для высоконагруженных серверных сред. Запуск Llama 70B на двух адаптерах осуществляется командой --tensor-parallel-size 2.
Главное преимущество vLLM — технология PagedAttention, которая сводит к нулю деградацию и фрагментацию KV-cache. Это гарантирует возможность одновременной обработки десятков параллельных потоков без падения производительности.
DigitalRazor OneStack — быстрое решение
Если вы хотите избежать долгой настройки программного окружения, компания DigitalRazor предлагает готовый комплекс OneStack. Инженеры заранее устанавливают и настраивают всё необходимое программное обеспечение, поэтому вы получаете сервер или рабочую станцию для немедленного запуска Llama 70B и DeepSeek.
Платформа OneStack объединяет оптимизированную операционную систему, актуальные драйверы NVIDIA, платформу Docker и ключевые фреймворки для инференса, включая vLLM и Ollama. Вы просто включаете оборудование, открываете рабочий интерфейс и сразу загружаете нужные веса нейросети. Этот подход бережёт время специалистов и полностью исключает проблемы с несовместимостью библиотек или версий программного обеспечения.
Рабочая станция или GPU-сервер — что выбрать под 70B
| Ожидаемый сценарий | Рекомендуемая конфигурация системы | Бюджет инвестиций | Что получаете на выходе |
|---|---|---|---|
| Один пользователь, личные эксперименты | ПК с 2× RTX 4090 или одной RTX 5090 | от 600 000 ₽ | Формат Q4, уверенный 8–16K контекст, 25–45 т/с |
| Рабочая станция профи разработчика | ПК с 2× RTX 5090 или одна PRO 6000 | от 900 000 ₽ | Формат Q4–Q5, массивный до 32K контекст |
| Небольшая ML-команда (2–5 чел.) | Рабочий сервер + 2–4× A100 80GB | от 3 500 000 ₽ | Эталонный FP16, длинный контекст, API-сервис |
| Production multi-user (много юзеров) | Мощный кластер из нескольких A100/H100 | от 10 000 000 ₽ | Полный FP16, высокий батчинг, генерация 24/7 |
Для экспериментов и тестирования пайплайнов оптимально подойдут мощные и тихие рабочие станции, которые не требуют отдельной серверной комнаты. Если же требуется круглосуточная доступность для интеграции в коммерческие продукты компании и бескомпромиссная стабильность с ECC-памятью, рекомендуется инвестировать в надёжные рэковые GPU-серверы с промышленным охлаждением.
Выберите GPU-сервер для нейросетей
Готовые решения для работы с большими массивами данных
FAQ — ответы на частые вопросы
Заключение
Расчёт видеопамяти для систем искусственного интеллекта требует точности. Потребление памяти состоит из трёх частей:
- Объём весов модели;
- Контекстный кэш (KV-cache), который растёт по мере генерации ответа (алгоритм GQA замедляет этот рост);
- Затраты программной среды.
Оригинальная модель на 70 миллиардов параметров занимает 140 ГБ видеопамяти. Для домашнего запуска разработчики сжимают такие сети с помощью квантования. Формат Q4 уменьшает размер модели до 40–42 ГБ без потери качества. А архитектура Blackwell со встроенной поддержкой стандарта NVFP4 дополнительно ускоряет работу подобных алгоритмов.
Для запуска сжатых нейросетей энтузиасты собирают компьютеры с несколькими видеокартами (Multi-GPU). Для этого хорошо подходят старшие игровые модели вроде RTX 4090 или RTX 5090, а также специализированные ИИ-ускорители. Другой вариант — компьютеры с чипами Apple Silicon, так как они используют унифицированную память.
Основное правило архитектора систем
Нейросеть должна полностью помещаться в быструю видеопамять. Механизм частичной выгрузки данных в оперативную память (offloading) сильно замедляет генерацию. Поэтому вместо запуска огромных сетей с архитектурой Mixture of Experts на домашних компьютерах лучше использовать сжатые модели на 70 миллиардов параметров. Они работают быстро и выдают точные результаты.
































