
DeepSeek локально: установка и запуск на компьютере
Подберём игровой ПК за 2 шага
Ответьте на несколько вопросов — покажем готовые сборки
DeepSeek локально позволяет обсуждать тексты и код без интернета. Сначала нужно скачать модель и программу для чата, установить и настроить всё необходимое для запуска. Запросы обрабатывает сам ПК, поэтому скорость ответов зависит от его железа, выбранной модели и настроек.
Запустим компактную модель на Windows 11 двумя способами. Её возможности и качество ответов отличаются от текущего чата на сайте DeepSeek.
С чего начать
Выбери удобный маршрут:
- Без терминала — LM Studio: файл модели и настройки выбираются в окне приложения;
- Одной командой — Ollama: после установки программы модель можно скачать и запустить из терминала. У Ollama есть и собственный графический чат для Windows и macOS.
Без подходящей видеокарты оба приложения могут выполнять вычисления на процессоре, если он поддерживается программой и хватает оперативной памяти.
Перед загрузкой открой «Диспетчер задач → Производительность». Сверь объём оперативной памяти (RAM) и видеопамяти с таблицей ниже. Для видеокарты смотри объём выделенной памяти, а не сумму выделенной и общей. Проверь совместимость карты с выбранной программой. На SSD оставь место для модели и запас для программы и её файлов.
Что такое DeepSeek и зачем запускать его локально
DeepSeek выпускает модели и предлагает облачный чат. Для запуска на своём ПК нужны веса модели — файлы с параметрами для построения ответов — и программа, которая выполняет вычисления.
Открытая модель позволяет скачать и использовать веса по условиям лицензии. Это не означает открытости всего процесса обучения. Открытый исходный код, например у Ollama и llama.cpp, относится к программам, которые запускают модель.
Приватность: когда запросы остаются на компьютере
Запуская DeepSeek локально, можно разбирать материалы без отправки в облачный чат. Для этого выбери скачанную модель и отключи внешние инструменты и облачные подключения.
Веб-поиск и подключённые сервисы, работающие через интернет, передают данные за пределы ПК. Поиск моделей в онлайн-каталоге тоже требует сети, но для общения со скачанной моделью подключение не нужно.
Чтобы проверить автономный чат, заранее скачай все компоненты, отключи интернет и отправь запрос. Такой offline-режим не защищает от чужого доступа к компьютеру.
Без подписки на облачный сервис: ограничения своего компьютера
Подписка для локальной модели не нужна, но остаются расходы на железо, электричество и настройку. При наличии бесплатного веб-чата главный смысл домашнего варианта — автономность и контроль над данными.
Поиск свежих фактов и чтение файлов обеспечивает приложение с нужными инструментами: оно получает данные и передаёт их модели для ответа. Само скачивание весов этих функций не добавляет. Возможности оболочек разобраны в обзоре локальных моделей ИИ на ПК и сервере.
Выберите решение для работы
Найдите готовый компьютер под вашу профессию
Какую модель DeepSeek выбрать для своего компьютера
Для первого запуска берём DeepSeek-R1-0528-Qwen3-8B — около 8,19 млрд параметров. Файл весов в выбранном варианте Q4 занимает примерно 5 ГБ на диске. Это компактный вариант для домашнего ПК, а не текущий флагман.
R1 и R1-0528: для каких задач подходят модели с рассуждениями
DeepSeek-R1 — модель с рассуждениями, или reasoning-модель. Её обновлённая версия — R1-0528. Перед итоговым ответом такие модели могут по шагам разбирать ошибку в коде, искать решение задачи или сопоставлять условия.
Цепочка рассуждений бывает длиннее самого ответа: её генерация занимает время и расходует лимит генерации. Убедительное объяснение тоже может содержать ошибку.
Компактные модели: размер, качество и скорость
Дистилляция модели — обучение меньшей модели на примерах от большой. В выбранной нами модели за основу взяли Qwen3-8B и дообучили её на цепочках рассуждений R1-0528. Это отдельная модель, а не большой DeepSeek в уменьшенном архиве.
Ранее вышли DeepSeek-R1-Distill на базе Qwen и Llama: от 1,5B до 70B. Обозначение B означает миллиарды параметров. При нехватке памяти попробуй меньшую версию. Если 8B не справляется с задачами, сравни её с более крупной моделью, для которой хватает памяти.
Число параметров не заменяет проверку ответов: важны версия, обучение и квантование. Проверяй модель на своих задачах — разборе кода, работе с текстом или решении конкретных вопросов.
Полноразмерная R1 и новые крупные модели DeepSeek: дополнительная справка
Полная DeepSeek-R1 содержит 671 млрд параметров, из которых около 37 млрд активируются на каждый токен. В её архитектуре MoE вычисления задействуют только часть «экспертов» — отдельных блоков модели. Это сокращает объём вычислений, но хранить всё равно нужно все веса.
Модели V4 тоже относятся к другому масштабу: у Flash 284 млрд параметров, у Pro — 1,6 трлн.
V4.1-Flash имеет 552 млрд параметров основной модели, без учёта дополнительных компонентов. При обработке входного запроса активируются 8 млрд параметров на токен, при генерации ответа — 16 млрд. Эти числа относятся к отдельным этапам вычислений и не делают её аналогом нашей компактной 8B по требованиям к памяти.
Крупные варианты требуют отдельного расчёта памяти и скорости. Если выбранная программа поддерживает такой запуск, веса можно распределить между GPU, RAM и накопителями, но это уже отдельный проект.
GGUF и квантование: что означают Q4, Q5 и Q8
GGUF — формат файла, в котором хранятся веса модели и служебные сведения для её запуска. Его поддерживает llama.cpp. Квантование уменьшает размер файла и расход памяти за счёт менее точного представления весов. Из-за этого качество ответов может измениться.
Q4, Q5 и Q8 — разные уровни квантования. Для одной и той же модели Q4 обычно требует меньше памяти, Q5 занимает промежуточное положение, а Q8 сохраняет больше точности весов и занимает больше места. Это не шкала качества ответов: результат нужно проверять на своих задачах.
Q4 бывает разных типов, поэтому учитывай полное обозначение в имени файла. Меньший файл не всегда работает быстрее: скорость зависит также от оборудования и того, как программа обрабатывает выбранный тип квантования.
Для LM Studio используем GGUF-файл: DeepSeek-R1-0528-Qwen3-8B-Q4_K_M.gguf
В имени указаны модель и конкретный тип квантования — Q4_K_M. Выбираем его ради умеренных требований к памяти. В этом репозитории есть также Q6_K и Q8_0, а Q5 нет.
Наш GGUF размещён на Hugging Face издателем lmstudio-community. Это сторонняя подготовка весов DeepSeek. Перед загрузкой проверь в карточке автора, исходную модель, совместимость с выбранной программой и лицензию. У выбранной модели указана MIT. Для других моделей могут действовать также условия базовой модели, на которой они построены.
Самостоятельная конвертация не нужна. В инструкции для LM Studio скачаем готовый GGUF через Discover. Ссылка выше пригодится для проверки файла или ручной загрузки.
Ollama получает модель из собственного каталога по указанному тегу. Предварительно скачивать для этого маршрута файл с Hugging Face не требуется.
Сколько видеопамяти и оперативной памяти нужно
Размер файла не показывает весь расход памяти при запуске. Помимо весов, нужны рабочие буферы и KV-кэш — сохранённые промежуточные результаты обработки контекста.
Контекстное окно вмещает запрос, историю разговора и генерируемый ответ, включая рассуждения. Его измеряют в токенах — частях слов и других элементов текста. Начни с 4096 токенов, затем попробуй 8192, если нужно больше текста.
Чем длиннее разговор, тем больше места требуется для его обработки. Программа может заранее выделять память под всё выбранное контекстное окно, поэтому увеличение лимита способно повысить расход памяти ещё до длинной переписки.
В таблице — размеры выбранных файлов и расчётная нижняя оценка памяти для одного запроса: веса плюс KV-кэш в формате f16, то есть с 16-битным хранением данных. Рабочие буферы, ОС и другие программы не учтены. Это расчёт, а не замеры: для запуска нужен запас сверх указанных значений.
4K и 8K означают 4096 и 8192 токена. Размеры файлов указаны в десятичных ГБ, расчёт памяти — в двоичных ГиБ: 1 ГиБ ≈ 1,074 ГБ.
| Модель и квантование | Файл на диске | Веса + кэш при 4K / 8K | Режим, который стоит попробовать |
|---|---|---|---|
| R1-0528-Qwen3-8B, Q4_K_M | 5,03 ГБ | ≈5,25 / 5,81 ГиБ | GPU с 8 ГБ VRAM либо CPU/RAM |
| R1-0528-Qwen3-8B, Q6_K | 6,73 ГБ | ≈6,83 / 7,39 ГиБ | GPU с 12 ГБ VRAM либо смешанный |
| R1-0528-Qwen3-8B, Q8_0 | 8,71 ГБ | ≈8,67 / 9,24 ГиБ | GPU с 12 ГБ VRAM либо смешанный |
GPU в таблице — варианты для проверки, а не гарантия запуска. При 6 ГБ видеопамяти Q4 может потребовать переноса части слоёв модели в RAM. При 8 ГБ начни с Q4 и контекста на 4096 токенов. 12–16 ГБ дают больше запаса, но длинная история разговора расходует и его.
Для этой модели кэш f16 при 4K занимает около 0,56 ГиБ, при 8K — 1,13 ГиБ. При максимальном окне в 131 072 токена только кэш требует примерно 18 ГиБ — без весов и рабочих буферов. Включать такое окно для первого запуска не стоит.
Без подходящего GPU веса размещаются в RAM, а вычисления выполняет CPU. Для LM Studio на Windows рекомендуется от 16 ГБ RAM, но скорость работы придётся оценить на своих задачах.
В смешанном режиме часть слоёв обрабатывает GPU, часть — CPU. Программа должна уметь распределять модель между ними, а в каждом типе памяти должно хватать места для его части нагрузки.
Важно
Оперативная память и видеопамять не складываются в универсальный запас.
У Apple Silicon объединённую память делят CPU, GPU и система. Поэтому 16 ГБ общей памяти не равнозначны отдельным 16 ГБ RAM и 16 ГБ VRAM.
Как установить и запустить DeepSeek через Ollama
Установка на Windows и отличия для macOS и Linux
- Открой официальную страницу загрузки, скачай установщик и установи приложение. Наш пример рассчитан на Windows 11.
- Сверь видеокарту со списком поддерживаемого оборудования. Для NVIDIA и AMD условия зависят от GPU, ОС и драйвера.
- Открой новое окно PowerShell и введи ollama --version. Если появился номер версии, команда доступна.
- Проверь свободное место на системном диске. По умолчанию модель сохраняется в папке пользователя .ollama/models. Место понадобится и для самой программы.
На macOS Sonoma 14 и новее Ollama поддерживает GPU на Apple Silicon, а на Intel Mac работает только через CPU. Для Linux есть официальный установщик. Поддержку конкретной AMD-карты проверь отдельно для своей ОС. Команда выбора модели одинакова на всех платформах.
Выбор модели и первый запуск
В PowerShell выполни:
ollama run deepseek-r1:8b-0528-qwen3-q4_K_M
Команда скачает из каталога Ollama выбранную модель 8B с квантованием Q4_K_M и откроет чат. Объём загрузки — около 5,2 ГБ. Тег deepseek-r1:8b сейчас ведёт на ту же модель, но полное имя явно указывает версию, основу и квантование, снижая риск путаницы при обновлении каталога.
В строке чата задай стартовый контекст:
/set parameter num_ctx 4096
Эту команду вводи внутри чата Ollama. Она задаёт контекст для текущего сеанса. При новом запуске чата настройку можно повторить.
Заранее открой второе окно PowerShell — оно понадобится для проверки. В первом отправь запрос:
Ответь по-русски. Объясни в трёх предложениях, чем оперативная память отличается от SSD.
При первом запуске дождись загрузки весов в память. В ответе могут сначала появиться рассуждения, а затем итог. Если модель ответила, чат работает.
Пока модель генерирует ответ, во втором окне PowerShell выполни:
ollama ps
В столбце PROCESSOR проверь режим работы:
- 100% GPU — модель полностью размещена на видеокарте;
- 100% CPU — модель размещена в RAM, вычисления выполняет процессор;
- Проценты CPU/GPU — смешанный режим: модель распределена между процессором и видеокартой.
В столбце CONTEXT проверь, что выделено 4096 токенов.
Для выхода из чата введи /bye. Открыть его снова можно той же командой ollama run: уже скачанные файлы повторно загружать не потребуется. Выход из чата не обязательно сразу выгружает модель из памяти. Чтобы освободить её, выполни в PowerShell:
ollama stop deepseek-r1:8b-0528-qwen3-q4_K_M
Локальный сервер Ollama по адресу http://localhost:11434 даёт другим приложениям доступ к модели. API-ключ облачного DeepSeek ему не нужен.
Чтобы отключить облачные функции Ollama в Windows:
- Найди через поиск Windows «Изменение переменных среды текущего пользователя».
- Создай пользовательскую переменную OLLAMA_NO_CLOUD со значением 1.
- Полностью закрой Ollama через значок в области уведомлений и открой приложение снова.
Скачанная модель продолжит работать, а облачные модели и веб-поиск Ollama будут отключены. После перезапуска отправь новый запрос без интернета и проверь автономную работу.
Графический чат Ollama и дополнительный интерфейс Open WebUI
Для обычного чата достаточно настольного приложения Ollama: выбери скачанную модель и общайся в его окне. Если удобнее работать в браузере, можно дополнительно установить Open WebUI.
Установи Docker Desktop с поддержкой WSL 2 и включённой аппаратной виртуализацией в BIOS/UEFI. Запусти Docker Desktop и дождись готовности. Приложение Ollama тоже оставь работающим.
В PowerShell сначала создай секретный ключ для Open WebUI:
$webuiSecret = [guid]::NewGuid().ToString('N') + [guid]::NewGuid().ToString('N')
$webuiSecret
Вторая строка покажет значение ключа. Сохрани его для пересоздания контейнера: постоянный ключ позволяет сохранять действительность сеансов входа.
В том же окне PowerShell скопируй и выполни весь блок:
docker run -d `
-p 127.0.0.1:3000:8080 `
--add-host=host.docker.internal:host-gateway `
-e OLLAMA_BASE_URL=http://host.docker.internal:11434 `
-e "WEBUI_SECRET_KEY=$webuiSecret" `
-v open-webui:/app/backend/data `
--name open-webui `
--restart unless-stopped `
ghcr.io/open-webui/open-webui:v0.11.4
Docker скачает образ Open WebUI и запустит контейнер. Дождись его запуска, открой http://localhost:3000, создай локальный аккаунт и выбери модель. История и настройки сохраняются в томе open-webui — отдельном хранилище данных Docker.
Привязка Open WebUI к 127.0.0.1 ограничивает доступ к интерфейсу этим ПК. Внутри контейнера localhost указывает на сам контейнер, а host.docker.internal — на компьютер, где работает Ollama. Поэтому в команде подключения используется второй адрес.
Этот маршрут рассчитан на Docker Desktop в Windows. В обычном Docker на Linux доступ к сервису на хосте требует отдельной настройки.
Как запустить DeepSeek через LM Studio без терминала
Установка и выбор нужного файла
Для Windows x64 требуется процессор с поддержкой AVX2, рекомендуется от 16 ГБ RAM. Для Windows ARM есть отдельная версия программы.
На Mac поддерживается Apple Silicon с macOS 14 или новее. Intel Mac не подходит. Для Linux доступен AppImage для x64/ARM64, в документации указан Ubuntu 20.04+.
- Установи программу с официального сайта, выбрав свою ОС и архитектуру.
- Открой вкладку поиска моделей Discover. Вставь lmstudio-community/DeepSeek-R1-0528-Qwen3-8B-GGUF или адрес репозитория.
- В результатах выбери издателя lmstudio-community и файл DeepSeek-R1-0528-Qwen3-8B-Q4_K_M.gguf размером около 5,03 ГБ. Нажми Download и дождись завершения скачивания.
Файл теперь на диске, но для работы его ещё нужно загрузить в память. Если программа предлагает скачать движок для GGUF — компонент, который запускает модель, — установи его до отключения интернета.
Перенос слоёв на GPU и размер контекста
Открой My Models и нажми шестерёнку рядом с выбранной моделью. В параметрах загрузки настрой:
- Context Length — 4096 токенов для первого запуска;
- GPU Offload — доля слоёв модели, которую LM Studio переносит на видеокарту.
Для первого запуска оставь автоматический выбор, если он доступен. Проверь, какую видеокарту определила программа и какой уровень GPU Offload выбран.
Если возникает ошибка нехватки видеопамяти, уменьши GPU Offload: больше слоёв останется для обработки на процессоре с использованием оперативной памяти. При GPU Offload = 0 слои модели не переносятся на видеокарту. Нулевой перенос слоёв — режим CPU. После изменения параметров выгрузи модель из памяти и загрузи снова, чтобы новые настройки применились.
Отправь запрос: «Ответь по-русски. Объясни в трёх предложениях, чем оперативная память отличается от SSD». После успешного ответа попробуй у величить контекстное окно до 8192 токенов, перезагрузи модель и сравни расход памяти.
Отдельный лимит выходных токенов ограничивает генерацию, включая рассуждения. Слишком низкое значение может оборвать ответ ещё до итогового объяснения.
Шаблон чата оставь автоматическим: LM Studio берёт его из метаданных GGUF. Когда модель и движок скачаны, отключи интернет и повтори запрос в новом чате с этой же моделью, без внешних инструментов.
Частые ошибки при установке и запуске
Модель не помещается в память или отвечает очень медленно
Проверь, что выбрана нужная 8B Q4_K_M. Посмотри, сколько свободно RAM и VRAM, проверь размер контекста и закрой тяжёлые приложения. Сократи контекстное окно до 4096 токенов, перезагрузи модель и повтори запрос в новом чате.
При частичном переносе на GPU скорость может упираться в CPU: видеокарта ждёт, пока процессор обработает оставшиеся слои. Нехватка RAM может вызвать подкачку на диск и резкое замедление либо ошибку выделения памяти. Успешное открытие чата ещё не означает приемлемой скорости. Если даже короткий запрос обрабатывается слишком долго, попробуй меньшую модель.
Ollama или LM Studio не использует видеокарту
Проверь точное название GPU, поддержку на своей ОС и подходящий движок: CUDA для NVIDIA, ROCm/HIP или Vulkan для совместимых AMD, Metal для Apple Silicon. Доступные движки и списки поддерживаемых карт у Ollama и LM Studio могут отличаться.
Посмотри сообщения программы и проверь, какое устройство она использует. В Ollama выполни ollama ps во время генерации, в LM Studio проверь выбранный GPU и перенос слоёв. Обновление драйвера не устранит несовместимость карты и не переключит заданный режим CPU на GPU. После смены драйвера или движка перезапусти программу.
Ответ обрывается или модель слишком долго рассуждает
Проверь лимит вывода, правила остановки и сообщение об ошибке, если оно появилось. Если вручную добавлял правила остановки, убедись, что они не прерывают ответ раньше времени. Рассуждения тоже расходуют лимит и могут исчерпать его до итогового ответа.
Если генерация упирается в лимит вывода, увеличь его. Если для задачи нужно расширить и контекстное окно, сначала проверь запас памяти. Когда рассуждения просто затягиваются, упрости вопрос или разбей задачу на несколько запросов.
В терминальном чате Ollama команда /show parameters показывает заданные параметры модели. Команда /set parameter num_predict 4096 устанавливает лимит ответа в 4096 токенов, включая рассуждения, для текущего сеанса. Это отдельный параметр: размер контекста он не меняет. Сам по себе обрыв ответа не доказывает нехватку RAM или VRAM.
Ответы зацикливаются или выходят на английском
Создай новый чат, проверь версию модели и верни стандартный шаблон чата, если менял его вручную. Для R1-0528 не требуется самостоятельно дописывать <think> ради запуска рассуждений.
Если менял температуру, попробуй исходную настройку. В документации R1-0528 указан ориентир 0,6, но автоматически переносить его на все версии семейства не стоит.
Напиши: «Дай итоговый ответ по-русски, сохрани названия функций на английском». Язык рассуждений при этом может отличаться от языка ответа. Если зацикливание или языковые сбои повторяются, попробуй другую модель: одна фраза в запросе не исправит любой недостаток.
Команда не распознана или модель не скачивается
Если команда Ollama не распознана, открой новый PowerShell и проверь ollama --version. Если ошибка остаётся, убедись, что программа установлена.
При ошибке скачивания прочитай сообщение: причина может быть в сбое сети, неверном имени модели или нехватке места на диске. Если нужен другой диск, папка моделей меняется через переменную среды OLLAMA_MODELS в Ollama и через My Models в LM Studio. После изменения OLLAMA_MODELS полностью закрой Ollama через значок в области уведомлений и запусти снова.
Какое железо выбрать, если возможностей компьютера не хватает
Определи цель апгрейда: улучшить качество ответов, обрабатывать длинный документ, повысить скорость или обеспечить работу нескольких пользователей. Качество зависит от модели: более мощное железо поможет, если позволит запустить вариант, который лучше справляется с твоими задачами.
Если начинается подкачка на диск из-за нехватки RAM, увеличение оперативной памяти может устранить это ограничение. Но оно не заменяет GPU и не увеличивает VRAM. Если часть слоёв остаётся на CPU из-за заполненной видеопамяти, для их переноса на GPU нужна совместимая видеокарта с большим объёмом памяти.
При вычислениях на CPU важна пропускная способность RAM: процессору нужно быстро читать веса модели. Встроенный GPU обычно делит оперативную память с системой. Наличие NPU само по себе не гарантирует ускорения выбранной модели в Ollama или LM Studio — нужна поддержка со стороны программы и движка.
Для рабочей станции или сервера оцени охлаждение, питание и расширяемость. Несколько GPU не гарантируют автоматического сложения VRAM и пропорционального ускорения: результат зависит от программы, распределения модели и обмена данными между картами. Подробные критерии есть в материале о выборе GPU для локального ИИ.
Не знаешь, что выбрать для своих задач? Просто напиши в DigitalRazor. Поможем разобраться в требованиях и подобрать компьютер, рабочую станцию или сервер для локального DeepSeek. Модель, квантование, контекст и число пользователей уточним в разговоре — заранее готовить техническое задание не нужно. Варианты оборудования можно посмотреть на странице решений для DeepSeek.
Часто задаваемые вопросы
Заключение
Попробуй DeepSeek локально на привычной задаче: попроси объяснить код или сократить абзац. Проверь точность ответа, расход памяти и время ожидания. Несколько таких запросов помогут понять, подходит ли выбранная модель для твоей работы и хватает ли ресурсов ПК.
Если потребуется другая модель, длинный контекст или несколько параллельных чатов, напиши специалистам DigitalRazor. Можно обратиться, даже если ты пока не знаешь, какое железо нужно: поможем разобраться в требованиях и выбрать подходящий компьютер.
Подберём конфигурацию под твою нагрузку — от рабочей станции для личных задач до сервера для команды. Учтём требования модели, нужный объём памяти и возможности дальнейшего расширения, чтобы компьютер подходил и для первых экспериментов, и для повседневной работы.
Введите код в корзине – скидка применится к любой сборке DigitalRazor





























