8 800 500-99-26 Для звонков по России
Топ локальных нейросетей для программирования
База знаний
20 мин

Топ локальных нейросетей для программирования

DigitalRazor
DigitalRazor
Подписаться в Telegram
Содержание 13 разделов
Коротко о главном Что умеют локальные нейросети для программирования Зачем запускать модель локально, а не в облаке Как мы сравнивали модели Какие модели для программирования выбрать в 2026 году Сравнение моделей Сколько видеопамяти нужно для нейросети Тест локальных нейросетей на рабочей станции DigitalRazor Как подключить локальную модель к редактору кода Локальная модель или облачный ИИ Как выбрать модель и железо под свой сценарий Часто задаваемые вопросы Заключение
Подберём сервер под вашу задачу

Подберём конфигурацию сервера и отправим предложение.

Смотреть серверы
или свяжитесь с нами
Telegram Telegram WhatsApp WhatsApp ВКонтакте ВКонтакте MAX MAX

Подберём сервер под задачи

Ответьте на несколько вопросов — подготовим предложение

В этой статье сравним локальные нейросети для программирования: от подсказок в редакторе до ИИ-агентов, которые меняют несколько файлов и запускают тесты. Разберём восемь решений и семейств моделей, требования к видеопамяти (VRAM) и подключение к IDE — среде разработки.

Небольшая модель может работать на игровой видеокарте, а крупной модели для ИИ-агента могут понадобиться десятки или сотни гигабайт памяти. При этом более крупная модель не обязательно быстрее и полезнее в каждой задаче.

Коротко о главном

  • Для быстрого автодополнения начните с Qwen2.5-Coder 1.5B или 7B: Continue рекомендует эти модели для вставки кода между уже написанными фрагментами;
  • Для чата и разбора задач на системе с 16 ГБ памяти GPU рассмотрите gpt-oss-20b в формате MXFP4. Это ориентир разработчика, а не гарантия работы с любой длиной контекста;
  • Для персональной системы с 24–32 ГБ видеопамяти или доступной объединённой памяти попробуйте Qwen3-Coder-30B-A3B, Qwen3.8-27B или Devstral Small 2. Выбирайте квантованную версию с запасом памяти под контекст;
  • Для более тяжёлого агента рассмотрите квантованную Qwen3-Coder-Next на системе с 48–64 ГБ видеопамяти или доступной объединённой памяти. При 48 ГБ потребуется более компактная версия весов, чем стандартная Q4_K_M в Ollama. Для gpt-oss-120b ориентир разработчика — один GPU с 80 ГБ памяти при использовании MXFP4;
  • Для команды учитывайте число одновременных запросов и допустимое время ожидания. Общий сервис может работать на компактной модели: крупные DeepSeek или GLM нужны не каждой команде.

Что умеют локальные нейросети для программирования

Автодополнение кода

Редактор показывает продолжение строки или тело функции во время набора. Если разработчик успел дописать предлагаемый фрагмент, подсказка уже не нужна. Поэтому здесь важна малая задержка.

Fill-in-the-middle, или FIM, — заполнение пропуска между двумя фрагментами кода. Модель получает текст перед курсором и после него, затем предлагает вставку. Например, дописывает обработку исключения, сохраняя существующий возврат результата.

Для такого автодополнения важен подходящий формат обучения. Большая чат-модель может хорошо объяснять алгоритмы, но плохо работать с FIM. Документация Continue разделяет эти роли и рекомендует Qwen2.5-Coder 1.5B и 7B для локальных подсказок.

Qwen2.5-Coder

Чат, генерация и рефакторинг

В чате можно попросить объяснить функцию, написать тесты, найти ошибку или предложить рефакторинг. Помощнику для программирования нужны код, связанные типы и ожидаемое поведение. Запрос «добавь обработку тайм-аута, сохрани сигнатуру, проверь пустой ответ» задаёт проверяемый результат.

Модель может придумать несуществующий метод библиотеки или незаметно изменить логику. Поэтому сгенерированный код нужно проверить тестами и просмотром изменений. Чат видит только переданную информацию: большое контекстное окно не помогает, если расширение отправило один фрагмент без зависимостей.

ИИ-агенты и работа с целым проектом

ИИ-агент объединяет модель с инструментами: читает файлы, ищет по репозиторию, редактирует код и запускает команды. Агентный клиент выполняет выбранное моделью действие и возвращает ей результат. Так агент может исправить функцию, запустить тест, получить сообщение об ошибке и повторить правку.

Обычно для этого используют tool calling — структурированные вызовы инструментов. Модель, сервер и агентный клиент должны поддерживать совместимый формат вызовов. Ошибка в шаблоне диалога или обработчике вызовов может нарушить работу всей связки.

схема цикла ИИ-агент

Для пилота подойдёт отдельная ветка с конкретным дефектом и тестом, который его воспроизводит. Подготовьте рабочее окружение с нужными зависимостями и командами запуска тестов. Передавайте относящиеся к задаче файлы: весь проект без отбора может заполнить контекст лишним кодом.

Зачем запускать модель локально, а не в облаке

Конфиденциальность корпоративного кода

Локальный запуск сохраняет корпоративный код внутри периметра, только если там остаётся вся цепочка обработки. Для этого нужны три условия:

  1. Веса хранятся на оборудовании разработчика или компании.
  2. Инференс — вычисление ответа — выполняется на собственном оборудовании.
  3. IDE, индексация, поиск, журналы и инструменты агента не отправляют данные во внешние сервисы.

Открытые веса позволяют запускать модель самостоятельно, но не означают, что все данные обучения опубликованы. Открытый исходный код клиента или сервера — отдельная характеристика. Для коммерческой работы проверяют лицензию конкретных весов.

Для автономного режима Continue рекомендует локальную установку расширения, настройку локального провайдера и отключение Allow Anonymous Telemetry. После настройки нужно перезапустить VS Code. Модели для индексации и поиска тоже должны работать внутри периметра. В Ollama облачные функции отключаются переменной окружения OLLAMA_NO_CLOUD=1 с последующим перезапуском сервиса.

схема корпоративной сети

Адрес localhost сам по себе не подтверждает автономность всей цепочки. JetBrains AI Assistant может использовать облако для отдельных функций даже при подключённой локальной модели. Запросы с собственным API-ключом в Cursor проходят через инфраструктуру сервиса. Эти ограничения рассмотрим в разделе подключения.

Контроль расходов без оплаты каждого запроса

При самостоятельном запуске модели не нужно оплачивать её ответы по тарифу внешнего API. Остаются расходы на оборудование, электричество, охлаждение, обслуживание и обновления. Если GPU большую часть времени простаивает, затраты распределяются между небольшим числом задач. Поэтому локальный ИИ может оказаться дороже облачного доступа.

Один разработчик может начать с имеющейся рабочей станции. Для постоянной работы команды сравнивают общий сервер, отдельные компьютеры и облачный тариф, учитывая частоту обращений и пиковую нагрузку.

Полезнее считать стоимость завершённой задачи. Если компактная модель требует трёх исправлений, затраты времени разработчика могут перекрыть экономию на API. Для простых массовых операций локальная модель, напротив, может оказаться выгоднее.

Как мы сравнивали модели

Подборка основана на документации, опубликованных тестах и требованиях к развёртыванию. Единого стендового теста всех моделей мы не проводили, поэтому не сводим несопоставимые измерения в общий рейтинг скорости.

Качество генерации кода

HumanEval оценивает генерацию небольших функций по описанию. HumanEval+ расширяет набор тестов и строже проверяет корректность решения, но всё ещё не показывает умение менять большой проект.

LiveCodeBench использует задачи с известными датами публикации. Если известна дата завершения обучения модели, можно выбрать более поздние задания — при условии, что они есть в выбранной версии набора. Это снижает риск проверки запомненных решений. Однако решение конкурсной задачи по программированию отличается от исправления ошибки в сервисе.

Агентная работа с репозиторием

SWE-bench оценивает исправления в репозиториях. Среди более сложных наборов — SWE-Bench Pro V2, выпущенный 22 сентября 2026 года: 642 задания, ограничения сетевого доступа и повторная проверка изменений в чистом окружении.

Процент решённых задач относится ко всей системе «модель + агент + инструменты + окружение». На результат влияют подбор файлов, число попыток, время и глубина рассуждений. Результаты SWE-bench Verified нельзя напрямую сравнивать с Pro V2, а Terminal-Bench 2.1 — с 4.0: наборы заданий и условия оценки различаются.

инфографика из трёх карточек без рейтингов

Практические критерии

Для подсказок важны малая задержка и поддержка FIM. Для агента — поддержка инструментов и время до корректного изменения, включая повторные попытки. В обоих случаях проверяют требования к памяти, доступный контекст, лицензию и совместимость ПО.

Тестировать нужно конкретные веса и настройки: результаты модели с весами BF16 не гарантируют такого же качества квантованной версии. Ollama удобна для старта, llama.cpp — для работы с GGUF и гибридного запуска на CPU и GPU, vLLM — для обслуживания запросов к моделям поддерживаемых архитектур на сервере.

Какие модели для программирования выбрать в 2026 году

Буква B обозначает миллиарды параметров. У плотной модели при обработке токена участвует основная масса параметров. MoE, «смесь экспертов», использует только часть экспертных блоков. Это сокращает вычисления, но память для хранения весов нельзя рассчитывать только по активным параметрам.

Qwen2.5-Coder 1.5B и 7B — для подсказок

Это плотные модели с поддержкой FIM и лицензией Apache-2.0. Для автодополнения выбирайте базовые версии. Вариант 1.5B подходит для первого опыта на скромном оборудовании. Попробуйте 7B, если маленькая модель часто ошибается, а памяти достаточно. Базовый контекст компактных вариантов — около 32 тысяч токенов. Для 7B заявлено расширение до 128 тысяч с дополнительной настройкой.

Для старта с четырёхбитными версиями можно ориентироваться на 8–16 ГБ видеопамяти при умеренном контексте. Начальная связка — Ollama и Continue. Основное ограничение — сложные многошаговые изменения: быстрое дописывание функции не делает Qwen2.5-Coder сильным агентом. Поэтому для подсказок и чата можно назначить разные модели.

gpt-oss-20b и 120b — чат и рассуждения

У gpt-oss-20b около 21 млрд общих и 3,6 млрд активных параметров, у 120b — 117 и 5,1 млрд соответственно. Обе модели используют MoE, поддерживают контекст до 128 тысяч токенов и опубликованы под Apache-2.0.

Официальные ориентиры памяти — около 16 ГБ для 20b и один GPU с 80 ГБ для 120b. Эти значения относятся к MXFP4-квантованию экспертных весов и не гарантируют запуск с произвольной конверсией или максимальным контекстом.

Модели подходят для обсуждения решений и работы с инструментами. Отдельная FIM-специализация не заявлена, поэтому для подсказок оставьте компактный Qwen. Сервер должен поддерживать формат диалога Harmony.

Qwen3-Coder-30B-A3B — для персональной системы

У Qwen3-Coder-30B-A3B-Instruct 30,5 млрд общих и 3,3 млрд активных параметров. Нативный контекст — 262 144 токена, заявлено расширение до миллиона. Поддерживаются инструменты и FIM. Лицензия — Apache-2.0.

Это кандидат для чата с кодом, правок и агента на одной машине. Для подходящей четырёхбитной версии можно ориентироваться на 24–32 ГБ видеопамяти. Для запуска подойдут Ollama и совместимые версии llama.cpp или серверных движков.

Главное ограничение — расход памяти при длинном контексте. На 16 ГБ нельзя обещать комфортную работу целиком на GPU. Для агента нужен корректный обработчик собственного формата вызовов Qwen, а для подсказок нужно проверить задержку.

Qwen3.8-27B — код и задачи с изображениями

Qwen3.8-27B — плотная модель с языковой частью на 27 млрд параметров и поддержкой изображений. Она пригодится для работы с кодом, схемами и снимками интерфейса. Нативный контекст — 262 144 токена с расширением до миллиона, лицензия — Apache-2.0.

Qwen сообщает о 61,7% на SWE-bench Pro против 53,5% у Qwen3.6-27B. Обе модели тестировали с Claude Code, контекстом 256K и уточнённым набором заданий. Эти результаты относятся к опубликованной методике, а не к Pro V2, и не доказывают превосходства над всеми конкурентами.

Для четырёхбитного запуска с текстом можно ориентироваться на 24–32 ГБ видеопамяти. Обработка изображений и дополнительные компоненты увеличивают расход памяти. Разработчик перечисляет vLLM и SGLang среди вариантов запуска. Для настольного ПО нужна совместимая конверсия. Отдельная FIM-специализация не заявлена.

локальный чат Qwen3.8-27B

Devstral Small 2 — правки нескольких файлов

Devstral Small 2 24B Instruct 2512 от Mistral — плотная модель класса 24 млрд параметров для работы с инструментами и репозиторием. Контекст — 256K, лицензия — Apache-2.0. Карточка модели описывает локальное развёртывание через vLLM и работу с агентными клиентами.

Для запуска на персональном GPU нужен подходящий вариант квантования. С четырёхбитными весами можно ориентироваться на 24–32 ГБ видеопамяти. Указание Mistral на RTX 4090 или Mac с 32 ГБ общей памяти нельзя переносить на любой формат весов и настройки. FIM не относится к главным заявленным сценариям.

В каталоге API Small 2 отмечена как устаревший сервисный релиз, но опубликованные веса остаются доступны для самостоятельного запуска. Это специализированный кандидат, который стоит сравнить с актуальными Qwen на своём проекте.

Qwen3-Coder-Next — более тяжёлый агент

У Qwen3-Coder-Next около 80 млрд общих и трёх миллиардов активных параметров, гибридная архитектура и нативный контекст 262 144 токена. Лицензия — Apache-2.0, поддерживаются FIM и инструменты. Для запуска подойдут vLLM, SGLang и совместимые настольные движки.

Теоретический объём четырёхбитных весов — уже 40 ГБ без служебных данных и памяти под контекст. На практике файл Q4_K_M в Ollama занимает около 52 ГБ. Поэтому 48–64 ГБ — ориентир для выбора системы, а не гарантия запуска с любыми настройками. При 48 ГБ может понадобиться более компактное квантование или перенос части вычислений на CPU.

Если 30B уже решает задачи без частых повторов, переход на Next сначала нужно обосновать сравнением результатов.

Qwen3-Coder-Next

DeepSeek V4 и V4.1 — серверная инфраструктура

У V4-Flash около 284 млрд параметров основной модели и 13 млрд активных. У V4-Pro — около 1,6 трлн и 49 млрд соответственно. Контекст достигает миллиона токенов, лицензия — MIT. Эти модели рассматривают для сложных агентных задач, а не для быстрого FIM-автодополнения.

К дате статьи доступна DeepSeek-V4.1-Flash: 552 млрд параметров основной архитектуры, дополнительно 196 млрд условной памяти Engram и другие компоненты. При обработке входа активны около восьми миллиардов параметров, при генерации — 16 млрд. Контекст — до миллиона токенов, лицензия — MIT.

Для V4-Flash-0731 используйте рецепт vLLM для конкретной аппаратной платформы. Требования зависят от версии движка, контекста, числа параллельных запросов и дополнительных модулей генерации. Единого порога памяти для всех режимов нет. У V4.1 другая архитектура, поэтому её требования рассчитывают отдельно. Перед выбором оборудования проверьте запуск выбранных весов и работу инструментов на целевой конфигурации.

GLM-5.3-Flash — крупный общий сервис

У GLM-5.3-Flash примерно 321 млрд общих и 18 млрд активных параметров. Модель использует гибридную архитектуру, поддерживает инструменты и контекст до 1 048 576 токенов. Веса опубликованы под MIT.

Название Flash не делает её настольной моделью. По рецепту vLLM, нативные FP8-веса занимают около 306 ГиБ — примерно 329 ГБ. Дополнительно нужна память для контекста и работы движка. Достаточность четырёх GPU по 96 ГБ проверяют с выбранным контекстом, числом параллельных запросов и схемой распределения модели. Суммарная память карт сама по себе не подтверждает возможность запуска.

GLM сравнивают с серверными DeepSeek при выборе внутреннего агентного сервиса. Оснований выбирать её для FIM-подсказок нет: этот режим разумнее обслуживать компактной моделью.

Code Llama, StarCoder2, CodeGemma, WizardCoder и DeepSeek-Coder-V2 не включены в основной список: для нового запуска в подборке приоритет отдан более актуальным отправным точкам. Phi можно оценить при жёстком ограничении ресурсов. Qwen2.5-Coder сохранён благодаря полезной FIM-роли.

У MiniMax-M3 отдельная Community License. Она содержит положение о некоммерческом использовании и условия коммерческого применения. Для бизнеса нужны маркировка «Built with MiniMax M3» и разовое уведомление разработчика. Если годовая выручка продуктов или сервисов, использующих модель, превышает 20 млн долларов, требуется предварительное письменное разрешение. Это не безусловный запрет для бизнеса и не эквивалент Apache-2.0.

Для подсказок первый выбор — Qwen2.5-Coder. Для чата и правок — gpt-oss-20b при ограниченной памяти или Qwen3-Coder 30B при большем запасе. Серверные гиганты оценивают после выявления конкретных ограничений компактных моделей.

Сравнение моделей

Для какой задачи подходит модель

В таблице указан заявленный контекст. Максимальное окно доступно не на любой конфигурации, а расширение может требовать дополнительной настройки.

Модель Основной сценарий Контекст Лицензия
Qwen2.5-Coder 1.5B / 7B FIM-подсказки Около 32K, у 7B расширение до 128K Apache-2.0
gpt-oss-20b / 120b Чат, рассуждения, инструменты 128K Apache-2.0
Qwen3-Coder-30B-A3B Код, правки, агент, FIM 256K нативно Apache-2.0
Qwen3.8-27B Код и задачи с изображениями 256K нативно Apache-2.0
Devstral Small 2 Агентные правки репозитория 256K Apache-2.0
Qwen3-Coder-Next Более тяжёлый агент, FIM 256K нативно Apache-2.0
DeepSeek V4 / V4.1 Серверные агентные задачи До 1M MIT
GLM-5.3-Flash Общий агентный сервис 1M MIT

K и M — сокращённые обозначения тысяч и миллиона токенов. Длина окна не определяет качество: отбор нужных файлов может быть полезнее передачи всего репозитория.

Требования к памяти

Для четырёхбитных версий указаны оценки класса системы. Официальные ориентиры gpt-oss и данные рецептов vLLM отмечены отдельно. Возможность запуска проверяют для конкретных весов, настроек и нагрузки.

Модель и версия Формат / квантование Память GPU Для какого железа
Qwen2.5-Coder 1.5B / 7B Подходящая четырёхбитная версия 8–16 ГБ, оценка. Для 1.5B может хватить меньше Обычный ПК, подсказки
gpt-oss-20b MXFP4 экспертных весов Около 16 ГБ, ориентир разработчика Персональный чат
Qwen3-Coder 30B / Qwen3.8 27B Подходящая четырёхбитная версия 24–32 ГБ, оценка Производительная персональная система
Devstral Small 2 Подходящая четырёхбитная версия 24–32 ГБ, оценка Персональный агент
Qwen3-Coder-Next Подходящая четырёхбитная версия 48–64 ГБ, с учётом оговорки ниже Профессиональная система
gpt-oss-120b MXFP4 экспертных весов Один GPU с 80 ГБ, ориентир разработчика Рабочая станция или сервер
DeepSeek-V4-Flash-0731 Вариант FP8 в рецепте vLLM По рецепту для выбранной платформы и нагрузки Серверная конфигурация
GLM-5.3-Flash Нативный FP8 Около 306 ГиБ, или 329 ГБ, только для весов. Дополнительно нужна память для контекста и движка Крупная серверная конфигурация

У Qwen3-Coder-Next файл Q4_K_M в Ollama занимает около 52 ГБ. Поэтому при 48 ГБ видеопамяти может понадобиться более компактное квантование или частичная выгрузка на CPU.

Размер файла модели не равен её потреблению памяти. Для DeepSeek-V4.1-Flash универсальное значение не указано: новая архитектура и дополнительные компоненты требуют отдельного расчёта. Для любого варианта сначала задают контекст и число параллельных запросов, затем проверяют фактическое потребление памяти и работу под нагрузкой.

Сколько видеопамяти нужно для нейросети

Квантование снижает точность представления весов и сокращает их размер. Это позволяет запустить модель, исходная версия которой не помещается на GPU. Однако сильное сжатие может ухудшить качество кода и соблюдение формата вызовов инструментов.

GGUF — формат хранения, а не вид квантования. Он поддерживает веса разной точности, а Q4_K_M обозначает конкретный вариант квантования. MXFP4 у gpt-oss и произвольная конверсия в GGUF не гарантируют одинакового качества и расхода памяти.

Грубая нижняя оценка памяти только для весов

Память весов в байтах ≈ число параметров × число бит на параметр / 8.

Для 27 млрд параметров при идеальном четырёхбитном представлении получается 13,5 ГБ. Это десятичная оценка без служебных данных, буферов и памяти под контекст. У MoE учитывают все хранимые веса, а не только активные параметры.

схема бюджета памяти при запуске LLM

KV-кэш хранит ключи и значения внимания для уже обработанных токенов. Его объём зависит от архитектуры, длины контекста и точности хранения. Гибридные модели могут сочетать KV-кэш с состояниями других типов, поэтому одинаковое окно не означает одинакового расхода памяти. Параллельные запросы увеличивают потребность сервиса в памяти.

Видеокарты с 8–16 ГБ

На 8 ГБ начните с компактной FIM-модели. Qwen2.5-Coder 7B в сжатой версии — кандидат для проверки, а 1.5B оставляет больше ресурсов IDE и другим приложениям. На 16 ГБ рассмотрите gpt-oss-20b для чата, сохраняя запас под контекст.

Две одновременно загруженные модели конкурируют за память. Если загружать их по очереди, переключение добавляет ожидание. CPU offload позволяет разместить часть весов в системной памяти и, в зависимости от движка, выполнять часть вычислений на CPU. Это помогает запускать модели, которые не помещаются в видеопамять. llama.cpp поддерживает совместный CPU/GPU-инференс, но RAM не обеспечивает пропускную способность памяти GPU. Задержку такого режима измеряют отдельно.

24–32 ГБ — производительная персональная рабочая станция

В этом классе можно рассматривать Qwen3-Coder 30B, Qwen3.8 27B и Devstral с подходящим квантованием. Запас видеопамяти позволяет использовать менее сильное сжатие или более длинный контекст, но максимальные настройки не гарантированы.

Например, RTX 5090 с 32 ГБ оценивают по двум условиям: помещается ли выбранная версия модели и укладывается ли ответ в допустимое время. Инференс на видеокарте зависит и от движка, поэтому одних паспортных характеристик недостаточно.

DigitalRazor PC

Рабочая станция для разработки должна обеспечивать одновременную работу модели, IDE, контейнеров и сборки. Для системы этого класса 64 ГБ оперативной памяти можно взять за отправную точку, затем уточнить объём по приложениям. При offload отдельно учитывают размещённые в памяти веса и рабочие данные. Это рекомендация для подбора, а не минимальное требование каждой LLM.

На SSD нужно место под модель, версии для сравнения и проектные данные. Исходные и квантованные веса могут храниться одновременно, поэтому объём удобнее считать по фактическим файлам.

В DigitalRazor можно обсудить рабочую станцию для локальных LLM с подходящими GPU, RAM, питанием и охлаждением. При подборе укажите движок, контекст и одновременно работающие приложения.

[ PERFORMANCE PRO 750D ]
750D Tower
W5-3425X · RTX 5090 32ГБ · 128GB DDR5 ECC · 1 ТБ NVME 5.0
2 284 500 ₽
171 338 ₽ / мес Примерный ежемесячный платёж. Итоговая сумма рассчитывается индивидуально.
Подробнее
750D Tower
7965WX · RTX 5090 32ГБ · 256GB DDR5 ECC · 1 ТБ NVME 5.0
3 588 500 ₽
269 138 ₽ / мес Примерный ежемесячный платёж. Итоговая сумма рассчитывается индивидуально.
Подробнее
750D Tower
7975WX · RTX 5090 32ГБ · 256GB DDR5 ECC · 1 ТБ NVME 5.0
4 513 000 ₽
338 475 ₽ / мес Примерный ежемесячный платёж. Итоговая сумма рассчитывается индивидуально.
Подробнее

48–96+ ГБ и несколько GPU

Здесь можно рассматривать Qwen3-Coder-Next, gpt-oss-120b и менее ограниченные настройки компактных моделей с учётом требований выбранных весов. При этом две карты по 32 ГБ не работают как одна с 64 ГБ. Движок должен поддерживать распределение модели между GPU. Обмен данными и отдельные буферы создают дополнительные расходы, поэтому важны топология PCIe и совместимость выбранной платформы.

Единая память CPU и GPU — отдельный сценарий. 128 ГБ общей памяти нельзя описывать как 128 ГБ выделенной видеопамяти дискретной карты. Отличаются доступный модели объём, пропускная способность и конкуренция с ОС и приложениями.

Подробнее о платформах — в нашем материале о локальном ИИ и выборе оборудования.

Тест локальных нейросетей на рабочей станции DigitalRazor

Мы проверили скорость локальных моделей для программирования на DigitalRazor 350D Tower. Конфигурация станции: Ryzen 9 9950X, GeForce RTX 5090 с 32 ГБ видеопамяти и 64 ГБ DDR5.

Для сравнения выбрали Qwen3-Coder-30B-A3B, gpt-oss-20b и Devstral Small 2. Нас интересовало, сколько времени занимает генерация короткого ответа и более объёмного фрагмента кода.

PERFORMANCE PRO 150D

Как тестировали

Модели запускали через llama.cpp с CUDA. Qwen3-Coder и Devstral Small 2 использовали в формате GGUF Q4_K_M, gpt-oss-20b — в GGUF с весами MXFP4.

Все слои моделей размещались на GPU. Окно контекста составляло 8192 токена, входной запрос — до 4096 токенов. Одновременно обрабатывался один запрос. Замеры выполняли после загрузки модели и прогрева.

Отдельно оценивали генерацию 512 и 2048 токенов. Первый объём соответствует короткой функции или объяснению ошибки, второй — набору тестов или более объёмной правке. Конкретная длина кода зависит от задания и токенизатора.

Результаты тестирования

Модель Скорость генерации, токенов/с Генерация 512 токенов, с Генерация 2048 токенов, с
Qwen3-Coder-30B-A3B 180–260 2–3 8–12
gpt-oss-20b 180–260 2–3 8–12
Devstral Small 2 60–90 6–9 23–35

Qwen3-Coder и gpt-oss-20b выдавали короткий ответ за несколько секунд. Генерация более объёмного ответа занимала до 12 секунд. Devstral Small 2 работала медленнее: на выдачу 2048 токенов требовалось примерно 23–35 секунд.

В таблице указано время генерации после обработки входного запроса. Загрузка весов, подготовка контекста и задержки клиента в него не входят. Для gpt-oss учитывались все сгенерированные токены, включая рассуждения.

Что показал тест

Конфигурация с RTX 5090 подходит для персонального помощника разработчика в проверенных режимах: модель помещается в видеопамять, а ожидание ответа позволяет работать с ней интерактивно.

При этом скорость генерации не определяет качество кода. В агентных задачах к ней добавляются чтение файлов, вызовы инструментов, запуск тестов и повторные исправления. Для выбора модели под конкретный проект нужно дополнительно проверить правильность решений и время выполнения всей задачи.

[ PERFORMANCE PRO 350D ]
350D Tower
R7 9700X · RTX 5080 16ГБ · 64GB DDR5 RGB · 1 ТБ
494 500 ₽
37 088 ₽ / мес Примерный ежемесячный платёж. Итоговая сумма рассчитывается индивидуально.
Подробнее
350D Tower
i9-14900K · RTX 5090 32ГБ · 64GB DDR5 RGB · 1 ТБ
1 023 000 ₽
76 725 ₽ / мес Примерный ежемесячный платёж. Итоговая сумма рассчитывается индивидуально.
Подробнее
350D Tower
R9 9950X · RTX 5090 32ГБ · 64GB DDR5 RGB · 1 ТБ NVME 5.0
1 151 500 ₽
86 363 ₽ / мес Примерный ежемесячный платёж. Итоговая сумма рассчитывается индивидуально.
Подробнее

GPU-сервер для команды

Пять разработчиков не обязательно создают пять одновременных запросов. Редкий чат и постоянно работающие агенты дают разную нагрузку. При расчёте сервиса учитывают объём входных запросов и ответов, число активных задач и допустимое ожидание.

Подсказки и тяжёлого агента полезно обслуживать раздельно, выделяя им ресурсы так, чтобы длинная задача не задерживала вставки в редакторе. Серверные движки могут объединять обработку нескольких запросов — batching. Его настройки подбирают вместе с лимитами контекста и параллельности.

схема внутреннего сервиса

Для общего сервиса нужны ограничения ресурсов, метрики задержки и порядок обновления. Журналы с кодом тоже требуют защиты. Пилот может начаться с Qwen3-Coder 30B. Переход на серверного гиганта обосновывают задачами, с которыми компактная модель не справляется, а добавление GPU — измеренной нагрузкой.

При обсуждении GPU-сервера DigitalRazor для ИИ укажите версию весов, контекст, число одновременных задач и допустимое время ответа. Запрос «для пяти программистов» не определяет конфигурацию.

Rackstation AI
Для каких задач Компактный GPU-сервер до 2 видеокарт для начальных задач в AI и графике. Оптимален для инференса, визуализации, VFX и рендеринга в студиях и лабораториях, где важна гибкость.
Подробнее
Видеокарты
RTX / RTX PRO / H200 NVL
Объем видеопамяти до 282 ГБ
Процессоры
Threadripper PRO
Количество ядер до 96
RAM до 1024 ГБ DDR5
Форм-фактор 4.5U
Devbox AI
Для каких задач Универсальная платформа на 4–6 GPU для локального обучения моделей и генеративных задач. Подходит для команд, которым важна надёжность сервера и свобода выбора графики — от RTX 5090 до PRO RTX 6000.
Подробнее
Видеокарты
RTX / RTX PRO / H200 NVL
Объем видеопамяти до 576 ГБ
Процессоры
Threadripper PRO
Количество ядер до 96
RAM до 1024 ГБ DDR5
Форм-фактор 6.5U
Scale
Для каких задач Сервер промышленного уровня на 8 GPU с кластерной архитектурой. Предназначен для дата-центров и AI-ферм, где требуется масштабируемость и полная загрузка ресурсов под обучение LLM и R&D.
Подробнее
Видеокарты
RTX PRO 6000 / RTX 5090
Объем видеопамяти до 768 ГБ
Процессоры
AMD Epyc, Intel Xeon
Количество ядер до 320
RAM до 3072 ГБ DDR5
Форм-фактор 6U
HPC 4000
Для каких задач Серия серверов для кластеризации на 4 GPU. Предназначены для дата-центров и AI-ферм, где требуется повышенная плотность для обучение LLM и R&D.
Подробнее
Видеокарты
L40s / RTX PRO / H200 NVL
Объем видеопамяти до 564 ГБ
Процессоры
AMD EPYC, Intel Xeon
Количество ядер до 128
RAM до 1536 ГБ DDR5
Форм-фактор 2U
HPC 8000
Для каких задач Серия серверов для кластеризации на 8 GPU. Предназначены для дата-центров и AI-ферм, где требуется повышенная плотность для обучение LLM и R&D.
Подробнее
Видеокарты
L40s / RTX PRO / H200 NVL
Объем видеопамяти до 1128 ГБ
Процессоры
AMD EPYC, Intel Xeon
Количество ядер до 256
RAM до 2048 ГБ DDR5
Форм-фактор 4U
HGX H200
Для каких задач HGX объединяет 8 видеокарт NVIDIA H200, достигая экстремальной плотности производительности. Благодаря внутренней связности NVSwitch мгновенно интегрируется в масштабные вычислительные кластеры.
Подробнее
Видеокарты
NVIDIA H200 SXM
Объем видеопамяти до 1128 ГБ
Процессоры
AMD EPYC, Intel Xeon
Количество ядер до 256
RAM до 2048 ГБ DDR5
Форм-фактор 5U

Как подключить локальную модель к редактору кода

Ollama и Continue

Начальная цепочка — «VS Code или JetBrains — Continue — Ollama — модель». Ollama хранит веса и выполняет запросы, а расширение передаёт их из редактора. После установки компонентов и запуска сервиса Ollama загрузите модель ollama pull qwen2.5-coder:1.5b-base.

Пример локальной конфигурации Continue в config.yaml

name: Local Coding
version: 0.0.1
schema: v1
models:
- name: Local Autocomplete
provider: ollama
model: qwen2.5-coder:1.5b-base
apiBase: http://localhost:11434
roles:
- autocomplete

Значение model должно совпадать с тегом из ollama list. Для чата добавьте отдельную модель с ролью chat, для правок — edit. Примеры есть в руководстве Continue.

настройка Ollama

Для агента проверьте работу инструментов и согласуйте лимиты контекста клиента и сервера. Назначение роли не добавляет модели отсутствующих возможностей.

Подключение в JetBrains AI Assistant

JetBrains AI Assistant поддерживает Ollama, LM Studio и OpenAI-совместимые серверы. Совместимость с API OpenAI не требует обращения к облаку OpenAI.

В Settings — Tools — AI Assistant — Providers & API keys выберите провайдера, укажите адрес сервера, проверьте соединение и назначьте модели функциям.

AI Completion настраивается отдельно от чата. Для локальных подсказок выберите OpenAI Compatible и укажите сервер и модель. Вставки кода требуют поддержки FIM, а предсказание следующей правки — поддержки edit prediction.

JetBrains AI Assistant 2026.2

На дату статьи документация JetBrains указывает, что при использовании локальных моделей AI Assistant не поддерживает вызов инструментов настроенных MCP-серверов. MCP — протокол подключения инструментов к ИИ. При включённом JetBrains AI функции без совместимой собственной модели могут обращаться к облаку. Поэтому проверьте назначение моделей для каждой функции и сетевые обращения.

Локальные агенты из терминала

Aider может работать с Ollama. После установки Aider, загрузки qwen3-coder:30b и запуска Ollama откройте терминал в рабочей копии проекта.

Для Linux или macOS

export OLLAMA_API_BASE=http://127.0.0.1:11434
aider --model ollama_chat/qwen3-coder:30b

В Windows задайте переменную среды способом выбранной оболочки. Aider рекомендует префикс ollama_chat/.

Начните с конкретного дефекта, проверьте diff — изменения в файлах — и запустите тесты. Подключение к API ещё не подтверждает качество правок.

Что нужно знать о Cursor

Cursor сообщает, что запросы с собственными API-ключами проходят через его серверы для окончательного формирования запроса. Такие ключи работают только с чат-моделями, а Tab-подсказки используют встроенные модели Cursor.

Такой маршрут не обеспечивает полностью локальную цепочку «IDE — localhost». Ограничение хранения данных тоже не отменяет их внешней передачи. Для закрытого кода выберите клиент с документированным локальным маршрутом и проверьте сетевые обращения. Cursor рассматривают для облачной или гибридной работы, если она разрешена.

Локальная модель или облачный ИИ

Сценарий Собственная инфраструктура Облачная модель
Закрытый код Контроль обработки, если вся цепочка остаётся внутри периметра Передача допустима только по правилам компании и условиям сервиса
Быстрый старт Нужно загрузить веса и проверить запуск Обычно достаточно подключить сервис
Постоянная нагрузка Расходы зависят от стоимости оборудования, его загрузки и обслуживания Расходы зависят от тарифа и объёма обращений
Сложные задачи Качество зависит от выбранной модели, а её размер и настройки ограничены доступным железом Проще получить доступ к крупным моделям без собственного сервера
Обслуживание Обновления, мониторинг и совместимость обеспечивает компания Основную инфраструктуру обслуживает поставщик
Работа без интернета Возможна, если модели и инструменты работают автономно Нужен сетевой доступ к сервису

Облако удобно для редких тяжёлых задач, если передача контекста разрешена. Собственная система полезна при требованиях к периметру, автономности и стабильной нагрузке.

Гибридный вариант сочетает компактную FIM-модель на ПК с облачным помощником для сложных задач. Заранее определите, какие данные можно передавать в облако. Автоматическое переключение модели не должно отправлять туда закрытый репозиторий в обход этих правил.

Как выбрать модель и железо под свой сценарий

Есть 8–16 ГБ видеопамяти. Проверьте Qwen2.5-Coder для подсказок, а при 16 ГБ — gpt-oss-20b для чата. Измерьте время ожидания ответа и расход памяти при открытых рабочих приложениях.

Есть 24–32 ГБ видеопамяти. Сравните Qwen3-Coder 30B, Qwen3.8 27B и Devstral Small 2 на одном наборе задач. Зафиксируйте квантование, контекст, клиент и число попыток. Оценивайте пригодные результаты, а не только успешную загрузку весов.

Нужна конфиденциальность. Проверьте маршруты данных для чата, подсказок, индексации, инструментов, телеметрии и журналов. Отключите облачное переключение. После загрузки моделей и зависимостей проверьте работу с заблокированным доступом к внешним сервисам.

Нужно обслуживать команду. Проведите пилот с внутренним API, измерьте число одновременных активных задач и задержки. Сервер выбирают по параллельности, требованиям к доступности и обслуживанию, а не по числу сотрудников.

Нужны подсказки. Сравните задержку и долю принятых вставок у малых FIM-моделей. Более мощный ускоритель имеет смысл, если текущему GPU не хватает памяти или производительности для нужной нагрузки.

Для пилота подойдут написание теста пограничного случая, исправление ошибки и изменение двух связанных файлов. Доля успешно решённых задач, время выполнения и расход памяти помогут предметно обсудить конфигурацию с DigitalRazor.

дерево выбора

Часто задаваемые вопросы

1. Какая локальная модель лучше подходит для Python?
Для подсказок — Qwen2.5-Coder, для чата — gpt-oss-20b или Qwen3-Coder 30B в зависимости от доступной памяти. Для агента сравните модели на своём Python-проекте с одинаковыми инструментами и тестами.
2. Какую модель выбрать для автодополнения кода?
Начните с Qwen2.5-Coder 1.5B или 7B в Continue. Сравните задержку и полезность FIM-вставок. Хороший результат чат-модели в тестах не гарантирует удачных подсказок.
3. Можно ли запустить хорошую модель на обычной игровой видеокарте?
Да. Для подсказок подходят компактные модели. Для gpt-oss-20b с MXFP4 ориентир — около 16 ГБ. На 24–32 ГБ проверяют четырёхбитные модели класса 24–30B с нужным контекстом.
4. Сколько VRAM нужно для локальной нейросети?
Для старта с малыми FIM-моделями ориентир — 8–16 ГБ, для четырёхбитных 24–30B — 24–32 ГБ. Крупным решениям нужны десятки или сотни гигабайт. Точный объём проверяют с нужным контекстом и числом параллельных запросов.
5. В чём локальные модели уступают облачным?
Железо ограничивает размер модели и число параллельных задач, а обслуживанием занимается пользователь. Облако упрощает доступ к крупным моделям, но требует соединения и разрешения на передачу данных.
6. Можно ли полностью работать без подключения к интернету?
Да, если заранее загружены веса, расширения, зависимости и документация, а инструменты автономны и вся цепочка обработки локальна. Внешний веб-поиск, облачные функции и загрузка пакетов из интернета недоступны.
7. Нужен ли GPU-сервер небольшой команде разработчиков?
Не всегда: для редких обращений может хватить общей рабочей станции. Сервер выбирают по одновременной нагрузке и требованиям к доступности и обслуживанию. Число разработчиков не определяет конфигурацию.
8. Как часто стоит обновлять локальную модель?
Когда новая версия лучше решает ваши задачи. На прежнем наборе задач сравните качество, расход памяти, задержку и совместимость с агентом. Сохраните возможность вернуться к старой версии.

Заключение

Локальная нейросеть приносит пользу, когда помогает получать проверяемые изменения с приемлемым временем ответа и сохраняет нужный контроль над данными. Определите задачу, выберите модель и проверьте конкретные веса при нужном контексте. Затем подбирайте железо по измеренной нагрузке.

Поможем подобрать рабочую станцию или GPU-сервер под ваш сценарий. Собираем и тестируем оборудование на собственной площадке в Санкт-Петербурге. GPU-серверы проходят нагрузочное тестирование перед поставкой и поставляются с платформой OneStack, согласованными драйверами, CUDA и программной средой под задачу. Инженеры помогают с запуском и настройкой в течение гарантийного срока. Это сокращает объём самостоятельной работы по сборке и подготовке системы.

Обсудите с DigitalRazor рабочую станцию для локальных LLM или GPU-сервер для команды. Пришлите название модели, вариант квантования, типичный контекст, число одновременных задач и допустимое время ответа. Если модель ещё не выбрана, начните с описания задач, требований к конфиденциальности и бюджета. Эти данные помогут инженерам предложить конфигурацию под ожидаемую нагрузку.

Выберите GPU-сервер для нейросетей

Готовые решения для работы с большими массивами данных

Переход в каталог
Подберём сервер под вашу задачу

Подберём конфигурацию сервера и отправим предложение.

Смотреть серверы
или свяжитесь с нами
Telegram Telegram WhatsApp WhatsApp ВКонтакте ВКонтакте MAX MAX
9.5К

Так же будет интересно почитать

Сайт использует cookies
Узнать подробнее