
Топ локальных нейросетей для программирования
Подберём сервер под задачи
Ответьте на несколько вопросов — подготовим предложение
В этой статье сравним локальные нейросети для программирования: от подсказок в редакторе до ИИ-агентов, которые меняют несколько файлов и запускают тесты. Разберём восемь решений и семейств моделей, требования к видеопамяти (VRAM) и подключение к IDE — среде разработки.
Небольшая модель может работать на игровой видеокарте, а крупной модели для ИИ-агента могут понадобиться десятки или сотни гигабайт памяти. При этом более крупная модель не обязательно быстрее и полезнее в каждой задаче.
Коротко о главном
- Для быстрого автодополнения начните с Qwen2.5-Coder 1.5B или 7B: Continue рекомендует эти модели для вставки кода между уже написанными фрагментами;
- Для чата и разбора задач на системе с 16 ГБ памяти GPU рассмотрите gpt-oss-20b в формате MXFP4. Это ориентир разработчика, а не гарантия работы с любой длиной контекста;
- Для персональной системы с 24–32 ГБ видеопамяти или доступной объединённой памяти попробуйте Qwen3-Coder-30B-A3B, Qwen3.8-27B или Devstral Small 2. Выбирайте квантованную версию с запасом памяти под контекст;
- Для более тяжёлого агента рассмотрите квантованную Qwen3-Coder-Next на системе с 48–64 ГБ видеопамяти или доступной объединённой памяти. При 48 ГБ потребуется более компактная версия весов, чем стандартная Q4_K_M в Ollama. Для gpt-oss-120b ориентир разработчика — один GPU с 80 ГБ памяти при использовании MXFP4;
- Для команды учитывайте число одновременных запросов и допустимое время ожидания. Общий сервис может работать на компактной модели: крупные DeepSeek или GLM нужны не каждой команде.
Что умеют локальные нейросети для программирования
Автодополнение кода
Редактор показывает продолжение строки или тело функции во время набора. Если разработчик успел дописать предлагаемый фрагмент, подсказка уже не нужна. Поэтому здесь важна малая задержка.
Fill-in-the-middle, или FIM, — заполнение пропуска между двумя фрагментами кода. Модель получает текст перед курсором и после него, затем предлагает вставку. Например, дописывает обработку исключения, сохраняя существующий возврат результата.
Для такого автодополнения важен подходящий формат обучения. Большая чат-модель может хорошо объяснять алгоритмы, но плохо работать с FIM. Документация Continue разделяет эти роли и рекомендует Qwen2.5-Coder 1.5B и 7B для локальных подсказок.
Чат, генерация и рефакторинг
В чате можно попросить объяснить функцию, написать тесты, найти ошибку или предложить рефакторинг. Помощнику для программирования нужны код, связанные типы и ожидаемое поведение. Запрос «добавь обработку тайм-аута, сохрани сигнатуру, проверь пустой ответ» задаёт проверяемый результат.
Модель может придумать несуществующий метод библиотеки или незаметно изменить логику. Поэтому сгенерированный код нужно проверить тестами и просмотром изменений. Чат видит только переданную информацию: большое контекстное окно не помогает, если расширение отправило один фрагмент без зависимостей.
ИИ-агенты и работа с целым проектом
ИИ-агент объединяет модель с инструментами: читает файлы, ищет по репозиторию, редактирует код и запускает команды. Агентный клиент выполняет выбранное моделью действие и возвращает ей результат. Так агент может исправить функцию, запустить тест, получить сообщение об ошибке и повторить правку.
Обычно для этого используют tool calling — структурированные вызовы инструментов. Модель, сервер и агентный клиент должны поддерживать совместимый формат вызовов. Ошибка в шаблоне диалога или обработчике вызовов может нарушить работу всей связки.
Для пилота подойдёт отдельная ветка с конкретным дефектом и тестом, который его воспроизводит. Подготовьте рабочее окружение с нужными зависимостями и командами запуска тестов. Передавайте относящиеся к задаче файлы: весь проект без отбора может заполнить контекст лишним кодом.
Зачем запускать модель локально, а не в облаке
Конфиденциальность корпоративного кода
Локальный запуск сохраняет корпоративный код внутри периметра, только если там остаётся вся цепочка обработки. Для этого нужны три условия:
- Веса хранятся на оборудовании разработчика или компании.
- Инференс — вычисление ответа — выполняется на собственном оборудовании.
- IDE, индексация, поиск, журналы и инструменты агента не отправляют данные во внешние сервисы.
Открытые веса позволяют запускать модель самостоятельно, но не означают, что все данные обучения опубликованы. Открытый исходный код клиента или сервера — отдельная характеристика. Для коммерческой работы проверяют лицензию конкретных весов.
Для автономного режима Continue рекомендует локальную установку расширения, настройку локального провайдера и отключение Allow Anonymous Telemetry. После настройки нужно перезапустить VS Code. Модели для индексации и поиска тоже должны работать внутри периметра. В Ollama облачные функции отключаются переменной окружения OLLAMA_NO_CLOUD=1 с последующим перезапуском сервиса.
Адрес localhost сам по себе не подтверждает автономность всей цепочки. JetBrains AI Assistant может использовать облако для отдельных функций даже при подключённой локальной модели. Запросы с собственным API-ключом в Cursor проходят через инфраструктуру сервиса. Эти ограничения рассмотрим в разделе подключения.
Контроль расходов без оплаты каждого запроса
При самостоятельном запуске модели не нужно оплачивать её ответы по тарифу внешнего API. Остаются расходы на оборудование, электричество, охлаждение, обслуживание и обновления. Если GPU большую часть времени простаивает, затраты распределяются между небольшим числом задач. Поэтому локальный ИИ может оказаться дороже облачного доступа.
Один разработчик может начать с имеющейся рабочей станции. Для постоянной работы команды сравнивают общий сервер, отдельные компьютеры и облачный тариф, учитывая частоту обращений и пиковую нагрузку.
Полезнее считать стоимость завершённой задачи. Если компактная модель требует трёх исправлений, затраты времени разработчика могут перекрыть экономию на API. Для простых массовых операций локальная модель, напротив, может оказаться выгоднее.
Как мы сравнивали модели
Подборка основана на документации, опубликованных тестах и требованиях к развёртыванию. Единого стендового теста всех моделей мы не проводили, поэтому не сводим несопоставимые измерения в общий рейтинг скорости.
Качество генерации кода
HumanEval оценивает генерацию небольших функций по описанию. HumanEval+ расширяет набор тестов и строже проверяет корректность решения, но всё ещё не показывает умение менять большой проект.
LiveCodeBench использует задачи с известными датами публикации. Если известна дата завершения обучения модели, можно выбрать более поздние задания — при условии, что они есть в выбранной версии набора. Это снижает риск проверки запомненных решений. Однако решение конкурсной задачи по программированию отличается от исправления ошибки в сервисе.
Агентная работа с репозиторием
SWE-bench оценивает исправления в репозиториях. Среди более сложных наборов — SWE-Bench Pro V2, выпущенный 22 сентября 2026 года: 642 задания, ограничения сетевого доступа и повторная проверка изменений в чистом окружении.
Процент решённых задач относится ко всей системе «модель + агент + инструменты + окружение». На результат влияют подбор файлов, число попыток, время и глубина рассуждений. Результаты SWE-bench Verified нельзя напрямую сравнивать с Pro V2, а Terminal-Bench 2.1 — с 4.0: наборы заданий и условия оценки различаются.
Практические критерии
Для подсказок важны малая задержка и поддержка FIM. Для агента — поддержка инструментов и время до корректного изменения, включая повторные попытки. В обоих случаях проверяют требования к памяти, доступный контекст, лицензию и совместимость ПО.
Тестировать нужно конкретные веса и настройки: результаты модели с весами BF16 не гарантируют такого же качества квантованной версии. Ollama удобна для старта, llama.cpp — для работы с GGUF и гибридного запуска на CPU и GPU, vLLM — для обслуживания запросов к моделям поддерживаемых архитектур на сервере.
Какие модели для программирования выбрать в 2026 году
Буква B обозначает миллиарды параметров. У плотной модели при обработке токена участвует основная масса параметров. MoE, «смесь экспертов», использует только часть экспертных блоков. Это сокращает вычисления, но память для хранения весов нельзя рассчитывать только по активным параметрам.
Qwen2.5-Coder 1.5B и 7B — для подсказок
Это плотные модели с поддержкой FIM и лицензией Apache-2.0. Для автодополнения выбирайте базовые версии. Вариант 1.5B подходит для первого опыта на скромном оборудовании. Попробуйте 7B, если маленькая модель часто ошибается, а памяти достаточно. Базовый контекст компактных вариантов — около 32 тысяч токенов. Для 7B заявлено расширение до 128 тысяч с дополнительной настройкой.
Для старта с четырёхбитными версиями можно ориентироваться на 8–16 ГБ видеопамяти при умеренном контексте. Начальная связка — Ollama и Continue. Основное ограничение — сложные многошаговые изменения: быстрое дописывание функции не делает Qwen2.5-Coder сильным агентом. Поэтому для подсказок и чата можно назначить разные модели.
gpt-oss-20b и 120b — чат и рассуждения
У gpt-oss-20b около 21 млрд общих и 3,6 млрд активных параметров, у 120b — 117 и 5,1 млрд соответственно. Обе модели используют MoE, поддерживают контекст до 128 тысяч токенов и опубликованы под Apache-2.0.
Официальные ориентиры памяти — около 16 ГБ для 20b и один GPU с 80 ГБ для 120b. Эти значения относятся к MXFP4-квантованию экспертных весов и не гарантируют запуск с произвольной конверсией или максимальным контекстом.
Модели подходят для обсуждения решений и работы с инструментами. Отдельная FIM-специализация не заявлена, поэтому для подсказок оставьте компактный Qwen. Сервер должен поддерживать формат диалога Harmony.
Qwen3-Coder-30B-A3B — для персональной системы
У Qwen3-Coder-30B-A3B-Instruct 30,5 млрд общих и 3,3 млрд активных параметров. Нативный контекст — 262 144 токена, заявлено расширение до миллиона. Поддерживаются инструменты и FIM. Лицензия — Apache-2.0.
Это кандидат для чата с кодом, правок и агента на одной машине. Для подходящей четырёхбитной версии можно ориентироваться на 24–32 ГБ видеопамяти. Для запуска подойдут Ollama и совместимые версии llama.cpp или серверных движков.
Главное ограничение — расход памяти при длинном контексте. На 16 ГБ нельзя обещать комфортную работу целиком на GPU. Для агента нужен корректный обработчик собственного формата вызовов Qwen, а для подсказок нужно проверить задержку.
Qwen3.8-27B — код и задачи с изображениями
Qwen3.8-27B — плотная модель с языковой частью на 27 млрд параметров и поддержкой изображений. Она пригодится для работы с кодом, схемами и снимками интерфейса. Нативный контекст — 262 144 токена с расширением до миллиона, лицензия — Apache-2.0.
Qwen сообщает о 61,7% на SWE-bench Pro против 53,5% у Qwen3.6-27B. Обе модели тестировали с Claude Code, контекстом 256K и уточнённым набором заданий. Эти результаты относятся к опубликованной методике, а не к Pro V2, и не доказывают превосходства над всеми конкурентами.
Для четырёхбитного запуска с текстом можно ориентироваться на 24–32 ГБ видеопамяти. Обработка изображений и дополнительные компоненты увеличивают расход памяти. Разработчик перечисляет vLLM и SGLang среди вариантов запуска. Для настольного ПО нужна совместимая конверсия. Отдельная FIM-специализация не заявлена.
Devstral Small 2 — правки нескольких файлов
Devstral Small 2 24B Instruct 2512 от Mistral — плотная модель класса 24 млрд параметров для работы с инструментами и репозиторием. Контекст — 256K, лицензия — Apache-2.0. Карточка модели описывает локальное развёртывание через vLLM и работу с агентными клиентами.
Для запуска на персональном GPU нужен подходящий вариант квантования. С четырёхбитными весами можно ориентироваться на 24–32 ГБ видеопамяти. Указание Mistral на RTX 4090 или Mac с 32 ГБ общей памяти нельзя переносить на любой формат весов и настройки. FIM не относится к главным заявленным сценариям.
В каталоге API Small 2 отмечена как устаревший сервисный релиз, но опубликованные веса остаются доступны для самостоятельного запуска. Это специализированный кандидат, который стоит сравнить с актуальными Qwen на своём проекте.
Qwen3-Coder-Next — более тяжёлый агент
У Qwen3-Coder-Next около 80 млрд общих и трёх миллиардов активных параметров, гибридная архитектура и нативный контекст 262 144 токена. Лицензия — Apache-2.0, поддерживаются FIM и инструменты. Для запуска подойдут vLLM, SGLang и совместимые настольные движки.
Теоретический объём четырёхбитных весов — уже 40 ГБ без служебных данных и памяти под контекст. На практике файл Q4_K_M в Ollama занимает около 52 ГБ. Поэтому 48–64 ГБ — ориентир для выбора системы, а не гарантия запуска с любыми настройками. При 48 ГБ может понадобиться более компактное квантование или перенос части вычислений на CPU.
Если 30B уже решает задачи без частых повторов, переход на Next сначала нужно обосновать сравнением результатов.
DeepSeek V4 и V4.1 — серверная инфраструктура
У V4-Flash около 284 млрд параметров основной модели и 13 млрд активных. У V4-Pro — около 1,6 трлн и 49 млрд соответственно. Контекст достигает миллиона токенов, лицензия — MIT. Эти модели рассматривают для сложных агентных задач, а не для быстрого FIM-автодополнения.
К дате статьи доступна DeepSeek-V4.1-Flash: 552 млрд параметров основной архитектуры, дополнительно 196 млрд условной памяти Engram и другие компоненты. При обработке входа активны около восьми миллиардов параметров, при генерации — 16 млрд. Контекст — до миллиона токенов, лицензия — MIT.
Для V4-Flash-0731 используйте рецепт vLLM для конкретной аппаратной платформы. Требования зависят от версии движка, контекста, числа параллельных запросов и дополнительных модулей генерации. Единого порога памяти для всех режимов нет. У V4.1 другая архитектура, поэтому её требования рассчитывают отдельно. Перед выбором оборудования проверьте запуск выбранных весов и работу инструментов на целевой конфигурации.
GLM-5.3-Flash — крупный общий сервис
У GLM-5.3-Flash примерно 321 млрд общих и 18 млрд активных параметров. Модель использует гибридную архитектуру, поддерживает инструменты и контекст до 1 048 576 токенов. Веса опубликованы под MIT.
Название Flash не делает её настольной моделью. По рецепту vLLM, нативные FP8-веса занимают около 306 ГиБ — примерно 329 ГБ. Дополнительно нужна память для контекста и работы движка. Достаточность четырёх GPU по 96 ГБ проверяют с выбранным контекстом, числом параллельных запросов и схемой распределения модели. Суммарная память карт сама по себе не подтверждает возможность запуска.
GLM сравнивают с серверными DeepSeek при выборе внутреннего агентного сервиса. Оснований выбирать её для FIM-подсказок нет: этот режим разумнее обслуживать компактной моделью.
Code Llama, StarCoder2, CodeGemma, WizardCoder и DeepSeek-Coder-V2 не включены в основной список: для нового запуска в подборке приоритет отдан более актуальным отправным точкам. Phi можно оценить при жёстком ограничении ресурсов. Qwen2.5-Coder сохранён благодаря полезной FIM-роли.
У MiniMax-M3 отдельная Community License. Она содержит положение о некоммерческом использовании и условия коммерческого применения. Для бизнеса нужны маркировка «Built with MiniMax M3» и разовое уведомление разработчика. Если годовая выручка продуктов или сервисов, использующих модель, превышает 20 млн долларов, требуется предварительное письменное разрешение. Это не безусловный запрет для бизнеса и не эквивалент Apache-2.0.
Для подсказок первый выбор — Qwen2.5-Coder. Для чата и правок — gpt-oss-20b при ограниченной памяти или Qwen3-Coder 30B при большем запасе. Серверные гиганты оценивают после выявления конкретных ограничений компактных моделей.
Сравнение моделей
Для какой задачи подходит модель
В таблице указан заявленный контекст. Максимальное окно доступно не на любой конфигурации, а расширение может требовать дополнительной настройки.
| Модель | Основной сценарий | Контекст | Лицензия |
|---|---|---|---|
| Qwen2.5-Coder 1.5B / 7B | FIM-подсказки | Около 32K, у 7B расширение до 128K | Apache-2.0 |
| gpt-oss-20b / 120b | Чат, рассуждения, инструменты | 128K | Apache-2.0 |
| Qwen3-Coder-30B-A3B | Код, правки, агент, FIM | 256K нативно | Apache-2.0 |
| Qwen3.8-27B | Код и задачи с изображениями | 256K нативно | Apache-2.0 |
| Devstral Small 2 | Агентные правки репозитория | 256K | Apache-2.0 |
| Qwen3-Coder-Next | Более тяжёлый агент, FIM | 256K нативно | Apache-2.0 |
| DeepSeek V4 / V4.1 | Серверные агентные задачи | До 1M | MIT |
| GLM-5.3-Flash | Общий агентный сервис | 1M | MIT |
K и M — сокращённые обозначения тысяч и миллиона токенов. Длина окна не определяет качество: отбор нужных файлов может быть полезнее передачи всего репозитория.
Требования к памяти
Для четырёхбитных версий указаны оценки класса системы. Официальные ориентиры gpt-oss и данные рецептов vLLM отмечены отдельно. Возможность запуска проверяют для конкретных весов, настроек и нагрузки.
| Модель и версия | Формат / квантование | Память GPU | Для какого железа |
|---|---|---|---|
| Qwen2.5-Coder 1.5B / 7B | Подходящая четырёхбитная версия | 8–16 ГБ, оценка. Для 1.5B может хватить меньше | Обычный ПК, подсказки |
| gpt-oss-20b | MXFP4 экспертных весов | Около 16 ГБ, ориентир разработчика | Персональный чат |
| Qwen3-Coder 30B / Qwen3.8 27B | Подходящая четырёхбитная версия | 24–32 ГБ, оценка | Производительная персональная система |
| Devstral Small 2 | Подходящая четырёхбитная версия | 24–32 ГБ, оценка | Персональный агент |
| Qwen3-Coder-Next | Подходящая четырёхбитная версия | 48–64 ГБ, с учётом оговорки ниже | Профессиональная система |
| gpt-oss-120b | MXFP4 экспертных весов | Один GPU с 80 ГБ, ориентир разработчика | Рабочая станция или сервер |
| DeepSeek-V4-Flash-0731 | Вариант FP8 в рецепте vLLM | По рецепту для выбранной платформы и нагрузки | Серверная конфигурация |
| GLM-5.3-Flash | Нативный FP8 | Около 306 ГиБ, или 329 ГБ, только для весов. Дополнительно нужна память для контекста и движка | Крупная серверная конфигурация |
У Qwen3-Coder-Next файл Q4_K_M в Ollama занимает около 52 ГБ. Поэтому при 48 ГБ видеопамяти может понадобиться более компактное квантование или частичная выгрузка на CPU.
Размер файла модели не равен её потреблению памяти. Для DeepSeek-V4.1-Flash универсальное значение не указано: новая архитектура и дополнительные компоненты требуют отдельного расчёта. Для любого варианта сначала задают контекст и число параллельных запросов, затем проверяют фактическое потребление памяти и работу под нагрузкой.
Сколько видеопамяти нужно для нейросети
Квантование снижает точность представления весов и сокращает их размер. Это позволяет запустить модель, исходная версия которой не помещается на GPU. Однако сильное сжатие может ухудшить качество кода и соблюдение формата вызовов инструментов.
GGUF — формат хранения, а не вид квантования. Он поддерживает веса разной точности, а Q4_K_M обозначает конкретный вариант квантования. MXFP4 у gpt-oss и произвольная конверсия в GGUF не гарантируют одинакового качества и расхода памяти.
Грубая нижняя оценка памяти только для весов
Память весов в байтах ≈ число параметров × число бит на параметр / 8.
Для 27 млрд параметров при идеальном четырёхбитном представлении получается 13,5 ГБ. Это десятичная оценка без служебных данных, буферов и памяти под контекст. У MoE учитывают все хранимые веса, а не только активные параметры.
KV-кэш хранит ключи и значения внимания для уже обработанных токенов. Его объём зависит от архитектуры, длины контекста и точности хранения. Гибридные модели могут сочетать KV-кэш с состояниями других типов, поэтому одинаковое окно не означает одинакового расхода памяти. Параллельные запросы увеличивают потребность сервиса в памяти.
Видеокарты с 8–16 ГБ
На 8 ГБ начните с компактной FIM-модели. Qwen2.5-Coder 7B в сжатой версии — кандидат для проверки, а 1.5B оставляет больше ресурсов IDE и другим приложениям. На 16 ГБ рассмотрите gpt-oss-20b для чата, сохраняя запас под контекст.
Две одновременно загруженные модели конкурируют за память. Если загружать их по очереди, переключение добавляет ожидание. CPU offload позволяет разместить часть весов в системной памяти и, в зависимости от движка, выполнять часть вычислений на CPU. Это помогает запускать модели, которые не помещаются в видеопамять. llama.cpp поддерживает совместный CPU/GPU-инференс, но RAM не обеспечивает пропускную способность памяти GPU. Задержку такого режима измеряют отдельно.
24–32 ГБ — производительная персональная рабочая станция
В этом классе можно рассматривать Qwen3-Coder 30B, Qwen3.8 27B и Devstral с подходящим квантованием. Запас видеопамяти позволяет использовать менее сильное сжатие или более длинный контекст, но максимальные настройки не гарантированы.
Например, RTX 5090 с 32 ГБ оценивают по двум условиям: помещается ли выбранная версия модели и укладывается ли ответ в допустимое время. Инференс на видеокарте зависит и от движка, поэтому одних паспортных характеристик недостаточно.
Рабочая станция для разработки должна обеспечивать одновременную работу модели, IDE, контейнеров и сборки. Для системы этого класса 64 ГБ оперативной памяти можно взять за отправную точку, затем уточнить объём по приложениям. При offload отдельно учитывают размещённые в памяти веса и рабочие данные. Это рекомендация для подбора, а не минимальное требование каждой LLM.
На SSD нужно место под модель, версии для сравнения и проектные данные. Исходные и квантованные веса могут храниться одновременно, поэтому объём удобнее считать по фактическим файлам.
В DigitalRazor можно обсудить рабочую станцию для локальных LLM с подходящими GPU, RAM, питанием и охлаждением. При подборе укажите движок, контекст и одновременно работающие приложения.
48–96+ ГБ и несколько GPU
Здесь можно рассматривать Qwen3-Coder-Next, gpt-oss-120b и менее ограниченные настройки компактных моделей с учётом требований выбранных весов. При этом две карты по 32 ГБ не работают как одна с 64 ГБ. Движок должен поддерживать распределение модели между GPU. Обмен данными и отдельные буферы создают дополнительные расходы, поэтому важны топология PCIe и совместимость выбранной платформы.
Единая память CPU и GPU — отдельный сценарий. 128 ГБ общей памяти нельзя описывать как 128 ГБ выделенной видеопамяти дискретной карты. Отличаются доступный модели объём, пропускная способность и конкуренция с ОС и приложениями.
Подробнее о платформах — в нашем материале о локальном ИИ и выборе оборудования.
Тест локальных нейросетей на рабочей станции DigitalRazor
Мы проверили скорость локальных моделей для программирования на DigitalRazor 350D Tower. Конфигурация станции: Ryzen 9 9950X, GeForce RTX 5090 с 32 ГБ видеопамяти и 64 ГБ DDR5.
Для сравнения выбрали Qwen3-Coder-30B-A3B, gpt-oss-20b и Devstral Small 2. Нас интересовало, сколько времени занимает генерация короткого ответа и более объёмного фрагмента кода.
PERFORMANCE PRO 150D
Как тестировали
Модели запускали через llama.cpp с CUDA. Qwen3-Coder и Devstral Small 2 использовали в формате GGUF Q4_K_M, gpt-oss-20b — в GGUF с весами MXFP4.
Все слои моделей размещались на GPU. Окно контекста составляло 8192 токена, входной запрос — до 4096 токенов. Одновременно обрабатывался один запрос. Замеры выполняли после загрузки модели и прогрева.
Отдельно оценивали генерацию 512 и 2048 токенов. Первый объём соответствует короткой функции или объяснению ошибки, второй — набору тестов или более объёмной правке. Конкретная длина кода зависит от задания и токенизатора.
Результаты тестирования
| Модель | Скорость генерации, токенов/с | Генерация 512 токенов, с | Генерация 2048 токенов, с |
|---|---|---|---|
| Qwen3-Coder-30B-A3B | 180–260 | 2–3 | 8–12 |
| gpt-oss-20b | 180–260 | 2–3 | 8–12 |
| Devstral Small 2 | 60–90 | 6–9 | 23–35 |
Qwen3-Coder и gpt-oss-20b выдавали короткий ответ за несколько секунд. Генерация более объёмного ответа занимала до 12 секунд. Devstral Small 2 работала медленнее: на выдачу 2048 токенов требовалось примерно 23–35 секунд.
В таблице указано время генерации после обработки входного запроса. Загрузка весов, подготовка контекста и задержки клиента в него не входят. Для gpt-oss учитывались все сгенерированные токены, включая рассуждения.
Что показал тест
Конфигурация с RTX 5090 подходит для персонального помощника разработчика в проверенных режимах: модель помещается в видеопамять, а ожидание ответа позволяет работать с ней интерактивно.
При этом скорость генерации не определяет качество кода. В агентных задачах к ней добавляются чтение файлов, вызовы инструментов, запуск тестов и повторные исправления. Для выбора модели под конкретный проект нужно дополнительно проверить правильность решений и время выполнения всей задачи.
GPU-сервер для команды
Пять разработчиков не обязательно создают пять одновременных запросов. Редкий чат и постоянно работающие агенты дают разную нагрузку. При расчёте сервиса учитывают объём входных запросов и ответов, число активных задач и допустимое ожидание.
Подсказки и тяжёлого агента полезно обслуживать раздельно, выделяя им ресурсы так, чтобы длинная задача не задерживала вставки в редакторе. Серверные движки могут объединять обработку нескольких запросов — batching. Его настройки подбирают вместе с лимитами контекста и параллельности.
Для общего сервиса нужны ограничения ресурсов, метрики задержки и порядок обновления. Журналы с кодом тоже требуют защиты. Пилот может начаться с Qwen3-Coder 30B. Переход на серверного гиганта обосновывают задачами, с которыми компактная модель не справляется, а добавление GPU — измеренной нагрузкой.
При обсуждении GPU-сервера DigitalRazor для ИИ укажите версию весов, контекст, число одновременных задач и допустимое время ответа. Запрос «для пяти программистов» не определяет конфигурацию.
Как подключить локальную модель к редактору кода
Ollama и Continue
Начальная цепочка — «VS Code или JetBrains — Continue — Ollama — модель». Ollama хранит веса и выполняет запросы, а расширение передаёт их из редактора. После установки компонентов и запуска сервиса Ollama загрузите модель ollama pull qwen2.5-coder:1.5b-base.
Пример локальной конфигурации Continue в config.yaml
name: Local Coding
version: 0.0.1
schema: v1
models:
- name: Local Autocomplete
provider: ollama
model: qwen2.5-coder:1.5b-base
apiBase: http://localhost:11434
roles:
- autocomplete
Значение model должно совпадать с тегом из ollama list. Для чата добавьте отдельную модель с ролью chat, для правок — edit. Примеры есть в руководстве Continue.
Для агента проверьте работу инструментов и согласуйте лимиты контекста клиента и сервера. Назначение роли не добавляет модели отсутствующих возможностей.
Подключение в JetBrains AI Assistant
JetBrains AI Assistant поддерживает Ollama, LM Studio и OpenAI-совместимые серверы. Совместимость с API OpenAI не требует обращения к облаку OpenAI.
В Settings — Tools — AI Assistant — Providers & API keys выберите провайдера, укажите адрес сервера, проверьте соединение и назначьте модели функциям.
AI Completion настраивается отдельно от чата. Для локальных подсказок выберите OpenAI Compatible и укажите сервер и модель. Вставки кода требуют поддержки FIM, а предсказание следующей правки — поддержки edit prediction.
На дату статьи документация JetBrains указывает, что при использовании локальных моделей AI Assistant не поддерживает вызов инструментов настроенных MCP-серверов. MCP — протокол подключения инструментов к ИИ. При включённом JetBrains AI функции без совместимой собственной модели могут обращаться к облаку. Поэтому проверьте назначение моделей для каждой функции и сетевые обращения.
Локальные агенты из терминала
Aider может работать с Ollama. После установки Aider, загрузки qwen3-coder:30b и запуска Ollama откройте терминал в рабочей копии проекта.
Для Linux или macOS
export OLLAMA_API_BASE=http://127.0.0.1:11434
aider --model ollama_chat/qwen3-coder:30b
В Windows задайте переменную среды способом выбранной оболочки. Aider рекомендует префикс ollama_chat/.
Начните с конкретного дефекта, проверьте diff — изменения в файлах — и запустите тесты. Подключение к API ещё не подтверждает качество правок.
Что нужно знать о Cursor
Cursor сообщает, что запросы с собственными API-ключами проходят через его серверы для окончательного формирования запроса. Такие ключи работают только с чат-моделями, а Tab-подсказки используют встроенные модели Cursor.
Такой маршрут не обеспечивает полностью локальную цепочку «IDE — localhost». Ограничение хранения данных тоже не отменяет их внешней передачи. Для закрытого кода выберите клиент с документированным локальным маршрутом и проверьте сетевые обращения. Cursor рассматривают для облачной или гибридной работы, если она разрешена.
Локальная модель или облачный ИИ
| Сценарий | Собственная инфраструктура | Облачная модель |
|---|---|---|
| Закрытый код | Контроль обработки, если вся цепочка остаётся внутри периметра | Передача допустима только по правилам компании и условиям сервиса |
| Быстрый старт | Нужно загрузить веса и проверить запуск | Обычно достаточно подключить сервис |
| Постоянная нагрузка | Расходы зависят от стоимости оборудования, его загрузки и обслуживания | Расходы зависят от тарифа и объёма обращений |
| Сложные задачи | Качество зависит от выбранной модели, а её размер и настройки ограничены доступным железом | Проще получить доступ к крупным моделям без собственного сервера |
| Обслуживание | Обновления, мониторинг и совместимость обеспечивает компания | Основную инфраструктуру обслуживает поставщик |
| Работа без интернета | Возможна, если модели и инструменты работают автономно | Нужен сетевой доступ к сервису |
Облако удобно для редких тяжёлых задач, если передача контекста разрешена. Собственная система полезна при требованиях к периметру, автономности и стабильной нагрузке.
Гибридный вариант сочетает компактную FIM-модель на ПК с облачным помощником для сложных задач. Заранее определите, какие данные можно передавать в облако. Автоматическое переключение модели не должно отправлять туда закрытый репозиторий в обход этих правил.
Как выбрать модель и железо под свой сценарий
Есть 8–16 ГБ видеопамяти. Проверьте Qwen2.5-Coder для подсказок, а при 16 ГБ — gpt-oss-20b для чата. Измерьте время ожидания ответа и расход памяти при открытых рабочих приложениях.
Есть 24–32 ГБ видеопамяти. Сравните Qwen3-Coder 30B, Qwen3.8 27B и Devstral Small 2 на одном наборе задач. Зафиксируйте квантование, контекст, клиент и число попыток. Оценивайте пригодные результаты, а не только успешную загрузку весов.
Нужна конфиденциальность. Проверьте маршруты данных для чата, подсказок, индексации, инструментов, телеметрии и журналов. Отключите облачное переключение. После загрузки моделей и зависимостей проверьте работу с заблокированным доступом к внешним сервисам.
Нужно обслуживать команду. Проведите пилот с внутренним API, измерьте число одновременных активных задач и задержки. Сервер выбирают по параллельности, требованиям к доступности и обслуживанию, а не по числу сотрудников.
Нужны подсказки. Сравните задержку и долю принятых вставок у малых FIM-моделей. Более мощный ускоритель имеет смысл, если текущему GPU не хватает памяти или производительности для нужной нагрузки.
Для пилота подойдут написание теста пограничного случая, исправление ошибки и изменение двух связанных файлов. Доля успешно решённых задач, время выполнения и расход памяти помогут предметно обсудить конфигурацию с DigitalRazor.
Часто задаваемые вопросы
Заключение
Локальная нейросеть приносит пользу, когда помогает получать проверяемые изменения с приемлемым временем ответа и сохраняет нужный контроль над данными. Определите задачу, выберите модель и проверьте конкретные веса при нужном контексте. Затем подбирайте железо по измеренной нагрузке.
Поможем подобрать рабочую станцию или GPU-сервер под ваш сценарий. Собираем и тестируем оборудование на собственной площадке в Санкт-Петербурге. GPU-серверы проходят нагрузочное тестирование перед поставкой и поставляются с платформой OneStack, согласованными драйверами, CUDA и программной средой под задачу. Инженеры помогают с запуском и настройкой в течение гарантийного срока. Это сокращает объём самостоятельной работы по сборке и подготовке системы.
Обсудите с DigitalRazor рабочую станцию для локальных LLM или GPU-сервер для команды. Пришлите название модели, вариант квантования, типичный контекст, число одновременных задач и допустимое время ответа. Если модель ещё не выбрана, начните с описания задач, требований к конфиденциальности и бюджета. Эти данные помогут инженерам предложить конфигурацию под ожидаемую нагрузку.
Выберите GPU-сервер для нейросетей
Готовые решения для работы с большими массивами данных




































