8 800 500-99-26 Для звонков по России
Как развернуть ИИ-агента на своём сервере или VPS: пошаговый гайд
База знаний
18 мин

Как развернуть ИИ-агента на своём сервере или VPS: пошаговый гайд

DigitalRazor
DigitalRazor
Подписаться в Telegram
Содержание 16 разделов
Коротко Что выбрать: локальный сервер или VPS Что такое ИИ-агент Что умеют делать ИИ-агенты Как устроена схема работы ИИ-агента Где развернуть ИИ-агента Что потребуется для запуска Какой сервер нужен для ИИ-агента Какую модель выбрать Пошаговая установка локального ИИ-агента Как собрать первого агента в n8n Как подключить базу знаний Как развернуть ИИ-агента на VPS Selectel Гибридная схема: VPS в облаке, модель в офисе FAQ Заключение
Подберём сервер под вашу задачу

Подберём конфигурацию сервера и отправим предложение.

Смотреть серверы
или свяжитесь с нами
Telegram Telegram WhatsApp WhatsApp ВКонтакте ВКонтакте MAX MAX

Подберём сервер под задачи

Ответьте на несколько вопросов — подготовим предложение

В этой статье разберём, из каких компонентов состоит ИИ-агент, какой сервер ему нужен и как запустить его двумя способами: полностью локально на оборудовании DigitalRazor или круглосуточно на VPS/VDS-сервере провайдера Selectel. Пошаговая инструкция будет полезна тем, кто хочет создать агента для работы с документами, CRM, почтой, сайтом или Telegram, но пока не понимает, где должна работать нейросеть, зачем нужны n8n, Ollama и векторная база и требуется ли для проекта отдельная видеокарта.

Если вы раньше не работали с виртуальными серверами, сначала рекомендуем прочитать наши материалы о том, как запустить VPS/VDS-сервер и как выбрать подходящую конфигурацию VPS/VDS.

В качестве примера соберём агента на основе n8n. Платформа будет принимать запросы, обращаться к языковой модели, искать данные в документах и запускать разрешённые действия. Локальные модели запустим через Ollama, а документы поместим в векторную базу Qdrant.

Коротко

  • Обычный VPS подходит для логики агента, базы данных, интерфейса и интеграций;
  • Для небольшого агента, который обращается к модели через API, видеокарта на VPS не нужна;
  • Для полностью локального запуска нейросети требуется рабочая станция или сервер с GPU;
  • n8n управляет последовательностью действий агента;
  • Ollama запускает локальную языковую модель;
  • Qdrant хранит представления документов для интеллектуального поиска;
  • PostgreSQL хранит настройки, историю и служебные данные;
  • Опасные действия агента нужно выполнять только после подтверждения человеком.

Что выбрать: локальный сервер или VPS

Вот понятная инструкция, которая поможет определиться, какой сервер вам нужен.

Серверная стойка

Выбирайте VPS Selectel, если:

  • нужно быстро проверить идею;
  • модель доступна через API;
  • агент должен работать круглосуточно;
  • нет системного администратора для локального оборудования;
  • нагрузка пока неизвестна;
  • важна возможность быстро увеличить ресурсы.

Выбирайте локальный сервер DigitalRazor, если:

  • агент обрабатывает конфиденциальные документы;
  • внешние API использовать нельзя;
  • модель работает постоянно;
  • запросов становится много;
  • требуется предсказуемая скорость;
  • нужно хранить весь контур внутри компании.

Выбирайте облачный сервер с GPU, если:

  • нужна локальная модель без покупки оборудования;
  • проект временный;
  • вычислительная нагрузка возникает периодически;
  • нужно быстро протестировать несколько GPU;
  • инфраструктура должна находиться в дата-центре.

Выбирайте гибридную схему, если:

  • агент должен быть доступен из интернета;
  • документы и модель должны оставаться внутри компании;
  • в офисе уже есть сервер с GPU;
  • нужно разделить публичный и закрытый контуры.

А теперь обо всём поговорим более подробно.

Что такое ИИ-агент

ИИ-агент — это программа, которая использует языковую модель для выбора и выполнения действий.

Устройство ИИ агента

Обычный ИИ-ассистент в основном отвечает на вопросы. Агент может не только подготовить текст, но и обратиться к базе данных, проверить остатки товара на складе, создать задачу в CRM, отправить письмо или запустить другой сценарий.

Например, пользователь пишет: «Проверь новые обращения клиентов, выдели срочные и создай задачи для отдела продаж».

В этом случае агент может:

  1. получить новые обращения из почты или CRM;
  2. проанализировать их содержание;
  3. определить тему и срочность;
  4. найти информацию о клиенте;
  5. подготовить краткое резюме;
  6. создать задачи;
  7. отправить сотруднику отчёт.

Главное отличие агента от обычного сценария автоматизации состоит в том, что часть решений принимает языковая модель. Заранее заданная автоматизация следует жёсткому маршруту, а агент может выбирать подходящий инструмент в зависимости от запроса.

Это не означает, что ему нужно давать полную свободу. Надёжный агент работает внутри заданных ограничений: получает доступ только к нужным системам, использует разрешённые инструменты и запрашивает подтверждение перед важными действиями.

Что умеют делать ИИ-агенты

Агент — это одна и та же конструкция: модель, которая выбирает и вызывает инструменты. За исключением мультиагентной системы, о которой поговорим чуть ниже.

Специализация агента — это не отдельный вид техники, а набор подключённых инструментов и системная инструкция. Один и тот же агент становится помощником по базе знаний, если дать ему поиск по документам, или диспетчером заявок, если дать ему доступ к CRM. Ниже — типовые задачи, которые агенты способны закрывать.

Агент для работы с базой знаний

Ищет информацию в инструкциях, договорах, регламентах, каталогах и технической документации.

Такой агент подходит для внутренней поддержки сотрудников, консультации клиентов и поиска по большому архиву документов.

Агент для автоматизации процессов

Работает с CRM, почтой, календарём, системой управления задачами и другими приложениями.

Он может квалифицировать заявки, готовить ответы, создавать карточки клиентов и обновлять статусы сделок.

Агент для наблюдения и аналитики

Запускается по расписанию, проверяет источники и сообщает об изменениях.

Например, он может анализировать показатели продаж, журналы работы сервера, цены конкурентов или новые публикации по заданной теме.

Агент для разработчиков и системных администраторов

Читает программный код и журналы ошибок, формирует команды, подготавливает исправления и помогает искать причины сбоев.

Такому агенту особенно опасно выдавать неограниченный доступ к командной строке. Команды, меняющие файлы или инфраструктуру, должен проверять человек.

Мультиагентная система

Отдельный случай — не заточка одного агента, а связка из нескольких специализированных агентов. Один планирует задачу, второй ищет документы, третий проверяет факты, четвёртый готовит результат. Это уже про архитектуру, а не про область применения.

Мультиагентная система полезна в сложных процессах, но требует больше запросов к модели, памяти и вычислительных ресурсов. Начинать проект лучше с одного агента и добавлять роли только после появления измеримой необходимости.

Как устроена схема работы ИИ-агента

Запрос → управляющая платформа → языковая модель → память и база знаний → инструменты → проверка → действие → журнал работы

Разберём каждый компонент.

1. Точка входа

Агент получает задачу из чата, Telegram, формы на сайте, электронной почты, CRM или через программный интерфейс.

2. Управляющая платформа

Она передаёт данные между компонентами и контролирует порядок действий.

n8n

Пример псевдокода ИИ-агента на n8n

В нашем примере эту роль выполняет платформа для автоматизации рабочих процессов n8n. Она позволяет собирать сценарии из визуальных блоков и подключать внешние приложения через готовые интеграции или API. n8n поддерживает самостоятельное размещение на собственной инфраструктуре и объединяет автоматизацию процессов с инструментами ИИ.

Для проектов, где агенту нужно сохранять контекст и накопленный опыт между сессиями, n8n можно дополнить Hermes Agent от Nous Research — открытым self-hosted агентом с персистентной памятью, который можно использовать в пайплайне как оркестратор. n8n остаётся визуальным конструктором предсказуемых сценариев, а Hermes работает как автономный агент с памятью, собственными скиллами и задачами по расписанию. Поэтому эти инструменты не заменяют друг друга и могут использоваться вместе.

Важно!

Не путайте Hermes Agent с языковыми моделями Hermes той же команды. Это разные продукты.

3. Языковая модель

Модель анализирует запрос, выбирает дальнейшие действия и формирует ответ.

Она может работать:

ИИ-роутер Selectel предоставляет единый программный интерфейс для обращения к генеративным моделям. Такой вариант подходит, если вы хотите развернуть управляющую часть агента на VPS, но не планируете самостоятельно устанавливать и обслуживать языковую модель.

4. Память

Кратковременная память хранит текущую переписку. Долговременная — сведения о пользователях, предыдущих действиях и результатах.

Для рабочих проектов данные лучше хранить в PostgreSQL, а не только внутри памяти отдельного сценария.

5. База знаний

Документы преобразуются в числовые представления и сохраняются в векторной базе. Когда пользователь задаёт вопрос, система находит подходящие фрагменты и передаёт их модели.

Такой подход называется генерацией с дополнением из внешних источников — RAG.

RAG - Retrieval Augmented Generation

6. Инструменты

Инструментами могут быть:

  • запрос к CRM;
  • чтение почты;
  • поиск по сайту;
  • получение данных из базы;
  • создание задачи;
  • отправка сообщения;
  • вызов собственного API.

7. Проверка

Перед отправкой письма, удалением данных, изменением сделки или выполнением команды агент должен запросить подтверждение человека.

В n8n можно добавлять проверку человеком перед вызовом инструментов, способных изменить данные или выполнить необратимое действие.

8. Журнал работы

Необходимо сохранять запрос, выбранные инструменты, полученные ответы, ошибки и итоговое действие. Без журналов невозможно понять, почему агент принял неправильное решение.

Где развернуть ИИ-агента

Вариант Где работает модель Преимущества Ограничения
VPS/VDS Selectel + внешний API у поставщика модели быстрый запуск, не нужен GPU данные передаются внешнему сервису
Облачный сервер Selectel с GPU в облаке Selectel оплата по мере использования, быстрое масштабирование регулярные расходы на аренду GPU, за 12–18 месяцев превышает стоимость карты
Локальная рабочая станция DigitalRazor внутри компании полный контроль над данными, на большой дистанции дешевле покупка и обслуживание оборудования
Локальный GPU-сервер DigitalRazor внутри компании или собственного ЦОД круглосуточная работа, несколько GPU требуется подготовленная инфраструктура
Гибридная схема модель локально, n8n в облаке приватная модель и публичный интерфейс нужно защищённое соединение

Для первого прототипа чаще всего достаточно VPS с 4–8 ГБ оперативной памяти и обращения к модели через API или ИИ-роутер Selectel.

Локальный сервер оправдан, когда агент работает с конфиденциальными документами, запросов много или постоянная аренда вычислительных ресурсов становится дороже собственного оборудования.

Что потребуется для запуска

До установки программ нужно определить:

  1. какую задачу выполняет агент;
  2. откуда он получает запросы;
  3. к каким системам обращается;
  4. какие действия может выполнять;
  5. где будет работать языковая модель;
  6. какие документы входят в базу знаний;
  7. какие действия требуют подтверждения;
  8. как будет оцениваться качество.

Плохая постановка задачи: Сделать умного агента для компании.

Хорошая постановка: Агент получает вопрос сотрудника в Telegram, ищет ответ в регламентах компании, указывает источник и создаёт заявку в техническую поддержку, когда ответа нет.

Во втором случае можно проверить точность поиска, долю решённых вопросов, время ответа и число правильно созданных заявок.

Какой сервер нужен для ИИ-агента

Необходимо отдельно считать ресурсы управляющей платформы и языковой модели.

DigitalRazor HGX H200

n8n, PostgreSQL и Qdrant могут работать на обычном процессоре. Основную нагрузку создаёт локальная языковая модель.

Обычный VPS без GPU

Обычный VPS/VDS Selectel подходит, если языковая модель вызывается через внешний API, ИИ-роутер или отдельный сервер с GPU.

В июле 2026 года Selectel предлагает семь фиксированных конфигураций VPS/VDS с KVM-виртуализацией и NVMe-накопителями. Среди них есть варианты 2 vCPU/4 ГБ/50 ГБ за 650 рублей в месяц, 4 vCPU/8 ГБ/80 ГБ за 1100 рублей и 6 vCPU/12 ГБ/120 ГБ за 2000 рублей. Цены могут измениться к моменту публикации.

Задача vCPU ОЗУ Стартовая конфигурация
Один тестовый агент и внешний API 2 4 ГБ VDS 2-4-50
n8n, PostgreSQL и Qdrant 4 8 ГБ VDS 4-8-80
Несколько агентов и обработка документов 6 12 ГБ VDS 6-12-120
Высокая нагрузка от 8 от 16 ГБ произвольный облачный сервер

Запускать крупную модель через Ollama на обычном VPS без видеокарты технически возможно, но ответы будут формироваться медленно. VPS лучше использовать как управляющий узел, а вычисления передавать через API или на отдельный GPU-сервер.

Локальная рабочая станция или сервер с GPU

Для полностью локального агента можно использовать рабочую станцию или GPU-сервер DigitalRazor. В этом случае языковая модель, база знаний и управляющая платформа работают внутри инфраструктуры компании.

Практический пример полностью локальной схемы — Hermes Agent, развёрнутый на собственной рабочей станции или GPU-сервере. Он может обращаться к языковой модели через Ollama, хранить память и скиллы внутри инфраструктуры компании, а при необходимости работать в гибридном режиме с облачными моделями.

Сценарий Класс модели Ресурсы GPU Решение DigitalRazor
Первый локальный агент 4–12B от 16 ГБ Performance Pro 350R
Агент с инструментами и большой базой знаний 14–30B 32 ГБ Performance Pro 350R с RTX 5090
Крупная модель или несколько агентов 30–120B 96–192 ГБ Performance Pro 750R
Общий сервер для команды несколько моделей 2 GPU Rackstation AI
Высокая параллельная нагрузка несколько экземпляров моделей 4–6 GPU Devbox AI

Performance Pro 350R поддерживает одну видеокарту от RTX 5060 Ti до RTX PRO 6000 с 96 ГБ памяти. Performance Pro 750R позволяет установить две RTX PRO 6000 и получить до 192 ГБ суммарной видеопамяти.

[ PERFORMANCE PRO TOWER ]
350D Tower
i9-14900K · RTX 5090 32ГБ · 64GB DDR5 RGB · 1 ТБ
856 500 ₽
64 238 ₽ / мес Примерный ежемесячный платёж. Итоговая сумма рассчитывается индивидуально.
Подробнее
750D Tower
7965WX · RTX 5090 32ГБ · 256GB DDR5 ECC · 1 ТБ NVME 5.0
2 569 500 ₽
192 713 ₽ / мес Примерный ежемесячный платёж. Итоговая сумма рассчитывается индивидуально.
Подробнее
900D Tower
2 x EPYC 9534 · RTX PRO 5000 48GB · 512GB DDR5 ECC · 2 ТБ
5 897 000 ₽
442 275 ₽ / мес Примерный ежемесячный платёж. Итоговая сумма рассчитывается индивидуально.
Подробнее

Rackstation AI рассчитан на одну или две видеокарты, а Devbox AI поддерживает до четырёх RTX 5090 либо до шести RTX PRO 6000. Такие системы подходят для круглосуточной работы нескольких агентов и общего доступа команды.

Для большинства корпоративных агентов H200 не требуется. Она становится оправданной при массовом обслуживании пользователей, очень крупных моделях или высокой нагрузке на один экземпляр модели.

Серверы и рабочие станции DigitalRazor также могут поставляться с платформой OneStack. Она упрощает запуск моделей и управление контейнерами через графический интерфейс, поэтому часть пользователей сможет обойтись без ручной настройки каждого компонента через командную строку.

OneStack

Выберите GPU-сервер для нейросетей

Готовые решения для работы с большими массивами данных

Переход в каталог

Какую модель выбрать

Для первого проекта не нужно начинать с самой крупной модели. Чем меньше модель, тем быстрее она отвечает и тем проще её запускать.

Для проверки схемы

  • Llama 3.2 3B;
  • Gemma 3 4B;
  • Qwen3 4B.

Эти модели подходят для проверки интерфейса, памяти, поиска по документам и подключения инструментов.

Для рабочего русскоязычного агента

  • Qwen3 8B;
  • Gemma 3 12B;
  • более крупные варианты Qwen при наличии видеопамяти.

Для сложного рассуждения и работы с инструментами

  • gpt-oss 20B;
  • Qwen3 30B;
  • крупные специализированные модели.

В Ollama доступна gpt-oss 20B размером около 14 ГБ, предназначенная в том числе для рассуждения и агентных задач. Gemma 3 предлагается в вариантах от 270 млн до 27 млрд параметров, а семейство Qwen3 включает как компактные, так и крупные модели.

При выборе проверяйте не только качество ответов, но и способность модели правильно вызывать инструменты. Небольшая модель может хорошо пересказывать текст, но ошибаться при составлении параметров API.

Пошаговая установка локального ИИ-агента

Для примера используем официальный набор Self-hosted AI Starter Kit от n8n. Он объединяет:

  • n8n;
  • Ollama;
  • Qdrant;
  • PostgreSQL.

Набор разворачивается через Docker Compose и предназначен для быстрого создания прототипов локальных ИИ-систем. Разработчики отдельно предупреждают, что шаблон не полностью подготовлен для промышленной эксплуатации без дополнительной настройки безопасности и отказоустойчивости.

Шаг 1. Подготовьте сервер

Рекомендуемая основа:

  • Ubuntu 24.04 LTS;
  • от 32 ГБ оперативной памяти;
  • NVMe-накопитель от 1 ТБ;
  • видеокарта NVIDIA от 16 ГБ;
  • установленный драйвер NVIDIA;
  • доступ по SSH;
  • Docker и Docker Compose.

Для модели среднего класса лучше использовать 64–128 ГБ ОЗУ и накопитель от 2 ТБ.

Шаг 2. Обновите систему

Сделайте это с помощью команд:

sudo apt update
sudo apt upgrade -y
sudo apt install -y git curl ca-certificates openssl

Шаг 3. Установите Docker

Для тестового окружения можно использовать установочный сценарий Docker:

curl -fsSL https://get.docker.com -o get-docker.sh
sudo sh get-docker.sh
sudo usermod -aG docker $USER

После добавления пользователя в группу необходимо выйти из сеанса и подключиться снова.

Разработчики Docker рекомендуют использовать быстрый установочный сценарий только для тестовых и демонстрационных сред. На рабочем сервере Docker следует устанавливать через официальный репозиторий пакетов, чтобы контролировать версии и обновления.

Проверьте установку:

docker --version
docker compose version

Шаг 4. Настройте работу Docker с видеокартой

Установите NVIDIA Container Toolkit и проверьте, что команда возвращает сведения о видеокарте:

nvidia-smi

Ollama использует NVIDIA Container Toolkit, чтобы получить доступ к GPU из контейнера. После настройки Docker Runtime можно запускать контейнер с параметром доступа к видеокарте.

Шаг 5. Скачайте набор компонентов

git clone https://github.com/n8n-io/self-hosted-ai-starter-kit.git
cd self-hosted-ai-starter-kit
cp .env.example .env

Шаг 6. Настройте пароли и ключи

Откройте файл:

nano .env

Замените стандартные значения:

  • POSTGRES_USER;
  • POSTGRES_PASSWORD;
  • POSTGRES_DB;
  • N8N_ENCRYPTION_KEY;
  • N8N_USER_MANAGEMENT_JWT_SECRET.

Случайный ключ можно создать командой:

openssl rand -hex 32

Для каждого параметра используйте отдельное значение. Файл .env нельзя публиковать в Git или пересылать вместе с проектом.

Ограничьте доступ:

chmod 600 .env

Шаг 7. Запустите компоненты

Для сервера с NVIDIA:

docker compose --profile gpu-nvidia up -d

Для тестового запуска только на процессоре:

docker compose --profile cpu up -d

Проверьте контейнеры:

docker compose ps

Набор запускает n8n, PostgreSQL, Qdrant и Ollama в общей внутренней сети Docker.

Шаг 8. Загрузите языковую модель

Например:

docker exec -it ollama ollama pull qwen3:8b

Или для более мощной видеокарты:

docker exec -it ollama ollama pull gpt-oss:20b

Проверьте модель:

docker exec -it ollama ollama run qwen3:8b

Шаг 9. Откройте n8n

В тестовой локальной сети интерфейс будет доступен по адресу:

http://IP-АДРЕС-СЕРВЕРА:5678

Создайте учётную запись владельца.

Не оставляйте порт 5678 открытым в интернете на рабочем сервере. Для внешнего доступа необходимо настроить домен, HTTPS и обратный прокси-сервер.

Как собрать первого агента в n8n

Соберём агента, который отвечает на вопросы и при необходимости использует подключённый инструмент.

Шаг 1. Создайте новый сценарий

В n8n нажмите «Create Workflow»

Шаг 2. Добавьте точку входа

Для проверки используйте блок Chat Trigger. Позже его можно заменить на:

  • Telegram Trigger;
  • Webhook;
  • форму сайта;
  • почтовый триггер;
  • событие из CRM.

Шаг 3. Добавьте блок AI Agent

Этот блок будет получать запрос и решать, какой инструмент использовать.

Шаг 4. Подключите Ollama Chat Model

Создайте подключение к Ollama.

Если n8n и Ollama работают в одном наборе контейнеров, используйте внутренний адрес:

http://ollama:11434

Выберите загруженную модель, например qwen3:8b.

API Ollama по умолчанию работает на порту 11434. При локальном обращении отдельная авторизация не требуется, поэтому этот порт нельзя публиковать в интернете без дополнительной защиты.

Шаг 5. Напишите системную инструкцию

Пример:

Ты — внутренний ИИ-агент службы поддержки.
Отвечай только на основе найденных документов.
Если данных недостаточно, прямо сообщи об этом.
Не придумывай названия, даты, цены и условия.
Перед созданием заявки кратко покажи пользователю,
какие сведения будут в неё переданы.
Не выполняй действия, не относящиеся к поддержке.

Хорошая системная инструкция определяет:

  • роль агента;
  • разрешённые задачи;
  • запрещённые действия;
  • формат ответа;
  • порядок работы с инструментами;
  • условия передачи задачи человеку.

Шаг 6. Добавьте память

Для демонстрации подойдёт простая память текущего диалога.

Для рабочего сервиса используйте PostgreSQL, чтобы история не пропадала после перезапуска и не зависела от одного процесса n8n.

Шаг 7. Подключите инструмент

В качестве первого инструмента можно использовать:

  • HTTP Request для обращения к API;
  • Telegram для отправки сообщения;
  • PostgreSQL для чтения данных;
  • CRM;
  • систему управления задачами.

Начните с инструмента только для чтения. Например, разрешите агенту получать статус заказа, но пока не разрешайте менять его.

Шаг 8. Протестируйте ошибки

Проверьте:

  • что произойдёт при неполном запросе;
  • выберет ли агент правильный инструмент;
  • сможет ли он отказаться от запрещённого действия;
  • что произойдёт при недоступном API;
  • не повторит ли действие после ошибки;
  • запросит ли подтверждение перед изменением данных.

Нужна помощь с выбором сервера?

Специалисты помогут подобрать оборудование под нагрузку, бюджет и задачи

Написать

Как подключить базу знаний

Чтобы агент отвечал по внутренним документам, потребуется отдельный процесс загрузки данных.

Схема загрузки

Документ → извлечение текста → разделение на фрагменты → создание числовых представлений → запись в Qdrant

Схема поиска

Вопрос → поиск похожих фрагментов → передача найденного текста модели → ответ со ссылкой на источник

В n8n нужно создать два сценария.

Сценарий загрузки

  1. Получает PDF, DOCX, TXT или данные из хранилища.
  2. Извлекает текст.
  3. Разделяет его на небольшие смысловые фрагменты.
  4. Создаёт числовые представления текста.
  5. Записывает фрагменты в Qdrant вместе с названием файла и разделом.

Сценарий ответа

  1. Получает вопрос.
  2. Ищет связанные фрагменты в Qdrant.
  3. Передаёт их агенту.
  4. Формирует ответ.
  5. Указывает использованные документы.

Не загружайте все документы в один массив без метаданных. Сохраняйте:

  • название файла;
  • тип документа;
  • дату;
  • номер раздела;
  • версию;
  • уровень доступа.

Иначе агент не сможет показать источник и отличить действующий регламент от устаревшего.

Как развернуть ИИ-агента на VPS Selectel

В облачном варианте есть два основных пути.

VPS/VDS

Вариант 1. VPS управляет агентом, модель вызывается через API

Это самый простой и экономичный запуск.

На VPS/VDS Selectel работают:

  • n8n;
  • PostgreSQL;
  • Qdrant;
  • интерфейс агента;
  • интеграции с внешними системами.

Языковая модель работает во внешнем сервисе, через ИИ-роутер Selectel или на отдельном сервере с GPU.

Шаг 1. Создайте VPS

Для небольшого рабочего проекта можно начать с конфигурации:

  • 4 виртуальных ядра;
  • 8 ГБ оперативной памяти;
  • накопитель от 80 ГБ;
  • Ubuntu.

Выбрать готовую конфигурацию можно на странице VPS/VDS Selectel.

Шаг 2. Добавьте SSH-ключ

Подключайтесь к серверу по SSH-ключу, а не по паролю. Selectel рекомендует отключать вход по паролю и запрещать подключение пользователя root.

Шаг 3. Настройте сетевой доступ

Откройте:

  • SSH только для доверенных IP-адресов;
  • порт 80 для выпуска сертификата;
  • порт 443 для HTTPS.

Не открывайте публично:

  • PostgreSQL — 5432;
  • Qdrant — 6333;
  • Ollama — 11434;
  • n8n — 5678 после настройки обратного прокси.

Шаг 4. Выберите способ установки n8n

Есть два варианта.

Первый — создать обычный VPS и установить n8n самостоятельно через Docker.

Второй — использовать готовый образ n8n Virtual Machine в ИИ-маркетплейсе Selectel. В таком случае основные компоненты уже подготовлены, поэтому можно быстрее перейти к настройке сценариев агента.

Для самостоятельного развёртывания контейнеров также можно использовать раздел готовых серверных приложений Selectel.

Для простого теста:

docker run -d \
  --name n8n \
  --restart unless-stopped \
  -p 127.0.0.1:5678:5678 \
  -v n8n_data:/home/node/.n8n \
  docker.n8n.io/n8nio/n8n

Привязка к адресу 127.0.0.1 означает, что интерфейс не будет напрямую доступен из интернета.

Шаг 6. Подключите языковую модель

Вместо локального Ollama добавьте в n8n подключение к облачной модели.

Для работы через ИИ-роутер Selectel потребуются:

  • ключ программного интерфейса;
  • адрес точки подключения;
  • название выбранной модели;
  • ограничения на расходы и количество запросов.

Если готового блока для нужного сервиса в n8n нет, используйте блок HTTP Request и совместимый программный интерфейс.

Шаг 7. Настройте домен и HTTPS

Привяжите домен к публичному IP-адресу VPS и установите обратный прокси-сервер:

  • Nginx;
  • Traefik;
  • Caddy.

Он будет принимать защищённое соединение на порту 443 и передавать запросы в контейнер n8n.

Selectel приводит пример настройки n8n с Traefik и автоматическим выпуском сертификата Let’s Encrypt.

Вариант 2. Вся система работает на облачном сервере с GPU

Если документы не должны передаваться внешнему поставщику модели, можно арендовать облачный сервер Selectel с GPU. В облаке доступны виртуальные машины с NVIDIA T4, A2, A30, A100, A2000, A5000, RTX 4090, RTX 6000 Ada и другими ускорителями. Видеокарта передаётся виртуальной машине как выделенное устройство. Доступность конкретной модели зависит от пула.

На одном сервере будут работать:

  • n8n;
  • Ollama или другой сервер языковой модели;
  • Qdrant;
  • PostgreSQL;
  • локальная модель;
  • интерфейс агента.

Дальнейшая установка практически совпадает с локальным вариантом:

  1. установите драйвер NVIDIA;
  2. настройте доступ контейнеров к видеокарте;
  3. установите Docker;
  4. разверните n8n, Ollama, Qdrant и PostgreSQL;
  5. загрузите языковую модель;
  6. настройте HTTPS;
  7. закройте внутренние порты;
  8. настройте резервное копирование.

Аренда облачного GPU выгодна, пока нагрузка непостоянная. Если агент и модель работают круглосуточно, аренда за год-полтора обычно превышает стоимость покупки эквивалентной карты — с этого момента собственный сервер дешевле. Точка окупаемости зависит от класса GPU и тарифа, поэтому её стоит посчитать на своих числах до аренды на длительный срок.

Гибридная схема: VPS в облаке, модель в офисе

В гибридной схеме публичная часть агента работает на VPS/VDS Selectel, а модель и конфиденциальные документы остаются на оборудовании DigitalRazor.

На VPS Selectel работают:

  • публичный интерфейс;
  • Telegram-бот;
  • n8n;
  • очередь заданий;
  • приём внешних событий.

На локальном GPU-сервере DigitalRazor работают:

  • Ollama или другой сервер моделей;
  • Qdrant с конфиденциальными документами;
  • внутренние базы данных;
  • локальная языковая модель.

Для небольшого закрытого контура подойдёт Performance Pro 350R. Для нескольких моделей и пользователей — Performance Pro 750R или Rackstation AI.

[ PERFORMANCE PRO RACK ]
350R RACK
U9-285K · RTX 5090 32ГБ · 128GB DDR5 RGB · 2 ТБ
1 198 000 ₽
89 850 ₽ / мес Примерный ежемесячный платёж. Итоговая сумма рассчитывается индивидуально.
Подробнее
750R RACK
7975WX · RTX 5090 32ГБ · 256GB DDR5 ECC · 2 ТБ NVMe 5.0
3 403 000 ₽
255 225 ₽ / мес Примерный ежемесячный платёж. Итоговая сумма рассчитывается индивидуально.
Подробнее
900R RACK
2 x EPYC 9575F · RTX PRO 5000 48GB · 512GB DDR5 ECC · 2 ТБ
6 556 000 ₽
491 700 ₽ / мес Примерный ежемесячный платёж. Итоговая сумма рассчитывается индивидуально.
Подробнее

Облачный и локальный серверы соединяются через защищённый туннель. Порты Ollama, Qdrant и базы данных не должны быть доступны из открытого интернета.

Что нужно защитить перед запуском

Не давайте агенту права администратора

Не подключайте к нему оболочку с правами root. Для каждого инструмента создавайте отдельную учётную запись с минимально необходимыми разрешениями.

Разделяйте чтение и изменение

Инструмент получения списка заказов и инструмент отмены заказа должны быть разными. Второй должен требовать подтверждения.

Не публикуйте внутренние API

Ollama, Qdrant и PostgreSQL должны работать во внутренней сети Docker, локальной сети или закрытой подсети.

Используйте HTTPS

Токены, документы и сообщения нельзя передавать через открытый HTTP.

Ограничивайте расходы

Для облачных моделей задайте:

  • лимит запросов;
  • лимит токенов;
  • дневной бюджет;
  • ограничение длины диалога;
  • максимальное число повторных попыток.

Защищайте агента от инструкций в документах

Загруженный документ может содержать текст, который пытается заставить агента игнорировать правила или передать секретные данные.

Содержимое документов необходимо считать недоверенным источником. Оно может использоваться для ответа, но не должно изменять системную инструкцию или разрешения агента.

Добавьте подтверждение человеком

Обязательно подтверждайте:

  • отправку писем;
  • платежи;
  • удаление данных;
  • изменение договоров;
  • публикацию материалов;
  • выполнение команд;
  • изменение прав доступа.

Настройте резервные копии

Сохраняйте:

  • базу PostgreSQL;
  • данные Qdrant;
  • конфигурации n8n;
  • файл переменных окружения в защищённом хранилище;
  • загруженные документы;
  • собственные сценарии.

Selectel позволяет создавать ручные резервные копии дисков и настраивать их по расписанию.

Проверяйте конфигурацию

n8n имеет встроенный аудит безопасности, который показывает незащищённые вебхуки, устаревшие настройки, опасные блоки, доступ к файловой системе и другие риски.

FAQ

1. Можно ли запустить ИИ-агента на обычном VPS?
Да. На VPS можно разместить n8n, базу данных и интеграции, а языковую модель вызывать через API. Для локального запуска крупной модели потребуется облачный или физический сервер с GPU.
2. Нужна ли ИИ-агенту видеокарта?
Не всегда. GPU нужен для локальной языковой модели. Если агент обращается к внешней модели через API, его логика может работать на обычном VPS без видеокарты.
3. Сколько оперативной памяти нужно для n8n?
Для теста достаточно 4 ГБ. Для n8n, PostgreSQL, Qdrant и нескольких сценариев лучше начинать с 8 ГБ. Обработка большого количества документов может потребовать 12–16 ГБ.
4. Можно ли установить Ollama на VPS без GPU?
Можно, но модель будет работать на процессоре и отвечать медленно. Такой вариант подходит для проверки схемы, но не для постоянного обслуживания пользователей.
5. Что лучше для агента: n8n или Python?
n8n удобнее для быстрого запуска и готовых интеграций. Python даёт больше контроля над сложной логикой. Часто n8n управляет процессом, а отдельные компоненты пишутся на Python.
6. Какую модель выбрать для первого агента?
Для проверки подойдут Qwen3 4B или 8B, Gemma 3 4B и Llama 3.2 3B. После настройки схемы можно тестировать более крупную модель на своих запросах.
7. Можно ли подключить ИИ-агента к Telegram?
Да. В n8n есть блоки для получения и отправки сообщений Telegram. Агент может принимать вопросы, искать информацию, запускать инструменты и возвращать результат в чат.
8. Что такое RAG в ИИ-агенте?
Это поиск по подключённой базе документов перед формированием ответа. Агент находит подходящие фрагменты и передаёт их модели, поэтому ей не нужно запоминать документы во время обучения.
9. Безопасно ли размещать ИИ-агента на VPS?
Да, при правильной настройке. Нужны SSH-ключи, HTTPS, закрытые внутренние порты, ограниченные права, резервные копии и подтверждение человеком перед важными действиями.
10. Может ли один сервер обслуживать нескольких агентов?
Да. Несколько агентов могут использовать одну платформу n8n и одну модель. Требования к серверу зависят от числа одновременных запросов, размера моделей и подключённых баз данных.
11. Работает ли ИИ-агент без интернета?
Полностью локальный агент с Ollama, локальными документами и внутренними инструментами может работать без интернета. Внешние сайты, облачные API и мессенджеры в таком режиме будут недоступны.
12. Сколько стоит сервер для ИИ-агента?
VPS для агента с внешней моделью может стоить от нескольких сотен рублей в месяц. Локальный запуск модели требует GPU, а стоимость зависит от её размера и числа пользователей.

Заключение

Для запуска первого ИИ-агента не нужен дорогой серверный кластер. Достаточно определить одну полезную задачу, развернуть n8n на VPS/VDS Selectel, подключить языковую модель через ИИ-роутер и выдать агенту один безопасный инструмент.

Когда схема заработает, можно добавить базу знаний, долговременную память, новые интеграции и локальную модель.

Если вычисления нужны только периодически, подойдёт облачный сервер Selectel с GPU. Но стоит помнить, что при работе 24/7 аренда GPU за 12–18 месяцев превышает стоимость покупки той же карты.

Если данные должны оставаться внутри компании, модель и базу документов можно развернуть на рабочей станции или GPU-сервере DigitalRazor.

Для одного агента и одной модели можно рассмотреть Performance Pro 350R. Для крупных моделей и двух видеокарт — Performance Pro 750R. Для общего доступа команды и круглосуточной нагрузки — Rackstation AI или Devbox AI.

Главное — выбирать инфраструктуру под конкретный процесс: какой запрос получает агент, какие данные использует, какое действие выполняет и кто проверяет результат.

Для каких задач Компактный GPU-сервер до 2 видеокарт для начальных задач в AI и графике. Оптимален для инференса, визуализации, VFX и рендеринга в студиях и лабораториях, где важна гибкость.
Подробнее
Видеокарты
RTX / RTX PRO / H200 NVL
Объем видеопамяти до 282 ГБ
Процессоры
Threadripper PRO
Количество ядер до 96
RAM до 1024 ГБ DDR5
Форм-фактор 4.5U
Для каких задач Универсальная платформа на 4–6 GPU для локального обучения моделей и генеративных задач. Подходит для команд, которым важна надёжность сервера и свобода выбора графики — от RTX 5090 до PRO RTX 6000.
Подробнее
Видеокарты
RTX / RTX PRO / H200 NVL
Объем видеопамяти до 576 ГБ
Процессоры
Threadripper PRO
Количество ядер до 96
RAM до 1024 ГБ DDR5
Форм-фактор 6.5U
Для каких задач Сервер промышленного уровня на 8 GPU с кластерной архитектурой. Предназначен для дата-центров и AI-ферм, где требуется масштабируемость и полная загрузка ресурсов под обучение LLM и R&D.
Подробнее
Видеокарты
RTX PRO 6000 / RTX 5090
Объем видеопамяти до 768 ГБ
Процессоры
AMD Epyc, Intel Xeon
Количество ядер до 320
RAM до 3072 ГБ DDR5
Форм-фактор 6U
Для каких задач Серия серверов для кластеризации на 4 GPU. Предназначены для дата-центров и AI-ферм, где требуется повышенная плотность для обучение LLM и R&D.
Подробнее
Видеокарты
L40s / RTX PRO / H200 NVL
Объем видеопамяти до 564 ГБ
Процессоры
AMD EPYC, Intel Xeon
Количество ядер до 128
RAM до 1536 ГБ DDR5
Форм-фактор 2U
Для каких задач Серия серверов для кластеризации на 8 GPU. Предназначены для дата-центров и AI-ферм, где требуется повышенная плотность для обучение LLM и R&D.
Подробнее
Видеокарты
L40s / RTX PRO / H200 NVL
Объем видеопамяти до 1128 ГБ
Процессоры
AMD EPYC, Intel Xeon
Количество ядер до 256
RAM до 2048 ГБ DDR5
Форм-фактор 4U
Для каких задач HGX объединяет 8 видеокарт NVIDIA H200, достигая экстремальной плотности производительности. Благодаря внутренней связности NVSwitch мгновенно интегрируется в масштабные вычислительные кластеры.
Подробнее
Видеокарты
NVIDIA H200 SXM
Объем видеопамяти до 1128 ГБ
Процессоры
AMD EPYC, Intel Xeon
Количество ядер до 256
RAM до 2048 ГБ DDR5
Форм-фактор 5U
Подберём сервер под вашу задачу

Подберём конфигурацию сервера и отправим предложение.

Смотреть серверы
или свяжитесь с нами
Telegram Telegram WhatsApp WhatsApp ВКонтакте ВКонтакте MAX MAX
1.9К

Так же будет интересно почитать

Сайт использует cookies
Узнать подробнее