8 800 500-99-26 Для звонков по России
Как развернуть ИИ-агента на своём сервере или VPS: пошаговый гайд
База знаний
19 мин

Как развернуть ИИ-агента на своём сервере или VPS: пошаговый гайд

DigitalRazor
DigitalRazor
Подписаться в Telegram
Содержание 16 разделов
Коротко Что выбрать: локальный сервер или VPS Что такое ИИ-агент Что умеют делать ИИ-агенты Как устроена схема работы ИИ-агента Где развернуть ИИ-агента Что потребуется для запуска Какой сервер нужен для ИИ-агента Какую модель выбрать Пошаговая установка локального ИИ-агента Как собрать первого агента в n8n Как подключить базу знаний Как развернуть ИИ-агента на VPS Selectel Гибридная схема: VPS в облаке, модель в офисе FAQ Заключение
Подберём сервер под вашу задачу

Подберём конфигурацию сервера и отправим предложение.

Смотреть серверы
или свяжитесь с нами
Telegram Telegram WhatsApp WhatsApp ВКонтакте ВКонтакте MAX MAX

Подберём сервер под задачи

Ответьте на несколько вопросов — подготовим предложение

В этой статье разберём, из каких компонентов состоит ИИ-агент, какая инфраструктура ему нужна и как запустить его двумя способами: полностью локально на оборудовании DigitalRazor или круглосуточно на VPS/VDS-сервере провайдера Selectel. Пошаговая инструкция будет полезна тем, кто хочет создать агента для работы с документами, CRM, почтой, сайтом или Telegram-ботом, но пока не понимает, где должна работать нейросеть, зачем нужны n8n, Ollama и векторная база и требуется ли для проекта отдельная видеокарта.

Если вы раньше не работали с виртуальными серверами, сначала рекомендуем прочитать наши материалы о том, как запустить VPS/VDS-сервер и как выбрать подходящую конфигурацию VPS/VDS.

В качестве примера соберём агента на основе n8n. Платформа будет принимать запросы, обращаться к языковой модели, искать данные в документах и запускать разрешённые действия. Локальные модели запустим через Ollama, а документы поместим в векторную базу Qdrant.

Коротко

  • Обычный VPS подходит для логики агента, базы данных, интерфейса и интеграций;
  • Для небольшого агента, который обращается к модели через API, видеокарта на VPS не нужна;
  • Для полностью локального запуска нейросети требуется рабочая станция или сервер с GPU;
  • n8n управляет последовательностью действий агента;
  • Telegram-бот может служить интерфейсом для пользователей;
  • Ollama запускает локальную языковую модель;
  • Qdrant хранит представления документов для интеллектуального поиска;
  • PostgreSQL хранит настройки, историю и служебные данные;
  • Опасные действия агента нужно выполнять только после подтверждения человеком.

Что выбрать: локальный сервер или VPS

Вот понятная инструкция, которая поможет определиться, какой сервер вам нужен.

Серверная стойка

Выбирайте VPS Selectel, если:

  • нужно быстро проверить идею;
  • модель доступна через API;
  • агент должен работать круглосуточно;
  • нет системного администратора для локального оборудования;
  • нагрузка пока неизвестна;
  • важна возможность быстро увеличить ресурсы.

Выбирайте локальный сервер DigitalRazor, если:

  • агент обрабатывает конфиденциальные документы;
  • внешние API использовать нельзя;
  • модель работает постоянно;
  • запросов становится много;
  • требуется предсказуемая скорость;
  • нужно хранить весь контур внутри компании.

Выбирайте облачный сервер с GPU, если:

  • нужна локальная модель без покупки оборудования;
  • проект временный;
  • вычислительная нагрузка возникает периодически;
  • нужно быстро протестировать несколько GPU;
  • инфраструктура должна находиться в дата-центре.

Выбирайте гибридную схему, если:

  • агент должен быть доступен из интернета;
  • документы и модель должны оставаться внутри компании;
  • в офисе уже есть оборудование с GPU;
  • нужно разделить публичный и закрытый контуры.

А теперь обо всём поговорим более подробно.

Что такое ИИ-агент

ИИ-агент — это программа, которая использует языковую модель для выбора и выполнения действий.

Устройство ИИ агента

Обычный ИИ-ассистент в основном отвечает на вопросы. Агент может не только подготовить текст, но и обратиться к базе данных, проверить остатки товара на складе, создать задачу в CRM, отправить письмо или запустить другой сценарий.

Например, пользователь пишет: «Проверь новые обращения клиентов, выдели срочные и создай задачи для отдела продаж».

В этом случае агент может:

  1. Получить новые обращения из почты или CRM.
  2. Проанализировать их содержание.
  3. Определить тему и срочность.
  4. Найти информацию о клиенте.
  5. Подготовить краткое резюме.
  6. Создать задачи.
  7. Отправить сотруднику отчёт.

Главное отличие агента от обычного сценария автоматизации состоит в том, что часть решений принимает языковая модель. Заранее заданная автоматизация следует жёсткому маршруту, а агент может выбирать подходящий инструмент в зависимости от запроса.

Это не означает, что ему нужно давать полную свободу. Надёжный агент работает внутри заданных ограничений: получает доступ только к нужным системам, использует разрешённые инструменты и запрашивает подтверждение перед важными действиями.

Что умеют делать ИИ-агенты

Агент — это одна и та же конструкция: модель, которая выбирает и вызывает инструменты. За исключением мультиагентной системы, о которой поговорим чуть ниже.

Специализация агента — это не отдельный вид техники, а набор подключённых инструментов и системная инструкция. Один и тот же агент становится помощником по базе знаний, если дать ему поиск по документам, или диспетчером заявок, если дать ему доступ к CRM. Ниже — типовые задачи, которые агенты способны закрывать.

Агент для работы с базой знаний

Ищет информацию в инструкциях, договорах, регламентах, каталогах и технической документации.

Такой агент подходит для внутренней поддержки сотрудников, консультации клиентов и поиска по большому архиву документов.

Агент для автоматизации процессов

Работает с CRM, почтой, календарём, системой управления задачами и другими приложениями.

Он может квалифицировать заявки, готовить ответы, создавать карточки клиентов и обновлять статусы сделок.

Агент для наблюдения и аналитики

Запускается по расписанию, проверяет источники и сообщает об изменениях.

Например, он может анализировать показатели продаж, журналы инфраструктуры, цены конкурентов или новые публикации по заданной теме.

Агент для разработчиков и системных администраторов

Читает программный код и журналы ошибок, формирует команды, подготавливает исправления и помогает искать причины сбоев.

Такому агенту особенно опасно выдавать неограниченный доступ к командной строке. Команды, меняющие файлы или инфраструктуру, должен проверять человек.

Мультиагентная система

Отдельный случай — не заточка одного агента, а связка из нескольких специализированных агентов. Один планирует задачу, второй ищет документы, третий проверяет факты, четвёртый готовит результат. Это уже про архитектуру, а не про область применения.

Мультиагентная система полезна в сложных процессах, но требует больше запросов к модели, памяти и вычислительных ресурсов. Начинать проект лучше с одного агента и добавлять роли только после появления измеримой необходимости.

Как устроена схема работы ИИ-агента

Базовый конвейер обработки выглядит так:
Запрос → управляющая платформа → языковая модель → память и база знаний → инструменты → проверка → действие → журнал работы

Разберём каждый компонент.

1. Точка входа

Агент получает задачу из чата, Telegram, формы на сайте, электронной почты, CRM или через программный интерфейс.

2. Управляющая платформа

Она передаёт данные между компонентами и контролирует порядок действий.

n8n

Пример псевдокода ИИ-агента на n8n

В нашем примере эту роль выполняет платформа для автоматизации рабочих процессов n8n. Она позволяет собирать сценарии из визуальных блоков и подключать внешние приложения через готовые интеграции или API. n8n поддерживает самостоятельное размещение на собственной инфраструктуре и объединяет автоматизацию процессов с инструментами ИИ.

Для проектов, где агенту нужно сохранять контекст и накопленный опыт между сессиями, n8n можно дополнить Hermes Agent от Nous Research — открытым self-hosted агентом с персистентной памятью, который можно использовать в пайплайне как оркестратор. n8n остаётся визуальным конструктором предсказуемых сценариев, а Hermes работает как автономный агент с памятью, собственными скиллами и задачами по расписанию. Поэтому эти инструменты не заменяют друг друга и могут использоваться вместе.

Важно!

Не путайте Hermes Agent с языковыми моделями Hermes той же команды. Это разные продукты.

3. Языковая модель

Модель анализирует запрос, выбирает дальнейшие действия и формирует ответ.

Она может работать:

ИИ-роутер Selectel предоставляет единый программный интерфейс для обращения к генеративным моделям. Такой вариант подходит, если вы хотите развернуть управляющую часть агента на VPS, но не планируете самостоятельно устанавливать и обслуживать языковую модель.

4. Память

Кратковременная память хранит текущую переписку. Долговременная — сведения о пользователях, предыдущих действиях и результатах.

Для рабочих проектов данные лучше хранить в PostgreSQL, а не только внутри памяти отдельного сценария.

5. База знаний

Документы преобразуются в числовые представления и сохраняются в векторной базе. Когда пользователь задаёт вопрос, система находит подходящие фрагменты и передаёт их модели.

Такой подход называется генерацией с дополнением из внешних источников — RAG.

RAG - Retrieval Augmented Generation

6. Инструменты

Инструментами могут быть:

  • запрос к CRM;
  • чтение почты;
  • поиск по сайту;
  • получение данных из базы;
  • создание задачи;
  • отправка сообщения;
  • вызов собственного API.

7. Проверка

Перед отправкой письма, удалением данных, изменением сделки или выполнением команды агент должен запросить подтверждение человека.

В n8n можно добавлять проверку человеком перед вызовом инструментов, способных изменить данные или выполнить необратимое действие.

8. Журнал работы

Необходимо сохранять запрос, выбранные инструменты, полученные ответы, ошибки и итоговое действие. Без журналов невозможно понять, почему агент принял неправильное решение.

Чем n8n + Ollama отличаются от Claude Code и OpenClaw

Это не взаимозаменяемые продукты, а инструменты для разных сценариев.

  • n8n + Ollama — связка для управляемых бизнес-процессов. n8n задаёт маршрут, подключает CRM, почту, Telegram и другие системы, а Ollama запускает локальную модель.
  • Claude Code — агентный инструмент для разработки. Он читает репозиторий, изменяет файлы, запускает команды и подключается к внешним системам через MCP. Его выбирают для задач, связанных с кодом и инфраструктурой.
  • OpenClaw — самостоятельно размещаемый шлюз между ИИ-агентом и Telegram, WhatsApp, Slack и другими каналами. Он поддерживает сессии, память, инструменты и несколько агентов.

Где развернуть ИИ-агента

Вариант Где работает модель Преимущества Ограничения
VPS/VDS Selectel + внешний API у поставщика модели Быстрый запуск, не нужен GPU Данные передаются внешнему сервису
Облачный сервер Selectel с GPU в облаке Selectel Оплата по мере использования, быстрое масштабирование Регулярные расходы; точка окупаемости зависит от тарифа и загрузки
Локальная рабочая станция DigitalRazor внутри компании Полный контроль над данными, на большой дистанции дешевле Покупка и обслуживание оборудования
Локальный GPU-сервер DigitalRazor внутри компании или собственного ЦОД Круглосуточная работа, несколько GPU Требуется подготовленная инфраструктура
Гибридная схема модель локально, n8n в облаке Приватная модель и публичный интерфейс Нужно защищённое соединение

Для первого прототипа чаще всего достаточно VPS с 4–8 ГБ оперативной памяти и обращения к модели через API или ИИ-роутер Selectel.

Локальное размещение оправдано, когда агент работает с конфиденциальными документами, запросов много или постоянная аренда вычислительных ресурсов становится дороже собственного оборудования.

Что потребуется для запуска

До установки программ нужно определить:

  1. Какую задачу выполняет агент.
  2. Откуда он получает запросы.
  3. К каким системам обращается.
  4. Какие действия может выполнять.
  5. Где будет работать языковая модель.
  6. Какие документы входят в базу знаний.
  7. Какие действия требуют подтверждения.
  8. Как будет оцениваться качество.

Плохая постановка задачи: сделать умного агента для компании.

Хорошая постановка: Telegram-бот получает вопрос сотрудника, ищет ответ в регламентах компании, указывает источник и создаёт заявку в техническую поддержку, когда ответа нет.

Во втором случае можно проверить точность поиска, долю решённых вопросов, время ответа и число правильно созданных заявок.

Какой сервер нужен для ИИ-агента

Необходимо отдельно считать ресурсы управляющей платформы и языковой модели.

DigitalRazor HGX H200

n8n, PostgreSQL и Qdrant могут работать на обычном процессоре. Основную нагрузку создаёт локальная языковая модель.

Обычный VPS без GPU

Обычный VPS/VDS Selectel подходит, если языковая модель вызывается через внешний API, ИИ-роутер или отдельный вычислительный узел с GPU.

У Selectel доступны фиксированные конфигурации VPS/VDS с KVM-виртуализацией и NVMe-накопителями. Для агента с внешней моделью можно рассматривать VDS 2-4-50, VDS 4-8-80 и VDS 6-12-120. Актуальную стоимость проверяйте на странице сервиса перед запуском.

Задача vCPU ОЗУ Стартовая конфигурация
Один тестовый агент и внешний API 2 4 ГБ VDS 2-4-50
n8n, PostgreSQL и Qdrant 4 8 ГБ VDS 4-8-80
Несколько агентов и обработка документов 6 12 ГБ VDS 6-12-120
Высокая нагрузка от 8 от 16 ГБ Произвольный облачный сервер

Запускать крупную модель через Ollama на обычном VPS без видеокарты технически возможно, но ответы будут формироваться медленно. VPS лучше использовать как управляющий узел, а вычисления передавать через API или на отдельный GPU-узел.

Локальная рабочая станция или сервер с GPU

Для полностью локального агента можно использовать рабочую станцию или GPU-систему DigitalRazor. В этом случае языковая модель, база знаний и управляющая платформа работают внутри инфраструктуры компании.

Практический пример полностью локальной схемы — Hermes Agent, развёрнутый на собственной рабочей станции или вычислительной системе. Он может обращаться к языковой модели через Ollama, хранить память и скиллы внутри инфраструктуры компании, а при необходимости работать в гибридном режиме с облачными моделями.

Сценарий Класс модели Ресурсы GPU Решение DigitalRazor
Первый локальный агент 4–12B От 16 ГБ Performance Pro 350R
Агент с инструментами и большой базой знаний 14–30B 32 ГБ Performance Pro 350R с RTX 5090
Крупная модель или несколько агентов 30–120B 96–192 ГБ Performance Pro 750R
Общий сервер для команды Несколько моделей 2 GPU Rackstation AI
Высокая параллельная нагрузка Несколько экземпляров моделей 4–6 GPU Devbox AI

Performance Pro 350R поддерживает одну видеокарту от RTX 5060 Ti до RTX PRO 6000 с 96 ГБ памяти. Performance Pro 750R позволяет установить две RTX PRO 6000 и получить до 192 ГБ суммарной видеопамяти. Использовать её как единый пул можно только в том случае, если выбранная модель и программный стек поддерживают распределение по нескольким GPU.

[ PERFORMANCE PRO TOWER ]
350D Tower
i9-14900K · RTX 5090 32ГБ · 64GB DDR5 RGB · 1 ТБ
1 017 500 ₽
76 313 ₽ / мес Примерный ежемесячный платёж. Итоговая сумма рассчитывается индивидуально.
Подробнее
750D Tower
7965WX · RTX 5090 32ГБ · 256GB DDR5 ECC · 1 ТБ NVME 5.0
3 155 500 ₽
236 663 ₽ / мес Примерный ежемесячный платёж. Итоговая сумма рассчитывается индивидуально.
Подробнее
900D Tower
2 x EPYC 9534 · RTX PRO 5000 48GB · 512GB DDR5 ECC · 2 ТБ
6 757 500 ₽
506 813 ₽ / мес Примерный ежемесячный платёж. Итоговая сумма рассчитывается индивидуально.
Подробнее

Rackstation AI рассчитан на одну или две видеокарты, а Devbox AI поддерживает до четырёх RTX 5090 либо до шести RTX PRO 6000. Такие системы подходят для круглосуточной работы нескольких агентов и общего доступа команды.

Для большинства корпоративных агентов H200 не требуется. Она становится оправданной при массовом обслуживании пользователей, очень крупных моделях или высокой нагрузке на один экземпляр модели.

Оборудование DigitalRazor также может поставляться с платформой OneStack. Она упрощает запуск моделей и управление контейнерами через графический интерфейс, поэтому часть пользователей сможет обойтись без ручной настройки каждого компонента через командную строку.

OneStack

Выберите GPU-сервер для нейросетей

Готовые решения для работы с большими массивами данных

Переход в каталог

Какую модель выбрать

Для первого проекта не нужно начинать с самой крупной модели. Чем меньше модель, тем быстрее она отвечает и тем проще её запускать.

Для проверки схемы

  • Llama 3.2 3B;
  • Gemma 3 4B;
  • Qwen3 4B.

Эти модели подходят для проверки интерфейса, памяти, поиска по документам и подключения инструментов.

Для рабочего русскоязычного агента

  • Qwen3 8B;
  • Gemma 3 12B;
  • более крупные варианты Qwen при наличии видеопамяти.

Для сложного рассуждения и работы с инструментами

  • gpt-oss 20B;
  • Qwen3 30B;
  • крупные специализированные модели.

В Ollama доступна gpt-oss 20B размером около 14 ГБ, предназначенная в том числе для рассуждения и агентных задач. Gemma 3 предлагается в вариантах от 270 млн до 27 млрд параметров, а семейство Qwen3 включает как компактные, так и крупные модели.

При выборе проверяйте не только качество ответов, но и способность модели правильно вызывать инструменты. Небольшая модель может хорошо пересказывать текст, но ошибаться при составлении параметров API.

Пошаговая установка локального ИИ-агента

Для примера используем официальный набор Self-hosted AI Starter Kit от n8n. Он объединяет:

  • n8n;
  • Ollama;
  • Qdrant;
  • PostgreSQL.

Набор разворачивается через Docker Compose и предназначен для быстрого создания прототипов локальных ИИ-систем. Разработчики отдельно предупреждают, что шаблон не полностью подготовлен для промышленной эксплуатации без дополнительной настройки безопасности и отказоустойчивости.

Шаг 1. Подготовьте сервер

Рекомендуемая основа:

  • Ubuntu 24.04 LTS;
  • от 32 ГБ оперативной памяти;
  • NVMe-накопитель от 1 ТБ;
  • видеокарта NVIDIA от 16 ГБ;
  • установленный драйвер NVIDIA;
  • доступ по SSH;
  • Docker и Docker Compose.

Для модели среднего класса лучше использовать 64–128 ГБ ОЗУ и накопитель от 2 ТБ.

Шаг 2. Обновите систему

Сделайте это с помощью команд:

sudo apt update
sudo apt upgrade -y
sudo apt install -y git curl ca-certificates openssl

Шаг 3. Установите Docker

Для тестового окружения можно использовать установочный сценарий Docker:

curl -fsSL https://get.docker.com -o get-docker.sh
sudo sh get-docker.sh
sudo usermod -aG docker $USER

После добавления пользователя в группу необходимо выйти из сеанса и подключиться снова.

Разработчики Docker рекомендуют использовать быстрый установочный сценарий только для тестовых и демонстрационных сред. В рабочей среде Docker следует устанавливать через официальный репозиторий пакетов, чтобы контролировать версии и обновления.

Проверьте установку:

docker --version
docker compose version

Шаг 4. Настройте работу Docker с видеокартой

Установите NVIDIA Container Toolkit и проверьте, что команда возвращает сведения о видеокарте:

nvidia-smi

Ollama использует NVIDIA Container Toolkit, чтобы получить доступ к GPU из контейнера. После настройки Docker Runtime можно запускать контейнер с параметром доступа к видеокарте.

Шаг 5. Скачайте набор компонентов

git clone https://github.com/n8n-io/self-hosted-ai-starter-kit.git
cd self-hosted-ai-starter-kit
cp .env.example .env

Шаг 6. Настройте пароли и ключи

Откройте файл:

nano .env

Замените стандартные значения:

  • POSTGRES_USER;
  • POSTGRES_PASSWORD;
  • POSTGRES_DB;
  • N8N_ENCRYPTION_KEY;
  • N8N_USER_MANAGEMENT_JWT_SECRET.

Случайный ключ можно создать командой:

openssl rand -hex 32

Для каждого параметра используйте отдельное значение. Файл .env нельзя публиковать в Git или пересылать вместе с проектом.

Ограничьте доступ:

chmod 600 .env

Шаг 7. Запустите компоненты

Для системы с NVIDIA:

docker compose --profile gpu-nvidia up -d

Для тестового запуска только на процессоре:

docker compose --profile cpu up -d

Проверьте контейнеры:

docker compose ps

Набор запускает n8n, PostgreSQL, Qdrant и Ollama в общей внутренней сети Docker.

Шаг 8. Загрузите языковую модель

Например:

docker exec -it ollama ollama pull qwen3:8b

Или для более мощной видеокарты:

docker exec -it ollama ollama pull gpt-oss:20b

Проверьте модель:

docker exec -it ollama ollama run qwen3:8b

Шаг 9. Откройте n8n

В тестовой локальной сети интерфейс будет доступен по адресу:

http://IP-АДРЕС-СЕРВЕРА:5678

Создайте учётную запись владельца.

Не оставляйте порт 5678 открытым в интернете в рабочей среде. Для внешнего доступа необходимо настроить домен, HTTPS и обратный прокси-сервер.

Как собрать первого агента в n8n

Соберём агента, который отвечает на вопросы и при необходимости использует подключённый инструмент.

Шаг 1. Создайте новый сценарий

В n8n нажмите «Create Workflow».

Шаг 2. Добавьте точку входа

Для проверки используйте блок Chat Trigger. Для рабочего Telegram-бота выберите Telegram Trigger: он запускает сценарий после нового сообщения.

Чтобы подключить Telegram-бота:

  1. Создайте бота через BotFather и получите токен.
  2. Добавьте токен в учётные данные Telegram в n8n.
  3. В Telegram Trigger выберите событие Message.
  4. Передайте текст сообщения в AI Agent.
  5. Добавьте Telegram node с операцией Send Message и верните ответ в тот же chat ID.
  6. Активируйте сценарий и отправьте тестовое сообщение боту.

Telegram Trigger получает сообщения через вебхук, поэтому для постоянно работающего бота n8n должен быть доступен по публичному HTTPS-адресу. Ограничьте допустимые chat ID, не публикуйте токен и храните его в учётных данных n8n.

Вместо Telegram точкой входа также могут быть:

  • Webhook;
  • форма сайта;
  • почтовый триггер;
  • событие из CRM.

Шаг 3. Добавьте блок AI Agent

Этот блок будет получать запрос и решать, какой инструмент использовать.

Шаг 4. Подключите Ollama Chat Model

Создайте подключение к Ollama.

Если n8n и Ollama работают в одном наборе контейнеров, используйте внутренний адрес:

http://ollama:11434

Выберите загруженную модель, например qwen3:8b.

API Ollama по умолчанию работает на порту 11434. При локальном обращении отдельная авторизация не требуется, поэтому этот порт нельзя публиковать в интернете без дополнительной защиты.

Шаг 5. Напишите системную инструкцию

Пример:

Ты — внутренний ИИ-агент службы поддержки.
Отвечай только на основе найденных документов.
Если данных недостаточно, прямо сообщи об этом.
Не придумывай названия, даты, цены и условия.
Перед созданием заявки кратко покажи пользователю,
какие сведения будут в неё переданы.
Не выполняй действия, не относящиеся к поддержке.

Хорошая системная инструкция определяет:

  • роль агента;
  • разрешённые задачи;
  • запрещённые действия;
  • формат ответа;
  • порядок работы с инструментами;
  • условия передачи задачи человеку.

Шаг 6. Добавьте память

Для демонстрации подойдёт простая память текущего диалога.

Для рабочего сервиса используйте PostgreSQL, чтобы история не пропадала после перезапуска и не зависела от одного процесса n8n.

Шаг 7. Подключите инструмент

В качестве первого инструмента можно использовать:

  • HTTP Request для обращения к API;
  • Telegram для отправки сообщения;
  • PostgreSQL для чтения данных;
  • CRM;
  • систему управления задачами.

Начните с инструмента только для чтения. Например, разрешите агенту получать статус заказа, но пока не разрешайте менять его.

Шаг 8. Протестируйте ошибки

Проверьте:

  • что произойдёт при неполном запросе;
  • выберет ли агент правильный инструмент;
  • сможет ли он отказаться от запрещённого действия;
  • что произойдёт при недоступном API;
  • не повторит ли действие после ошибки;
  • запросит ли подтверждение перед изменением данных.

Нужна помощь с выбором сервера?

Специалисты помогут подобрать оборудование под нагрузку, бюджет и задачи

Написать

Как подключить базу знаний

Чтобы агент отвечал по внутренним документам, потребуется отдельный процесс загрузки данных.

Схема загрузки

Документ → извлечение текста → разделение на фрагменты → создание числовых представлений → запись в Qdrant

Схема поиска

Вопрос → поиск похожих фрагментов → передача найденного текста модели → ответ со ссылкой на источник

В n8n нужно создать два сценария.

Сценарий загрузки

  1. Получает PDF, DOCX, TXT или данные из хранилища.
  2. Извлекает текст.
  3. Разделяет его на небольшие смысловые фрагменты.
  4. Создаёт числовые представления текста.
  5. Записывает фрагменты в Qdrant вместе с названием файла и разделом.

Сценарий ответа

  1. Получает вопрос.
  2. Ищет связанные фрагменты в Qdrant.
  3. Передаёт их агенту.
  4. Формирует ответ.
  5. Указывает использованные документы.

Не загружайте все документы в один массив без метаданных. Сохраняйте:

  • название файла;
  • тип документа;
  • дату;
  • номер раздела;
  • версию;
  • уровень доступа.

Иначе агент не сможет показать источник и отличить действующий регламент от устаревшего.

Как развернуть ИИ-агента на VPS Selectel

В облачном варианте есть два основных пути.

VPS/VDS

Вариант 1. VPS управляет агентом, модель вызывается через API

Это самый простой и экономичный запуск.

На VPS/VDS Selectel работают:

  • n8n;
  • PostgreSQL;
  • Qdrant;
  • интерфейс агента;
  • интеграции с внешними системами.

Языковая модель работает во внешнем сервисе, через ИИ-роутер Selectel или на отдельном GPU-узле.

Шаг 1. Создайте VPS

Для небольшого рабочего проекта можно начать с конфигурации:

  • 4 виртуальных ядра;
  • 8 ГБ оперативной памяти;
  • накопитель от 80 ГБ;
  • Ubuntu.

Выбрать готовую конфигурацию можно на странице VPS/VDS Selectel.

Шаг 2. Добавьте SSH-ключ

Подключайтесь к VPS по SSH-ключу, а не по паролю. Selectel рекомендует отключать вход по паролю и запрещать подключение пользователя root.

Шаг 3. Настройте сетевой доступ

Откройте:

  • SSH только для доверенных IP-адресов;
  • порт 80 для выпуска сертификата;
  • порт 443 для HTTPS.

Не открывайте публично:

  • PostgreSQL — 5432;
  • Qdrant — 6333;
  • Ollama — 11434;
  • n8n — 5678 после настройки обратного прокси.

Шаг 4. Выберите способ установки n8n

Есть два варианта.

Первый — создать обычный VPS и установить n8n самостоятельно через Docker.

Второй — использовать готовый образ n8n Virtual Machine в ИИ-маркетплейсе Selectel. В таком случае основные компоненты уже подготовлены, поэтому можно быстрее перейти к настройке сценариев агента.

Для самостоятельного развёртывания контейнеров также можно использовать раздел готовых серверных приложений Selectel.

Для простого теста:

docker run -d \
  --name n8n \
  --restart unless-stopped \
  -p 127.0.0.1:5678:5678 \
  -v n8n_data:/home/node/.n8n \
  docker.n8n.io/n8nio/n8n

Привязка к адресу 127.0.0.1 означает, что интерфейс не будет напрямую доступен из интернета.

Шаг 5. Подключите языковую модель

Вместо локального Ollama добавьте в n8n подключение к облачной модели.

Для работы через ИИ-роутер Selectel потребуются:

  • ключ программного интерфейса;
  • адрес точки подключения;
  • название выбранной модели;
  • ограничения на расходы и количество запросов.

Если готового блока для нужного сервиса в n8n нет, используйте блок HTTP Request и совместимый программный интерфейс.

Шаг 6. Настройте домен и HTTPS

Привяжите домен к публичному IP-адресу VPS и установите обратный прокси-сервер:

  • Nginx;
  • Traefik;
  • Caddy.

Он будет принимать защищённое соединение на порту 443 и передавать запросы в контейнер n8n.

Вариант 2. Вся система работает на облачном сервере с GPU

Если документы не должны передаваться внешнему поставщику модели, можно арендовать облачный сервер Selectel с GPU. В облаке доступны виртуальные машины с GPU; набор ускорителей зависит от пула и зоны доступности. Видеокарта передаётся виртуальной машине как выделенное устройство. Доступность конкретной модели зависит от пула.

В одной виртуальной машине будут работать:

  • n8n;
  • Ollama или другой сервер языковой модели;
  • Qdrant;
  • PostgreSQL;
  • локальная модель;
  • интерфейс агента.

Дальнейшая установка практически совпадает с локальным вариантом:

  1. Установите драйвер NVIDIA.
  2. Настройте доступ контейнеров к видеокарте.
  3. Установите Docker.
  4. Разверните n8n, Ollama, Qdrant и PostgreSQL.
  5. Загрузите языковую модель.
  6. Настройте HTTPS.
  7. Закройте внутренние порты.
  8. Настройте резервное копирование.

При постоянной нагрузке сравните полную стоимость аренды и покупки: точка окупаемости собственного сервера зависит от класса GPU, тарифа, загрузки, электричества и обслуживания.

Гибридная схема: VPS в облаке, модель в офисе

В гибридной схеме публичная часть агента работает на VPS/VDS Selectel, а модель и конфиденциальные документы остаются на оборудовании DigitalRazor.

На VPS Selectel работают:

  • публичный интерфейс;
  • Telegram-бот;
  • n8n;
  • очередь заданий;
  • приём внешних событий.

На локальном вычислительном контуре DigitalRazor работают:

  • Ollama или другой сервис моделей;
  • Qdrant с конфиденциальными документами;
  • внутренние базы данных;
  • локальная языковая модель.

Для небольшого закрытого контура подойдёт Performance Pro 350R. Для нескольких моделей и пользователей — Performance Pro 750R или Rackstation AI.

[ PERFORMANCE PRO RACK ]
350R RACK
U9-285K · RTX 5090 32ГБ · 128GB DDR5 RGB · 2 ТБ
1 390 500 ₽
104 288 ₽ / мес Примерный ежемесячный платёж. Итоговая сумма рассчитывается индивидуально.
Подробнее
750R RACK
7975WX · RTX 5090 32ГБ · 256GB DDR5 ECC · 2 ТБ NVMe 5.0
4 144 000 ₽
310 800 ₽ / мес Примерный ежемесячный платёж. Итоговая сумма рассчитывается индивидуально.
Подробнее
900R RACK
2 x EPYC 9575F · RTX PRO 5000 48GB · 512GB DDR5 ECC · 2 ТБ
7 536 000 ₽
565 200 ₽ / мес Примерный ежемесячный платёж. Итоговая сумма рассчитывается индивидуально.
Подробнее

Облачная и локальная части соединяются через защищённый туннель. Порты Ollama, Qdrant и базы данных не должны быть доступны из открытого интернета.

Что нужно защитить перед запуском

Не давайте агенту права администратора

Не подключайте к нему оболочку с правами root. Для каждого инструмента создавайте отдельную учётную запись с минимально необходимыми разрешениями.

Разделяйте чтение и изменение

Инструмент получения списка заказов и инструмент отмены заказа должны быть разными. Второй должен требовать подтверждения.

Не публикуйте внутренние API

Ollama, Qdrant и PostgreSQL должны работать во внутренней сети Docker, локальной сети или закрытой подсети.

Используйте HTTPS

Токены, документы и сообщения нельзя передавать через открытый HTTP.

Ограничивайте расходы

Для облачных моделей задайте:

  • лимит запросов;
  • лимит токенов;
  • дневной бюджет;
  • ограничение длины диалога;
  • максимальное число повторных попыток.

Защищайте агента от инструкций в документах

Загруженный документ может содержать текст, который пытается заставить агента игнорировать правила или передать секретные данные.

Содержимое документов необходимо считать недоверенным источником. Оно может использоваться для ответа, но не должно изменять системную инструкцию или разрешения агента.

Добавьте подтверждение человеком

Обязательно подтверждайте:

  • отправку писем;
  • платежи;
  • удаление данных;
  • изменение договоров;
  • публикацию материалов;
  • выполнение команд;
  • изменение прав доступа.

Настройте резервные копии

Сохраняйте:

  • базу PostgreSQL;
  • данные Qdrant;
  • конфигурации n8n;
  • файл переменных окружения в защищённом хранилище;
  • загруженные документы;
  • собственные сценарии.

Selectel позволяет создавать ручные резервные копии дисков и настраивать их по расписанию.

Проверяйте конфигурацию

n8n имеет встроенный аудит безопасности, который показывает незащищённые вебхуки, устаревшие настройки, опасные блоки, доступ к файловой системе и другие риски.

FAQ

1. Можно ли запустить ИИ-агента на обычном VPS?
Да. На VPS можно разместить n8n, базу данных и интеграции, а языковую модель вызывать через API. Для локального запуска крупной модели потребуется облачная или физическая система с GPU.
2. Нужна ли ИИ-агенту видеокарта?
Не всегда. GPU нужен для локальной языковой модели. Если агент обращается к внешней модели через API, его логика может работать на обычном VPS без видеокарты.
3. Сколько оперативной памяти нужно для n8n?
Для теста достаточно 4 ГБ. Для n8n, PostgreSQL, Qdrant и нескольких сценариев лучше начинать с 8 ГБ. Обработка большого количества документов может потребовать 12–16 ГБ.
4. Можно ли установить Ollama на VPS без GPU?
Можно, но модель будет работать на процессоре и отвечать медленно. Такой вариант подходит для проверки схемы, но не для постоянного обслуживания пользователей.
5. Что лучше для агента: n8n или Python?
n8n удобнее для быстрого запуска и готовых интеграций. Python даёт больше контроля над сложной логикой. Часто n8n управляет процессом, а отдельные компоненты пишутся на Python.
6. Какую модель выбрать для первого агента?
Для проверки подойдут Qwen3 4B или 8B, Gemma 3 4B и Llama 3.2 3B. После настройки схемы можно тестировать более крупную модель на своих запросах.
7. Можно ли подключить ИИ-агента к Telegram?
Да. В n8n есть блоки для получения и отправки сообщений Telegram. Агент может принимать вопросы, искать информацию, запускать инструменты и возвращать результат в чат.
8. Что такое RAG в ИИ-агенте?
Это поиск по подключённой базе документов перед формированием ответа. Агент находит подходящие фрагменты и передаёт их модели, поэтому ей не нужно запоминать документы во время обучения.
9. Безопасно ли размещать ИИ-агента на VPS?
Да, при правильной настройке. Нужны SSH-ключи, HTTPS, закрытые внутренние порты, ограниченные права, резервные копии и подтверждение человеком перед важными действиями.
10. Может ли один сервер обслуживать нескольких агентов?
Да. Несколько агентов могут использовать одну платформу n8n и одну модель. Необходимые ресурсы зависят от числа одновременных запросов, размера моделей и подключённых баз данных.
11. Работает ли ИИ-агент без интернета?
Полностью локальный агент с Ollama, локальными документами и внутренними инструментами может работать без интернета. Внешние сайты, облачные API и мессенджеры в таком режиме будут недоступны.
12. Сколько стоит сервер для ИИ-агента?
VPS для агента с внешней моделью может стоить от нескольких сотен рублей в месяц. Локальный запуск модели требует GPU, а стоимость зависит от её размера и числа пользователей.
13. Чем n8n + Ollama отличаются от Claude Code и OpenClaw?
n8n + Ollama подходят для управляемых бизнес-процессов с локальной моделью. Claude Code ориентирован на работу с кодом и командной строкой, а OpenClaw связывает агента с Telegram и другими мессенджерами.

Заключение

Для запуска первого ИИ-агента не нужен дорогой вычислительный кластер. Достаточно определить одну полезную задачу, развернуть n8n на VPS/VDS Selectel, подключить языковую модель через ИИ-роутер и выдать агенту один безопасный инструмент.

Когда схема заработает, можно добавить базу знаний, долговременную память, новые интеграции и локальную модель.

Если вычисления нужны только периодически, подойдёт облачный сервер Selectel с GPU. Но стоит помнить, что при работе 24/7 нужно сравнить полную стоимость аренды и собственного оборудования с учётом загрузки, электричества и обслуживания.

Если данные должны оставаться внутри компании, модель и базу документов можно развернуть на рабочей станции или GPU-сервере DigitalRazor.

Для одного агента и одной модели можно рассмотреть Performance Pro 350R. Для крупных моделей и двух видеокарт — Performance Pro 750R. Для общего доступа команды и круглосуточной нагрузки — Rackstation AI или Devbox AI.

Главное — выбирать инфраструктуру под конкретный процесс: какой запрос получает агент, какие данные использует, какое действие выполняет и кто проверяет результат.

Rackstation AI
Для каких задач Компактный GPU-сервер до 2 видеокарт для начальных задач в AI и графике. Оптимален для инференса, визуализации, VFX и рендеринга в студиях и лабораториях, где важна гибкость.
Подробнее
Видеокарты
RTX / RTX PRO / H200 NVL
Объем видеопамяти до 282 ГБ
Процессоры
Threadripper PRO
Количество ядер до 96
RAM до 1024 ГБ DDR5
Форм-фактор 4.5U
Devbox AI
Для каких задач Универсальная платформа на 4–6 GPU для локального обучения моделей и генеративных задач. Подходит для команд, которым важна надёжность сервера и свобода выбора графики — от RTX 5090 до PRO RTX 6000.
Подробнее
Видеокарты
RTX / RTX PRO / H200 NVL
Объем видеопамяти до 576 ГБ
Процессоры
Threadripper PRO
Количество ядер до 96
RAM до 1024 ГБ DDR5
Форм-фактор 6.5U
Scale
Для каких задач Сервер промышленного уровня на 8 GPU с кластерной архитектурой. Предназначен для дата-центров и AI-ферм, где требуется масштабируемость и полная загрузка ресурсов под обучение LLM и R&D.
Подробнее
Видеокарты
RTX PRO 6000 / RTX 5090
Объем видеопамяти до 768 ГБ
Процессоры
AMD Epyc, Intel Xeon
Количество ядер до 320
RAM до 3072 ГБ DDR5
Форм-фактор 6U
HPC 4000
Для каких задач Серия серверов для кластеризации на 4 GPU. Предназначены для дата-центров и AI-ферм, где требуется повышенная плотность для обучение LLM и R&D.
Подробнее
Видеокарты
L40s / RTX PRO / H200 NVL
Объем видеопамяти до 564 ГБ
Процессоры
AMD EPYC, Intel Xeon
Количество ядер до 128
RAM до 1536 ГБ DDR5
Форм-фактор 2U
HPC 8000
Для каких задач Серия серверов для кластеризации на 8 GPU. Предназначены для дата-центров и AI-ферм, где требуется повышенная плотность для обучение LLM и R&D.
Подробнее
Видеокарты
L40s / RTX PRO / H200 NVL
Объем видеопамяти до 1128 ГБ
Процессоры
AMD EPYC, Intel Xeon
Количество ядер до 256
RAM до 2048 ГБ DDR5
Форм-фактор 4U
HGX H200
Для каких задач HGX объединяет 8 видеокарт NVIDIA H200, достигая экстремальной плотности производительности. Благодаря внутренней связности NVSwitch мгновенно интегрируется в масштабные вычислительные кластеры.
Подробнее
Видеокарты
NVIDIA H200 SXM
Объем видеопамяти до 1128 ГБ
Процессоры
AMD EPYC, Intel Xeon
Количество ядер до 256
RAM до 2048 ГБ DDR5
Форм-фактор 5U
Подберём сервер под вашу задачу

Подберём конфигурацию сервера и отправим предложение.

Смотреть серверы
или свяжитесь с нами
Telegram Telegram WhatsApp WhatsApp ВКонтакте ВКонтакте MAX MAX
33.4К

Так же будет интересно почитать

Сайт использует cookies
Узнать подробнее