8 800 500-99-26 Для звонков по России
ИИ-ассистент для ритейла на своём сервере
Рабочие станции
16 мин

ИИ-ассистент для ритейла на своём сервере

DigitalRazor
DigitalRazor
Подписаться в Telegram
Содержание 10 разделов
Короткий ответ: когда ритейлу нужен локальный ИИ Что ритейл получает от ИИ Почему ритейлу может быть выгоден локальный ИИ Как устроен локальный ИИ в торговой сети Модели для локального запуска Как подобрать инфраструктуру Как сравнить стоимость своего ИИ-сервера и облака Как начать внедрение локального ИИ Часто задаваемые вопросы Подберём оборудование для ИИ в вашей сети
Подберём сервер под вашу задачу

Подберём конфигурацию сервера и отправим предложение.

Смотреть серверы
или свяжитесь с нами
Telegram Telegram WhatsApp WhatsApp ВКонтакте ВКонтакте MAX MAX

Подберём сервер под задачи

Ответьте на несколько вопросов — подготовим предложение

Искусственный интеллект в ритейле уже можно оценивать по влиянию на продажи. Askona, производитель и продавец товаров для сна и дома, проверила эффект ИИ-консультанта в приложении с помощью A/B-теста — сравнения двух вариантов сервиса. По данным компании, с 26 февраля по 13 марта 2026 года конверсия в покупку, то есть доля пользователей, совершивших покупку, выросла на 9,8%, а выручка — на 18,4%. Конечно, это результат одного проекта: в другой сети эффект будет зависеть от ассортимента, интерфейса и аудитории.

Разберём, где ИИ в ритейле приносит измеримую пользу, когда локальный запуск оправдан и как рассчитать инфраструктуру до покупки оборудования.

Короткий ответ: когда ритейлу нужен локальный ИИ

Локальный контур — запуск модели и связанных сервисов на инфраструктуре компании — стоит рассматривать при постоянной высокой нагрузке. Её могут создавать многочисленные одновременные запросы пользователей или видеопотоки с камер. Ещё один повод — большие расходы на API, через который приложения обращаются к облачной модели, при стабильном потоке запросов.

Другие причины — ограничения на передачу чувствительных данных, требования к малой задержке и работе при сбоях внешнего канала. Чтобы сервис продолжал работать без внешней связи, модель, нужные данные и критичные сервисы должны быть доступны внутри локального контура.

Для небольшого пилота или нерегулярной нагрузки облако может быть проще и дешевле, особенно если задача не связана с чувствительными данными. Российское облако тоже позволяет выполнять требования локализации персональных данных (ПДн) при подходящем размещении и настройке системы. Такую инфраструктуру предоставляет, например, облачная платформа Yandex Cloud.

Выбор начинается с требований к данным, профиля нагрузки, SLA — согласованного уровня доступности и качества сервиса — и сравнения полной стоимости вариантов, включая эксплуатацию и поддержку.

Что ритейл получает от ИИ

Искусственный интеллект в ритейле полезен там, где результат можно измерить: по конверсии, наличию товара, списаниям, времени ответа или числу ручных операций. Большие языковые модели (LLM) работают с текстом, классическое машинное обучение (ML) — например, с прогнозами по данным о продажах, а компьютерное зрение (CV) — с изображениями и видео. Эти задачи создают разную нагрузку на оборудование.

Применение ИИ в ритейле

Персонализация рекомендаций и клиентский опыт

Персонализация рекомендаций опирается на историю покупок, каталог и контекст запроса. Эти данные помогают формировать рекомендации товаров и персональные предложения, выбирать next best offer — следующее наиболее подходящее предложение для клиента.

В пилоте результат сравнивают с контрольной группой. Основные метрики — CTR, то есть доля кликов от числа показов рекомендаций, конверсия, средний чек и дополнительная выручка.

Прогнозирование спроса и управление запасами

Прогноз помогает планировать закупки и остатки, сокращать случаи отсутствия товара — out-of-stock (OOS), снижать списания и управлять оборотным капиталом. Кассовые системы POS дают данные о продажах, системы управления ресурсами предприятия ERP и складом WMS — об остатках и поставках. Модель оценивает будущий спрос, а бизнес-правила превращают прогноз в заказ с учётом сроков поставки, размера партии и страхового запаса.

В мае 2026 года разработчик систем планирования RELEX сообщил о результатах исландской продуктовой сети Krónan. После внедрения прогнозирования и пополнения запасов в распределительных центрах оборачиваемость за октябрь 2024 — сентябрь 2025 года выросла на 7,5% относительно предыдущего года. Время, которое сотрудник тратил на заказы и планирование, сократилось более чем наполовину. Это данные поставщика о результате внедрения системы и изменения процессов, а не об эффекте одной модели.

В собственном пилоте стоит измерять ошибку прогноза, OOS, списания, оборачиваемость и страховой запас.

Компьютерное зрение: полки, инвентаризация и предотвращение потерь

Видеораспознавание товаров на полке и контроль выкладки товара помогают находить пустые места и нарушения размещения. Компьютерное зрение также используют для проверки ценников, анализа очередей и кассовых зон. Предотвращение краж — отдельный сценарий: подозрительное событие требует проверки, а срабатывание системы само по себе не доказывает кражу.

В 2026 году сеть магазинов Fix Price запустила в 500 точках пилот OSA-сервиса для контроля наличия товаров на полках и актуальности ценников. OSA, или on-shelf availability, обозначает доступность товара на полке для покупателя. По данным компании, в отдельных магазинах прирост оборота достигал 2%. Периоды расчёта подбирали с учётом цикла оборачиваемости товаров. Сервис помогал выявлять недостаток товара, отсутствие или ошибки ценников и расхождения между учётными и фактическими остатками.

Видеоаналитика может включать обнаружение объектов, распознавание текста и отслеживание объектов и классификацию. При выборе оборудования считают весь пайплайн: приём и декодирование потока, подготовку кадров и работу моделей. Поэтому число GPU зависит от разрешения, частоты обработки кадров и состава пайплайна, а не только от количества камер.

Чат-боты, голосовые и корпоративные ассистенты

Чат-бот поддержки клиентов отвечает на вопросы о товарах, заказах и доставке. Голосовой ассистент добавляет распознавание речи ASR и синтез речи TTS. Корпоративный ассистент работает с регламентами и базой знаний, часто через RAG: система находит нужные фрагменты документов и передаёт их LLM вместе с вопросом.

RAG не гарантирует правильный ответ: качество зависит от актуальности индекса, эмбеддингов, разбиение документов на фрагменты и повторное ранжирование. Векторная база данных помогает искать фрагменты по смыслу, но не заменяет проверку прав доступа. Документы, недоступные сотруднику, не должны попадать в контекст LLM.

Fix Price описывала ИИ-сервис для проверки договоров аренды: раньше ручная проверка занимала около часа, а ИИ анализировал договор и формировал отчёт за несколько минут. Решение по договору оставалось за специалистом. По данным компании, полное время проверки сократилось как минимум вдвое. Кейс Fix Price.

В пилоте стоит измерять полное время обработки с учётом проверки человеком, число ошибок и долю эскалаций — случаев, которые требуют передачи вопроса ответственному специалисту.

Динамическое ценообразование

Динамическое ценообразование учитывает спрос, остатки, срок годности, сезонность, цены конкурентов и маржу. Здесь искусственный интеллект в ритейле не обязательно означает LLM или GPU: табличные модели и алгоритмы оптимизации часто работают на центральном процессоре (CPU). Метрики — маржинальная прибыль, доля проданного товарного запаса, то есть доля проданного товарного запаса за выбранный период, и списания.

Задача Что измеряем Технология Вычислительный профиль
Рекомендации CTR, конверсия, средний чек Рекомендательные модели, LLM + RAG для диалога CPU или GPU в зависимости от модели и потока запросов
Спрос и запасы Ошибка прогноза, OOS, списания Табличный ML, оптимизация Часто CPU. Важны объём данных и время расчёта
Полки и ценники OSA, ошибки ценников, ручные проверки Detection + OCR, tracking для видео На месте, рядом с камерами (edge), или в центре. Нагрузка зависит от потока кадров и моделей
Потери Подтверждённые инциденты, пропуски, ложные срабатывания CV + правила Edge или центр. Нагрузка зависит от числа потоков и моделей
Корпоративный поиск Время ответа, доля решённых запросов RAG + LLM Память под модель и контекст, число одновременных запросов
Голос Задержка ответа, доля автоматизированных обращений ASR + LLM + TTS Число одновременных диалогов и требования SLA

Задачи ИИ в ритейле: бизнес-метрики, технологии и вычислительный профиль

Почему ритейлу может быть выгоден локальный ИИ

Размещение на собственной инфраструктуре (on-premise) даёт больше контроля над данными и работой сервиса. Польза зависит от ограничений и нагрузки конкретной сети.

Выделенный GPU-сервер

Данные, закрытый контур и 152-ФЗ

Федеральный закон № 152-ФЗ «О персональных данных» не требует собственного физического сервера. Часть 5 статьи 18 запрещает при сборе ПДн граждан РФ использовать зарубежные базы для записи, систематизации, накопления, хранения, уточнения и извлечения этих данных, кроме прямо предусмотренных законом исключений. Требование можно выполнить как на собственной инфраструктуре, так и в подходящем российском облаке. Статья 18.

Трансграничную передачу регулирует статья 12. До её начала оператор — компания, организующая обработку ПДн, — направляет отдельное уведомление Роскомнадзору, надзорному органу в этой сфере. Одного уведомления недостаточно: необходимо выполнить остальные требования статьи и учитывать возможные ограничения или запрет передачи. Статья 12.

Статья 11 регулирует обработку биометрических ПДн. Не любое видео с лицом относится к биометрии: важно, использует ли оператор физиологические или биологические признаки для установления личности. При этом видео может оставаться персональными данными и без биометрической идентификации. Статья 11.

Закрытый контур позволяет компании самой определять маршруты данных, права доступа, сроки хранения журналов событий — логов — и интеграции с бизнес-системами. Среди них CRM для управления отношениями с клиентами, а также ERP, WMS и POS. Но локальная нейросеть не становится безопасной автоматически: нужны разделение сети на изолированные сегменты, обновления, резервное копирование и контроль доступа.

Задержка и работа в реальном времени

В видеоаналитике время уходит не только на выполнение модели — инференс. Его занимают передача потока по сети, декодирование, подготовка кадров, обработка результатов и запуск действия по бизнес-правилу.

У LLM другая цепочка. При использовании RAG она включает поиск фрагментов (retrieval), затем обработку входного контекста моделью (prefill) и генерацию ответа. Быстрый инференс сам по себе не гарантирует быстрой реакции всего сервиса.

Поэтому задержку в реальном времени измеряют end-to-end — от события или запроса до нужного результата. Помимо типичного времени полезно отслеживать p50, p95 и p99: значения, в которые укладываются соответственно 50%, 95% и 99% измерений. Так видны и обычная скорость, и редкие долгие ответы.

Периферийный ИИ, или периферийный инференс рядом с источником данных, сокращает сетевой путь. Это полезно, когда реакция нужна прямо в магазине или ограничена пропускная способность WAN — внешней сети, связывающей магазин с удалённой инфраструктурой. Для ночного прогноза спроса важнее завершить расчёт к началу закупок, чем сэкономить миллисекунды.

Стоимость при постоянной высокой нагрузке

Облачный API обычно оплачивается по токенам или запросам, аренда GPU — по времени использования. Локальный запуск требует капитальных затрат на оборудование и добавляет эксплуатационные расходы. Сравнивать варианты нужно по полной стоимости владения (TCO) за одинаковый период и при сопоставимом SLA.

Стоимость локального сервера и облака

Контроль инфраструктуры и независимость от внешних API

Собственный контур позволяет зафиксировать версии модели и движка инференса — ПО, которое выполняет модель, — задать свои лимиты и контролировать логи. Локальные сервисы могут работать без внешнего интернет-канала, если все критичные зависимости доступны внутри контура.

Компания при этом отвечает за обновления, безопасность, мониторинг, планирование вычислительных мощностей и восстановление после сбоев. Перед обновлением модели или движка нужно проверять совместимость и регрессии — ухудшение качества или производительности на рабочих задачах.

Когда облако или гибридная схема лучше

Облако удобнее для пилота, нерегулярных запросов и резких пиков, если у провайдера доступны нужные ресурсы и квоты. Готовый API снижает требования к опыту команды в эксплуатации GPU. Аренда облачного сервера с GPU всё ещё требует настройки и сопровождения ПО.

В гибридной схеме чувствительные данные и связанные с ними вычисления остаются локально. В облако можно вынести пиковую нагрузку, для которой разрешена передача данных и заранее подготовлены интеграции.

Критерий On-premise Облако Что важно ритейлу
Капитальные затраты Покупка оборудования и подготовка площадки Обычно ниже, без покупки серверов Бюджет старта
Расходы Покупка, эксплуатация и резерв Оплата использования или выделенных ресурсов Загрузка и условия тарифа
Задержка Можно сократить сетевой путь Зависит от канала, региона и очередей сервиса Полная задержка и SLA
Данные Компания управляет маршрутами и хранением Контроль разделён с провайдером Где данные хранятся и обрабатываются
Масштабирование В пределах резерва, затем закупка В пределах квот и доступных мощностей Пики и темп роста
Эксплуатация На компании или её подрядчике Провайдер обслуживает платформу, ответственность за ПО зависит от услуги Компетенции команды
Интернет Возможна автономность локальных сервисов Нужен канал доступа к сервису, не обязательно публичный интернет Устойчивость WAN
Модель Версии модели и движка под контролем компании В API — условия провайдера, на арендованных GPU — свой выбор Регрессии и совместимость

Сравнение локальной и облачной инфраструктуры для задач ритейла

Как устроен локальный ИИ в торговой сети

POS даёт данные о транзакциях, CRM — клиентский контекст, ERP и WMS — данные о закупках и остатках. Документы служат источниками для RAG, камеры — для видеоаналитики.

Центральный GPU-сервер или edge-узлы в магазинах

Центральная схема упрощает управление моделями и распределение нагрузки между ускорителями. Но передача видеопотоков из магазинов увеличивает нагрузку на WAN, а их запись — на центральное хранилище (storage).

Edge переносит инференс в магазин. Если передавать в центр только результаты обработки, трафика становится меньше. Обработка рядом с камерами также сокращает сетевую задержку, но множество распределённых узлов сложнее обновлять и обеспечивать резервом на случай отказа.

Один из вариантов гибридной схемы — выполнять detection и tracking рядом с камерами, а в центр передавать события и метаданные: время, место и параметры обнаруженного события. RAG и аналитика всей сети при этом работают централизованно. Полное видео можно хранить в магазине, а нужные фрагменты передавать по запросу, если это соответствует требованиям к архиву и доступу.

Выбор зависит от числа камер и параметров видеопотоков, пропускной способности канала, требований к хранению видео и SLA.

Гибридная схема

Модели для локального запуска

Локальную LLM выбирают по лицензии, качеству русского языка на корпоративных вопросах, длине контекста, требованиям к VRAM, поддержке квантизации и совместимости с движком инференса. На сентябрь 2026 года среди open-weight вариантов — Qwen3, Mistral Small 4 и gpt-oss.

LLM с открытыми весами для чат-ботов и RAG

Qwen3-32B содержит 32,8 млрд параметров и распространяется по Apache 2.0. Русский входит в заявленные 119 языков и диалектов. Контекст — 32 768 токенов, с YaRN — до 131 072. Длинный контекст нужно отдельно проверять на целевых документах и движке.

Mistral Small 4 — MoE-модель на 119 млрд параметров, из которых 6,5 млрд активны на токен. Контекст — 256K, лицензия — Apache 2.0. При 4–16 битах веса занимают грубо 60–238 ГБ без KV-кэша, runtime-буферов и запаса.

gpt-oss-20b и gpt-oss-120b поддерживают локальный запуск, распространяются по Apache 2.0 и имеют контекст 128K. OpenAI указывает преимущественно англоязычные данные предобучения, поэтому русский нужно проверять на корпоративном корпусе.

VRAM: почему параметров недостаточно

Базовая оценка памяти под веса в байтах — число параметров × битность / 8. Но для запуска в видеопамяти GPU, или VRAM, должны помещаться также KV-кэш, рабочие буферы движка (runtime) и запас. KV-кэш хранит промежуточные данные механизма внимания для уже обработанных токенов, чтобы не вычислять их заново при генерации.

Для одной последовательности KV-кэш в BF16 занимает около 8 ГиБ при 32 768 токенах и около 32 ГиБ при 131 072 токенах. При нескольких одновременно активных последовательностях общий объём KV-кэша растёт, поэтому параллельную нагрузку нужно учитывать отдельно.

Квантизация

Снижение точности представления параметров — уменьшает объём весов, но не сокращает KV-кэш автоматически. Его формат задаётся отдельно. Длинный контекст и число одновременных запросов, то есть число одновременно обрабатываемых запросов (concurrency), продолжают увеличивать потребность в памяти.

Модели компьютерного зрения

В системе анализа полок детектор находит объекты, классификатор или поиск по эмбеддингу изображения определяет товар, а OCR распознаёт текст. Для видео при необходимости добавляют трекер, который отслеживает объекты между кадрами. Бизнес-правила превращают результаты в событие или задачу сотруднику. Эта цепочка обработки называется пайплайном.

Скорость одного детектора в бенчмарке не равна скорости всего пайплайна. Важно различать входной FPS — число поступающих кадров в секунду — и inference FPS — число кадров, обрабатываемых моделями за секунду.

Влияет и batching — объединение кадров в пакеты. Он может повысить пропускную способность, но ожидание заполнения пакета добавляет задержку.

Как подобрать инфраструктуру

GPU-серверы для разных задач

Серверы для видеоаналитики и нагруженного инференса

GPU-сервер нужен, когда сервис обслуживает много одновременных LLM-запросов, несколько моделей или большой поток камер и требует резерва по мощности. Конфигурацию выбирают по целевой нагрузке и подтверждают нагрузочным тестом. Варианты есть в разделе серверов DigitalRazor для ИИ, а критерии выбора подробнее разобраны в материале «Как выбрать сервер для ИИ».

Scale
Для каких задач Сервер промышленного уровня на 8 GPU с кластерной архитектурой. Предназначен для дата-центров и AI-ферм, где требуется масштабируемость и полная загрузка ресурсов под обучение LLM и R&D.
Подробнее
Видеокарты
RTX PRO 6000 / RTX 5090
Объем видеопамяти до 768 ГБ
Процессоры
AMD Epyc, Intel Xeon
Количество ядер до 320
RAM до 3072 ГБ DDR5
Форм-фактор 6U
HPC 8000
Для каких задач Серия серверов для кластеризации на 8 GPU. Предназначены для дата-центров и AI-ферм, где требуется повышенная плотность для обучение LLM и R&D.
Подробнее
Видеокарты
L40s / RTX PRO / H200 NVL
Объем видеопамяти до 1128 ГБ
Процессоры
AMD EPYC, Intel Xeon
Количество ядер до 256
RAM до 2048 ГБ DDR5
Форм-фактор 4U
HGX H200
Для каких задач HGX объединяет 8 видеокарт NVIDIA H200, достигая экстремальной плотности производительности. Благодаря внутренней связности NVSwitch мгновенно интегрируется в масштабные вычислительные кластеры.
Подробнее
Видеокарты
NVIDIA H200 SXM
Объем видеопамяти до 1128 ГБ
Процессоры
AMD EPYC, Intel Xeon
Количество ядер до 256
RAM до 2048 ГБ DDR5
Форм-фактор 5U

Рабочие станции для локальных LLM и RAG

Для пилота, разработки и RAG небольшой команды подойдёт рабочая станция, если модель и нагрузка укладываются в её ресурсы. На ней можно проверить квантизацию, контекст и concurrency до закупки промышленной инфраструктуры. Примеры систем есть в разделе DigitalRazor для локальных LLM, а настройка пилота разобрана в гайде по LM Studio, API и RAG.

Как рассчитать сервер для LLM

Для расчёта нужны точная модель, формат данных (dtype) и квантизация, типичная и максимальная длина контекста, длина ответа и число одновременных запросов. Целевые показатели — TTFT, время до первого токена ответа, и tokens/s, скорость генерации в токенах в секунду. Для tokens/s отдельно задают скорость на запрос и суммарную пропускную способность сервиса.

Если на том же узле работают модели эмбеддингов, reranker, ASR или TTS, их потребление памяти и вычислительных ресурсов включают в расчёт.

Порядок проверки:

  1. Проверить, хватает ли памяти под веса, KV-кэш и рабочие буферы с запасом.
  2. Измерить задержку одного запроса (single-request latency).
  3. Воспроизвести целевую concurrency с реальными длинами запросов и ответов.
  4. Проверить TTFT, tokens/s и задержки p95/p99.
  5. Определить число реплик — параллельно работающих экземпляров сервиса — и резерв на случай отказа или обслуживания узла.

Выберите GPU-сервер для нейросетей

Готовые решения для работы с большими массивами данных

Переход в каталог

Как рассчитать сервер для видеоаналитики

Нужны число камер, разрешение, кодек, битрейт, входная частота кадров и частота обработки кадров. Также учитывают число моделей, tracking, OCR, срок хранения видео, расположение узлов и SLA.

Для 100 камер с разрешением 1080p и средним битрейтом 4 Мбит/с суммарный видеопоток составляет около 400 Мбит/с. При передаче всего видео в центр такую нагрузку получает центральный канал. Непрерывный архив за 30 суток займёт примерно 129,6 ТБ. Это объём самого видео, без служебных данных, дисковой избыточности и запаса свободного места. Для сети также нужен запас на колебания битрейта и служебный трафик.

При анализе 10 кадров/с с каждой камеры системе нужно обрабатывать суммарно 1000 кадров/с. Но необходимое число GPU зависит от пайплайна.

В тестах DeepStream 9.1 — платформы видеоаналитики производителя GPU NVIDIA — ускоритель RTX PRO 6000 Blackwell Server Edition показывает:

  • 946 FPS для детектора RT-DETR с входом 640 × 640 пикселей и трекером NvDCF;
  • 159 FPS для детектора Grounding-DINO с входом 544 × 960 пикселей без трекера.

Оба теста используют 16-битную точность FP16 и TensorRT — движок оптимизации и выполнения моделей NVIDIA. Источник — тестовое видео 1080p H.265. Измерения включают декодирование и обработку до получения метаданных, но вывод изображения отключён.

Эти цифры показывают зависимость производительности от модели, разрешения и трекинга. Они не сравнивают качество распознавания и не заменяют тест на видео из магазинов с нужными OCR, правилами обработки и запасом мощности.

Сценарий Что нужно знать Главные ограничения Что проверять первым
RAG небольшой команды Модель, контекст, concurrency, TTFT VRAM и задержка Помещается ли нагрузка пилота на рабочей станции или сервере с одной GPU
RAG общего сервиса Concurrency, tokens/s, кэш, требования к высокой доступности (HA) Пропускная способность и VRAM Производительность сервера, число GPU и реплик под нагрузкой
Видео одного магазина Битрейт, inference FPS, detector/OCR/tracker, WAN Декодирование и суммарный FPS Edge или центр с учётом канала, задержки и пайплайна
Видео торговой сети Модели, SLA, срок хранения, WAN GPU, сеть и хранилище Центральная схема или edge + центр, затем число GPU по тесту
Голос ASR + LLM + TTS, concurrency Задержка end-to-end Полная задержка диалога при размещении в центре или на edge

Что учитывать при расчёте инфраструктуры для разных ИИ-сценариев

Для локального архива отдельно проектируют систему хранения данных: её объём и пропускная способность могут ограничить систему наряду с GPU.

Как сравнить стоимость своего ИИ-сервера и облака

Универсального срока нет. При умеренной нагрузке ИИ-ассистент для ритейла может обходиться дешевле через API, а при стабильной высокой загрузке — на собственной инфраструктуре. Сравнение корректно только при сопоставимом качестве ответов, SLA и полном TCO за одинаковый период.

Что входит в TCO

Для локального запуска учитывают серверы, диски, сеть, внедрение, электричество, охлаждение, размещение, обслуживание, резервные мощности, лицензии и резервное копирование. Упрощённая оценка среднемесячных затрат:

(CapEx − ожидаемая стоимость оборудования в конце срока) / срок эксплуатации в месяцах + ежемесячные эксплуатационные расходы.

Эта формула распределяет затраты на оборудование по сроку службы. Она не показывает срок возврата первоначальных вложений.

В облаке считают оплату токенов через API или аренду GPU по часам, работу моделей эмбеддингов и reranker, управляемый поисковый сервис (managed search), хранение данных (storage), операции и исходящий трафик. Также учитывают внедрение, поддержку и оплату резервируемых ресурсов, если они нужны для пиков или отказоустойчивости.

Сценарий 1 — корпоративный RAG-ассистент

Возьмём 1000 сотрудников, каждый из которых отправляет 10 запросов в день в течение 22 рабочих дней. Средний запрос содержит 2500 входных токенов, включая инструкции, историю диалога и найденные документы. На ответ приходится 350 оплачиваемых выходных токенов. Получаем 220 000 запросов, 550 млн входных и 77 млн выходных токенов в месяц.

На 8 сентября 2026 года в Yandex AI Studio — облачном сервисе работы с ИИ-моделями — синхронные запросы к языковой модели DeepSeek V4 Flash стоят 0,3 рубля за 1000 входных токенов и 0,5 рубля за 1000 выходных. Цены включают НДС. Тарифы Yandex AI Studio.

При этих ставках обработка запросов обойдётся примерно в 203 500 рублей в месяц. Расчёт не учитывает скидку на кэшированные входные токены, создание эмбеддингов, retrieval, reranker, сеть и поддержку. Если модель генерирует дополнительно оплачиваемые токены рассуждений, они тоже должны входить в принятый объём ответа.

Нагрузка Запросов в месяц Только токены, с НДС
0,1× 22 000 ≈20 350 рублей
220 000 ≈203 500 рублей
10× 2,2 млн ≈2,035 млн рублей

Расходы на токены RAG-ассистента при разной нагрузке по тарифу DeepSeek V4 Flash на 8 сентября 2026 года

Таблица показывает рост расходов при неизменных длинах запросов, ответов и тарифах. Для расчёта окупаемости нужны стоимость локальной конфигурации, энергопотребление, обслуживание и резерв. Нагрузочный тест должен подтвердить нужную производительность той же модели или альтернативы с сопоставимым качеством ответов.

Сценарий 2 — видеоаналитика торговой сети

Для тех же 100 камер по 4 Мбит/с непрерывный архив за 30 дней занимает около 129,6 ТБ, или 120 699 ГиБ.

Для примера возьмём ставку 2,376 рубля за ГиБ в месяц с НДС, приведённую в документации Yandex Object Storage — облачного объектного хранилища — для класса Standard. Получаем примерно 287 тысяч рублей в месяц только за хранение. Это расчётное допущение, перед закупкой его нужно сверить с действующим прайс-листом.

Такая сумма соответствует заполненному 30-дневному архиву, объём которого сохраняется в течение всего расчётного месяца. В первый месяц, пока архив накапливается с нуля, средний занятый объём и плата за хранение будут ниже. Операции и исходящий интернет-трафик сверх бесплатных лимитов оплачиваются отдельно. Вычисления для видеоаналитики в эту сумму не входят.

Edge-обработка позволяет хранить исходное видео в магазине, а в центр отправлять события и метаданные. Это снижает нагрузку на WAN и потребность в центральном хранилище, если полный архив не требуется именно в центре. Локальные диски, их резервирование и обслуживание при этом остаются частью TCO.

Как начать внедрение локального ИИ

Внедрение локального ИИ лучше начинать с одной бизнес-задачи:

  1. Выбрать метрику и зафиксировать исходное значение.
  2. Подготовить данные и настроить права доступа.
  3. Запустить пилот в облаке, на рабочей станции или edge-узле с учётом ограничений на передачу данных.
  4. Измерить бизнес-эффект, проверить качество работы и задержки p95/p99 под целевой нагрузкой.
  5. Рассчитать промышленную конфигурацию, резерв и TCO.

Размер модели и число камер — только часть исходных данных. Конфигурация зависит также от контекста, concurrency, параметров видеопотоков, SLA и требований к доступности.

Нужна помощь с выбором сервера?

Специалисты помогут подобрать оборудование под нагрузку, бюджет и задачи

Написать

Часто задаваемые вопросы

1. Что такое ИИ-ассистент для ритейла?
Сервис на базе LLM или других ML-моделей, подключённый к каталогу, данным компании или корпоративной базе знаний. Он консультирует, помогает искать информацию, подбирать товары и автоматизировать рабочие процессы.
2. Какие задачи искусственный интеллект решает в магазине?
Искусственный интеллект в ритейле помогает контролировать полки и ценники, рекомендовать товары, прогнозировать спрос, управлять запасами, отвечать клиентам, искать документы и анализировать операции. Тип модели выбирают под задачу.
3. Когда локальный ИИ выгоднее облачного?
При стабильной высокой нагрузке локальный запуск может быть дешевле. Сравнивают полный TCO за одинаковый срок при сопоставимом SLA и качестве ответов. Требования к данным, автономности и задержке тоже влияют на выбор.
4. Требуется ли для ИИ в ритейле GPU-сервер?
Не всегда. Для пилота RAG может хватить рабочей станции, для табличного ML — CPU. Потребность в сервере с GPU определяют по числу одновременных запросов, видеопотокам, моделям и SLA промышленного сервиса.
5. Сколько VRAM нужно для локальной LLM?
При размещении модели на GPU учитывают веса, KV-кэш, рабочие буферы движка и запас. Квантизация весов не уменьшает KV-кэш автоматически. Его объём зависит от формата хранения, длины контекста и числа одновременных запросов.
6. Сколько камер может обрабатывать один GPU-сервер?
Универсального числа нет. Результат зависит от модели, разрешения, inference FPS, кодека, декодирования, tracker, OCR и SLA. На одном GPU производительность разных пайплайнов может различаться в разы.
7. Требует ли 152-ФЗ собственного сервера?
Нет. 152-ФЗ устанавливает правила обработки и локализации персональных данных, но не требует собственного сервера. Подходящее российское облако тоже позволяет выполнить эти требования при корректном размещении и настройке системы.
8. Как рассчитать конфигурацию для торговой сети?
Нужны число пользователей или камер, модель, контекст, concurrency, битрейт, inference FPS, этапы пайплайна, срок хранения и SLA. По результатам нагрузочного теста определяют необходимые ресурсы и резерв.

Подберём оборудование для ИИ в вашей сети

Расскажите, какую задачу хотите решить: помочь сотрудникам быстрее находить ответы, консультировать покупателей или контролировать полки. Для первого обсуждения достаточно описать сценарий, масштаб сети и ожидаемую нагрузку. Если пилот уже запущен, его результаты помогут точнее подобрать оборудование.

В DigitalRazor подберём рабочую станцию или GPU-сервер для ИИ с учётом выбранных моделей, требований к скорости и планов расширения. Проверим совместимость компонентов, предусмотрим необходимый объём памяти и учтём возможности вашей сети, хранилища и площадки.

Так будет проще понять, сколько стоит оборудование для старта, какой запас мощности нужен сейчас и как расширять систему по мере роста нагрузки. Оставьте заявку — обсудим вашу задачу и предложим подходящую конфигурацию.

Rackstation AI
Для каких задач Компактный GPU-сервер до 2 видеокарт для начальных задач в AI и графике. Оптимален для инференса, визуализации, VFX и рендеринга в студиях и лабораториях, где важна гибкость.
Подробнее
Видеокарты
RTX / RTX PRO / H200 NVL
Объем видеопамяти до 282 ГБ
Процессоры
Threadripper PRO
Количество ядер до 96
RAM до 1024 ГБ DDR5
Форм-фактор 4.5U
Devbox AI
Для каких задач Универсальная платформа на 4–6 GPU для локального обучения моделей и генеративных задач. Подходит для команд, которым важна надёжность сервера и свобода выбора графики — от RTX 5090 до PRO RTX 6000.
Подробнее
Видеокарты
RTX / RTX PRO / H200 NVL
Объем видеопамяти до 576 ГБ
Процессоры
Threadripper PRO
Количество ядер до 96
RAM до 1024 ГБ DDR5
Форм-фактор 6.5U
Scale
Для каких задач Сервер промышленного уровня на 8 GPU с кластерной архитектурой. Предназначен для дата-центров и AI-ферм, где требуется масштабируемость и полная загрузка ресурсов под обучение LLM и R&D.
Подробнее
Видеокарты
RTX PRO 6000 / RTX 5090
Объем видеопамяти до 768 ГБ
Процессоры
AMD Epyc, Intel Xeon
Количество ядер до 320
RAM до 3072 ГБ DDR5
Форм-фактор 6U
HPC 4000
Для каких задач Серия серверов для кластеризации на 4 GPU. Предназначены для дата-центров и AI-ферм, где требуется повышенная плотность для обучение LLM и R&D.
Подробнее
Видеокарты
L40s / RTX PRO / H200 NVL
Объем видеопамяти до 564 ГБ
Процессоры
AMD EPYC, Intel Xeon
Количество ядер до 128
RAM до 1536 ГБ DDR5
Форм-фактор 2U
HPC 8000
Для каких задач Серия серверов для кластеризации на 8 GPU. Предназначены для дата-центров и AI-ферм, где требуется повышенная плотность для обучение LLM и R&D.
Подробнее
Видеокарты
L40s / RTX PRO / H200 NVL
Объем видеопамяти до 1128 ГБ
Процессоры
AMD EPYC, Intel Xeon
Количество ядер до 256
RAM до 2048 ГБ DDR5
Форм-фактор 4U
HGX H200
Для каких задач HGX объединяет 8 видеокарт NVIDIA H200, достигая экстремальной плотности производительности. Благодаря внутренней связности NVSwitch мгновенно интегрируется в масштабные вычислительные кластеры.
Подробнее
Видеокарты
NVIDIA H200 SXM
Объем видеопамяти до 1128 ГБ
Процессоры
AMD EPYC, Intel Xeon
Количество ядер до 256
RAM до 2048 ГБ DDR5
Форм-фактор 5U
Подберём сервер под вашу задачу

Подберём конфигурацию сервера и отправим предложение.

Смотреть серверы
или свяжитесь с нами
Telegram Telegram WhatsApp WhatsApp ВКонтакте ВКонтакте MAX MAX
1.3К

Так же будет интересно почитать

Выбираем компьютер для работы в Blender
Олег Олегович Олег Олегович
Статьи
Выбираем компьютер для работы в Blender

Blender полюбился многим за стабильное развитие и техническую поддержку. Спектр возможностей у приложения широкий: от визуализации до монтажа и рендеринга. Поэтому выбор оптимального компьютера вызывает вопросы. В продолжении цикла статей разберем системные требования и ответим, какую графическую станцию выбрать для комфортной работы.

4 мин
75.2К
Процессоры AMD Ryzen X3D в рабочих задачах
Олег Олегович Олег Олегович
Статьи
Процессоры AMD Ryzen X3D в рабочих задачах

В этом материале расскажем, почему постулат «Ryzen X3D предназначены только для игр» можно считать устаревшим. Почему Ryzen 9900X3D и 9950X3D — не просто какие-то странные процессоры, а очень любопытное гибридное решение. Вариант для тех, кто использует компьютер не только для игр, но и для работы.

9 мин
69.3К

Сайт использует cookies
Узнать подробнее