
ИИ-ассистент для ритейла на своём сервере
Подберём сервер под задачи
Ответьте на несколько вопросов — подготовим предложение
Искусственный интеллект в ритейле уже можно оценивать по влиянию на продажи. Askona, производитель и продавец товаров для сна и дома, проверила эффект ИИ-консультанта в приложении с помощью A/B-теста — сравнения двух вариантов сервиса. По данным компании, с 26 февраля по 13 марта 2026 года конверсия в покупку, то есть доля пользователей, совершивших покупку, выросла на 9,8%, а выручка — на 18,4%. Конечно, это результат одного проекта: в другой сети эффект будет зависеть от ассортимента, интерфейса и аудитории.
Разберём, где ИИ в ритейле приносит измеримую пользу, когда локальный запуск оправдан и как рассчитать инфраструктуру до покупки оборудования.
Короткий ответ: когда ритейлу нужен локальный ИИ
Локальный контур — запуск модели и связанных сервисов на инфраструктуре компании — стоит рассматривать при постоянной высокой нагрузке. Её могут создавать многочисленные одновременные запросы пользователей или видеопотоки с камер. Ещё один повод — большие расходы на API, через который приложения обращаются к облачной модели, при стабильном потоке запросов.
Другие причины — ограничения на передачу чувствительных данных, требования к малой задержке и работе при сбоях внешнего канала. Чтобы сервис продолжал работать без внешней связи, модель, нужные данные и критичные сервисы должны быть доступны внутри локального контура.
Для небольшого пилота или нерегулярной нагрузки облако может быть проще и дешевле, особенно если задача не связана с чувствительными данными. Российское облако тоже позволяет выполнять требования локализации персональных данных (ПДн) при подходящем размещении и настройке системы. Такую инфраструктуру предоставляет, например, облачная платформа Yandex Cloud.
Выбор начинается с требований к данным, профиля нагрузки, SLA — согласованного уровня доступности и качества сервиса — и сравнения полной стоимости вариантов, включая эксплуатацию и поддержку.
Что ритейл получает от ИИ
Искусственный интеллект в ритейле полезен там, где результат можно измерить: по конверсии, наличию товара, списаниям, времени ответа или числу ручных операций. Большие языковые модели (LLM) работают с текстом, классическое машинное обучение (ML) — например, с прогнозами по данным о продажах, а компьютерное зрение (CV) — с изображениями и видео. Эти задачи создают разную нагрузку на оборудование.
Персонализация рекомендаций и клиентский опыт
Персонализация рекомендаций опирается на историю покупок, каталог и контекст запроса. Эти данные помогают формировать рекомендации товаров и персональные предложения, выбирать next best offer — следующее наиболее подходящее предложение для клиента.
В пилоте результат сравнивают с контрольной группой. Основные метрики — CTR, то есть доля кликов от числа показов рекомендаций, конверсия, средний чек и дополнительная выручка.
Прогнозирование спроса и управление запасами
Прогноз помогает планировать закупки и остатки, сокращать случаи отсутствия товара — out-of-stock (OOS), снижать списания и управлять оборотным капиталом. Кассовые системы POS дают данные о продажах, системы управления ресурсами предприятия ERP и складом WMS — об остатках и поставках. Модель оценивает будущий спрос, а бизнес-правила превращают прогноз в заказ с учётом сроков поставки, размера партии и страхового запаса.
В мае 2026 года разработчик систем планирования RELEX сообщил о результатах исландской продуктовой сети Krónan. После внедрения прогнозирования и пополнения запасов в распределительных центрах оборачиваемость за октябрь 2024 — сентябрь 2025 года выросла на 7,5% относительно предыдущего года. Время, которое сотрудник тратил на заказы и планирование, сократилось более чем наполовину. Это данные поставщика о результате внедрения системы и изменения процессов, а не об эффекте одной модели.
В собственном пилоте стоит измерять ошибку прогноза, OOS, списания, оборачиваемость и страховой запас.
Компьютерное зрение: полки, инвентаризация и предотвращение потерь
Видеораспознавание товаров на полке и контроль выкладки товара помогают находить пустые места и нарушения размещения. Компьютерное зрение также используют для проверки ценников, анализа очередей и кассовых зон. Предотвращение краж — отдельный сценарий: подозрительное событие требует проверки, а срабатывание системы само по себе не доказывает кражу.
В 2026 году сеть магазинов Fix Price запустила в 500 точках пилот OSA-сервиса для контроля наличия товаров на полках и актуальности ценников. OSA, или on-shelf availability, обозначает доступность товара на полке для покупателя. По данным компании, в отдельных магазинах прирост оборота достигал 2%. Периоды расчёта подбирали с учётом цикла оборачиваемости товаров. Сервис помогал выявлять недостаток товара, отсутствие или ошибки ценников и расхождения между учётными и фактическими остатками.
Видеоаналитика может включать обнаружение объектов, распознавание текста и отслеживание объектов и классификацию. При выборе оборудования считают весь пайплайн: приём и декодирование потока, подготовку кадров и работу моделей. Поэтому число GPU зависит от разрешения, частоты обработки кадров и состава пайплайна, а не только от количества камер.
Чат-боты, голосовые и корпоративные ассистенты
Чат-бот поддержки клиентов отвечает на вопросы о товарах, заказах и доставке. Голосовой ассистент добавляет распознавание речи ASR и синтез речи TTS. Корпоративный ассистент работает с регламентами и базой знаний, часто через RAG: система находит нужные фрагменты документов и передаёт их LLM вместе с вопросом.
RAG не гарантирует правильный ответ: качество зависит от актуальности индекса, эмбеддингов, разбиение документов на фрагменты и повторное ранжирование. Векторная база данных помогает искать фрагменты по смыслу, но не заменяет проверку прав доступа. Документы, недоступные сотруднику, не должны попадать в контекст LLM.
Fix Price описывала ИИ-сервис для проверки договоров аренды: раньше ручная проверка занимала около часа, а ИИ анализировал договор и формировал отчёт за несколько минут. Решение по договору оставалось за специалистом. По данным компании, полное время проверки сократилось как минимум вдвое. Кейс Fix Price.
В пилоте стоит измерять полное время обработки с учётом проверки человеком, число ошибок и долю эскалаций — случаев, которые требуют передачи вопроса ответственному специалисту.
Динамическое ценообразование
Динамическое ценообразование учитывает спрос, остатки, срок годности, сезонность, цены конкурентов и маржу. Здесь искусственный интеллект в ритейле не обязательно означает LLM или GPU: табличные модели и алгоритмы оптимизации часто работают на центральном процессоре (CPU). Метрики — маржинальная прибыль, доля проданного товарного запаса, то есть доля проданного товарного запаса за выбранный период, и списания.
| Задача | Что измеряем | Технология | Вычислительный профиль |
|---|---|---|---|
| Рекомендации | CTR, конверсия, средний чек | Рекомендательные модели, LLM + RAG для диалога | CPU или GPU в зависимости от модели и потока запросов |
| Спрос и запасы | Ошибка прогноза, OOS, списания | Табличный ML, оптимизация | Часто CPU. Важны объём данных и время расчёта |
| Полки и ценники | OSA, ошибки ценников, ручные проверки | Detection + OCR, tracking для видео | На месте, рядом с камерами (edge), или в центре. Нагрузка зависит от потока кадров и моделей |
| Потери | Подтверждённые инциденты, пропуски, ложные срабатывания | CV + правила | Edge или центр. Нагрузка зависит от числа потоков и моделей |
| Корпоративный поиск | Время ответа, доля решённых запросов | RAG + LLM | Память под модель и контекст, число одновременных запросов |
| Голос | Задержка ответа, доля автоматизированных обращений | ASR + LLM + TTS | Число одновременных диалогов и требования SLA |
Задачи ИИ в ритейле: бизнес-метрики, технологии и вычислительный профиль
Почему ритейлу может быть выгоден локальный ИИ
Размещение на собственной инфраструктуре (on-premise) даёт больше контроля над данными и работой сервиса. Польза зависит от ограничений и нагрузки конкретной сети.
Данные, закрытый контур и 152-ФЗ
Федеральный закон № 152-ФЗ «О персональных данных» не требует собственного физического сервера. Часть 5 статьи 18 запрещает при сборе ПДн граждан РФ использовать зарубежные базы для записи, систематизации, накопления, хранения, уточнения и извлечения этих данных, кроме прямо предусмотренных законом исключений. Требование можно выполнить как на собственной инфраструктуре, так и в подходящем российском облаке. Статья 18.
Трансграничную передачу регулирует статья 12. До её начала оператор — компания, организующая обработку ПДн, — направляет отдельное уведомление Роскомнадзору, надзорному органу в этой сфере. Одного уведомления недостаточно: необходимо выполнить остальные требования статьи и учитывать возможные ограничения или запрет передачи. Статья 12.
Статья 11 регулирует обработку биометрических ПДн. Не любое видео с лицом относится к биометрии: важно, использует ли оператор физиологические или биологические признаки для установления личности. При этом видео может оставаться персональными данными и без биометрической идентификации. Статья 11.
Закрытый контур позволяет компании самой определять маршруты данных, права доступа, сроки хранения журналов событий — логов — и интеграции с бизнес-системами. Среди них CRM для управления отношениями с клиентами, а также ERP, WMS и POS. Но локальная нейросеть не становится безопасной автоматически: нужны разделение сети на изолированные сегменты, обновления, резервное копирование и контроль доступа.
Задержка и работа в реальном времени
В видеоаналитике время уходит не только на выполнение модели — инференс. Его занимают передача потока по сети, декодирование, подготовка кадров, обработка результатов и запуск действия по бизнес-правилу.
У LLM другая цепочка. При использовании RAG она включает поиск фрагментов (retrieval), затем обработку входного контекста моделью (prefill) и генерацию ответа. Быстрый инференс сам по себе не гарантирует быстрой реакции всего сервиса.
Поэтому задержку в реальном времени измеряют end-to-end — от события или запроса до нужного результата. Помимо типичного времени полезно отслеживать p50, p95 и p99: значения, в которые укладываются соответственно 50%, 95% и 99% измерений. Так видны и обычная скорость, и редкие долгие ответы.
Периферийный ИИ, или периферийный инференс рядом с источником данных, сокращает сетевой путь. Это полезно, когда реакция нужна прямо в магазине или ограничена пропускная способность WAN — внешней сети, связывающей магазин с удалённой инфраструктурой. Для ночного прогноза спроса важнее завершить расчёт к началу закупок, чем сэкономить миллисекунды.
Стоимость при постоянной высокой нагрузке
Облачный API обычно оплачивается по токенам или запросам, аренда GPU — по времени использования. Локальный запуск требует капитальных затрат на оборудование и добавляет эксплуатационные расходы. Сравнивать варианты нужно по полной стоимости владения (TCO) за одинаковый период и при сопоставимом SLA.
Контроль инфраструктуры и независимость от внешних API
Собственный контур позволяет зафиксировать версии модели и движка инференса — ПО, которое выполняет модель, — задать свои лимиты и контролировать логи. Локальные сервисы могут работать без внешнего интернет-канала, если все критичные зависимости доступны внутри контура.
Компания при этом отвечает за обновления, безопасность, мониторинг, планирование вычислительных мощностей и восстановление после сбоев. Перед обновлением модели или движка нужно проверять совместимость и регрессии — ухудшение качества или производительности на рабочих задачах.
Когда облако или гибридная схема лучше
Облако удобнее для пилота, нерегулярных запросов и резких пиков, если у провайдера доступны нужные ресурсы и квоты. Готовый API снижает требования к опыту команды в эксплуатации GPU. Аренда облачного сервера с GPU всё ещё требует настройки и сопровождения ПО.
В гибридной схеме чувствительные данные и связанные с ними вычисления остаются локально. В облако можно вынести пиковую нагрузку, для которой разрешена передача данных и заранее подготовлены интеграции.
| Критерий | On-premise | Облако | Что важно ритейлу |
|---|---|---|---|
| Капитальные затраты | Покупка оборудования и подготовка площадки | Обычно ниже, без покупки серверов | Бюджет старта |
| Расходы | Покупка, эксплуатация и резерв | Оплата использования или выделенных ресурсов | Загрузка и условия тарифа |
| Задержка | Можно сократить сетевой путь | Зависит от канала, региона и очередей сервиса | Полная задержка и SLA |
| Данные | Компания управляет маршрутами и хранением | Контроль разделён с провайдером | Где данные хранятся и обрабатываются |
| Масштабирование | В пределах резерва, затем закупка | В пределах квот и доступных мощностей | Пики и темп роста |
| Эксплуатация | На компании или её подрядчике | Провайдер обслуживает платформу, ответственность за ПО зависит от услуги | Компетенции команды |
| Интернет | Возможна автономность локальных сервисов | Нужен канал доступа к сервису, не обязательно публичный интернет | Устойчивость WAN |
| Модель | Версии модели и движка под контролем компании | В API — условия провайдера, на арендованных GPU — свой выбор | Регрессии и совместимость |
Сравнение локальной и облачной инфраструктуры для задач ритейла
Как устроен локальный ИИ в торговой сети
POS даёт данные о транзакциях, CRM — клиентский контекст, ERP и WMS — данные о закупках и остатках. Документы служат источниками для RAG, камеры — для видеоаналитики.
Центральный GPU-сервер или edge-узлы в магазинах
Центральная схема упрощает управление моделями и распределение нагрузки между ускорителями. Но передача видеопотоков из магазинов увеличивает нагрузку на WAN, а их запись — на центральное хранилище (storage).
Edge переносит инференс в магазин. Если передавать в центр только результаты обработки, трафика становится меньше. Обработка рядом с камерами также сокращает сетевую задержку, но множество распределённых узлов сложнее обновлять и обеспечивать резервом на случай отказа.
Один из вариантов гибридной схемы — выполнять detection и tracking рядом с камерами, а в центр передавать события и метаданные: время, место и параметры обнаруженного события. RAG и аналитика всей сети при этом работают централизованно. Полное видео можно хранить в магазине, а нужные фрагменты передавать по запросу, если это соответствует требованиям к архиву и доступу.
Выбор зависит от числа камер и параметров видеопотоков, пропускной способности канала, требований к хранению видео и SLA.
Модели для локального запуска
Локальную LLM выбирают по лицензии, качеству русского языка на корпоративных вопросах, длине контекста, требованиям к VRAM, поддержке квантизации и совместимости с движком инференса. На сентябрь 2026 года среди open-weight вариантов — Qwen3, Mistral Small 4 и gpt-oss.
LLM с открытыми весами для чат-ботов и RAG
Qwen3-32B содержит 32,8 млрд параметров и распространяется по Apache 2.0. Русский входит в заявленные 119 языков и диалектов. Контекст — 32 768 токенов, с YaRN — до 131 072. Длинный контекст нужно отдельно проверять на целевых документах и движке.
Mistral Small 4 — MoE-модель на 119 млрд параметров, из которых 6,5 млрд активны на токен. Контекст — 256K, лицензия — Apache 2.0. При 4–16 битах веса занимают грубо 60–238 ГБ без KV-кэша, runtime-буферов и запаса.
gpt-oss-20b и gpt-oss-120b поддерживают локальный запуск, распространяются по Apache 2.0 и имеют контекст 128K. OpenAI указывает преимущественно англоязычные данные предобучения, поэтому русский нужно проверять на корпоративном корпусе.
VRAM: почему параметров недостаточно
Базовая оценка памяти под веса в байтах — число параметров × битность / 8. Но для запуска в видеопамяти GPU, или VRAM, должны помещаться также KV-кэш, рабочие буферы движка (runtime) и запас. KV-кэш хранит промежуточные данные механизма внимания для уже обработанных токенов, чтобы не вычислять их заново при генерации.
Для одной последовательности KV-кэш в BF16 занимает около 8 ГиБ при 32 768 токенах и около 32 ГиБ при 131 072 токенах. При нескольких одновременно активных последовательностях общий объём KV-кэша растёт, поэтому параллельную нагрузку нужно учитывать отдельно.
Квантизация
Снижение точности представления параметров — уменьшает объём весов, но не сокращает KV-кэш автоматически. Его формат задаётся отдельно. Длинный контекст и число одновременных запросов, то есть число одновременно обрабатываемых запросов (concurrency), продолжают увеличивать потребность в памяти.
Модели компьютерного зрения
В системе анализа полок детектор находит объекты, классификатор или поиск по эмбеддингу изображения определяет товар, а OCR распознаёт текст. Для видео при необходимости добавляют трекер, который отслеживает объекты между кадрами. Бизнес-правила превращают результаты в событие или задачу сотруднику. Эта цепочка обработки называется пайплайном.
Скорость одного детектора в бенчмарке не равна скорости всего пайплайна. Важно различать входной FPS — число поступающих кадров в секунду — и inference FPS — число кадров, обрабатываемых моделями за секунду.
Влияет и batching — объединение кадров в пакеты. Он может повысить пропускную способность, но ожидание заполнения пакета добавляет задержку.
Как подобрать инфраструктуру
Серверы для видеоаналитики и нагруженного инференса
GPU-сервер нужен, когда сервис обслуживает много одновременных LLM-запросов, несколько моделей или большой поток камер и требует резерва по мощности. Конфигурацию выбирают по целевой нагрузке и подтверждают нагрузочным тестом. Варианты есть в разделе серверов DigitalRazor для ИИ, а критерии выбора подробнее разобраны в материале «Как выбрать сервер для ИИ».
Рабочие станции для локальных LLM и RAG
Для пилота, разработки и RAG небольшой команды подойдёт рабочая станция, если модель и нагрузка укладываются в её ресурсы. На ней можно проверить квантизацию, контекст и concurrency до закупки промышленной инфраструктуры. Примеры систем есть в разделе DigitalRazor для локальных LLM, а настройка пилота разобрана в гайде по LM Studio, API и RAG.
Как рассчитать сервер для LLM
Для расчёта нужны точная модель, формат данных (dtype) и квантизация, типичная и максимальная длина контекста, длина ответа и число одновременных запросов. Целевые показатели — TTFT, время до первого токена ответа, и tokens/s, скорость генерации в токенах в секунду. Для tokens/s отдельно задают скорость на запрос и суммарную пропускную способность сервиса.
Если на том же узле работают модели эмбеддингов, reranker, ASR или TTS, их потребление памяти и вычислительных ресурсов включают в расчёт.
Порядок проверки:
- Проверить, хватает ли памяти под веса, KV-кэш и рабочие буферы с запасом.
- Измерить задержку одного запроса (single-request latency).
- Воспроизвести целевую concurrency с реальными длинами запросов и ответов.
- Проверить TTFT, tokens/s и задержки p95/p99.
- Определить число реплик — параллельно работающих экземпляров сервиса — и резерв на случай отказа или обслуживания узла.
Выберите GPU-сервер для нейросетей
Готовые решения для работы с большими массивами данных
Как рассчитать сервер для видеоаналитики
Нужны число камер, разрешение, кодек, битрейт, входная частота кадров и частота обработки кадров. Также учитывают число моделей, tracking, OCR, срок хранения видео, расположение узлов и SLA.
Для 100 камер с разрешением 1080p и средним битрейтом 4 Мбит/с суммарный видеопоток составляет около 400 Мбит/с. При передаче всего видео в центр такую нагрузку получает центральный канал. Непрерывный архив за 30 суток займёт примерно 129,6 ТБ. Это объём самого видео, без служебных данных, дисковой избыточности и запаса свободного места. Для сети также нужен запас на колебания битрейта и служебный трафик.
При анализе 10 кадров/с с каждой камеры системе нужно обрабатывать суммарно 1000 кадров/с. Но необходимое число GPU зависит от пайплайна.
В тестах DeepStream 9.1 — платформы видеоаналитики производителя GPU NVIDIA — ускоритель RTX PRO 6000 Blackwell Server Edition показывает:
- 946 FPS для детектора RT-DETR с входом 640 × 640 пикселей и трекером NvDCF;
- 159 FPS для детектора Grounding-DINO с входом 544 × 960 пикселей без трекера.
Оба теста используют 16-битную точность FP16 и TensorRT — движок оптимизации и выполнения моделей NVIDIA. Источник — тестовое видео 1080p H.265. Измерения включают декодирование и обработку до получения метаданных, но вывод изображения отключён.
Эти цифры показывают зависимость производительности от модели, разрешения и трекинга. Они не сравнивают качество распознавания и не заменяют тест на видео из магазинов с нужными OCR, правилами обработки и запасом мощности.
| Сценарий | Что нужно знать | Главные ограничения | Что проверять первым |
|---|---|---|---|
| RAG небольшой команды | Модель, контекст, concurrency, TTFT | VRAM и задержка | Помещается ли нагрузка пилота на рабочей станции или сервере с одной GPU |
| RAG общего сервиса | Concurrency, tokens/s, кэш, требования к высокой доступности (HA) | Пропускная способность и VRAM | Производительность сервера, число GPU и реплик под нагрузкой |
| Видео одного магазина | Битрейт, inference FPS, detector/OCR/tracker, WAN | Декодирование и суммарный FPS | Edge или центр с учётом канала, задержки и пайплайна |
| Видео торговой сети | Модели, SLA, срок хранения, WAN | GPU, сеть и хранилище | Центральная схема или edge + центр, затем число GPU по тесту |
| Голос | ASR + LLM + TTS, concurrency | Задержка end-to-end | Полная задержка диалога при размещении в центре или на edge |
Что учитывать при расчёте инфраструктуры для разных ИИ-сценариев
Для локального архива отдельно проектируют систему хранения данных: её объём и пропускная способность могут ограничить систему наряду с GPU.
Как сравнить стоимость своего ИИ-сервера и облака
Универсального срока нет. При умеренной нагрузке ИИ-ассистент для ритейла может обходиться дешевле через API, а при стабильной высокой загрузке — на собственной инфраструктуре. Сравнение корректно только при сопоставимом качестве ответов, SLA и полном TCO за одинаковый период.
Что входит в TCO
Для локального запуска учитывают серверы, диски, сеть, внедрение, электричество, охлаждение, размещение, обслуживание, резервные мощности, лицензии и резервное копирование. Упрощённая оценка среднемесячных затрат:
(CapEx − ожидаемая стоимость оборудования в конце срока) / срок эксплуатации в месяцах + ежемесячные эксплуатационные расходы.
Эта формула распределяет затраты на оборудование по сроку службы. Она не показывает срок возврата первоначальных вложений.
В облаке считают оплату токенов через API или аренду GPU по часам, работу моделей эмбеддингов и reranker, управляемый поисковый сервис (managed search), хранение данных (storage), операции и исходящий трафик. Также учитывают внедрение, поддержку и оплату резервируемых ресурсов, если они нужны для пиков или отказоустойчивости.
Сценарий 1 — корпоративный RAG-ассистент
Возьмём 1000 сотрудников, каждый из которых отправляет 10 запросов в день в течение 22 рабочих дней. Средний запрос содержит 2500 входных токенов, включая инструкции, историю диалога и найденные документы. На ответ приходится 350 оплачиваемых выходных токенов. Получаем 220 000 запросов, 550 млн входных и 77 млн выходных токенов в месяц.
На 8 сентября 2026 года в Yandex AI Studio — облачном сервисе работы с ИИ-моделями — синхронные запросы к языковой модели DeepSeek V4 Flash стоят 0,3 рубля за 1000 входных токенов и 0,5 рубля за 1000 выходных. Цены включают НДС. Тарифы Yandex AI Studio.
При этих ставках обработка запросов обойдётся примерно в 203 500 рублей в месяц. Расчёт не учитывает скидку на кэшированные входные токены, создание эмбеддингов, retrieval, reranker, сеть и поддержку. Если модель генерирует дополнительно оплачиваемые токены рассуждений, они тоже должны входить в принятый объём ответа.
| Нагрузка | Запросов в месяц | Только токены, с НДС |
|---|---|---|
| 0,1× | 22 000 | ≈20 350 рублей |
| 1× | 220 000 | ≈203 500 рублей |
| 10× | 2,2 млн | ≈2,035 млн рублей |
Расходы на токены RAG-ассистента при разной нагрузке по тарифу DeepSeek V4 Flash на 8 сентября 2026 года
Таблица показывает рост расходов при неизменных длинах запросов, ответов и тарифах. Для расчёта окупаемости нужны стоимость локальной конфигурации, энергопотребление, обслуживание и резерв. Нагрузочный тест должен подтвердить нужную производительность той же модели или альтернативы с сопоставимым качеством ответов.
Сценарий 2 — видеоаналитика торговой сети
Для тех же 100 камер по 4 Мбит/с непрерывный архив за 30 дней занимает около 129,6 ТБ, или 120 699 ГиБ.
Для примера возьмём ставку 2,376 рубля за ГиБ в месяц с НДС, приведённую в документации Yandex Object Storage — облачного объектного хранилища — для класса Standard. Получаем примерно 287 тысяч рублей в месяц только за хранение. Это расчётное допущение, перед закупкой его нужно сверить с действующим прайс-листом.
Такая сумма соответствует заполненному 30-дневному архиву, объём которого сохраняется в течение всего расчётного месяца. В первый месяц, пока архив накапливается с нуля, средний занятый объём и плата за хранение будут ниже. Операции и исходящий интернет-трафик сверх бесплатных лимитов оплачиваются отдельно. Вычисления для видеоаналитики в эту сумму не входят.
Edge-обработка позволяет хранить исходное видео в магазине, а в центр отправлять события и метаданные. Это снижает нагрузку на WAN и потребность в центральном хранилище, если полный архив не требуется именно в центре. Локальные диски, их резервирование и обслуживание при этом остаются частью TCO.
Как начать внедрение локального ИИ
Внедрение локального ИИ лучше начинать с одной бизнес-задачи:
- Выбрать метрику и зафиксировать исходное значение.
- Подготовить данные и настроить права доступа.
- Запустить пилот в облаке, на рабочей станции или edge-узле с учётом ограничений на передачу данных.
- Измерить бизнес-эффект, проверить качество работы и задержки p95/p99 под целевой нагрузкой.
- Рассчитать промышленную конфигурацию, резерв и TCO.
Размер модели и число камер — только часть исходных данных. Конфигурация зависит также от контекста, concurrency, параметров видеопотоков, SLA и требований к доступности.
Нужна помощь с выбором сервера?
Специалисты помогут подобрать оборудование под нагрузку, бюджет и задачи
Часто задаваемые вопросы
Подберём оборудование для ИИ в вашей сети
Расскажите, какую задачу хотите решить: помочь сотрудникам быстрее находить ответы, консультировать покупателей или контролировать полки. Для первого обсуждения достаточно описать сценарий, масштаб сети и ожидаемую нагрузку. Если пилот уже запущен, его результаты помогут точнее подобрать оборудование.
В DigitalRazor подберём рабочую станцию или GPU-сервер для ИИ с учётом выбранных моделей, требований к скорости и планов расширения. Проверим совместимость компонентов, предусмотрим необходимый объём памяти и учтём возможности вашей сети, хранилища и площадки.
Так будет проще понять, сколько стоит оборудование для старта, какой запас мощности нужен сейчас и как расширять систему по мере роста нагрузки. Оставьте заявку — обсудим вашу задачу и предложим подходящую конфигурацию.





















