8 800 500-99-26 Для звонков по России
MiniMax H3: открытая модель видео — и вопрос числа GPU
Софт
2 мин

MiniMax H3: открытая модель видео — и вопрос числа GPU

DigitalRazor
DigitalRazor
Подписаться в Telegram
Содержание 4 раздела
Краткое содержание Модель, которая понимает всё сразу От одной RTX 4090 до кластера на четыре GPU Слабое место: разреженное внимание пока не завезли
Подберём сервер под вашу задачу

Подберём конфигурацию сервера и отправим предложение.

Смотреть серверы
или свяжитесь с нами
Telegram Telegram WhatsApp WhatsApp ВКонтакте ВКонтакте MAX MAX

Подберём сервер под задачи

Ответьте на несколько вопросов — подготовим предложение

Китайская MiniMax открыла веса H3 — модели, которая по тексту, картинке или видео генерирует ролики до 15 секунд в разрешении 2K со встроенным стереозвуком. Само видео впечатляет, но у инфраструктурного отдела вопрос другой: сколько GPU реально нужно, чтобы это запустить — от одной десктопной карты до полноценного инференс-сервера.

Краткое содержание

  • 33 млрд параметров, архитектура H3-Omni-Transformer, около 13 млрд — в блоках AdaLN, которые можно закэшировать при инференсе;
  • видео до 15 секунд в 2K, 24 кадра в секунду, встроенный стереозвук 32 кГц;
  • минимальный порог входа — около 21 ГБ видеопамяти, то есть одна RTX 4090;
  • для промышленного развёртывания в 2K MiniMax официально рекомендует четыре GPU через SGLang.

Модель, которая понимает всё сразу

H3 — не отдельная видеомодель, а единый трансформер. Он принимает текст, изображения, видео и аудио на входе и выдаёт видео на выходе, используя одни и те же слои внимания и полносвязные блоки для всех модальностей. MiniMax называет такой подход Omni-Transformer. Токенизатор H3-VAE сжимает последовательность в четыре раза эффективнее прежних схем — отсюда и приемлемая скорость генерации при 33 миллиардах параметров.

  • поддержка входа: текст, до 9 референсных изображений, 3 видеоклипа, 3 аудиофрагмента;
  • вывод: 4–15 секунд, до 2K, соотношения сторон 16:9, 1:1, 3:4, 9:16;
  • 11 поддерживаемых языков, включая русский.

От одной RTX 4090 до кластера на четыре GPU

Именно здесь модель интересна закупщику железа больше, чем маркетологу. MiniMax указывает минимальный порог развёртывания — около 21 ГБ видеопамяти. Хватает одной потребительской RTX 4090, так что разработчик или небольшая студия опробуют модель на обычной рабочей станции. А вот карточка модели на Hugging Face для полноценного продакшена рекомендует уже четыре GPU: параллелизм Ulysses через SGLang, вычисления в BF16. Из альтернативных фреймворков называют vLLM, Diffusers и ComfyUI. «Одна карта для теста» и «четыре карты для продакшена» — разные бюджеты, и это стоит закладывать сразу.

Слабое место: разреженное внимание пока не завезли

В карточке модели прямо написано: сейчас доступна только полная схема внимания, разреженную обещают добавить позже. На практике это означает более высокую вычислительную нагрузку, чем могла бы быть при разреженном внимании, — отсюда и рекомендация сразу закладывать четыре GPU, а не рассчитывать на одну карту под серьёзным потоком запросов. Есть и лицензионный нюанс: веса распространяются по MiniMax H3 Community License Agreement с обязательной модерацией контента — это стоит учесть при встраивании модели в свой сервис.

Мнение DigitalRazor

Открытые веса H3 — хороший повод протестировать сценарий на своей RTX 4090 или RTX 6000, не платя за API. Но если задача — стабильный сервис генерации видео для бизнеса, сразу считайте конфигурацию на четыре GPU с достаточной памятью и охлаждением: официальные рекомендации MiniMax не оставляют простора для экономии на железе.

Для каких задач Компактный GPU-сервер до 2 видеокарт для начальных задач в AI и графике. Оптимален для инференса, визуализации, VFX и рендеринга в студиях и лабораториях, где важна гибкость.
Подробнее
Видеокарты
RTX / RTX PRO / H200 NVL
Объем видеопамяти до 282 ГБ
Процессоры
Threadripper PRO
Количество ядер до 96
RAM до 1024 ГБ DDR5
Форм-фактор 4.5U
Для каких задач Универсальная платформа на 4–6 GPU для локального обучения моделей и генеративных задач. Подходит для команд, которым важна надёжность сервера и свобода выбора графики — от RTX 5090 до PRO RTX 6000.
Подробнее
Видеокарты
RTX / RTX PRO / H200 NVL
Объем видеопамяти до 576 ГБ
Процессоры
Threadripper PRO
Количество ядер до 96
RAM до 1024 ГБ DDR5
Форм-фактор 6.5U
Для каких задач Сервер промышленного уровня на 8 GPU с кластерной архитектурой. Предназначен для дата-центров и AI-ферм, где требуется масштабируемость и полная загрузка ресурсов под обучение LLM и R&D.
Подробнее
Видеокарты
RTX PRO 6000 / RTX 5090
Объем видеопамяти до 768 ГБ
Процессоры
AMD Epyc, Intel Xeon
Количество ядер до 320
RAM до 3072 ГБ DDR5
Форм-фактор 6U
Для каких задач Серия серверов для кластеризации на 4 GPU. Предназначены для дата-центров и AI-ферм, где требуется повышенная плотность для обучение LLM и R&D.
Подробнее
Видеокарты
L40s / RTX PRO / H200 NVL
Объем видеопамяти до 564 ГБ
Процессоры
AMD EPYC, Intel Xeon
Количество ядер до 128
RAM до 1536 ГБ DDR5
Форм-фактор 2U
Для каких задач Серия серверов для кластеризации на 8 GPU. Предназначены для дата-центров и AI-ферм, где требуется повышенная плотность для обучение LLM и R&D.
Подробнее
Видеокарты
L40s / RTX PRO / H200 NVL
Объем видеопамяти до 1128 ГБ
Процессоры
AMD EPYC, Intel Xeon
Количество ядер до 256
RAM до 2048 ГБ DDR5
Форм-фактор 4U
Для каких задач HGX объединяет 8 видеокарт NVIDIA H200, достигая экстремальной плотности производительности. Благодаря внутренней связности NVSwitch мгновенно интегрируется в масштабные вычислительные кластеры.
Подробнее
Видеокарты
NVIDIA H200 SXM
Объем видеопамяти до 1128 ГБ
Процессоры
AMD EPYC, Intel Xeon
Количество ядер до 256
RAM до 2048 ГБ DDR5
Форм-фактор 5U
Подберём сервер под вашу задачу

Подберём конфигурацию сервера и отправим предложение.

Смотреть серверы
или свяжитесь с нами
Telegram Telegram WhatsApp WhatsApp ВКонтакте ВКонтакте MAX MAX
9.8К

Так же будет интересно почитать

Сайт использует cookies
Узнать подробнее