
MiniMax H3: открытая модель видео — и вопрос числа GPU
Подберём сервер под задачи
Ответьте на несколько вопросов — подготовим предложение
Китайская MiniMax открыла веса H3 — модели, которая по тексту, картинке или видео генерирует ролики до 15 секунд в разрешении 2K со встроенным стереозвуком. Само видео впечатляет, но у инфраструктурного отдела вопрос другой: сколько GPU реально нужно, чтобы это запустить — от одной десктопной карты до полноценного инференс-сервера.
Краткое содержание
- 33 млрд параметров, архитектура H3-Omni-Transformer, около 13 млрд — в блоках AdaLN, которые можно закэшировать при инференсе;
- видео до 15 секунд в 2K, 24 кадра в секунду, встроенный стереозвук 32 кГц;
- минимальный порог входа — около 21 ГБ видеопамяти, то есть одна RTX 4090;
- для промышленного развёртывания в 2K MiniMax официально рекомендует четыре GPU через SGLang.
Модель, которая понимает всё сразу
H3 — не отдельная видеомодель, а единый трансформер. Он принимает текст, изображения, видео и аудио на входе и выдаёт видео на выходе, используя одни и те же слои внимания и полносвязные блоки для всех модальностей. MiniMax называет такой подход Omni-Transformer. Токенизатор H3-VAE сжимает последовательность в четыре раза эффективнее прежних схем — отсюда и приемлемая скорость генерации при 33 миллиардах параметров.
- поддержка входа: текст, до 9 референсных изображений, 3 видеоклипа, 3 аудиофрагмента;
- вывод: 4–15 секунд, до 2K, соотношения сторон 16:9, 1:1, 3:4, 9:16;
- 11 поддерживаемых языков, включая русский.
От одной RTX 4090 до кластера на четыре GPU
Именно здесь модель интересна закупщику железа больше, чем маркетологу. MiniMax указывает минимальный порог развёртывания — около 21 ГБ видеопамяти. Хватает одной потребительской RTX 4090, так что разработчик или небольшая студия опробуют модель на обычной рабочей станции. А вот карточка модели на Hugging Face для полноценного продакшена рекомендует уже четыре GPU: параллелизм Ulysses через SGLang, вычисления в BF16. Из альтернативных фреймворков называют vLLM, Diffusers и ComfyUI. «Одна карта для теста» и «четыре карты для продакшена» — разные бюджеты, и это стоит закладывать сразу.
Слабое место: разреженное внимание пока не завезли
В карточке модели прямо написано: сейчас доступна только полная схема внимания, разреженную обещают добавить позже. На практике это означает более высокую вычислительную нагрузку, чем могла бы быть при разреженном внимании, — отсюда и рекомендация сразу закладывать четыре GPU, а не рассчитывать на одну карту под серьёзным потоком запросов. Есть и лицензионный нюанс: веса распространяются по MiniMax H3 Community License Agreement с обязательной модерацией контента — это стоит учесть при встраивании модели в свой сервис.
Мнение DigitalRazor
Открытые веса H3 — хороший повод протестировать сценарий на своей RTX 4090 или RTX 6000, не платя за API. Но если задача — стабильный сервис генерации видео для бизнеса, сразу считайте конфигурацию на четыре GPU с достаточной памятью и охлаждением: официальные рекомендации MiniMax не оставляют простора для экономии на железе.














