8 800 500-99-26 Для звонков по России
GLM-5.3-Flash: мультимодальный флагман дешевле GLM-5.2
Софт
3 мин

GLM-5.3-Flash: мультимодальный флагман дешевле GLM-5.2

DigitalRazor
DigitalRazor
Подписаться в Telegram
Содержание 4 раздела
Краткое содержание Мультимодальность без отдельного визуального модуля Сколько GPU нужно, чтобы поднять модель у себя Обучена на китайских чипах — при чём тут российский бизнес
Подберём сервер под вашу задачу

Подберём конфигурацию сервера и отправим предложение.

Смотреть серверы
или свяжитесь с нами
Telegram Telegram WhatsApp WhatsApp ВКонтакте ВКонтакте MAX MAX

Подберём сервер под задачи

Ответьте на несколько вопросов — подготовим предложение

Китайская Z.ai выпустила GLM-5.3-Flash — первую модель линейки, где текст и изображения обрабатываются в одном представлении без отдельного визуального модуля. Весит она 320 миллиардов параметров, но на каждый токен активирует лишь 18 миллиардов, а распространяется по лицензии MIT. Для компании, которая считает не токены, а серверы под инференс, вопрос один: сколько памяти и GPU реально нужно.

Краткое содержание

  • 320 млрд параметров всего, активны 18 млрд на токен — гибридная архитектура с разреженным и линейным вниманием;
  • нативная мультимодальность: текст и изображения без отдельного визуального адаптера;
  • контекст до 1 млн токенов, обучение на 30 трлн токенов, лицензия MIT;
  • вдвое легче предшественницы GLM-5.2 (753 млрд параметров), но обгоняет её в тестах при заметно меньшей стоимости инференса.
Результаты бенчмарка GLM-5.3-Flash

Мультимодальность без отдельного визуального модуля

У большинства открытых моделей картинки обрабатывает отдельный визуальный энкодер, который переводит изображение в токены для языковой части. Две сети вместо одной. GLM-5.3-Flash с самого начала обучена работать с текстом и изображениями в общем представлении — архитектура с гибридным разреженным и линейным вниманием, плюс Manifold-Constrained Hyper-Connections для устойчивого масштабирования при росте контекста. Разбор скриншотов, диаграмм, сканов документов не требует держать в памяти отдельную визуальную модель поверх языковой — расходы на инференс считаются по весу одной сети.

Сколько GPU нужно, чтобы поднять модель у себя

Официальных рекомендаций по железу Z.ai не публикует, но параметры известны. В формате FP8, который модель поддерживает нативно, контрольная точка весит около 320 Гбайт — по байту на параметр. Одной картой этого не поднять: даже связка из четырёх ускорителей NVIDIA H100 на 80 Гбайт даёт лишь 320 Гбайт впритык, без запаса под контекст и промежуточные вычисления. Реалистичный вариант — узел на четырёх NVIDIA H200 (141 Гбайт на карту, 564 Гбайт суммарно) либо шесть-восемь H100, если карты уже есть в парке. Для сравнения: DeepSeek V4 Pro, о котором мы писали ранее, весит в FP8 около 900 Гбайт — GLM-5.3-Flash легче почти втрое, хотя обе модели построены на смеси экспертов.

  • FP8 — нативный формат, около 320 Гбайт, нужен многокарточный сервер;
  • 4-битные сборки GGUF — заметно компактнее, но точных цифр разработчик не приводит;
  • крайние 1–2-битные кванты от Unsloth с выгрузкой в оперативную память — вариант для одной-двух карт, но с потерей качества.

Обучена на китайских чипах — при чём тут российский бизнес

В анонсе Z.ai отдельно подчёркивает: модель обучена и работает целиком на китайских ИИ-чипах, без ускорителей NVIDIA. На инференс у заказчика это не влияет — модель распространяется в стандартных форматах и запускается на SGLang, vLLM, TokenSpeed и KTransformers, то есть на любых GPU, которые поддерживают эти движки. Но сам факт показывает, что альтернативный стек обучения больших моделей на неамериканском железе становится рабочим, а не экспериментальным. Для российских компаний, которые не первый год считают доступность и цену западных ускорителей, это скорее сигнал на будущее, чем повод менять планы здесь и сейчас: развернуть GLM-5.3-Flash пока проще и дешевле на серверах с GPU, которые уже продаются и обслуживаются в России.

Мнение DigitalRazor

GLM-5.3-Flash — редкий случай, когда открытая модель одновременно дешевле в эксплуатации и компактнее предшественницы: 320 Гбайт весов в FP8 — это уже не полтора десятка карт, а вменяемый сервер на четыре-восемь GPU. Компаниям, которые уже держат парк на 80–141 Гбайт памяти на карту, стоит присмотреться к модели в первую очередь для мультимодальных сценариев — разбора документов и скриншотов. Без такого парка разумнее начать с квантованной сборки на одной-двух картах и решать вопрос о полноценном сервере по результатам теста. Мы готовы подобрать конфигурацию под любой из этих сценариев.

Rackstation AI
Для каких задач Компактный GPU-сервер до 2 видеокарт для начальных задач в AI и графике. Оптимален для инференса, визуализации, VFX и рендеринга в студиях и лабораториях, где важна гибкость.
Подробнее
Видеокарты
RTX / RTX PRO / H200 NVL
Объем видеопамяти до 282 ГБ
Процессоры
Threadripper PRO
Количество ядер до 96
RAM до 1024 ГБ DDR5
Форм-фактор 4.5U
Devbox AI
Для каких задач Универсальная платформа на 4–6 GPU для локального обучения моделей и генеративных задач. Подходит для команд, которым важна надёжность сервера и свобода выбора графики — от RTX 5090 до PRO RTX 6000.
Подробнее
Видеокарты
RTX / RTX PRO / H200 NVL
Объем видеопамяти до 576 ГБ
Процессоры
Threadripper PRO
Количество ядер до 96
RAM до 1024 ГБ DDR5
Форм-фактор 6.5U
Scale
Для каких задач Сервер промышленного уровня на 8 GPU с кластерной архитектурой. Предназначен для дата-центров и AI-ферм, где требуется масштабируемость и полная загрузка ресурсов под обучение LLM и R&D.
Подробнее
Видеокарты
RTX PRO 6000 / RTX 5090
Объем видеопамяти до 768 ГБ
Процессоры
AMD Epyc, Intel Xeon
Количество ядер до 320
RAM до 3072 ГБ DDR5
Форм-фактор 6U
HPC 4000
Для каких задач Серия серверов для кластеризации на 4 GPU. Предназначены для дата-центров и AI-ферм, где требуется повышенная плотность для обучение LLM и R&D.
Подробнее
Видеокарты
L40s / RTX PRO / H200 NVL
Объем видеопамяти до 564 ГБ
Процессоры
AMD EPYC, Intel Xeon
Количество ядер до 128
RAM до 1536 ГБ DDR5
Форм-фактор 2U
HPC 8000
Для каких задач Серия серверов для кластеризации на 8 GPU. Предназначены для дата-центров и AI-ферм, где требуется повышенная плотность для обучение LLM и R&D.
Подробнее
Видеокарты
L40s / RTX PRO / H200 NVL
Объем видеопамяти до 1128 ГБ
Процессоры
AMD EPYC, Intel Xeon
Количество ядер до 256
RAM до 2048 ГБ DDR5
Форм-фактор 4U
HGX H200
Для каких задач HGX объединяет 8 видеокарт NVIDIA H200, достигая экстремальной плотности производительности. Благодаря внутренней связности NVSwitch мгновенно интегрируется в масштабные вычислительные кластеры.
Подробнее
Видеокарты
NVIDIA H200 SXM
Объем видеопамяти до 1128 ГБ
Процессоры
AMD EPYC, Intel Xeon
Количество ядер до 256
RAM до 2048 ГБ DDR5
Форм-фактор 5U
Подберём сервер под вашу задачу

Подберём конфигурацию сервера и отправим предложение.

Смотреть серверы
или свяжитесь с нами
Telegram Telegram WhatsApp WhatsApp ВКонтакте ВКонтакте MAX MAX
9.4К

Так же будет интересно почитать

Сайт использует cookies
Узнать подробнее