
GLM-5.3-Flash: мультимодальный флагман дешевле GLM-5.2
Подберём сервер под задачи
Ответьте на несколько вопросов — подготовим предложение
Китайская Z.ai выпустила GLM-5.3-Flash — первую модель линейки, где текст и изображения обрабатываются в одном представлении без отдельного визуального модуля. Весит она 320 миллиардов параметров, но на каждый токен активирует лишь 18 миллиардов, а распространяется по лицензии MIT. Для компании, которая считает не токены, а серверы под инференс, вопрос один: сколько памяти и GPU реально нужно.
Краткое содержание
- 320 млрд параметров всего, активны 18 млрд на токен — гибридная архитектура с разреженным и линейным вниманием;
- нативная мультимодальность: текст и изображения без отдельного визуального адаптера;
- контекст до 1 млн токенов, обучение на 30 трлн токенов, лицензия MIT;
- вдвое легче предшественницы GLM-5.2 (753 млрд параметров), но обгоняет её в тестах при заметно меньшей стоимости инференса.
Мультимодальность без отдельного визуального модуля
У большинства открытых моделей картинки обрабатывает отдельный визуальный энкодер, который переводит изображение в токены для языковой части. Две сети вместо одной. GLM-5.3-Flash с самого начала обучена работать с текстом и изображениями в общем представлении — архитектура с гибридным разреженным и линейным вниманием, плюс Manifold-Constrained Hyper-Connections для устойчивого масштабирования при росте контекста. Разбор скриншотов, диаграмм, сканов документов не требует держать в памяти отдельную визуальную модель поверх языковой — расходы на инференс считаются по весу одной сети.
Сколько GPU нужно, чтобы поднять модель у себя
Официальных рекомендаций по железу Z.ai не публикует, но параметры известны. В формате FP8, который модель поддерживает нативно, контрольная точка весит около 320 Гбайт — по байту на параметр. Одной картой этого не поднять: даже связка из четырёх ускорителей NVIDIA H100 на 80 Гбайт даёт лишь 320 Гбайт впритык, без запаса под контекст и промежуточные вычисления. Реалистичный вариант — узел на четырёх NVIDIA H200 (141 Гбайт на карту, 564 Гбайт суммарно) либо шесть-восемь H100, если карты уже есть в парке. Для сравнения: DeepSeek V4 Pro, о котором мы писали ранее, весит в FP8 около 900 Гбайт — GLM-5.3-Flash легче почти втрое, хотя обе модели построены на смеси экспертов.
- FP8 — нативный формат, около 320 Гбайт, нужен многокарточный сервер;
- 4-битные сборки GGUF — заметно компактнее, но точных цифр разработчик не приводит;
- крайние 1–2-битные кванты от Unsloth с выгрузкой в оперативную память — вариант для одной-двух карт, но с потерей качества.
Обучена на китайских чипах — при чём тут российский бизнес
В анонсе Z.ai отдельно подчёркивает: модель обучена и работает целиком на китайских ИИ-чипах, без ускорителей NVIDIA. На инференс у заказчика это не влияет — модель распространяется в стандартных форматах и запускается на SGLang, vLLM, TokenSpeed и KTransformers, то есть на любых GPU, которые поддерживают эти движки. Но сам факт показывает, что альтернативный стек обучения больших моделей на неамериканском железе становится рабочим, а не экспериментальным. Для российских компаний, которые не первый год считают доступность и цену западных ускорителей, это скорее сигнал на будущее, чем повод менять планы здесь и сейчас: развернуть GLM-5.3-Flash пока проще и дешевле на серверах с GPU, которые уже продаются и обслуживаются в России.
Мнение DigitalRazor
GLM-5.3-Flash — редкий случай, когда открытая модель одновременно дешевле в эксплуатации и компактнее предшественницы: 320 Гбайт весов в FP8 — это уже не полтора десятка карт, а вменяемый сервер на четыре-восемь GPU. Компаниям, которые уже держат парк на 80–141 Гбайт памяти на карту, стоит присмотреться к модели в первую очередь для мультимодальных сценариев — разбора документов и скриншотов. Без такого парка разумнее начать с квантованной сборки на одной-двух картах и решать вопрос о полноценном сервере по результатам теста. Мы готовы подобрать конфигурацию под любой из этих сценариев.














