
GLM-5.3: китайский кодинг-флагман размером с сервер
Подберём сервер под задачи
Ответьте на несколько вопросов — подготовим предложение
Китайская Z.ai выложила веса флагманской модели GLM-5.3 — 753 миллиарда параметров и заметный скачок в агентном кодинге и поиске уязвимостей. Модель открытая, но с оговоркой: чтобы её запустить, нужен не игровой GPU, а полноценный сервер на несколько ускорителей с сотнями гигабайт видеопамяти.
Краткое содержание
- MoE-архитектура: 753 млрд параметров всего, активны только 40 млрд на токен;
- Terminal-Bench 3.0 вырос с 4,6 до 28,3 процента — заметный рывок в агентном кодинге;
- контекст — 1 млн токенов, вывод — до 128 тысяч токенов за раз;
- минимум для полноценного инференса в FP8 — восемь ускорителей NVIDIA H200.
Откуда взялся скачок в бенчмарках
GLM-5.3 использует ту же базовую архитектуру, что и GLM-5.2. Z.ai подчёркивает: все улучшения — от постобучения, без изменений в самой сети. Результат заметный. Terminal-Bench 3.0 вырос с 4,6 до 28,3 процента, DeepSWE v1.1 — с 46,2 до 66,9 процента. В CyberGym, тесте на поиск и подтверждение уязвимостей в исходном коде, модель набрала 84,5 процента против прежних 77,2 процента. Контекстное окно осталось прежним — 1 млн токенов, генерация — до 128 тысяч за проход.
Сервер, а не рабочая станция
Формально это MoE-модель: из 753 млрд параметров на каждый токен работает только 40 млрд. Вычислительная нагрузка ниже, чем у плотной модели такого же размера. Но для инференса всё равно нужен полноценный кластер. В FP8 веса занимают около 750 ГБ на диске. Минимальная конфигурация для запуска — восемь ускорителей NVIDIA H200, это около 1,1 ТБ видеопамяти на узел, из которых на кэш и промежуточные вычисления остаётся порядка 375 ГБ. Для BF16 нужно уже два таких узла — либо один на восьми ускорителях B300 архитектуры Blackwell с 2,3 ТБ видеопамяти.
Путь для тех, у кого нет кластера
Есть и обходной путь. Динамическое квантование GGUF от Unsloth сжимает модель до 217–239 ГБ на диске даже на агрессивных 1–2-битных схемах. В одну видеокарту это всё равно не влезет, но 256 ГБ общей памяти хватает на связку из двух NVIDIA DGX Spark или на Mac Studio с достаточным объёмом унифицированной памяти. Качество заметно просядет, зато не придётся закупать серверный кластер.
Кому это подходит, а кому — нет
Несколько дней назад мы разбирали GLM-5.3-Flash — облегчённую версию той же линейки: 320 млрд параметров, 18 млрд активных, конфигурация из одного-двух ускорителей. Флагманский GLM-5.3 — другая весовая категория. Он рассчитан на компании, у которых уже есть или планируется выделенный GPU-сервер, а не рабочая станция для локального инференса. Открытые веса снимают вопрос лицензии за API. Вопрос капитальных затрат на железо остаётся.
Мнение DigitalRazor
GLM-5.3 — весомый аргумент в пользу открытых моделей для команд, готовых вложиться в собственную инфраструктуру: качество кода и разбор уязвимостей на уровне закрытых конкурентов, а веса не привязывают к чужому API. Входной билет один — сервер с восемью ускорителями H200 или B300, а не видеокарта в рабочей станции. Бюджет и задачи скромнее? Присмотритесь к GLM-5.3-Flash — под неё мы уже прикидывали конфигурацию попроще. DigitalRazor подберёт и поставит правильное железо под любой из двух сценариев.














