8 800 500-99-26 Для звонков по России
GLM-5.3: китайский кодинг-флагман размером с сервер
Софт
2 мин

GLM-5.3: китайский кодинг-флагман размером с сервер

DigitalRazor
DigitalRazor
Подписаться в Telegram
Содержание 5 разделов
Краткое содержание Откуда взялся скачок в бенчмарках Сервер, а не рабочая станция Путь для тех, у кого нет кластера Кому это подходит, а кому — нет
Подберём сервер под вашу задачу

Подберём конфигурацию сервера и отправим предложение.

Смотреть серверы
или свяжитесь с нами
Telegram Telegram WhatsApp WhatsApp ВКонтакте ВКонтакте MAX MAX

Подберём сервер под задачи

Ответьте на несколько вопросов — подготовим предложение

Китайская Z.ai выложила веса флагманской модели GLM-5.3 — 753 миллиарда параметров и заметный скачок в агентном кодинге и поиске уязвимостей. Модель открытая, но с оговоркой: чтобы её запустить, нужен не игровой GPU, а полноценный сервер на несколько ускорителей с сотнями гигабайт видеопамяти.

Краткое содержание

  • MoE-архитектура: 753 млрд параметров всего, активны только 40 млрд на токен;
  • Terminal-Bench 3.0 вырос с 4,6 до 28,3 процента — заметный рывок в агентном кодинге;
  • контекст — 1 млн токенов, вывод — до 128 тысяч токенов за раз;
  • минимум для полноценного инференса в FP8 — восемь ускорителей NVIDIA H200.

Откуда взялся скачок в бенчмарках

GLM-5.3 использует ту же базовую архитектуру, что и GLM-5.2. Z.ai подчёркивает: все улучшения — от постобучения, без изменений в самой сети. Результат заметный. Terminal-Bench 3.0 вырос с 4,6 до 28,3 процента, DeepSWE v1.1 — с 46,2 до 66,9 процента. В CyberGym, тесте на поиск и подтверждение уязвимостей в исходном коде, модель набрала 84,5 процента против прежних 77,2 процента. Контекстное окно осталось прежним — 1 млн токенов, генерация — до 128 тысяч за проход.

GLM-5.3 бенчмарк

Сервер, а не рабочая станция

Формально это MoE-модель: из 753 млрд параметров на каждый токен работает только 40 млрд. Вычислительная нагрузка ниже, чем у плотной модели такого же размера. Но для инференса всё равно нужен полноценный кластер. В FP8 веса занимают около 750 ГБ на диске. Минимальная конфигурация для запуска — восемь ускорителей NVIDIA H200, это около 1,1 ТБ видеопамяти на узел, из которых на кэш и промежуточные вычисления остаётся порядка 375 ГБ. Для BF16 нужно уже два таких узла — либо один на восьми ускорителях B300 архитектуры Blackwell с 2,3 ТБ видеопамяти.

Путь для тех, у кого нет кластера

Есть и обходной путь. Динамическое квантование GGUF от Unsloth сжимает модель до 217–239 ГБ на диске даже на агрессивных 1–2-битных схемах. В одну видеокарту это всё равно не влезет, но 256 ГБ общей памяти хватает на связку из двух NVIDIA DGX Spark или на Mac Studio с достаточным объёмом унифицированной памяти. Качество заметно просядет, зато не придётся закупать серверный кластер.

Кому это подходит, а кому — нет

Несколько дней назад мы разбирали GLM-5.3-Flash — облегчённую версию той же линейки: 320 млрд параметров, 18 млрд активных, конфигурация из одного-двух ускорителей. Флагманский GLM-5.3 — другая весовая категория. Он рассчитан на компании, у которых уже есть или планируется выделенный GPU-сервер, а не рабочая станция для локального инференса. Открытые веса снимают вопрос лицензии за API. Вопрос капитальных затрат на железо остаётся.

Мнение DigitalRazor

GLM-5.3 — весомый аргумент в пользу открытых моделей для команд, готовых вложиться в собственную инфраструктуру: качество кода и разбор уязвимостей на уровне закрытых конкурентов, а веса не привязывают к чужому API. Входной билет один — сервер с восемью ускорителями H200 или B300, а не видеокарта в рабочей станции. Бюджет и задачи скромнее? Присмотритесь к GLM-5.3-Flash — под неё мы уже прикидывали конфигурацию попроще. DigitalRazor подберёт и поставит правильное железо под любой из двух сценариев.

Rackstation AI
Для каких задач Компактный GPU-сервер до 2 видеокарт для начальных задач в AI и графике. Оптимален для инференса, визуализации, VFX и рендеринга в студиях и лабораториях, где важна гибкость.
Подробнее
Видеокарты
RTX / RTX PRO / H200 NVL
Объем видеопамяти до 282 ГБ
Процессоры
Threadripper PRO
Количество ядер до 96
RAM до 1024 ГБ DDR5
Форм-фактор 4.5U
Devbox AI
Для каких задач Универсальная платформа на 4–6 GPU для локального обучения моделей и генеративных задач. Подходит для команд, которым важна надёжность сервера и свобода выбора графики — от RTX 5090 до PRO RTX 6000.
Подробнее
Видеокарты
RTX / RTX PRO / H200 NVL
Объем видеопамяти до 576 ГБ
Процессоры
Threadripper PRO
Количество ядер до 96
RAM до 1024 ГБ DDR5
Форм-фактор 6.5U
Scale
Для каких задач Сервер промышленного уровня на 8 GPU с кластерной архитектурой. Предназначен для дата-центров и AI-ферм, где требуется масштабируемость и полная загрузка ресурсов под обучение LLM и R&D.
Подробнее
Видеокарты
RTX PRO 6000 / RTX 5090
Объем видеопамяти до 768 ГБ
Процессоры
AMD Epyc, Intel Xeon
Количество ядер до 320
RAM до 3072 ГБ DDR5
Форм-фактор 6U
HPC 4000
Для каких задач Серия серверов для кластеризации на 4 GPU. Предназначены для дата-центров и AI-ферм, где требуется повышенная плотность для обучение LLM и R&D.
Подробнее
Видеокарты
L40s / RTX PRO / H200 NVL
Объем видеопамяти до 564 ГБ
Процессоры
AMD EPYC, Intel Xeon
Количество ядер до 128
RAM до 1536 ГБ DDR5
Форм-фактор 2U
HPC 8000
Для каких задач Серия серверов для кластеризации на 8 GPU. Предназначены для дата-центров и AI-ферм, где требуется повышенная плотность для обучение LLM и R&D.
Подробнее
Видеокарты
L40s / RTX PRO / H200 NVL
Объем видеопамяти до 1128 ГБ
Процессоры
AMD EPYC, Intel Xeon
Количество ядер до 256
RAM до 2048 ГБ DDR5
Форм-фактор 4U
HGX H200
Для каких задач HGX объединяет 8 видеокарт NVIDIA H200, достигая экстремальной плотности производительности. Благодаря внутренней связности NVSwitch мгновенно интегрируется в масштабные вычислительные кластеры.
Подробнее
Видеокарты
NVIDIA H200 SXM
Объем видеопамяти до 1128 ГБ
Процессоры
AMD EPYC, Intel Xeon
Количество ядер до 256
RAM до 2048 ГБ DDR5
Форм-фактор 5U
Подберём сервер под вашу задачу

Подберём конфигурацию сервера и отправим предложение.

Смотреть серверы
или свяжитесь с нами
Telegram Telegram WhatsApp WhatsApp ВКонтакте ВКонтакте MAX MAX
1.1К

Так же будет интересно почитать

Сайт использует cookies
Узнать подробнее