8 800 500-99-26 Для звонков по России
Meta* Muse Glimmer: агент на 30 млрд параметров и один GPU
Софт
2 мин

Meta* Muse Glimmer: агент на 30 млрд параметров и один GPU

DigitalRazor
DigitalRazor
Подписаться в Telegram
Содержание 4 раздела
Краткое содержание Агент со зрением и памятью на 131 тысячу токенов Сколько видеопамяти нужно на самом деле Бенчмарки против Gemma и Qwen быстро устареют
Подберём сервер под вашу задачу

Подберём конфигурацию сервера и отправим предложение.

Смотреть серверы
или свяжитесь с нами
Telegram Telegram WhatsApp WhatsApp ВКонтакте ВКонтакте MAX MAX

Подберём сервер под задачи

Ответьте на несколько вопросов — подготовим предложение

Meta* выпустила Muse Glimmer — открытую агентную модель на 30 миллиардов параметров с поддержкой изображений и вызова инструментов. Модель специально сжали так, чтобы она помещалась в память одной видеокарты, а не требовала сервер с несколькими ускорителями. Лицензия Apache 2.0 разрешает свободное коммерческое использование — без прежних ограничений линейки Llama.

Краткое содержание

  • 30 млрд параметров, плотная архитектура без смеси экспертов — дистиллирована из закрытой Muse Spark 1.2;
  • своё зрение через модуль ViT-G/14 на 1,8 млрд параметров и контекст на 131 072 токена;
  • в 4-битном квантовании укладывается примерно в 17 ГБ видеопамяти — хватает игровой RTX 4090 или RX 7900 XTX;
  • лицензия Apache 2.0 — полностью открытая, без ограничений на коммерческое применение.

Агент со зрением и памятью на 131 тысячу токенов

Большинство свежих моделей такого размера — смесь экспертов, где активна лишь часть параметров. Glimmer работает иначе: все 30 миллиардов задействованы на каждом токене. У модели встроенное зрение — энкодер ViT-G/14 разбирает изображение на кадры до 4096 токенов, а Grouped-Query Attention держит контекст в 131 072 токена без раздувания кеша. Модель умеет вести многошаговые задачи, вызывать инструменты и подниматься после сбоя в цепочке рассуждений — это и называют «агентностью». Словарь на 202 048 токенов покрывает около ста языков, включая русский.

Сколько видеопамяти нужно на самом деле

Для бизнеса главный вопрос не в бенчмарках, а в том, какое железо под это покупать.

  • нативная точность BF16 — около 60 ГБ, влезает в NVIDIA RTX PRO 6000 или AMD Instinct MI350P;
  • 4-битное квантование (K-Quant) — около 17 ГБ при потере точности на агентных задачах около одного процента, хватает потребительских видеокарт серий RTX 30/40 или RX 7900 XT/XTX;
  • 3-битное сжатие протискивает модель в 16 ГБ, но заметно теряет в точности — для продакшена такой уровень рискован;
  • отдельная модель-«черновик» DFlash ускоряет генерацию спекулятивным декодированием: на RTX 5090 — до 233 токенов в секунду.

Бенчмарки против Gemma и Qwen быстро устареют

Meta* сравнивает Glimmer с Google Gemma 4 на 31 млрд параметров и Alibaba Qwen 3.6 на 27 млрд: по собственным тестам компании Glimmer впереди на агентном MCP-Atlas (63,2%), Terminal-Bench 2.1 (75,4%), MMMU Pro (63,0%) и CharXiv (70,4%). Верить таким цифрам стоит с поправкой: конкуренты выкатывают обновления моделей быстрее, чем успевает устояться очередной лидерборд, и через месяц расклад может измениться. Более практичный сигнал — сама лицензия. Прежние модели линейки Llama ограничивали крупный коммерческий деплой отдельными условиями, здесь же Apache 2.0 без исключений: разворачивайте, дорабатывайте и встраивайте в продукт без юридических согласований с Meta*.

Мнение DigitalRazor

Для пилота локального ИИ-агента без аренды многокарточного сервера Glimmer — разумный выбор: одна рабочая станция с RTX PRO 6000 держит модель без потерь точности, а обычная RTX 4090 или 5090 потянет квантованную версию для менее критичных задач. Для продакшена с высокой нагрузкой и агентами, которым нужна максимальная точность, закладывайте BF16-конфигурацию — экономия на 3-битном сжатии обычно выходит боком на сложных сценариях.

Для каких задач Компактный GPU-сервер до 2 видеокарт для начальных задач в AI и графике. Оптимален для инференса, визуализации, VFX и рендеринга в студиях и лабораториях, где важна гибкость.
Подробнее
Видеокарты
RTX / RTX PRO / H200 NVL
Объем видеопамяти до 282 ГБ
Процессоры
Threadripper PRO
Количество ядер до 96
RAM до 1024 ГБ DDR5
Форм-фактор 4.5U
Для каких задач Универсальная платформа на 4–6 GPU для локального обучения моделей и генеративных задач. Подходит для команд, которым важна надёжность сервера и свобода выбора графики — от RTX 5090 до PRO RTX 6000.
Подробнее
Видеокарты
RTX / RTX PRO / H200 NVL
Объем видеопамяти до 576 ГБ
Процессоры
Threadripper PRO
Количество ядер до 96
RAM до 1024 ГБ DDR5
Форм-фактор 6.5U
Для каких задач Сервер промышленного уровня на 8 GPU с кластерной архитектурой. Предназначен для дата-центров и AI-ферм, где требуется масштабируемость и полная загрузка ресурсов под обучение LLM и R&D.
Подробнее
Видеокарты
RTX PRO 6000 / RTX 5090
Объем видеопамяти до 768 ГБ
Процессоры
AMD Epyc, Intel Xeon
Количество ядер до 320
RAM до 3072 ГБ DDR5
Форм-фактор 6U
Для каких задач Серия серверов для кластеризации на 4 GPU. Предназначены для дата-центров и AI-ферм, где требуется повышенная плотность для обучение LLM и R&D.
Подробнее
Видеокарты
L40s / RTX PRO / H200 NVL
Объем видеопамяти до 564 ГБ
Процессоры
AMD EPYC, Intel Xeon
Количество ядер до 128
RAM до 1536 ГБ DDR5
Форм-фактор 2U
Для каких задач Серия серверов для кластеризации на 8 GPU. Предназначены для дата-центров и AI-ферм, где требуется повышенная плотность для обучение LLM и R&D.
Подробнее
Видеокарты
L40s / RTX PRO / H200 NVL
Объем видеопамяти до 1128 ГБ
Процессоры
AMD EPYC, Intel Xeon
Количество ядер до 256
RAM до 2048 ГБ DDR5
Форм-фактор 4U
Для каких задач HGX объединяет 8 видеокарт NVIDIA H200, достигая экстремальной плотности производительности. Благодаря внутренней связности NVSwitch мгновенно интегрируется в масштабные вычислительные кластеры.
Подробнее
Видеокарты
NVIDIA H200 SXM
Объем видеопамяти до 1128 ГБ
Процессоры
AMD EPYC, Intel Xeon
Количество ядер до 256
RAM до 2048 ГБ DDR5
Форм-фактор 5U

*Meta признана экстремистской организацией на территории РФ.

Подберём сервер под вашу задачу

Подберём конфигурацию сервера и отправим предложение.

Смотреть серверы
или свяжитесь с нами
Telegram Telegram WhatsApp WhatsApp ВКонтакте ВКонтакте MAX MAX
4.3К

Так же будет интересно почитать

Сайт использует cookies
Узнать подробнее