
Meta* Muse Glimmer: агент на 30 млрд параметров и один GPU
Подберём сервер под задачи
Ответьте на несколько вопросов — подготовим предложение
Meta* выпустила Muse Glimmer — открытую агентную модель на 30 миллиардов параметров с поддержкой изображений и вызова инструментов. Модель специально сжали так, чтобы она помещалась в память одной видеокарты, а не требовала сервер с несколькими ускорителями. Лицензия Apache 2.0 разрешает свободное коммерческое использование — без прежних ограничений линейки Llama.
Краткое содержание
- 30 млрд параметров, плотная архитектура без смеси экспертов — дистиллирована из закрытой Muse Spark 1.2;
- своё зрение через модуль ViT-G/14 на 1,8 млрд параметров и контекст на 131 072 токена;
- в 4-битном квантовании укладывается примерно в 17 ГБ видеопамяти — хватает игровой RTX 4090 или RX 7900 XTX;
- лицензия Apache 2.0 — полностью открытая, без ограничений на коммерческое применение.
Агент со зрением и памятью на 131 тысячу токенов
Большинство свежих моделей такого размера — смесь экспертов, где активна лишь часть параметров. Glimmer работает иначе: все 30 миллиардов задействованы на каждом токене. У модели встроенное зрение — энкодер ViT-G/14 разбирает изображение на кадры до 4096 токенов, а Grouped-Query Attention держит контекст в 131 072 токена без раздувания кеша. Модель умеет вести многошаговые задачи, вызывать инструменты и подниматься после сбоя в цепочке рассуждений — это и называют «агентностью». Словарь на 202 048 токенов покрывает около ста языков, включая русский.
Сколько видеопамяти нужно на самом деле
Для бизнеса главный вопрос не в бенчмарках, а в том, какое железо под это покупать.
- нативная точность BF16 — около 60 ГБ, влезает в NVIDIA RTX PRO 6000 или AMD Instinct MI350P;
- 4-битное квантование (K-Quant) — около 17 ГБ при потере точности на агентных задачах около одного процента, хватает потребительских видеокарт серий RTX 30/40 или RX 7900 XT/XTX;
- 3-битное сжатие протискивает модель в 16 ГБ, но заметно теряет в точности — для продакшена такой уровень рискован;
- отдельная модель-«черновик» DFlash ускоряет генерацию спекулятивным декодированием: на RTX 5090 — до 233 токенов в секунду.
Бенчмарки против Gemma и Qwen быстро устареют
Meta* сравнивает Glimmer с Google Gemma 4 на 31 млрд параметров и Alibaba Qwen 3.6 на 27 млрд: по собственным тестам компании Glimmer впереди на агентном MCP-Atlas (63,2%), Terminal-Bench 2.1 (75,4%), MMMU Pro (63,0%) и CharXiv (70,4%). Верить таким цифрам стоит с поправкой: конкуренты выкатывают обновления моделей быстрее, чем успевает устояться очередной лидерборд, и через месяц расклад может измениться. Более практичный сигнал — сама лицензия. Прежние модели линейки Llama ограничивали крупный коммерческий деплой отдельными условиями, здесь же Apache 2.0 без исключений: разворачивайте, дорабатывайте и встраивайте в продукт без юридических согласований с Meta*.
Мнение DigitalRazor
Для пилота локального ИИ-агента без аренды многокарточного сервера Glimmer — разумный выбор: одна рабочая станция с RTX PRO 6000 держит модель без потерь точности, а обычная RTX 4090 или 5090 потянет квантованную версию для менее критичных задач. Для продакшена с высокой нагрузкой и агентами, которым нужна максимальная точность, закладывайте BF16-конфигурацию — экономия на 3-битном сжатии обычно выходит боком на сложных сценариях.
*Meta признана экстремистской организацией на территории РФ.













