8 800 500-99-26 Для звонков по России
Nemotron 3.5 Lightning: агенты на своём GPU
Софт
2 мин

Nemotron 3.5 Lightning: агенты на своём GPU

DigitalRazor
DigitalRazor
Подписаться в Telegram
Содержание 4 раздела
Краткое содержание MoE на 30 млрд: экономия ради агентов От RTX 5090 до Blackwell: где крутить модель Не единственная в своём классе
Подберём сервер под вашу задачу

Подберём конфигурацию сервера и отправим предложение.

Смотреть серверы
или свяжитесь с нами
Telegram Telegram WhatsApp WhatsApp ВКонтакте ВКонтакте MAX MAX

Подберём сервер под задачи

Ответьте на несколько вопросов — подготовим предложение

NVIDIA открыла веса Nemotron 3.5 Lightning — компактную MoE-модель на 30 миллиардов параметров, из которых активны лишь 3 миллиарда. Агентные сценарии гоняют модель миллионы раз в сутки, и такая экономия окупает разработку многократно. Модель работает на своём железе — от GeForce RTX 5090 до серверных Blackwell и Hopper.

Краткое содержание

  • архитектура MoE: 30 млрд параметров всего, активны только 3 млрд на токен;
  • по данным NVIDIA, агентные задачи решаются на 30% быстрее Qwen3.6 35B при том же уровне точности;
  • готовые чекпоинты NVFP4 и BF16 — от компактных станций до серверных GPU;
  • веса и рецепты обучения открыты по стандарту OpenMDW-1.1.

MoE на 30 млрд: экономия ради агентов

В архитектуре «смесь экспертов» на каждый токен активируется не вся модель, а маленькая её часть — здесь это 3 млрд параметров из 30 млрд. Для чат-бота с редкими запросами разница не критична, но агентный сценарий устроен иначе: один рабочий процесс делает десятки и сотни вызовов модели за сессию — выбор инструмента, разбор результата, передача задачи подагенту. Умножьте это на масштаб продакшена, и экономия на активных параметрах превращается в прямую экономию на GPU-часах.

Отдельно NVIDIA даёт готовые чекпоинты в NVFP4 и BF16. NVFP4 — четырёхбитное квантование, разработанное NVIDIA под собственные тензорные ядра Blackwell: по грубой прикидке (число параметров × 4 бита) модель в этом формате занимает порядка 15 ГБ видеопамяти, а в BF16 — около 60 ГБ. Наличие обоих вариантов из коробки экономит время на самостоятельном квантовании перед деплоем.

От RTX 5090 до Blackwell: где крутить модель

NVIDIA прямо называет диапазон целевого железа: DGX Spark и GeForce RTX 5090 для локального запуска, GPU Blackwell, Hopper и Ampere — для серверного масштаба. При оценке в 15 ГБ видеопамяти в NVFP4 модель комфортно помещается даже в один потребительский ускоритель, а в BF16 нужна уже полноценная серверная карта. На практике небольшой отдел разработки может обкатать агента на рабочей станции с RTX 5090, а в продакшен вывести на существующем парке GPU Ampere или Hopper — без немедленной закупки новейшего Blackwell.

Не единственная в своём классе

Nemotron 3.5 Lightning сравнивают с Qwen3.6 35B — и это симптоматично: за последние недели вышли сразу несколько открытых моделей близкого калибра от разных вендоров, включая обновления DeepSeek и других игроков. Рынок компактных агентных моделей уплотняется быстро, и через квартал-два появится модель с похожими или лучшими цифрами. Второй нюанс — лицензия OpenMDW-1.1 своя, не общепринятая Apache или MIT, и перед коммерческим внедрением условия стоит перечитать отдельно, а не полагаться на репутацию открытых весов NVIDIA по умолчанию.

Мнение DigitalRazor

Для компаний с высокой частотой обращений к модели — тысячи и миллионы вызовов агентов в сутки — компактный активный объём в 3 млрд параметров ощутимо снижает стоимость инференса против прогона всего через одну большую модель. Разумный путь — сначала проверить Nemotron 3.5 Lightning на существующем парке GPU (даже RTX-класса), и только после этого решать, нужна ли под агентную нагрузку отдельная серверная закупка.

Rackstation AI
Для каких задач Компактный GPU-сервер до 2 видеокарт для начальных задач в AI и графике. Оптимален для инференса, визуализации, VFX и рендеринга в студиях и лабораториях, где важна гибкость.
Подробнее
Видеокарты
RTX / RTX PRO / H200 NVL
Объем видеопамяти до 282 ГБ
Процессоры
Threadripper PRO
Количество ядер до 96
RAM до 1024 ГБ DDR5
Форм-фактор 4.5U
Devbox AI
Для каких задач Универсальная платформа на 4–6 GPU для локального обучения моделей и генеративных задач. Подходит для команд, которым важна надёжность сервера и свобода выбора графики — от RTX 5090 до PRO RTX 6000.
Подробнее
Видеокарты
RTX / RTX PRO / H200 NVL
Объем видеопамяти до 576 ГБ
Процессоры
Threadripper PRO
Количество ядер до 96
RAM до 1024 ГБ DDR5
Форм-фактор 6.5U
Scale
Для каких задач Сервер промышленного уровня на 8 GPU с кластерной архитектурой. Предназначен для дата-центров и AI-ферм, где требуется масштабируемость и полная загрузка ресурсов под обучение LLM и R&D.
Подробнее
Видеокарты
RTX PRO 6000 / RTX 5090
Объем видеопамяти до 768 ГБ
Процессоры
AMD Epyc, Intel Xeon
Количество ядер до 320
RAM до 3072 ГБ DDR5
Форм-фактор 6U
HPC 4000
Для каких задач Серия серверов для кластеризации на 4 GPU. Предназначены для дата-центров и AI-ферм, где требуется повышенная плотность для обучение LLM и R&D.
Подробнее
Видеокарты
L40s / RTX PRO / H200 NVL
Объем видеопамяти до 564 ГБ
Процессоры
AMD EPYC, Intel Xeon
Количество ядер до 128
RAM до 1536 ГБ DDR5
Форм-фактор 2U
HPC 8000
Для каких задач Серия серверов для кластеризации на 8 GPU. Предназначены для дата-центров и AI-ферм, где требуется повышенная плотность для обучение LLM и R&D.
Подробнее
Видеокарты
L40s / RTX PRO / H200 NVL
Объем видеопамяти до 1128 ГБ
Процессоры
AMD EPYC, Intel Xeon
Количество ядер до 256
RAM до 2048 ГБ DDR5
Форм-фактор 4U
HGX H200
Для каких задач HGX объединяет 8 видеокарт NVIDIA H200, достигая экстремальной плотности производительности. Благодаря внутренней связности NVSwitch мгновенно интегрируется в масштабные вычислительные кластеры.
Подробнее
Видеокарты
NVIDIA H200 SXM
Объем видеопамяти до 1128 ГБ
Процессоры
AMD EPYC, Intel Xeon
Количество ядер до 256
RAM до 2048 ГБ DDR5
Форм-фактор 5U
Подберём сервер под вашу задачу

Подберём конфигурацию сервера и отправим предложение.

Смотреть серверы
или свяжитесь с нами
Telegram Telegram WhatsApp WhatsApp ВКонтакте ВКонтакте MAX MAX
9.5К

Так же будет интересно почитать

Сайт использует cookies
Узнать подробнее