
Nemotron 3.5 Lightning: агенты на своём GPU
Подберём сервер под задачи
Ответьте на несколько вопросов — подготовим предложение
NVIDIA открыла веса Nemotron 3.5 Lightning — компактную MoE-модель на 30 миллиардов параметров, из которых активны лишь 3 миллиарда. Агентные сценарии гоняют модель миллионы раз в сутки, и такая экономия окупает разработку многократно. Модель работает на своём железе — от GeForce RTX 5090 до серверных Blackwell и Hopper.
Краткое содержание
- архитектура MoE: 30 млрд параметров всего, активны только 3 млрд на токен;
- по данным NVIDIA, агентные задачи решаются на 30% быстрее Qwen3.6 35B при том же уровне точности;
- готовые чекпоинты NVFP4 и BF16 — от компактных станций до серверных GPU;
- веса и рецепты обучения открыты по стандарту OpenMDW-1.1.
MoE на 30 млрд: экономия ради агентов
В архитектуре «смесь экспертов» на каждый токен активируется не вся модель, а маленькая её часть — здесь это 3 млрд параметров из 30 млрд. Для чат-бота с редкими запросами разница не критична, но агентный сценарий устроен иначе: один рабочий процесс делает десятки и сотни вызовов модели за сессию — выбор инструмента, разбор результата, передача задачи подагенту. Умножьте это на масштаб продакшена, и экономия на активных параметрах превращается в прямую экономию на GPU-часах.
Отдельно NVIDIA даёт готовые чекпоинты в NVFP4 и BF16. NVFP4 — четырёхбитное квантование, разработанное NVIDIA под собственные тензорные ядра Blackwell: по грубой прикидке (число параметров × 4 бита) модель в этом формате занимает порядка 15 ГБ видеопамяти, а в BF16 — около 60 ГБ. Наличие обоих вариантов из коробки экономит время на самостоятельном квантовании перед деплоем.
От RTX 5090 до Blackwell: где крутить модель
NVIDIA прямо называет диапазон целевого железа: DGX Spark и GeForce RTX 5090 для локального запуска, GPU Blackwell, Hopper и Ampere — для серверного масштаба. При оценке в 15 ГБ видеопамяти в NVFP4 модель комфортно помещается даже в один потребительский ускоритель, а в BF16 нужна уже полноценная серверная карта. На практике небольшой отдел разработки может обкатать агента на рабочей станции с RTX 5090, а в продакшен вывести на существующем парке GPU Ampere или Hopper — без немедленной закупки новейшего Blackwell.
Не единственная в своём классе
Nemotron 3.5 Lightning сравнивают с Qwen3.6 35B — и это симптоматично: за последние недели вышли сразу несколько открытых моделей близкого калибра от разных вендоров, включая обновления DeepSeek и других игроков. Рынок компактных агентных моделей уплотняется быстро, и через квартал-два появится модель с похожими или лучшими цифрами. Второй нюанс — лицензия OpenMDW-1.1 своя, не общепринятая Apache или MIT, и перед коммерческим внедрением условия стоит перечитать отдельно, а не полагаться на репутацию открытых весов NVIDIA по умолчанию.
Мнение DigitalRazor
Для компаний с высокой частотой обращений к модели — тысячи и миллионы вызовов агентов в сутки — компактный активный объём в 3 млрд параметров ощутимо снижает стоимость инференса против прогона всего через одну большую модель. Разумный путь — сначала проверить Nemotron 3.5 Lightning на существующем парке GPU (даже RTX-класса), и только после этого решать, нужна ли под агентную нагрузку отдельная серверная закупка.













