
Kimi K3: 2,8 трлн параметров — сколько нужно GPU
Подберём сервер под задачи
Ответьте на несколько вопросов — подготовим предложение
Moonshot AI представила Kimi K3 — самую крупную открытую модель на сегодняшний день: 2,8 триллиона параметров и контекст в миллион токенов. Полные веса выложат 27 июля, но уже понятен главный вопрос для бизнеса: сколько ускорителей нужно, чтобы запустить такую модель у себя, а не через API и внешних поставщиков.
Краткое содержание
- 2,8 трлн параметров всего, но на каждый токен работают лишь 16 из 896 экспертов — архитектура MoE;
- гибридное внимание Kimi Delta Attention и контекст до 1 млн токенов;
- вес модели в квантовании MXFP4/MXFP8 — 1,4 ТБ, но реальный аппетит к памяти намного выше;
- полные открытые веса выйдут 27 июля 2026 года, лицензия открытая.
Сколько GPU нужно для локального запуска
Сами параметры в компактном квантовании MXFP4/MXFP8 занимают 1,4 ТБ — это укладывается в 10 ускорителей Nvidia H200 или в 5 ускорителей B200. Но это только вес модели. Отдельно, сверх этого объёма, нужно ещё минимум 5,12 ТБ видеопамяти под KV-кэш и активации — расплата за контекст в миллион токенов. На практике счёт идёт не о паре серверов, а о кластере в несколько стоек.
Архитектура: почему параметров много, а считает мало
K3 построена на смеси экспертов: из 896 экспертов на каждый токен включаются только 16 — это около 1,8% от общего числа. Ещё в архитектуре — гибридное внимание Kimi Delta Attention: в части слоёв оно заменяет квадратичное внимание на линейное, иначе миллион токенов контекста обходился бы ещё дороже по памяти и времени счёта. По данным Moonshot AI, вместе эти решения дают примерно 2,5-кратный прирост эффективности использования вычислений по сравнению с предыдущей моделью K2.
Результаты: где K3 обходит конкурентов
По собственным замерам Moonshot AI, K3 уступает по общей планке Claude Fable 5 и GPT-5.6 Sol, но обходит Claude Opus 4.8 и GPT-5.5 в кодогенерации и агентных задачах: 93,5% на GPQA-Diamond, 81,6% на MMMU-Pro, 94,3% на MathVision. В независимом рейтинге Frontend Code Arena K3 набрала 1679 очков и обошла Claude Fable 5 в слепом тестировании фронтенд-кода.
Доступность железа и экономика своего кластера
H200 и B200 — топовые ускорители Nvidia с ограничениями на экспорт в ряд стран, и в России набрать десятки таких карт напрямую и легально не выйдет — только через партнёров и облачные площадки за пределами прямых поставок. Даже если железо найдётся, кластер на несколько терабайт видеопамяти — это капитальные вложения уровня гиперскейлера, а не рядового интегратора. Для большинства компаний разумный первый шаг — API или аренда GPU-инстансов у облачного провайдера, а свой кластер под K3 имеет смысл только при постоянной высокой нагрузке.
Мнение DigitalRazor
Открытые веса Kimi K3 — это скорее сигнал рынку, чем повод для немедленной закупки: содержать под неё собственный кластер по силам лишь единицам. Тем, кому важны контроль над данными и локальный инференс, разумнее присмотреться к более компактным открытым моделям под собственный сервер, а K3 пока держать на карандаше как ориентир возможностей. Когда веса откроют 27 июля, приходите к нам подбирать конфигурации под конкретную нагрузку.













