8 800 500-99-26 Для звонков по России
Kimi K3: 2,8 трлн параметров — сколько нужно GPU
Софт
2 мин

Kimi K3: 2,8 трлн параметров — сколько нужно GPU

DigitalRazor
DigitalRazor
Подписаться в Telegram
Содержание 5 разделов
Краткое содержание Сколько GPU нужно для локального запуска Архитектура: почему параметров много, а считает мало Результаты: где K3 обходит конкурентов Доступность железа и экономика своего кластера
Подберём сервер под вашу задачу

Подберём конфигурацию сервера и отправим предложение.

Смотреть серверы
или свяжитесь с нами
Telegram Telegram WhatsApp WhatsApp ВКонтакте ВКонтакте MAX MAX

Подберём сервер под задачи

Ответьте на несколько вопросов — подготовим предложение

Moonshot AI представила Kimi K3 — самую крупную открытую модель на сегодняшний день: 2,8 триллиона параметров и контекст в миллион токенов. Полные веса выложат 27 июля, но уже понятен главный вопрос для бизнеса: сколько ускорителей нужно, чтобы запустить такую модель у себя, а не через API и внешних поставщиков.

Краткое содержание

  • 2,8 трлн параметров всего, но на каждый токен работают лишь 16 из 896 экспертов — архитектура MoE;
  • гибридное внимание Kimi Delta Attention и контекст до 1 млн токенов;
  • вес модели в квантовании MXFP4/MXFP8 — 1,4 ТБ, но реальный аппетит к памяти намного выше;
  • полные открытые веса выйдут 27 июля 2026 года, лицензия открытая.

Сколько GPU нужно для локального запуска

Сами параметры в компактном квантовании MXFP4/MXFP8 занимают 1,4 ТБ — это укладывается в 10 ускорителей Nvidia H200 или в 5 ускорителей B200. Но это только вес модели. Отдельно, сверх этого объёма, нужно ещё минимум 5,12 ТБ видеопамяти под KV-кэш и активации — расплата за контекст в миллион токенов. На практике счёт идёт не о паре серверов, а о кластере в несколько стоек.

Архитектура: почему параметров много, а считает мало

K3 построена на смеси экспертов: из 896 экспертов на каждый токен включаются только 16 — это около 1,8% от общего числа. Ещё в архитектуре — гибридное внимание Kimi Delta Attention: в части слоёв оно заменяет квадратичное внимание на линейное, иначе миллион токенов контекста обходился бы ещё дороже по памяти и времени счёта. По данным Moonshot AI, вместе эти решения дают примерно 2,5-кратный прирост эффективности использования вычислений по сравнению с предыдущей моделью K2.

Результаты: где K3 обходит конкурентов

По собственным замерам Moonshot AI, K3 уступает по общей планке Claude Fable 5 и GPT-5.6 Sol, но обходит Claude Opus 4.8 и GPT-5.5 в кодогенерации и агентных задачах: 93,5% на GPQA-Diamond, 81,6% на MMMU-Pro, 94,3% на MathVision. В независимом рейтинге Frontend Code Arena K3 набрала 1679 очков и обошла Claude Fable 5 в слепом тестировании фронтенд-кода.

Доступность железа и экономика своего кластера

H200 и B200 — топовые ускорители Nvidia с ограничениями на экспорт в ряд стран, и в России набрать десятки таких карт напрямую и легально не выйдет — только через партнёров и облачные площадки за пределами прямых поставок. Даже если железо найдётся, кластер на несколько терабайт видеопамяти — это капитальные вложения уровня гиперскейлера, а не рядового интегратора. Для большинства компаний разумный первый шаг — API или аренда GPU-инстансов у облачного провайдера, а свой кластер под K3 имеет смысл только при постоянной высокой нагрузке.

Мнение DigitalRazor

Открытые веса Kimi K3 — это скорее сигнал рынку, чем повод для немедленной закупки: содержать под неё собственный кластер по силам лишь единицам. Тем, кому важны контроль над данными и локальный инференс, разумнее присмотреться к более компактным открытым моделям под собственный сервер, а K3 пока держать на карандаше как ориентир возможностей. Когда веса откроют 27 июля, приходите к нам подбирать конфигурации под конкретную нагрузку.

Для каких задач Компактный GPU-сервер до 2 видеокарт для начальных задач в AI и графике. Оптимален для инференса, визуализации, VFX и рендеринга в студиях и лабораториях, где важна гибкость.
Подробнее
Видеокарты
RTX / RTX PRO / H200 NVL
Объем видеопамяти до 282 ГБ
Процессоры
Threadripper PRO
Количество ядер до 96
RAM до 1024 ГБ DDR5
Форм-фактор 4.5U
Для каких задач Универсальная платформа на 4–6 GPU для локального обучения моделей и генеративных задач. Подходит для команд, которым важна надёжность сервера и свобода выбора графики — от RTX 5090 до PRO RTX 6000.
Подробнее
Видеокарты
RTX / RTX PRO / H200 NVL
Объем видеопамяти до 576 ГБ
Процессоры
Threadripper PRO
Количество ядер до 96
RAM до 1024 ГБ DDR5
Форм-фактор 6.5U
Для каких задач Сервер промышленного уровня на 8 GPU с кластерной архитектурой. Предназначен для дата-центров и AI-ферм, где требуется масштабируемость и полная загрузка ресурсов под обучение LLM и R&D.
Подробнее
Видеокарты
RTX PRO 6000 / RTX 5090
Объем видеопамяти до 768 ГБ
Процессоры
AMD Epyc, Intel Xeon
Количество ядер до 320
RAM до 3072 ГБ DDR5
Форм-фактор 6U
Для каких задач Серия серверов для кластеризации на 4 GPU. Предназначены для дата-центров и AI-ферм, где требуется повышенная плотность для обучение LLM и R&D.
Подробнее
Видеокарты
L40s / RTX PRO / H200 NVL
Объем видеопамяти до 564 ГБ
Процессоры
AMD EPYC, Intel Xeon
Количество ядер до 128
RAM до 1536 ГБ DDR5
Форм-фактор 2U
Для каких задач Серия серверов для кластеризации на 8 GPU. Предназначены для дата-центров и AI-ферм, где требуется повышенная плотность для обучение LLM и R&D.
Подробнее
Видеокарты
L40s / RTX PRO / H200 NVL
Объем видеопамяти до 1128 ГБ
Процессоры
AMD EPYC, Intel Xeon
Количество ядер до 256
RAM до 2048 ГБ DDR5
Форм-фактор 4U
Для каких задач HGX объединяет 8 видеокарт NVIDIA H200, достигая экстремальной плотности производительности. Благодаря внутренней связности NVSwitch мгновенно интегрируется в масштабные вычислительные кластеры.
Подробнее
Видеокарты
NVIDIA H200 SXM
Объем видеопамяти до 1128 ГБ
Процессоры
AMD EPYC, Intel Xeon
Количество ядер до 256
RAM до 2048 ГБ DDR5
Форм-фактор 5U
Подберём сервер под вашу задачу

Подберём конфигурацию сервера и отправим предложение.

Смотреть серверы
или свяжитесь с нами
Telegram Telegram WhatsApp WhatsApp ВКонтакте ВКонтакте MAX MAX
2.8К

Так же будет интересно почитать

Сайт использует cookies
Узнать подробнее