
AliceAI-Foundation-80B: открытая модель весом 160 гигабайт
Подберём сервер под задачи
Ответьте на несколько вопросов — подготовим предложение
Яндекс открыл веса AliceAI-Foundation-80B-A3B-Base — базовой модели на 80 миллиардов параметров, обученной с нуля. По российским бенчмаркам она обходит модели крупнее, включая DeepSeek-V4-Flash-Base на 284 миллиарда параметров. Для бизнеса, который присматривается к локальному запуску отечественного ИИ, вопрос один: сколько видеопамяти и серверов для этого нужно.
Краткое содержание
- 80 млрд параметров всего, активны только 3 млрд на токен — гибридная архитектура с MoE-слоями на 512 экспертов;
- контекст до 262 144 токенов, лицензия Apache 2.0 без ограничений на коммерческое использование;
- на русскоязычных тестах обходит DeepSeek-V4-Flash-Base (284 млрд параметров) и Nemotron-3-Super-120B-Base;
- это базовая модель без инструктивной настройки — фундамент, а не готовый чат-бот.
Меньше параметров, выше результат на русском
Архитектура гибридная: 48 слоёв, механизмы KDA и Gated Attention вместе с MoE. В каждом MoE-слое 512 экспертов, из которых на токен выбираются десять плюс один общий. Отсюда и разрыв между 80 миллиардами параметров общих и всего 3 миллиардами активных. Яндекс собрал обучающий корпус заново и проверял архитектурные решения на сериях обучений с нуля — по 2 триллиона токенов каждая.
На тесте российских фактов WikiWebFacts модель набирает 86,5 балла против 62,4 у Qwen3.5-35B-A3B-Base и 70,2 у GLM-4.5-Air-Base. Опережает даже куда более тяжёлую DeepSeek-V4-Flash-Base: 86,5 против 83,2. В математике MATH-500 — 91,1 против 81,9 у Qwen, в HMMT 2026 — 96,9 против 87,9. В коде обгоняет Nemotron-3-Super-120B-Base, используя вчетверо меньше активных параметров.
Сколько GPU нужно, чтобы поднять модель
Вес модели в формате BF16 — около 160 гигабайт. Ни на одну существующую видеокарту целиком это не помещается, даже на самую вместительную. В официальном примере запуска через vLLM Яндекс задействует четыре GPU с 80 гигабайтами памяти каждая — конфигурация уровня H100 или A100 SXM с тензорным параллелизмом между картами. При этом активны только 3 миллиарда параметров на токен, поэтому скорость генерации сопоставима с гораздо более компактной моделью: тяжёлая тут только память, а не вычисления.
Квантование до 4 бит сжимает вес примерно до 45 гигабайт — теоретически укладывается в одну профессиональную карту на 48–96 гигабайт. Но официального квантованного релиза от Яндекса пока нет. На Hugging Face есть только одна сборка от сообщества, а нестандартное внимание KDA обычно тормозит поддержку в инструментах вроде llama.cpp на недели.
Фундамент, а не готовый чат-бот
AliceAI-Foundation-80B-A3B-Base — это претрейн-модель без диалоговой донастройки. Яндекс прямо называет её экспериментальной: она проверяет архитектурные решения для будущей единой рассуждающей модели, на которой будет строиться агентность Алисы. Для бизнеса это значит, что использовать модель как есть не получится — нужен собственный этап инструктивного дообучения под задачу. А сравнения в тестах приведены только с базовыми версиями конкурентов, без их более новых инструктивных релизов.
Мнение DigitalRazor
Обучение с нуля и лицензия Apache 2.0 — сильный аргумент для тех, кто выбирает отечественную модель без юридических рисков вокруг чужих весов. Но это база, а не ассистент под ключ: под инференс в BF16 понадобится сервер на четыре GPU с 80 гигабайтами памяти каждая, а под конкретную задачу — ещё и собственное дообучение. Если нужен компактный вариант на одной карте, разумнее дождаться официального квантованного релиза, а не полагаться на сборки сообщества.













