
AliceAI-T5-35B: поисковый ИИ Яндекса для одной GPU
Есть проект? Напишите нам
Обсудим задачу и подберём оборудование
Яндекс выложил в открытый доступ AliceAI-T5-35B-A0.6B — модель, которая уже отвечает на быстрые вопросы в поиске «Алиса». У неё 35 миллиардов параметров, но на каждый токен работает лишь 0,6 миллиарда — и это меняет расчёт железа: вместо кластера ускорителей достаточно одной серьёзной видеокарты.
Краткое содержание
- AliceAI-T5-35B-A0.6B: 34,35 млрд параметров, из них на каждый токен активны только 0,6 млрд — MoE из 512 экспертов, по 8 на токен;
- редкая для 2026 года схема «кодировщик — декодировщик» в духе T5, а не привычный decoder-only;
- вес модели в bf16 — около 69 гигабайт, квантованные GGUF-сборки сообщества начинаются от 21 гигабайта;
- модель уже в проде: генерирует быстрые ответы в поиске «Алиса», лицензия — Apache 2.0.
Архитектура: кодировщик-декодировщик вместо decoder-only
Большинство открытых моделей 2026 года — decoder-only, как Qwen или DeepSeek. Яндекс для AliceAI-T5-35B выбрал схему T5: 16 слоёв кодировщика и 12 слоёв декодировщика, поверх — разреженный MoE-блок на 512 экспертов, из которых на каждый токен маршрутизируются восемь. Балансировку экспертов взяли по схеме DeepSeek-V3 — без вспомогательной функции потерь, через смещения, которые обновляются динамически. Контекст растили в три шага: обучали на 8 тысячах токенов, затем расширили до 128 тысяч через YaRN. Корпус обучения — 15 триллионов токенов, в основном из собственных данных компании.
Сколько видеопамяти нужно на практике
34,35 млрд уникальных параметров в bf16 — это порядка 69 гигабайт весов, модель целиком помещается на одну карту класса H100 или H200 (80–141 гигабайт) без разбивки по нескольким ускорителям. Яндекс тестировал инференс на H200 в FP8, где объём весов падает примерно вдвое — до района 35 гигабайт, и модель укладывается в одну рабочую станцию с RTX 6000 Ada на 48 гигабайт. Сообщество уже выложило квантованные GGUF-сборки: Q8_0 — 36,8 гигабайта, Q6_K — 28,4 гигабайта, Q4_K_M — 21 гигабайт, и последний вариант влезает даже в потребительскую карту на 24 гигабайта. Для сравнения: DeepSeek V4.1 Flash, о которой мы писали на прошлой неделе, весит 567–763 гигабайта и требует сервер на семь-восемь топовых ускорителей — AliceAI-T5-35B играет в другой весовой категории.
Мало вычислений — не значит мало памяти
Раз на токен работает лишь 0,6 млрд параметров, по вычислениям модель ведёт себя как компактная — инференс быстрый и дешёвый по флопсам. Но память экономить не выйдет: маршрутизатор на каждом токене может выбрать любые восемь экспертов из 512, и заранее не угадать какие — значит, держать под рукой приходится все 512. Отсюда разрыв между «0,6 миллиарда активных» и реальным объёмом видеопамяти под всю модель. Ещё нюанс: оптимизированный инференс-стек Яндекс не публикует — внешним доступен только запуск через Hugging Face Transformers с кастомным кодом модели, и по скорости это заметно уступает тому, что компания использует у себя в проде. По бенчмаркам модель сильна именно там, для чего её растили: на Ya WikiWebFacts и Ya CultCat она обходит Qwen 35B-A3, а в математике и коде — MATH и HumanEval — уступает заметно. Это инструмент для поиска фактов и длинного контекста, не универсальный ассистент-программист.
Мнение DigitalRazor
Для российских интеграторов AliceAI-T5-35B — редкий случай, когда открытая модель такого класса умещается в одну рабочую станцию, а не требует сервер на несколько ускорителей. Если задача — быстрый поиск фактов и работа с длинным контекстом на русском языке, а не программирование или математика, модель стоит попробовать уже на карте с 24–48 гигабайтами памяти. Мы можем подобрать конфигурацию под конкретный квант — от рабочей станции с одной RTX 6000 Ada до сервера с H100 под полную bf16-точность.












