8 800 500-99-26 Для звонков по России
AliceAI-T5-35B: поисковый ИИ Яндекса для одной GPU
Софт
3 мин

AliceAI-T5-35B: поисковый ИИ Яндекса для одной GPU

DigitalRazor
DigitalRazor
Подписаться в Telegram
Содержание 4 раздела
Краткое содержание Архитектура: кодировщик-декодировщик вместо decoder-only Сколько видеопамяти нужно на практике Мало вычислений — не значит мало памяти
Подберём решение под ваш проект

Расскажите о задаче — предложим оптимальную конфигурацию и реализацию.

Обсудить проект
или свяжитесь с нами
Telegram Telegram WhatsApp WhatsApp ВКонтакте ВКонтакте MAX MAX

Есть проект? Напишите нам

Обсудим задачу и подберём оборудование

Обсудить проект

Яндекс выложил в открытый доступ AliceAI-T5-35B-A0.6B — модель, которая уже отвечает на быстрые вопросы в поиске «Алиса». У неё 35 миллиардов параметров, но на каждый токен работает лишь 0,6 миллиарда — и это меняет расчёт железа: вместо кластера ускорителей достаточно одной серьёзной видеокарты.

Краткое содержание

  • AliceAI-T5-35B-A0.6B: 34,35 млрд параметров, из них на каждый токен активны только 0,6 млрд — MoE из 512 экспертов, по 8 на токен;
  • редкая для 2026 года схема «кодировщик — декодировщик» в духе T5, а не привычный decoder-only;
  • вес модели в bf16 — около 69 гигабайт, квантованные GGUF-сборки сообщества начинаются от 21 гигабайта;
  • модель уже в проде: генерирует быстрые ответы в поиске «Алиса», лицензия — Apache 2.0.

Архитектура: кодировщик-декодировщик вместо decoder-only

Большинство открытых моделей 2026 года — decoder-only, как Qwen или DeepSeek. Яндекс для AliceAI-T5-35B выбрал схему T5: 16 слоёв кодировщика и 12 слоёв декодировщика, поверх — разреженный MoE-блок на 512 экспертов, из которых на каждый токен маршрутизируются восемь. Балансировку экспертов взяли по схеме DeepSeek-V3 — без вспомогательной функции потерь, через смещения, которые обновляются динамически. Контекст растили в три шага: обучали на 8 тысячах токенов, затем расширили до 128 тысяч через YaRN. Корпус обучения — 15 триллионов токенов, в основном из собственных данных компании.

Архитектура AliceAI-T5-35B

Сколько видеопамяти нужно на практике

34,35 млрд уникальных параметров в bf16 — это порядка 69 гигабайт весов, модель целиком помещается на одну карту класса H100 или H200 (80–141 гигабайт) без разбивки по нескольким ускорителям. Яндекс тестировал инференс на H200 в FP8, где объём весов падает примерно вдвое — до района 35 гигабайт, и модель укладывается в одну рабочую станцию с RTX 6000 Ada на 48 гигабайт. Сообщество уже выложило квантованные GGUF-сборки: Q8_0 — 36,8 гигабайта, Q6_K — 28,4 гигабайта, Q4_K_M — 21 гигабайт, и последний вариант влезает даже в потребительскую карту на 24 гигабайта. Для сравнения: DeepSeek V4.1 Flash, о которой мы писали на прошлой неделе, весит 567–763 гигабайта и требует сервер на семь-восемь топовых ускорителей — AliceAI-T5-35B играет в другой весовой категории.

Мало вычислений — не значит мало памяти

Раз на токен работает лишь 0,6 млрд параметров, по вычислениям модель ведёт себя как компактная — инференс быстрый и дешёвый по флопсам. Но память экономить не выйдет: маршрутизатор на каждом токене может выбрать любые восемь экспертов из 512, и заранее не угадать какие — значит, держать под рукой приходится все 512. Отсюда разрыв между «0,6 миллиарда активных» и реальным объёмом видеопамяти под всю модель. Ещё нюанс: оптимизированный инференс-стек Яндекс не публикует — внешним доступен только запуск через Hugging Face Transformers с кастомным кодом модели, и по скорости это заметно уступает тому, что компания использует у себя в проде. По бенчмаркам модель сильна именно там, для чего её растили: на Ya WikiWebFacts и Ya CultCat она обходит Qwen 35B-A3, а в математике и коде — MATH и HumanEval — уступает заметно. Это инструмент для поиска фактов и длинного контекста, не универсальный ассистент-программист.

Мнение DigitalRazor

Для российских интеграторов AliceAI-T5-35B — редкий случай, когда открытая модель такого класса умещается в одну рабочую станцию, а не требует сервер на несколько ускорителей. Если задача — быстрый поиск фактов и работа с длинным контекстом на русском языке, а не программирование или математика, модель стоит попробовать уже на карте с 24–48 гигабайтами памяти. Мы можем подобрать конфигурацию под конкретный квант — от рабочей станции с одной RTX 6000 Ada до сервера с H100 под полную bf16-точность.

AMD Ryzen AI Halo
Для каких задач Запуск и дообучение больших языковых моделей до 200 млрд локально
Подробнее
Видеокарты
Radeon 8060S
Объем видеопамяти 64 ГБ
Процессоры
Ryzen AI Max+ 395
Количество ядер 16 Zen 5
RAM Объединена с VRAM
Форм-фактор SFF
NVIDIA DGX Spark
Для каких задач Запуск и дообучение больших языковых моделей до 200 млрд локально
Подробнее
Видеокарты
Grace Blackwell
Объем видеопамяти 128 ГБ
Процессоры
NVIDIA GB10
Количество ядер 20 Arm
RAM Объединена с VRAM
Форм-фактор SFF
NVIDIA RTX Spark
Для каких задач Запуск и дообучение больших языковых моделей до 200 млрд локально
Подробнее
Видеокарты
Grace Blackwell
Объем видеопамяти 128 ГБ
Процессоры
NVIDIA Grace
Количество ядер 20 Arm
RAM Объединена с VRAM
Форм-фактор Laptop
Подберём решение под ваш проект

Расскажите о задаче — предложим оптимальную конфигурацию и реализацию.

Обсудить проект
или свяжитесь с нами
Telegram Telegram WhatsApp WhatsApp ВКонтакте ВКонтакте MAX MAX
9.2К

Так же будет интересно почитать

Сайт использует cookies
Узнать подробнее