МОДЕЛЬ / ЯНДЕКС

YandexGPT 5 Lite 8B Pretrain

Единственная в нашем разборе лицензия с достижимым порогом: 10 млн выходных токенов в месяц. Порог, который корпоративный контур реально может перешагнуть.

российская веса открыты
Коротко

Модель на 8 млрд параметров. При режиме «INT8, контекст 8192 токена, восемь одновременных запросов» нужно 18,2 ГБ памяти — это 1× NVIDIA L4. Доступ к весам: веса скачиваются свободно. Лицензия: Лицензионное соглашение YandexGPT-5-Lite-8B. Проверить сценарий до закупки можно на арендованной карте.

Характеристики

Сняты роботом из карточки модели и файла конфигурации, которые публикует сам автор. Ревизия f4aec3abf522. Проверено 02.09.2026.

РазработчикЯндекс
Параметры8 млрд
Слоёв32
Голов внимания32
KV-голов8
ВниманиеGQA — общие ключи на группу голов
Контекст32 768 токенов
Память на токен контекста 0,131 МБ
Разрядность весовBF16
Доступ к весамвеса скачиваются свободно
Первоисточник карточка модели

Сколько нужно памяти

Считается по снятой архитектуре модели: веса плюс KV-кэш под контекст, с надбавкой на накладные расходы рантайма. Меняются только длина контекста и число одновременных запросов — и требование к железу уезжает в разы. Именно поэтому «столько-то гигабайт под модель» без указания нагрузки ничего не значит.

Сценарий Контекст Одновременно FP16 / BF16FP8 / INT8INT4
Один пользователь, короткий запрос 4 096 1 19,8 ГБ
1× NVIDIA L4
10,2 ГБ
1× NVIDIA A16
5,4 ГБ
1× NVIDIA A16
Небольшая группа 8 192 4 23,6 ГБ
1× NVIDIA L4
13,9 ГБ
1× NVIDIA A16
9,1 ГБ
1× NVIDIA A16
Отдел, длинные документы 32 768 8 53,6 ГБ
1× Huawei Ascend 910C
44 ГБ
1× NVIDIA L40S
39,2 ГБ
1× NVIDIA L40S
Много пользователей, длинный контекст 32 768 32 156,7 ГБ
1× NVIDIA B200
147,1 ГБ
1× NVIDIA B200
142,3 ГБ
1× NVIDIA B200

KV-кэш считается в 16 битах даже там, где веса ужаты сильнее: кэш почти никогда не квантуется вместе с весами. Подбор карт — оценка сверху по памяти из нашего справочника ускорителей; скорость ответа, питание и охлаждение считаются отдельно. Подбор идёт по объёму памяти и не учитывает программный стек: Ascend и AMD требуют другого инференс-сервера, чем NVIDIA, и это отдельный разговор при проектировании.

Во что обходится запуск

Во сколько обходится держать эту модель на арендованной карте. Ставка снята с прайса площадки, у неё есть дата.

СВОЯ КАРТА В АРЕНДУ
9 095 ₽/мес
1× NVIDIA L40S — самая дешёвая конфигурация из тех, где модель помещается и где ставку мы наблюдаем. Ставка FirstVDS, пересчёт из суточной ставки при непрерывной загрузке, проверено 02.09.2026.

Ни один наблюдаемый поставщик эту модель по API не отдаёт — сравнить не с чем, и это тоже ответ: пробовать её придётся сразу на своём или арендованном железе. Карты в конфигурации складываются по памяти: собрать из них один работающий узел и получить на нём нужную скорость — отдельная инженерная задача, и её цена сюда не входит. Расчёт идёт по средней нагрузке из таблицы выше: INT8, контекст 8192 токена, восемь одновременных запросов. Свои условия — в расчёте под нагрузку. Вся картина по токенам — на странице цены миллиона.

Что разрешает лицензия

Лицензионное соглашение YandexGPT-5-Lite-8B Да, с условием своя лицензия вендора
Если при использовании Модели Вы достигаете значения в 10 миллионов выходных Токенов в месяц (далее - "Пороговое значение"), то Вы обязаны в течение 30 календарных дней, следующих за месяцем, в котором было достигнуто Пороговое значение, обратиться в Яндекс

Порог: 10 млн выходных токенов в месяц — дальше нужно обращаться в Яндекс за условиями

Обязательства по указанию: уведомление об авторских правах Яндекса при распространении модели и производных

Переносится дальше: ограничения по применению вы обязаны включить в собственные договоры с теми, кому передаёте модель или продукт на её основе.

⚠️ Единственный порог в этой таблице, который предприятие реально перешагнёт: 10 млн выходных токенов в месяц — это порядка сотни активных пользователей внутреннего помощника. Считать его надо ДО внедрения. Отдельно стоит дать юристу прочитать раздел с ограничениями по контенту: там перечислена «информация, нарушающая права на частную жизнь, содержащая персональные данные лиц, а также иная информация ограниченного доступа, включая коммерческую, банковскую, налоговую тайну» — формулировка широкая, а закрытый контур строят как раз вокруг таких данных.

Первоисточник: файл лицензии, прочитан 15.08.2026. Полный разбор всех лицензий — на отдельной странице.

2-я по размеру из 12 моделей класса «языковая модель»

Размер решает, на чём модель поедет: 8 млрд параметров — это легче 10 моделей класса и тяжелее 1 модели. Ряд ниже — модели того же класса по числу параметров; расчёт памяти у каждой свой.

1 T-lite-it-1.0 7,6 млрд
2 YandexGPT 5 Lite 8B Pretrain — эта страница 8 млрд
3 Qwen3-8B 8,2 млрд
4 Vikhr-Nemo-12B-Instruct-R 12,2 млрд
5 GigaChat-20B-A3B-instruct 20,6 млрд
7 Gemma 3 27B Instruct 27,4 млрд
8 T-pro-it-1.0 32,8 млрд
9 Qwen3-32B 32,8 млрд
10 Llama 3.3 70B Instruct 70,6 млрд
11 Qwen2.5-72B-Instruct 72,7 млрд
12 DeepSeek-V3 684,5 млрд

Что дальше

Сколько памяти нужно этой модели

Расчёт под ваш контекст и число одновременных запросов: сколько видеопамяти займут веса и кэш и на скольких картах это поместится.

Контекст и batch учитываются в KV-кэше для инференса; кэш считается для архитектуры GQA — так устроены все актуальные открытые модели. Оценка ориентировочная (rule-of-thumb), не профилировщик.

Требуемая VRAM ≈ 169 ГБ
Память под веса140 ГБ
KV-кэш (инференс)1,3 ГБ
Достаточно одной карты
Сколько карт нужно
NVIDIA H100 80 ГБ
NVIDIA H200 141 ГБ
NVIDIA B200 192 ГБ
NVIDIA B300 288 ГБ
NVIDIA A100 80 ГБ
NVIDIA L40S 48 ГБ
RTX PRO 6000 96 ГБ
RTX 6000 Ada 48 ГБ
AMD Instinct MI300X 192 ГБ
Huawei Ascend 910C 64 ГБ
NVIDIA A16 16 ГБ 11×
NVIDIA L4 24 ГБ
NVIDIA RTX 5090 32 ГБ
NVIDIA RTX 4090 24 ГБ
NVIDIA RTX 3090 24 ГБ
NVIDIA RTX A4000 16 ГБ 11×

Инференс: веса ×1,2 (overhead рантайма) + оценка KV-кэша по контексту и батчу. Архитектура модели здесь неизвестна — вы задаёте только размер, — поэтому она угадывается по числу параметров и предполагается GQA: так устроены Llama 3, Qwen 2.5, Mistral и другие актуальные открытые модели. Сверка по 11 моделям нашего каталога 26.08.2026: у моделей на полном внимании MHA кэш выходит примерно в 10 раз больше оценки, у DeepSeek-V3 со сжатым вниманием MLA — в 21 раз меньше. Если модель известна, точное число есть на её странице в каталоге.

Важно. Расчёт ориентировочный (rule-of-thumb) и не является офертой. Реальная потребность в VRAM зависит от архитектуры модели, движка инференса, длины контекста, метода дообучения (полное / LoRA / QLoRA) и параллелизма. Данные карт (память, TDP) — ориентир, требуют выверки по datasheet. Точный подбор под вашу модель эксперт подтверждает по запросу.