YandexGPT 5 Lite 8B Pretrain
Единственная в нашем разборе лицензия с достижимым порогом: 10 млн выходных токенов в месяц. Порог, который корпоративный контур реально может перешагнуть.
Модель на 8 млрд параметров. При режиме «INT8, контекст 8192 токена, восемь одновременных запросов» нужно 18,2 ГБ памяти — это 1× NVIDIA L4. Доступ к весам: веса скачиваются свободно. Лицензия: Лицензионное соглашение YandexGPT-5-Lite-8B. Проверить сценарий до закупки можно на арендованной карте.
Характеристики
Сняты роботом из карточки модели и файла конфигурации, которые публикует сам автор.
Ревизия f4aec3abf522. Проверено 02.09.2026.
Сколько нужно памяти
Считается по снятой архитектуре модели: веса плюс KV-кэш под контекст, с надбавкой на накладные расходы рантайма. Меняются только длина контекста и число одновременных запросов — и требование к железу уезжает в разы. Именно поэтому «столько-то гигабайт под модель» без указания нагрузки ничего не значит.
| Сценарий | Контекст | Одновременно | FP16 / BF16 | FP8 / INT8 | INT4 |
|---|---|---|---|---|---|
| Один пользователь, короткий запрос | 4 096 | 1 | 19,8 ГБ 1× NVIDIA L4 | 10,2 ГБ 1× NVIDIA A16 | 5,4 ГБ 1× NVIDIA A16 |
| Небольшая группа | 8 192 | 4 | 23,6 ГБ 1× NVIDIA L4 | 13,9 ГБ 1× NVIDIA A16 | 9,1 ГБ 1× NVIDIA A16 |
| Отдел, длинные документы | 32 768 | 8 | 53,6 ГБ 1× Huawei Ascend 910C | 44 ГБ 1× NVIDIA L40S | 39,2 ГБ 1× NVIDIA L40S |
| Много пользователей, длинный контекст | 32 768 | 32 | 156,7 ГБ 1× NVIDIA B200 | 147,1 ГБ 1× NVIDIA B200 | 142,3 ГБ 1× NVIDIA B200 |
KV-кэш считается в 16 битах даже там, где веса ужаты сильнее: кэш почти никогда не квантуется вместе с весами. Подбор карт — оценка сверху по памяти из нашего справочника ускорителей; скорость ответа, питание и охлаждение считаются отдельно. Подбор идёт по объёму памяти и не учитывает программный стек: Ascend и AMD требуют другого инференс-сервера, чем NVIDIA, и это отдельный разговор при проектировании.
Во что обходится запуск
Во сколько обходится держать эту модель на арендованной карте. Ставка снята с прайса площадки, у неё есть дата.
Ни один наблюдаемый поставщик эту модель по API не отдаёт — сравнить не с чем, и это тоже ответ: пробовать её придётся сразу на своём или арендованном железе. Карты в конфигурации складываются по памяти: собрать из них один работающий узел и получить на нём нужную скорость — отдельная инженерная задача, и её цена сюда не входит. Расчёт идёт по средней нагрузке из таблицы выше: INT8, контекст 8192 токена, восемь одновременных запросов. Свои условия — в расчёте под нагрузку. Вся картина по токенам — на странице цены миллиона.
Что разрешает лицензия
Если при использовании Модели Вы достигаете значения в 10 миллионов выходных Токенов в месяц (далее - "Пороговое значение"), то Вы обязаны в течение 30 календарных дней, следующих за месяцем, в котором было достигнуто Пороговое значение, обратиться в Яндекс
Порог: 10 млн выходных токенов в месяц — дальше нужно обращаться в Яндекс за условиями
Обязательства по указанию: уведомление об авторских правах Яндекса при распространении модели и производных
Переносится дальше: ограничения по применению вы обязаны включить в собственные договоры с теми, кому передаёте модель или продукт на её основе.
⚠️ Единственный порог в этой таблице, который предприятие реально перешагнёт: 10 млн выходных токенов в месяц — это порядка сотни активных пользователей внутреннего помощника. Считать его надо ДО внедрения. Отдельно стоит дать юристу прочитать раздел с ограничениями по контенту: там перечислена «информация, нарушающая права на частную жизнь, содержащая персональные данные лиц, а также иная информация ограниченного доступа, включая коммерческую, банковскую, налоговую тайну» — формулировка широкая, а закрытый контур строят как раз вокруг таких данных.
Первоисточник: файл лицензии, прочитан 15.08.2026. Полный разбор всех лицензий — на отдельной странице.
2-я по размеру из 12 моделей класса «языковая модель»
Размер решает, на чём модель поедет: 8 млрд параметров — это легче 10 моделей класса и тяжелее 1 модели. Ряд ниже — модели того же класса по числу параметров; расчёт памяти у каждой свой.
Что дальше
Сколько памяти нужно этой модели
Расчёт под ваш контекст и число одновременных запросов: сколько видеопамяти займут веса и кэш и на скольких картах это поместится.
Контекст и batch учитываются в KV-кэше для инференса; кэш считается для архитектуры GQA — так устроены все актуальные открытые модели. Оценка ориентировочная (rule-of-thumb), не профилировщик.
- Все площадки с B300 (3) →
- Все площадки с H100 (18) →
- Все площадки с H200 (12) →
- Все площадки с A100 (22) →
- Все площадки с L40S (9) →
- Все площадки с RTX PRO 6000 Blackwell (5) →
- Все площадки с L4 (8) →
- Все площадки с RTX 5090 (5) →
- Все площадки с RTX 4090 (10) →
- Все площадки с RTX 3090 (3) →
- Все площадки с RTX A4000 (7) →
Инференс: веса ×1,2 (overhead рантайма) + оценка KV-кэша по контексту и батчу. Архитектура модели здесь неизвестна — вы задаёте только размер, — поэтому она угадывается по числу параметров и предполагается GQA: так устроены Llama 3, Qwen 2.5, Mistral и другие актуальные открытые модели. Сверка по 11 моделям нашего каталога 26.08.2026: у моделей на полном внимании MHA кэш выходит примерно в 10 раз больше оценки, у DeepSeek-V3 со сжатым вниманием MLA — в 21 раз меньше. Если модель известна, точное число есть на её странице в каталоге.