GigaChat-20B-A3B-instruct
Российская MoE-модель с открытыми весами. Лицензия MIT заявлена только в метаданных карточки — файла LICENSE в репозитории нет, и это разница в доказательстве.
Модель на 20,6 млрд параметров. При режиме «INT8, контекст 8192 токена, восемь одновременных запросов» нужно 32,2 ГБ памяти — это 1× NVIDIA L40S. Доступ к весам: веса скачиваются свободно. Лицензия: MIT. Внимание: это MoE-модель — в памяти обязаны лежать все веса, а не только активные. Проверить сценарий до закупки можно на арендованной карте.
Характеристики
Сняты роботом из карточки модели и файла конфигурации, которые публикует сам автор.
Ревизия d6a97fca83b0. Проверено 02.09.2026.
Сколько нужно памяти
Считается по снятой архитектуре модели: веса плюс KV-кэш под контекст, с надбавкой на накладные расходы рантайма. Меняются только длина контекста и число одновременных запросов — и требование к железу уезжает в разы. Именно поэтому «столько-то гигабайт под модель» без указания нагрузки ничего не значит.
| Сценарий | Контекст | Одновременно | FP16 / BF16 | FP8 / INT8 | INT4 |
|---|---|---|---|---|---|
| Один пользователь, короткий запрос | 4 096 | 1 | 49,9 ГБ 1× Huawei Ascend 910C | 25,2 ГБ 1× NVIDIA RTX 5090 | 12,8 ГБ 1× NVIDIA A16 |
| Небольшая группа | 8 192 | 4 | 53,2 ГБ 1× Huawei Ascend 910C | 28,5 ГБ 1× NVIDIA RTX 5090 | 16,1 ГБ 1× NVIDIA L4 |
| Отдел, длинные документы | 32 768 | 8 | 79,5 ГБ 1× NVIDIA H100 | 54,8 ГБ 1× Huawei Ascend 910C | 42,4 ГБ 1× NVIDIA L40S |
| Много пользователей, длинный контекст | 32 768 | 32 | 169,7 ГБ 1× NVIDIA B200 | 145 ГБ 1× NVIDIA B200 | 132,6 ГБ 1× NVIDIA H200 |
Это MoE-модель: считается полный размер весов, потому что в памяти обязаны находиться все эксперты — маршрутизатор выбирает их на лету. Число активных экспертов влияет на скорость, а не на память. KV-кэш считается в 16 битах даже там, где веса ужаты сильнее: кэш почти никогда не квантуется вместе с весами. Подбор карт — оценка сверху по памяти из нашего справочника ускорителей; скорость ответа, питание и охлаждение считаются отдельно. Подбор идёт по объёму памяти и не учитывает программный стек: Ascend и AMD требуют другого инференс-сервера, чем NVIDIA, и это отдельный разговор при проектировании.
Во что обходится запуск
Во сколько обходится держать эту модель на арендованной карте. Ставка снята с прайса площадки, у неё есть дата.
Ни один наблюдаемый поставщик эту модель по API не отдаёт — сравнить не с чем, и это тоже ответ: пробовать её придётся сразу на своём или арендованном железе. Карты в конфигурации складываются по памяти: собрать из них один работающий узел и получить на нём нужную скорость — отдельная инженерная задача, и её цена сюда не входит. Расчёт идёт по средней нагрузке из таблицы выше: INT8, контекст 8192 токена, восемь одновременных запросов. Свои условия — в расчёте под нагрузку. Вся картина по токенам — на странице цены миллиона.
Что разрешает лицензия
license: mit
⚠️ Лицензия заявлена только в метаданных карточки модели: отдельного файла LICENSE в репозитории нет (проверено 15.08.2026 — 404). MIT сам по себе предельно свободен, но подтверждение здесь слабее, чем у остальных строк таблицы, и это стоит уточнить у правообладателя до промышленного внедрения.
Первоисточник: файл лицензии, прочитан 15.08.2026. Полный разбор всех лицензий — на отдельной странице.
5-я по размеру из 12 моделей класса «языковая модель»
Размер решает, на чём модель поедет: 20,6 млрд параметров — это легче 7 моделей класса и тяжелее 4 моделей. Ряд ниже — модели того же класса по числу параметров; расчёт памяти у каждой свой.
Что дальше
Сколько памяти нужно этой модели
Расчёт под ваш контекст и число одновременных запросов: сколько видеопамяти займут веса и кэш и на скольких картах это поместится.
Контекст и batch учитываются в KV-кэше для инференса; кэш считается для архитектуры GQA — так устроены все актуальные открытые модели. Оценка ориентировочная (rule-of-thumb), не профилировщик.
- Все площадки с B300 (3) →
- Все площадки с H100 (18) →
- Все площадки с H200 (12) →
- Все площадки с A100 (22) →
- Все площадки с L40S (9) →
- Все площадки с RTX PRO 6000 Blackwell (5) →
- Все площадки с L4 (8) →
- Все площадки с RTX 5090 (5) →
- Все площадки с RTX 4090 (10) →
- Все площадки с RTX 3090 (3) →
- Все площадки с RTX A4000 (7) →
Инференс: веса ×1,2 (overhead рантайма) + оценка KV-кэша по контексту и батчу. Архитектура модели здесь неизвестна — вы задаёте только размер, — поэтому она угадывается по числу параметров и предполагается GQA: так устроены Llama 3, Qwen 2.5, Mistral и другие актуальные открытые модели. Сверка по 11 моделям нашего каталога 26.08.2026: у моделей на полном внимании MHA кэш выходит примерно в 10 раз больше оценки, у DeepSeek-V3 со сжатым вниманием MLA — в 21 раз меньше. Если модель известна, точное число есть на её странице в каталоге.