Gemma 3 27B Instruct
Условия использования Gemma переносятся на всех, кому вы передаёте модель или её производную, — это отдельный разговор с юристом предприятия.
Модель на 27,4 млрд параметров: в INT8 это около 27,4 ГБ под одни только веса. Полную потребность в памяти посчитать не можем — не снята архитектура модели: веса выдаются только после принятия условий и входа в аккаунт, а вместе с ними закрыт и файл конфигурации. Без числа слоёв и KV-голов память под контекст не считается, а складывать одни веса и называть это ответом — значит занизить его молча. Общий расчёт по числу параметров, с оговоркой что архитектура в нём предполагается, — калькулятор подбора GPU.
Характеристики
Сняты роботом из карточки модели и файла конфигурации, которые публикует сам автор.
Ревизия 005ad3404e59. Проверено 02.09.2026.
Что разрешает лицензия
You must include the use restrictions referenced in Section 3.2 as an enforceable provision in any agreement (e.g., license agreement, terms of use, etc.) governing the use and/or distribution of Gemma or Model Derivatives
Обязательства по указанию: передавать текст ограничений и уведомление всем последующим пользователям
Переносится дальше: ограничения по применению вы обязаны включить в собственные договоры с теми, кому передаёте модель или продукт на её основе.
Коммерческое использование не запрещено и порогов нет, но ограничения по применению (Prohibited Use Policy) обязаны быть перенесены в ваши собственные договоры как исполнимое условие — это работа юриста, а не инженера.
Первоисточник: файл лицензии, прочитан 15.08.2026. Полный разбор всех лицензий — на отдельной странице.
7-я по размеру из 12 моделей класса «языковая модель»
Размер решает, на чём модель поедет: 27,4 млрд параметров — это легче 5 моделей класса и тяжелее 6 моделей. Ряд ниже — модели того же класса по числу параметров; расчёт памяти у каждой свой.
Что дальше
Сколько памяти нужно этой модели
Расчёт под ваш контекст и число одновременных запросов: сколько видеопамяти займут веса и кэш и на скольких картах это поместится.
Контекст и batch учитываются в KV-кэше для инференса; кэш считается для архитектуры GQA — так устроены все актуальные открытые модели. Оценка ориентировочная (rule-of-thumb), не профилировщик.
- Все площадки с B300 (3) →
- Все площадки с H100 (18) →
- Все площадки с H200 (12) →
- Все площадки с A100 (22) →
- Все площадки с L40S (9) →
- Все площадки с RTX PRO 6000 Blackwell (5) →
- Все площадки с L4 (8) →
- Все площадки с RTX 5090 (5) →
- Все площадки с RTX 4090 (10) →
- Все площадки с RTX 3090 (3) →
- Все площадки с RTX A4000 (7) →
Инференс: веса ×1,2 (overhead рантайма) + оценка KV-кэша по контексту и батчу. Архитектура модели здесь неизвестна — вы задаёте только размер, — поэтому она угадывается по числу параметров и предполагается GQA: так устроены Llama 3, Qwen 2.5, Mistral и другие актуальные открытые модели. Сверка по 11 моделям нашего каталога 26.08.2026: у моделей на полном внимании MHA кэш выходит примерно в 10 раз больше оценки, у DeepSeek-V3 со сжатым вниманием MLA — в 21 раз меньше. Если модель известна, точное число есть на её странице в каталоге.