Qwen3-8B
Самая доступная точка входа: помещается в одну потребительскую карту и позволяет проверить сценарий до закупки сервера.
Модель на 8,2 млрд параметров. При режиме «INT8, контекст 8192 токена, восемь одновременных запросов» нужно 19,5 ГБ памяти — это 1× NVIDIA L4. Доступ к весам: веса скачиваются свободно. Лицензия: в карточке заявлено «apache-2.0», нашего разбора ещё нет. Проверить сценарий до закупки можно на арендованной карте.
Характеристики
Сняты роботом из карточки модели и файла конфигурации, которые публикует сам автор.
Ревизия b968826d9c46. Проверено 02.09.2026.
Сколько нужно памяти
Считается по снятой архитектуре модели: веса плюс KV-кэш под контекст, с надбавкой на накладные расходы рантайма. Меняются только длина контекста и число одновременных запросов — и требование к железу уезжает в разы. Именно поэтому «столько-то гигабайт под модель» без указания нагрузки ничего не значит.
| Сценарий | Контекст | Одновременно | FP16 / BF16 | FP8 / INT8 | INT4 |
|---|---|---|---|---|---|
| Один пользователь, короткий запрос | 4 096 | 1 | 20,3 ГБ 1× NVIDIA L4 | 10,4 ГБ 1× NVIDIA A16 | 5,5 ГБ 1× NVIDIA A16 |
| Небольшая группа | 8 192 | 4 | 24,5 ГБ 1× NVIDIA RTX 5090 | 14,7 ГБ 1× NVIDIA A16 | 9,7 ГБ 1× NVIDIA A16 |
| Отдел, длинные документы | 32 768 | 8 | 58,3 ГБ 1× Huawei Ascend 910C | 48,5 ГБ 1× Huawei Ascend 910C | 43,6 ГБ 1× NVIDIA L40S |
| Много пользователей, длинный контекст | 32 768 | 32 | 174,3 ГБ 1× NVIDIA B200 | 164,4 ГБ 1× NVIDIA B200 | 159,5 ГБ 1× NVIDIA B200 |
KV-кэш считается в 16 битах даже там, где веса ужаты сильнее: кэш почти никогда не квантуется вместе с весами. Подбор карт — оценка сверху по памяти из нашего справочника ускорителей; скорость ответа, питание и охлаждение считаются отдельно. Подбор идёт по объёму памяти и не учитывает программный стек: Ascend и AMD требуют другого инференс-сервера, чем NVIDIA, и это отдельный разговор при проектировании.
Во что обходится миллион токенов
Два счёта рядом: платить за токены чужому поставщику или держать модель на арендованной карте. Обе цифры наши — цену токена мы снимаем с прайсов, ставку аренды с площадок, — и обе с датой. Порог ниже это условие, а не совет: он говорит, при каком объёме счета сравниваются, а не что вам выбрать.
Карты в конфигурации складываются по памяти: собрать из них один работающий узел и получить на нём нужную скорость — отдельная инженерная задача, и её цена сюда не входит. Расчёт идёт по средней нагрузке из таблицы выше: INT8, контекст 8192 токена, восемь одновременных запросов. Свои условия — в расчёте под нагрузку. Вся картина по токенам — на странице цены миллиона.
Что разрешает лицензия
Нашего разбора этой лицензии по первоисточнику пока нет. В карточке модели заявлено «apache-2.0» — это метаданные, а не прочитанный нами текст лицензии, и на них нельзя опираться в корпоративном решении. Разобранные лицензии — здесь.
3-я по размеру из 12 моделей класса «языковая модель»
Размер решает, на чём модель поедет: 8,2 млрд параметров — это легче 9 моделей класса и тяжелее 2 моделей. Ряд ниже — модели того же класса по числу параметров; расчёт памяти у каждой свой.
Что дальше
Сколько памяти нужно этой модели
Расчёт под ваш контекст и число одновременных запросов: сколько видеопамяти займут веса и кэш и на скольких картах это поместится.
Контекст и batch учитываются в KV-кэше для инференса; кэш считается для архитектуры GQA — так устроены все актуальные открытые модели. Оценка ориентировочная (rule-of-thumb), не профилировщик.
- Все площадки с B300 (3) →
- Все площадки с H100 (18) →
- Все площадки с H200 (12) →
- Все площадки с A100 (22) →
- Все площадки с L40S (9) →
- Все площадки с RTX PRO 6000 Blackwell (5) →
- Все площадки с L4 (8) →
- Все площадки с RTX 5090 (5) →
- Все площадки с RTX 4090 (10) →
- Все площадки с RTX 3090 (3) →
- Все площадки с RTX A4000 (7) →
Инференс: веса ×1,2 (overhead рантайма) + оценка KV-кэша по контексту и батчу. Архитектура модели здесь неизвестна — вы задаёте только размер, — поэтому она угадывается по числу параметров и предполагается GQA: так устроены Llama 3, Qwen 2.5, Mistral и другие актуальные открытые модели. Сверка по 11 моделям нашего каталога 26.08.2026: у моделей на полном внимании MHA кэш выходит примерно в 10 раз больше оценки, у DeepSeek-V3 со сжатым вниманием MLA — в 21 раз меньше. Если модель известна, точное число есть на её странице в каталоге.