Qwen3-32B
Рабочая лошадь отдела: разбор документов и поддержка при одной карте с большой памятью. Лицензия разобрана и не содержит порогов.
Модель на 32,8 млрд параметров. При режиме «INT8, контекст 8192 токена, восемь одновременных запросов» нужно 56,5 ГБ памяти — это 1× Huawei Ascend 910C. Доступ к весам: веса скачиваются свободно. Лицензия: Apache 2.0. Проверить сценарий до закупки можно на арендованной карте.
Характеристики
Сняты роботом из карточки модели и файла конфигурации, которые публикует сам автор.
Ревизия 9216db5781bf. Проверено 02.09.2026.
Сколько нужно памяти
Считается по снятой архитектуре модели: веса плюс KV-кэш под контекст, с надбавкой на накладные расходы рантайма. Меняются только длина контекста и число одновременных запросов — и требование к железу уезжает в разы. Именно поэтому «столько-то гигабайт под модель» без указания нагрузки ничего не значит.
| Сценарий | Контекст | Одновременно | FP16 / BF16 | FP8 / INT8 | INT4 |
|---|---|---|---|---|---|
| Один пользователь, короткий запрос | 4 096 | 1 | 79,7 ГБ 1× NVIDIA H100 | 40,4 ГБ 1× NVIDIA L40S | 20,7 ГБ 1× NVIDIA L4 |
| Небольшая группа | 8 192 | 4 | 87,2 ГБ 1× RTX PRO 6000 | 47,9 ГБ 1× NVIDIA L40S | 28,2 ГБ 1× NVIDIA RTX 5090 |
| Отдел, длинные документы | 32 768 | 8 | 147,3 ГБ 1× NVIDIA B200 | 108 ГБ 1× NVIDIA H200 | 88,4 ГБ 1× RTX PRO 6000 |
| Много пользователей, длинный контекст | 32 768 | 32 | 353,5 ГБ 2× NVIDIA B200 | 314,2 ГБ 2× NVIDIA B200 | 294,5 ГБ 2× NVIDIA B200 |
KV-кэш считается в 16 битах даже там, где веса ужаты сильнее: кэш почти никогда не квантуется вместе с весами. Подбор карт — оценка сверху по памяти из нашего справочника ускорителей; скорость ответа, питание и охлаждение считаются отдельно. Подбор идёт по объёму памяти и не учитывает программный стек: Ascend и AMD требуют другого инференс-сервера, чем NVIDIA, и это отдельный разговор при проектировании.
Во что обходится миллион токенов
Два счёта рядом: платить за токены чужому поставщику или держать модель на арендованной карте. Обе цифры наши — цену токена мы снимаем с прайсов, ставку аренды с площадок, — и обе с датой. Порог ниже это условие, а не совет: он говорит, при каком объёме счета сравниваются, а не что вам выбрать.
Карты в конфигурации складываются по памяти: собрать из них один работающий узел и получить на нём нужную скорость — отдельная инженерная задача, и её цена сюда не входит. Расчёт идёт по средней нагрузке из таблицы выше: INT8, контекст 8192 токена, восемь одновременных запросов. Свои условия — в расчёте под нагрузку. Вся картина по токенам — на странице цены миллиона.
Что разрешает лицензия
license: apache-2.0
Актуальное поколение Qwen выложено под Apache 2.0 — самой свободной из встречающихся здесь лицензий: коммерческое использование без порогов, без обязательной атрибуции в продукте и без переносимых ограничений.
Первоисточник: файл лицензии, прочитан 15.08.2026. Полный разбор всех лицензий — на отдельной странице.
9-я по размеру из 12 моделей класса «языковая модель»
Размер решает, на чём модель поедет: 32,8 млрд параметров — это легче 3 моделей класса и тяжелее 8 моделей. Ряд ниже — модели того же класса по числу параметров; расчёт памяти у каждой свой.
Что дальше
Сколько памяти нужно этой модели
Расчёт под ваш контекст и число одновременных запросов: сколько видеопамяти займут веса и кэш и на скольких картах это поместится.
Контекст и batch учитываются в KV-кэше для инференса; кэш считается для архитектуры GQA — так устроены все актуальные открытые модели. Оценка ориентировочная (rule-of-thumb), не профилировщик.
- Все площадки с B300 (3) →
- Все площадки с H100 (18) →
- Все площадки с H200 (12) →
- Все площадки с A100 (22) →
- Все площадки с L40S (9) →
- Все площадки с RTX PRO 6000 Blackwell (5) →
- Все площадки с L4 (8) →
- Все площадки с RTX 5090 (5) →
- Все площадки с RTX 4090 (10) →
- Все площадки с RTX 3090 (3) →
- Все площадки с RTX A4000 (7) →
Инференс: веса ×1,2 (overhead рантайма) + оценка KV-кэша по контексту и батчу. Архитектура модели здесь неизвестна — вы задаёте только размер, — поэтому она угадывается по числу параметров и предполагается GQA: так устроены Llama 3, Qwen 2.5, Mistral и другие актуальные открытые модели. Сверка по 11 моделям нашего каталога 26.08.2026: у моделей на полном внимании MHA кэш выходит примерно в 10 раз больше оценки, у DeepSeek-V3 со сжатым вниманием MLA — в 21 раз меньше. Если модель известна, точное число есть на её странице в каталоге.
Что об этой модели писали
- 4-битная модель обошла полноразмерную: что это меняет в смете на железоПереводим «4 бита вместо 16» в гигабайты и в карты по снятой архитектуре моделей каталога, а не по числу параметров. Видно и то, что квантование экономит, и то, чего оно не трогает, — память под контекст.