Qwen2.5-72B-Instruct
Показывает, что лицензия у Qwen зависит от размера модели, а не от семейства: на 72B действует собственная лицензия вендора, а не Apache 2.0.
Модель на 72,7 млрд параметров. При режиме «INT8, контекст 8192 токена, восемь одновременных запросов» нужно 108,7 ГБ памяти — это 1× NVIDIA H200. Доступ к весам: веса скачиваются свободно. Лицензия: Qwen License Agreement. Проверить сценарий до закупки можно на арендованной карте.
Характеристики
Сняты роботом из карточки модели и файла конфигурации, которые публикует сам автор.
Ревизия 495f39366efe. Проверено 02.09.2026.
Сколько нужно памяти
Считается по снятой архитектуре модели: веса плюс KV-кэш под контекст, с надбавкой на накладные расходы рантайма. Меняются только длина контекста и число одновременных запросов — и требование к железу уезжает в разы. Именно поэтому «столько-то гигабайт под модель» без указания нагрузки ничего не значит.
| Сценарий | Контекст | Одновременно | FP16 / BF16 | FP8 / INT8 | INT4 |
|---|---|---|---|---|---|
| Один пользователь, короткий запрос | 4 096 | 1 | 175,8 ГБ 1× NVIDIA B200 | 88,6 ГБ 1× RTX PRO 6000 | 45 ГБ 1× NVIDIA L40S |
| Небольшая группа | 8 192 | 4 | 185,2 ГБ 1× NVIDIA B200 | 98 ГБ 1× NVIDIA H200 | 54,4 ГБ 1× Huawei Ascend 910C |
| Отдел, длинные документы | 32 768 | 8 | 260,4 ГБ 1× NVIDIA B300 | 173,1 ГБ 1× NVIDIA B200 | 129,5 ГБ 1× NVIDIA H200 |
| Много пользователей, длинный контекст | 32 768 | 32 | 518,1 ГБ 2× NVIDIA B300 | 430,8 ГБ 2× NVIDIA B300 | 387,2 ГБ 2× NVIDIA B300 |
KV-кэш считается в 16 битах даже там, где веса ужаты сильнее: кэш почти никогда не квантуется вместе с весами. Подбор карт — оценка сверху по памяти из нашего справочника ускорителей; скорость ответа, питание и охлаждение считаются отдельно. Подбор идёт по объёму памяти и не учитывает программный стек: Ascend и AMD требуют другого инференс-сервера, чем NVIDIA, и это отдельный разговор при проектировании.
Во что обходится миллион токенов
Два счёта рядом: платить за токены чужому поставщику или держать модель на арендованной карте. Обе цифры наши — цену токена мы снимаем с прайсов, ставку аренды с площадок, — и обе с датой. Порог ниже это условие, а не совет: он говорит, при каком объёме счета сравниваются, а не что вам выбрать.
Карты в конфигурации складываются по памяти: собрать из них один работающий узел и получить на нём нужную скорость — отдельная инженерная задача, и её цена сюда не входит. Расчёт идёт по средней нагрузке из таблицы выше: INT8, контекст 8192 токена, восемь одновременных запросов. Свои условия — в расчёте под нагрузку. Вся картина по токенам — на странице цены миллиона.
Что разрешает лицензия
If you are commercially using the Materials, and your product or service has more than 100 million monthly active users, you shall request a license from us.
Порог: 100 млн активных пользователей в месяц
Обязательства по указанию: «Built with Qwen» или «Improved using Qwen» в документации продукта — если на модели обучали свою
⚠️ Лицензия зависит от РАЗМЕРА модели, а не от семейства: Qwen2.5-7B-Instruct и Qwen3-32B выложены под Apache 2.0, а 72B — под собственным соглашением Qwen. Проверять надо ту карточку, которую скачиваете.
Первоисточник: файл лицензии, прочитан 15.08.2026. Полный разбор всех лицензий — на отдельной странице.
11-я по размеру из 12 моделей класса «языковая модель»
Размер решает, на чём модель поедет: 72,7 млрд параметров — это легче 1 модели класса и тяжелее 10 моделей. Ряд ниже — модели того же класса по числу параметров; расчёт памяти у каждой свой.
Что дальше
Сколько памяти нужно этой модели
Расчёт под ваш контекст и число одновременных запросов: сколько видеопамяти займут веса и кэш и на скольких картах это поместится.
Контекст и batch учитываются в KV-кэше для инференса; кэш считается для архитектуры GQA — так устроены все актуальные открытые модели. Оценка ориентировочная (rule-of-thumb), не профилировщик.
- Все площадки с B300 (3) →
- Все площадки с H100 (18) →
- Все площадки с H200 (12) →
- Все площадки с A100 (22) →
- Все площадки с L40S (9) →
- Все площадки с RTX PRO 6000 Blackwell (5) →
- Все площадки с L4 (8) →
- Все площадки с RTX 5090 (5) →
- Все площадки с RTX 4090 (10) →
- Все площадки с RTX 3090 (3) →
- Все площадки с RTX A4000 (7) →
Инференс: веса ×1,2 (overhead рантайма) + оценка KV-кэша по контексту и батчу. Архитектура модели здесь неизвестна — вы задаёте только размер, — поэтому она угадывается по числу параметров и предполагается GQA: так устроены Llama 3, Qwen 2.5, Mistral и другие актуальные открытые модели. Сверка по 11 моделям нашего каталога 26.08.2026: у моделей на полном внимании MHA кэш выходит примерно в 10 раз больше оценки, у DeepSeek-V3 со сжатым вниманием MLA — в 21 раз меньше. Если модель известна, точное число есть на её странице в каталоге.